· ローカルAI

Aleph Alphaが公開したMoE言語モデルKolibriのアーキテクチャとローカル推論要件

30秒でわかる内容解説

2026年10月3日、ドイツのAleph AlphaがApache 2.0ライセンスでMoEアーキテクチャの言語モデルKolibriを公開した。総パラメータ781億のうち推論時に約35億のみが活性化し、ドイツ語のトークン化と長期コンテキスト処理に特化している。ドイツ語と英語のローカル推論を目指す技術者にとって、78GBのVRAM要件と独自のプロトコルが実運用の鍵となる。データセットの透明性やスライディングウィンドウ構造は、自作サーバーでのファインチューニングにも役立つ。

MoE構造とVRAM要件が規定するハードル

Kolibriは6つの技術を積み重ねて設計されている。各層に384の専門サブネットワークを配置し、ルーターがトークンごとに6つを選択する。これにより推論コストは35億パラメータ相当になるが、全パラメータをメモリに保持する必要がある。FP8量子化で約78GBの重みを必要とし、ノートPCでは動作しない。データセンター用のGPUを2台接続するか、H200やB200単体での運用が想定される。

Kolibriの主要仕様
項目値
総パラメータ781億
推論時活性化約35億
対応言語ドイツ語・英語
最大コンテキスト1,048,576トークン
重みサイズ(FP8)約78GB
訓練データ約24兆トークン
訓練GPU768基(NVIDIA B200)

推論時のアクティブパラメータは35億だが、メモリ帯域がボトルネックになるため、単一GPUでは容量が不足する。コンテキストウィンドウは262,144トークンをネイティブにサポートし、1,048,576トークンまでテスト済みだ。40層が512トークンのスライディングウィンドウ attention を使い、5層ごと全体を参照する構成が長期処理を可能にする。写真ではAleph Alphaが公開したKolibriの技術概要が示されている。

Aleph Alphaが公開したKolibriの技術概要
Aleph Alphaが公開したKolibriの技術概要(出典:Hacker News)

推論強度はnone、low、medium、highの4段階から選べる。同じサーバーで迅速な応答と深い思考を切り替えられる。重みサイズはFP8で約78GBとなり、A100やH100の80GB版を2台用意する必要がある。コンテキストウィンドウを104万トークンに拡張するには、vLLMのフラグ2つを追加する必要がある。知識カットオフは2026年6月18日であり、ツール呼び出し機能も搭載されている。

ドイツ語最適化とMerlin-Arthur protocolの設計思想

約24兆トークン、ドイツ語が5分の1以上を含むデータでスクラッチ学習された。ドイツとフィンランドのインフラで768基のNVIDIA B200 GPUを用いて訓練された。独自アルゴリズムUniBPEを採用し、ドイツ語の長複合語を効率的に分割する。GPT-5のトークナイザーより11.2%少ないトークン数で済む。

訓練データは英語ウェブテキストにGemma 4、ドイツ語にMistral-NeMoを用いてリライトされた。Qwen3-32Bのラベルデータで品質フィルタリングを行った。政治的バイアスも測定・除去されている。スライディングウィンドウ層だけが位置埋め込みを持つため、追加の位置補正なしで26万トークンを超えて処理できる。

Merlin-Arthur protocolにより、正解が不明な場合に44%の割合で「知らない」と回答するように訓練されている。ドイツ語プロンプトではドイツ語で推論し、AIME 2025の数学スコアは87.5で同規模モデル中最上位となる。知識ベースのテストでは51.0と低く、文書検索(RAG)用途に限定される。Omniscienceテストでは14.8%の正答率を示す。

技術透明性への評価と実用面での分断

Hacker Newsでは技術的な透明性とドイツ語最適化が評価されている。189ページの技術報告書と学習データ作成法を開示した点が特に注目された。

一方で実用面ではVRAM要件が課題となる。2台のA100やH100(80GB版)が必要であり、ローカルPCでの手軽さが期待された層には物足りない。コーディングやマルチターンツール呼び出しの性能は上位モデルに劣る。Trivia回答では記憶ベースのスコアが低く、文書検索用途に限定される。

実機テストではfp8で約170トークン/秒の速度が記録され、推論速度自体は良好だと指摘されている。ただし過剰な推論にトークンを使う傾向があるとの意見もある。Aleph Alphaの市場での存在感を疑う声と、公的機関や医療での価値を認める声が分かれている。RULERテストでは12万8千トークンでQwen3.5が89.9(Kolibriは67.9)に対し、104万トークンでKolibriが63.2を記録する。

ホスト提供の欠如と量子化モデルの行方

公開直後はホスト型プロバイダーが対応しておらず、実運用のハードルが不明だ。vLLMの専用プラグイン(バージョン0.29)をインストールし、OpenAI互換サーバーとして起動させる必要がある。量子化モデルの登場によって消費メモリと推論速度がどう変化するかも未確認の段階である。

ソブリンAIとしての実態や、より大規模な稠密モデルとの競争優位性の持続性についても議論が続いている。技術報告書ではデータフィルタリングにGemma 4やMistral-NeMoを活用した手法も明かされており、ファインチューニングの参考になる。Qwen3.8 27Bのような稠密モデルがスコアで上回る場合でも、推論時のパラメータ使用量は約8分の1に抑えられる。

次世代の軽量版公開とクラウド提供開始が次の焦点となる。2026年10月3日に公開された重みはHugging Faceでダウンロード可能だ。ライセンスはApache 2.0で、学習コードの権利はAleph Alphaが保持する。

出典