· ローカルAI

XiaomiMiMoがオムニモーダルLLM「MiMo-V2.6」シリーズを公開

30秒でわかる内容解説

2026年9月22日、Xiaomi MiMo TeamがHugging Face上で「MiMo-V2.6-Pro-RL」と「MiMo-V2.6-Flash-RL」の2モデルを公開した。テキスト、画像、動画、音声を統合したオムニモーダルモデルで、MITライセンスに基づく商用利用も可能だ。スパースMoEアーキテクチャを採用し、消費パラメータを抑えつつ1Mトークンの超長文脈に対応する。自作PCやローカル環境で動作させる技術者にとって、高機能なエージェント基盤として即戦力となりうる構成だ。

1Mトークン対応のオムニモーダル基盤

本シリーズは強化学習による自己改善を軸に設計されている。Pro版は総パラメータ1.02T、活性化パラメータ42Bの構成だ。Flash版は総309B、活性化15Bに抑えられている。両モデルとも1Mトークンのコンテキスト長をサポートし、長期のレポジトリや複数セッションのエージェント実行を可能にする。

画像と音声の処理には専用エンコーダを内蔵する。ビジョンエンコーダは681MパラメータのMiMo ViTを採用し、動画と静止画を同時に扱う。音声エンコーダは308Mのパラメータを持つAudioTokenizerと、127Mのパラメータを持つパッチエンコーダで構成される。

推論速度の向上には5層のMTP(Multi-Token Prediction、複数トークンを同時に予測する機構)が搭載されている。1回のフォワードパスで最大7トークンを予測し、並列検証によって生成速度を高める仕組みだ。写真ではMiMo-V2.6の全体アーキテクチャ図が示されている。

Figure 1: MiMo-V2.6 architecture — omni encoders, hybrid SWA backbone, and MTP blocks
MiMo-V2.6の全体アーキテクチャ図(出典:Hugging Face trending

下の画像はMiMo-V2.6の全体アーキテクチャを示している。左右にオムニモーダル用のエンコーダが配置され、中央のSWA基幹ネットワークが処理を担う。右端にスペキュラティブデコーダが接続され、推論の高速化を図る構成だ。

LLM基幹の隠れ層サイズはPro版で6144、Flash版で4096だ。SWA(Sliding Window Attention、固定幅の文脈のみを参照する注意力機構)は128トークンのウィンドウサイズを持ち、GA(Global Attention)ヘッドと交互に配置される。

混合強化学習による自己改善ループ

訓練手法の核心は「You Only RL Once」という方針にある。コーディング、汎用エージェント、視覚認識、サイバーセキュリティのタスクを一度の混合強化学習で最適化する。ドメインごとに別々に学習するのではなく、バッチ内でタスクを混ぜることで能力が相互に強化される。

強化学習の基盤には非同期のGRPO(Group Relative Policy Optimization、グループ内の出力相対評価に基づく最適化手法)が採用されている。1ステップあたり1,568プロンプト×16ロールアウトを並列実行し、1更新あたり数十億トークンを処理する規模だ。

The first Transformer block uses global attention with a dense FFN.

最初のTransformerブロックはグローバル注意力と密なFFNを使用する。

報酬信号のスケールアップにはGroupwise Agentic Gradingが用いられる。合格・不合格の二値判定だけでなく、グループ内の生成結果を比較して相対的な優劣をつける。GRSでオフラインに評価基準を構築し、GARでオンラインに優勢度を再分配する。

強化学習終了後はMOPD2(Multi-Prefix Multi-Teacher On-Policy Distillation)による知識蒸留が行われる。教師モデルの履歴とSFTデモンストレーションを再利用し、決定ポイントのみを学習することで検証が困難なタスクへの対応力を拡張する。

ベンチマーク結果と比較対象の現状

公開されたベンチマーク結果では、Pro版がDeepSWE v1.1で71.9、Flash版が67.9のスコアを記録した。Code AgentカテゴリではProgramBenchでPro版が26.5、Flash版が26.0を示している。

汎用エージェント性能ではAutomationBench v1.0.6でPro版が53.1、Flash版が52.3をマークした。OSWorld-VerifiedではPro版が82.0、Flash版が80.8を記録している。

サイバーセキュリティ関連のテストでも目覚ましい結果が出ている。CyberGymでPro版が94.0、Flash版が95.1を示した。ExploitGymではPro版が17.8、Flash版が6.0となっている。

MiMo-V2.6シリーズのアーキテクチャ比較
構成要素Pro版Flash版
総パラメータ1.02T309B
活性化パラメータ42B15B
レイヤー数7048
隠れ層サイズ61444096

比較対象として表に挙げられているClaude Opus 5、GPT-5.6 Sol、Claude Fable 5の正確なリリース状況は資料のみでは確定していない。内部開発名称か公開済みのモデルかは現時点で不明だ。

MiMo Code BenchではPro版が63.2、Flash版が61.2を記録した。Terminal Bench 2.1ではPro版が89.9、Flash版が87.6を示している。

デプロイ環境の整備と今後の展開

技術者向けにSGLangとvLLMでのデプロイ手順が公開されている。Dockerイメージはlmsysorg/sglangとvllm/vllm-openai:mimov25-cu129が提供されている。

SGLangではTP(Tensor Parallelism)16、DP(Data Parallelism)2の構成で起動できる。vLLMではTP 8または4の設定例が示されている。両フレームワークともMIMO形式の推論パーサーとツールコールパーサーに対応している。

OpenRouterやXiaomi公式のAPIプラットフォーム、MiMo Desktopでも利用可能だ。ローカル環境ではメモリ消費を抑えるため、Flash版の15B活性化パラメータが消費GPU VRAMの目安となる。

技術レポートの公開とコミュニティDiscord、Reddit、Telegramでの議論が既に始まっている。2026年9月22日の公開を皮切りに、SGLangクックブックやvLLMレシピの更新が追って予定されている。

Pro版とFlash版の具体的な推論速度やメモリ使用量の差異数値は明記されていない。今後のベンチマーク比較や最適化パラメータの公開が期待される。

出典