新規モデル · 2026.09.22

MiMo V2.6 Pro・Flash同時公開:性能はどこまで来たのか

MiMo V2.6を一行で伝えると、Proだけが発表されたように見えがちです。実際はProとFlashが同時に公開されました。Proは総パラメータが1兆を超え、Flashは約309Bまで規模を抑えています。それでもXiaomiが公開したコーディングとエージェント評価では、名前から想像するほど大きな差はありません。最高点だけを並べず、どの試験で強かったのか、Flashを同時に見るべき理由、重みを自分で運用するための機器規模まで順に確認します。

要点

01
ProとFlashは2026年9月21日に同時公開され、どちらもテキスト・画像・動画・音声入力と1Mトークンのコンテキストに対応します。
02
Proは総1.02T・アクティブ42B、Flashは総309B・アクティブ15Bの疎MoEで、どちらも5層MTPデコーダーを備えます。
03
公式表ではDeepSWE v1.1がPro 71.9・Flash 67.9、AutomationBenchが53.1・52.3、OSWorld Verifiedが82.0・80.8です。

ProとFlashは同じ日に出た二つのモデルです

MiMo V2.6の中心はProだけではありません。Xiaomiは2026年9月21日にPro-RLとFlash-RLを同時公開しました。Proは総1.02Tのうちトークンごとに約42B、Flashは総309Bのうち約15Bが動きます。どちらも全専門家を保持しながら、各トークンで一部の経路だけを使う疎MoEです。Flashの15Bを通常の15B密モデルのファイルサイズとして読むと、実行条件を大きく見誤ります。

構造もよく似ています。Proは70層、Flashは48層で、多数の短窓アテンションの間にグローバルアテンションを置きます。専門家はProが384、Flashが256で、1トークンにつき8個を選びます。どちらも5層MTPデコーダーを備え、次の一語だけを順番に予測する方式に限定されません。FlashはProから機能を大きく省いた体験版ではなく、同じ設計をより小さな運用単位に合わせたモデルです。

同じ設計の大小二つの疎モデルで、一部の専門家引き出しだけが動く作業室
ProとFlashは同じ疎MoE系ですが、総保管規模とトークン当たりのアクティブ演算量が異なります。

性能表ではコーディングとエージェント作業から見る

公式結果で特に目を引くのは、知識問題より実際にツールを使う作業です。DeepSWE v1.1はPro 71.9、Flash 67.9、ProgramBenchは26.5と26.0です。AutomationBenchは53.1と52.3、Toolathlonは76.9と73.6でした。Proが上回るものの、Flashは規模差ほど大きく離れていません。複数ファイルを修正し、ツールを呼び出す用途を重視した説明と同じ方向の結果です。

コンピューター操作評価でも差は小さめです。OSWorld VerifiedはPro 82.0、Flash 80.8、JobBenchは62.0と61.2です。Terminal Bench 2.1は89.9と87.6、Visual Codingは72.3と71.5でした。一方、Terminal Bench 4.0では34.9と28.8まで差が広がります。すべての試験で同等ではありませんが、費用と処理量を考える運用ではFlashを独立した候補にできるほど近い項目が多くあります。

一つの計算装置からコード編集、ブラウザー操作、作業検証へ分岐するエージェント作業台
公開結果では、長文生成だけでなくコード修正、ツール利用、コンピューター操作で強さが目立ちます。

Flashが性能を多く残せた仕組み

Flashの総重みはProの約30%、アクティブ演算は約36%ですが、公開スコアは同じ比率では下がっていません。入力形式、長文脈、ツール利用の学習方針を共有し、Flashにも十分な専門家数とMTPデコーダーを残した影響と考えられます。CyberGymではFlash 95.1がPro 94.0を上回り、ProgramBenchの差は0.5点です。大きいモデルがすべての仕事で必ず勝つという結果ではありません。

Flashという名前は低遅延の保証ではありません。実速度は重み精度、テンソル・専門家並列、接続帯域、MTP承認率、同時要求数で変わります。公式カードはFlashについてSGLangのTP8・DP2構成とvLLMのTP4構成を示します。一般向けGPU一枚の最高速度ではなく、複数アクセラレーターへ分けて安定運用する例です。

テキストモデルとしてだけ見ると見落とす部分

両モデルはテキストだけでなく画像・動画・音声を入力できます。約681Mのビジョンエンコーダー、音声トークナイザーとパッチエンコーダーを備え、ネイティブ文脈は1,048,576トークンです。コードを調べながら画面キャプチャを読み、動画や音声も同じ作業へ入れることを一つのモデルで扱う設計です。マルチモーダルが後付け機能ではありません。

1M文脈は最初から最大で使う標準設定ではありません。長い入力はKVキャッシュとプリフィル時間を増やし、画像・動画・音声トークンも加わると一要求の負担が大きくなります。実運用では普段の文書長と同時利用者数を決めてからキャッシュを計算します。1Mをサポートすることと、低遅延で繰り返し処理することは別の機器条件です。

ローカル実行はデスクトップよりサーバーに近い

公式リポジトリのファイルを合計すると、Flashの重みは約177.7GB、Proは約573.5GBです。さらにKVキャッシュとランタイム領域が必要です。32GBや48GBのGPU一枚にアクティブ分だけ載せ、残りを省けるモデルではありません。Flashでも複数の高メモリアクセラレーターか大容量統合メモリのサーバーを前提に見る必要があります。

Proの公式SGLang例は2ノードでTP16・EP16、vLLM例はTP8です。Flashも公式例はTP4以上です。外部APIを使わず自社で運用できる公開重みなので、所有の意味ではローカルAIです。ただし実際のローカルは一台のデスクトップより、組織内のマルチGPUサーバーを指すことが多くなります。公開重みと個人PC向けモデルは同義ではありません。

大きな重み保管箱が六つの接続されたアクセラレーターモジュールへ分割された作業台
Flashでも公式重みは約177.7GBあり、一般向けGPU一枚より複数アクセラレーターへの分割が現実的です。

どんな場合にFlashから検討するか

少人数が最高性能を使う研究環境ならProが基準です。多数のコーディングエージェントや自動化要求を扱い、重要な評価でProとの差が小さいならFlashが現実的な出発点です。同じサーバー費用で処理量を増やすか、初期構成を小さくできます。Terminal Bench 4.0のように差が大きい仕事が重要なら、Proを直接検証する必要があります。

どちらも、試す前に新しい機器を買う規模ではありません。現在失敗しているリポジトリ修正、ブラウザー操作、セキュリティ分析を評価セットにし、レンタル環境か既存クラスターで先に比べる方が安全です。公開スコアは候補を絞る材料です。自分の仕事での成功率、一要求の遅延、同時処理数、運用費を記録してから最終判断をします。