新規モデル · 2026-09-04

Qwen3.8-Flash-Next:有効6Bでも180Bを載せる理由

「アクティブ6B」という説明を見ると、軽量モデルのように感じますが、実際のファイルサイズははるかに大きく、128GBのデバイスでも特別な設定が必要だと言われます。Qwen3.8-Flash-Nextを理解するには、計算する部分と保存する部分がなぜ異なるのかをまず区別しなければなりません。

「小さい」のは、モデルのどの部分か

Flash-Nextは、一部の専門家を選択して計算を行うMoE構造です。活性スケールは、1トークンあたりの使用されるパスを説明します。モデルの全重みをその分だけダウンロードするか、小さなGPUに収めるかという意味ではありません。

このモデルの登録構成は、コアLM約125B、PLEシリーズテーブル約51B、MTP約4Bを区別しています。総計約180Bの保存規模とトークンあたり約6Bの活性値を同じ容量のキャリアに収めることで、機器の要件を大きく誤解する可能性があります。

大規模重みの保存壁においては、一部のモジュールのみが動作する。以下は、活性化された稀疏モデルの作業室の写真。
各トークンについて約6Bが活性化されても、全体の重みはアクセス可能なメモリまたはストレージデバイス上に存在しなければならず、小型モデルのようにロードすることはできません。

大きなテーブルを別の場所に移す方法

PLEテーブルをRAMまたはSSDに配置するサポートパスがあることで、高速メモリの負担を軽減できます。これは、デコード候補を生成する繰り返し文脈の加速とは異なります。MTPは候補予測、PLEオフロードは保存位置という役割を分けましょう。

保存位置を変更すると、検索および送信コストが発生する可能性があります。特にSSDパスでは、最初のアクセスとキャッシュが残る再アクセスの差が大きくなります。モデルが実行されたという利点および通常の質問が速く終了するという利点を別々に確認すべきです。

アクセラレータとシステムメモリ、ストレージデバイスが3層に分かれた大型モデルのロード作業用の写真
コアモデルとPLEテーブル、キャッシュの位置を分けることで、制限された高速メモリでも実行経路を構成できるものの、ストレージデバイスの転送遅延が付きまとう。

Spark 1台の測定値は、実行環境とセットで読む

単一のDGX Sparkの実験パスは、特定のNVFP4チェックポイントおよびPLE mmapパッチなどの構成を使用します。命令1行またはトークン速度だけを取得する場合、必要なファイルやパッチが欠落する可能性があります。一般的なインストールで即座に再現されるとは限りません。

128GBの範囲内でGPUとCPUの位置を変更するだけでは、物理メモリの容量は増加しません。NVMeに格納されている部分、それ以外の重みとKVキャッシュがどこに存在しているかを確認することで、単一デバイス経路が可能である理由を理解できます。

2台の小型AIコンピュータが、短い高速ケーブルで接続された様子
2ノード構成ではモデルを1台よりも十分に分割して配置できますが、1つの回答の速度はデバイス数に比例して増加しません。

2つのデバイスを接続するときに得られるものは何でしょうか?

2つのノードに分散して保持することで、空間の余裕を増やすことができます。一方で、計算中に結果をやり取りする時間が増えます。1つの回答の速度が正確に2倍になるとは限りず、モデルの分割や接続・加速設定によって異なります。

2つの結果と1つの結果を比較する際には、モデルファイルおよびMTP、入力長を一致させる必要があります。異なる圧縮バージョンの最高記録をデバイス数の効果だけによって説明する場合、次の購入でも同様の差を期待することになります。

この実験が私に必要かどうか

新しい実行パスを試してみるのは、大きなモデルを扱うことに興味がある場合に十分に魅力的な選択です。しかし、毎日ドキュメントやコードを処理するツールが必要な場合は、インストールや復元、更新の負担も一緒に考慮すべきです。

複雑性を増す必要はありません。逆に、このモデルでしか得られない結果であれば、そのレシピの条件を確認し、期待される体験を比較してください。実行可能であるという状態に加え、続けて使えるという状態を持つモデルです。