Q4 · 4K チャンク基準

Qwen3.8-Flash-Next: 125B中、トークンあたり6Bが活性化されるMoEモデル · Q4実行メモリ約108GB

Qwen3.8-Flash-Next Q4実行に必要な約108GBメモリおよびデバイス別プリフィル、トークン生成速度、量子化および262,144トークン文脈条件を比較します。

モデル仕様

Q4で必要なメモリ
約108GB
総パラメータ
125B
活性パラメータ
6B
ネイティブコンテキスト
262,144 トークン

約180Bの在住重みを持つMoEモデルで、125BコアLM(6Bアクティブ)およびアーキテクチャ内蔵の51B n-gram/PLEインベーディングおよび4B MTPで構成されています。内蔵された51B PLEインベーディングテーブルはRAMオフロードが可能であり、プロンプト内の繰り返し文脈を検出するプロンプトリクエスト検索(Prompt Lookup)と投機的デコーディングとは別に機能します。

代表設備

デバイス別速度チューニング

デバイスを選択すると、量子化、安全なコンテキスト、GPU オフロード、Flash Attention、KVキャッシュおよびバッチ開始値を一括で確認できます。

Qwen3.8-Flash-Next:DGX Spark 1台のSGLang設定

このモデルのプリフィル・トークン生成速度の確認