Q4 · 4K チャンク基準
Qwen3.8-Flash-Next: 125B中、トークンあたり6Bが活性化されるMoEモデル · Q4実行メモリ約108GB
Qwen3.8-Flash-Next Q4実行に必要な約108GBメモリおよびデバイス別プリフィル、トークン生成速度、量子化および262,144トークン文脈条件を比較します。
モデル仕様
- Q4で必要なメモリ
- 約108GB
- 総パラメータ
- 125B
- 活性パラメータ
- 6B
- ネイティブコンテキスト
- 262,144 トークン
約180Bの在住重みを持つMoEモデルで、125BコアLM(6Bアクティブ)およびアーキテクチャ内蔵の51B n-gram/PLEインベーディングおよび4B MTPで構成されています。内蔵された51B PLEインベーディングテーブルはRAMオフロードが可能であり、プロンプト内の繰り返し文脈を検出するプロンプトリクエスト検索(Prompt Lookup)と投機的デコーディングとは別に機能します。
代表設備
- RTX 3090 24GB — 利用可能: 22.5GB, 936GB/s · 速度を体感 · 価格・電力・販売構成
- RTX PRO 6000 96GB — 利用可能: 93GB, 1792GB/s 速度を体感 · 価格・電力・販売構成
- MBP M3 Max 128GB — 利用可能: 114GB, 400GB/s · 速度を体感 · 価格・電力・販売構成
デバイス別速度チューニング
デバイスを選択すると、量子化、安全なコンテキスト、GPU オフロード、Flash Attention、KVキャッシュおよびバッチ開始値を一括で確認できます。