Q4 · 4K チャンク基準

Qwen3.6 35B-A3B (MoE): モデル全体35B中、トークンあたり3Bが活性化されるMoEモデル · Q4実行メモリ約22GB

Qwen3.6 35B-A3B (MoE) Q4実行に必要な約22GBメモリおよびデバイス別プリフィル、トークン生成速度、量子化および262,144トークン文脈条件を比較します。

モデル仕様

Q4で必要なメモリ
約22GB
総パラメータ
35B
活性パラメータ
3B
ネイティブコンテキスト
262,144 トークン

35Bパラメータ中のモードEモデルは、トークンごとに約3Bが活性化されます。メモリロードには35Bの容量が必要であり、デコード帯域幅は3Bの活性パラメータに基づいて消費されます。

代表設備

デバイス別速度チューニング

デバイスを選択すると、量子化、安全なコンテキスト、GPU オフロード、Flash Attention、KVキャッシュおよびバッチ開始値を一括で確認できます。

Qwen3.6 35B-A3B:vLLMとqwen3パーサーの設定

このモデルのプリフィル・トークン生成速度の確認