Q4 · 4K チャンク基準
Qwen3.6 35B-A3B (MoE): モデル全体35B中、トークンあたり3Bが活性化されるMoEモデル · Q4実行メモリ約22GB
Qwen3.6 35B-A3B (MoE) Q4実行に必要な約22GBメモリおよびデバイス別プリフィル、トークン生成速度、量子化および262,144トークン文脈条件を比較します。
モデル仕様
- Q4で必要なメモリ
- 約22GB
- 総パラメータ
- 35B
- 活性パラメータ
- 3B
- ネイティブコンテキスト
- 262,144 トークン
35Bパラメータ中のモードEモデルは、トークンごとに約3Bが活性化されます。メモリロードには35Bの容量が必要であり、デコード帯域幅は3Bの活性パラメータに基づいて消費されます。
代表設備
- RTX 5060 Ti 16GB — 利用可能 15GB、448GB/s · 速度を体感 · 価格・電力・販売構成
- 2×RTX5090 64GB(PCIe)— 使用可能61GB、3584GB/s・ 速度を体感 · 価格・電力・販売構成
- MBA M4 24GB — 20GBが利用可能、120GB/s 速度を体感 · 価格・電力・販売構成
デバイス別速度チューニング
デバイスを選択すると、量子化、安全なコンテキスト、GPU オフロード、Flash Attention、KVキャッシュおよびバッチ開始値を一括で確認できます。