Q4 · 4K チャンク基準
Gemma 4 26B-A4B (MoE): 25.2B中の3.8Bがトークンごとに活性化されるMoEモデル · Q4実行メモリ約16GB
Gemma 4 26B-A4B (MoE) Q4実行に必要な約16GBメモリおよびデバイス別プリフィル、トークン生成速度、量子化および262,144トークン文脈条件を比較します。
モデル仕様
- Q4で必要なメモリ
- 約16GB
- 総パラメータ
- 25.2B
- 活性パラメータ
- 3.8B
- ネイティブコンテキスト
- 262,144 トークン
25.2Bパラメータ中のモードEモデルで、トークンごとに3.8Bが活性化されます。256K(262,144)のネイティブコンテキストをサポートし、ロード対比で高速なデコードを提供します。
代表設備
- RTX 5060 Ti 16GB — 利用可能 15GB、448GB/s · 速度を体感 · 価格・電力・販売構成
- 2×RTX5090 64GB(PCIe)— 使用可能61GB、3584GB/s・ 速度を体感 · 価格・電力・販売構成
- MBA M4 16GB — 利用可能: 13GB, 120GB/s · 速度を体感 · 価格・電力・販売構成
デバイス別速度チューニング
デバイスを選択すると、量子化、安全なコンテキスト、GPU オフロード、Flash Attention、KVキャッシュおよびバッチ開始値を一括で確認できます。