Q4 · 4K チャンク基準

Gemma 4 12B: 11.95B 密度型モデル · Q4実行メモリ約8GB

Gemma 4 12B Q4の実行に必要な約8GBのメモリおよびデバイスごとのプリフィル、トークン生成速度、量子化、および262,144トークンのコンテキストを比較します。

モデル仕様

Q4で必要なメモリ
約8GB
総パラメータ
11.95B
活性パラメータ
11.95B
ネイティブコンテキスト
262,144 トークン

11.95Bパラメータの密度型単一モデルで256K(262,144)のネイティブコンテキストをサポートします。16GB〜24GBのGPUおよびMac環境で高速単独運転が可能です。

代表設備

デバイス別速度チューニング

デバイスを選択すると、量子化、安全なコンテキスト、GPU オフロード、Flash Attention、KVキャッシュおよびバッチ開始値を一括で確認できます。

Gemma 4 12B:16GB機器のLM Studio・vLLM設定

このモデルのプリフィル・トークン生成速度の確認