Q4 · 4K チャンク基準

DeepSeek-V4-Flash-0731 (MoE): 304B中のトークンあたり13Bが活性化されるMoEモデル · Q4実行メモリ約181GB

DeepSeek-V4-Flash-0731 (MoE) Q4実行に必要な約181GBメモリおよびデバイス別プリフィル、トークン生成速度、量子化および1,048,576トークン文脈条件を比較します。

モデル仕様

Q4で必要なメモリ
約181GB
総パラメータ
304B
活性パラメータ
13B
ネイティブコンテキスト
1,048,576 トークン

304Bパラメータ(13B活性)の大规模MoEモデルで、公式では1,048,576(1M)トークンコンテキスト(max_position_embeddings)をサポートしています。公式の例では4×GB300ノードを使用し、コミュニティ版の圧縮版はアーテファクトごとの実際サイズおよびランタイムの互換性を別途確認する必要があります。

代表設備

デバイス別速度チューニング

デバイスを選択すると、量子化、安全なコンテキスト、GPU オフロード、Flash Attention、KVキャッシュおよびバッチ開始値を一括で確認できます。

DeepSeek-V4-Flash:304Bモデルの分散実行設定

このモデルのプリフィル・トークン生成速度の確認