Q4 · 4K チャンク基準

GLM-5.3-Flash(MoE): 320B中の18Bがトークンごとに活性化されるMoEモデル · Q4実行メモリ約191GB

GLM-5.3-Flash (MoE) Q4実行に必要な約191GBメモリおよびデバイス別プリフィル、トークン生成速度、量子化および1,048,576トークン文脈条件を比較します。

モデル仕様

Q4で必要なメモリ
約191GB
総パラメータ
320B
活性パラメータ
18B
ネイティブコンテキスト
1,048,576 トークン

ハイブリッド稀疏+線形アテンション MoEモデルで、合計320Bパラメータ(18Bアクティブ)です。公式1,048,576(1M)トークンコンテキスト(text_config.max_position_embeddings)をサポートし、256GB以上の大容量メモリ環境に収容されます。

代表設備

デバイス別速度チューニング

デバイスを選択すると、量子化、安全なコンテキスト、GPU オフロード、Flash Attention、KVキャッシュおよびバッチ開始値を一括で確認できます。

GLM-5.3-Flash:320Bのサーバー向けMoEを動かす

このモデルのプリフィル・トークン生成速度の確認