Q4 · 4K チャンク基準
GLM-5.3-Flash(MoE): 320B中の18Bがトークンごとに活性化されるMoEモデル · Q4実行メモリ約191GB
GLM-5.3-Flash (MoE) Q4実行に必要な約191GBメモリおよびデバイス別プリフィル、トークン生成速度、量子化および1,048,576トークン文脈条件を比較します。
モデル仕様
- Q4で必要なメモリ
- 約191GB
- 総パラメータ
- 320B
- 活性パラメータ
- 18B
- ネイティブコンテキスト
- 1,048,576 トークン
ハイブリッド稀疏+線形アテンション MoEモデルで、合計320Bパラメータ(18Bアクティブ)です。公式1,048,576(1M)トークンコンテキスト(text_config.max_position_embeddings)をサポートし、256GB以上の大容量メモリ環境に収容されます。
代表設備
- 2×RTX5090 64GB(PCIe)— 使用可能61GB、3584GB/s・ 速度を体感 · 価格・電力・販売構成
- Studio M5 Ultra 256GB — 236GBが利用可能、1200GB/s 速度を体感 · 価格・電力・販売構成
- Studio M3 Ultra 512GB — 480GBが利用可能、819GB/s 速度を体感 · 価格・電力・販売構成
デバイス別速度チューニング
デバイスを選択すると、量子化、安全なコンテキスト、GPU オフロード、Flash Attention、KVキャッシュおよびバッチ開始値を一括で確認できます。