Q4 · 4K チャンク基準

Qwen3.8 27B2.51675648B 밀도형 모델 · Q4_K_M 예상 메모리 약 3GB

2.51675648Bパラメータの密モデルで、131,072トークンのネイティブコンテキストに対応します。表示するメモリと生成速度は量子化・ハードウェア仕様に基づく推定であり、実測値ではありません。

Q4_K_M 예상 메모리
約3GB
総パラメータ
27B
活性パラメータ
27B
ネイティブコンテキスト
256K

このモデルを実行する代表的な設備

RTX 5060 Ti 16GB

利用可能 15GB · 448GB/s

llama.cpp CUDA · Q4_K_M

トークン生成

5.6 ~ 5.7 tok/s

最初のトークン

6.9 ~ 12.2秒

2× RTX 5090 64GB (PCIe)

利用可能 61GB · 3584GB/s

llama.cpp CUDA · Q4_K_M · GPU2台分離

トークン生成

87.6 ~ 135.3 tok/s

最初のトークン

1.4 ~ 3.1秒

MBA M4 16GB

利用可能 13GB · 120GB/s

MLX 4ビット

トークン生成

0.0 tok/s

最初のトークン

0.0秒(メモリ不足)

実行ガイド

Qwen3.8 27B ローカルサービィング実行レシピ

デバイスを選択すると、量子化、安全なコンテキスト、GPU オフロード、Flash Attention、KVキャッシュおよびバッチ開始値も一緒に変更されます。

デバイス別速度チューニング

デバイスから再選択したい場合

予算、騒音、オペレーティングシステム、および中古許容の有無を基に、モデルが導入される構成をまず絞り込むことができます。