TERNARY_PQ2 · 4K 문맥 기준

Bonsai 2 27B 27.36BのDenseモデル · TERNARY_PQ2の推定メモリ約9GB

Qwen3.8-27Bから派生した3値重みモデルです。PQ2_0言語重みは7.21GBで、通常のllama.cppではなくHadamard変換対応ランタイムが必要です。速度体験ではPrismML公開のPQ2_0測定値を優先します。

TERNARY_PQ2 推定メモリ
約9GB
総パラメータ
27.36B
活性パラメータ
27.36B
ネイティブコンテキスト
256K

モデルから探す

このモデルに合う機器を探す

文書検索も同時に動かすなら

埋め込み・再ランキングモデルを同じGPUまたはユニファイドメモリに置く場合の予備容量です。CPUで別に動かすなら追加なしにしてください。

条件に合う機器 35· 5件を表示

RTX 5060 Ti 16GB

余裕あり · TERNARY_PQ2 · 空き 6.2GB

₩2,100,000

46.6 ~ 51.6 tok/s

Mac mini M4 Pro 24GB

余裕あり · TERNARY_PQ2 · 空き 11.2GB

₩2,650,000

27.3 ~ 30.3 tok/s

Mac mini M4 Pro 48GB

余裕あり · TERNARY_PQ2 · 空き 32.2GB

₩3,035,000

27.3 ~ 30.3 tok/s

RTX 3090 24GB

余裕あり · TERNARY_PQ2 · 空き 13.7GB

₩3,125,000

93.5 ~ 103.9 tok/s

MBP M4 Pro 48GB

余裕あり · TERNARY_PQ2 · 空き 32.2GB

₩3,450,000

27.3 ~ 30.3 tok/s

価格は範囲の中央値です。GPU単体には基本構成の費用を加えています。速度は同じモデル・4K入力での推定です。

実行ガイド

Bonsai 2 27B ローカルサービィング実行レシピ

デバイスを選択すると、量子化、安全なコンテキスト、GPU オフロード、Flash Attention、KVキャッシュおよびバッチ開始値も一緒に変更されます。

デバイス別速度チューニング

デバイスから再選択したい場合

予算、騒音、オペレーティングシステム、および中古許容の有無を基に、モデルが導入される構成をまず絞り込むことができます。