プリフィル・トークン生成速度
自分の機器でローカルAIはどれくらい速い?
自分のMacやGPUで動くローカルLLMと速度を確認できます。プリフィル、生成速度、必要メモリ、電力、価格、TCOを同じ条件で比較します。
ローカルLLMが初めてなら:意味・導入・PC要件から →最終更新
今必要なもの
307 GB/s
27B
14.7 ~ 17.1 tok/sデコード速度
モデル全体のロード(17.56GB / 56GB)
最初のトークン (TTFT)
8.6 ~ 10.0秒コンテキスト 4,096トークンを含む
プリフィル速度
412 ~ 479 tok/s8.6 ~ 9.9秒 (ユーザー提出記録に基づく推定)
全体消費時間(E2E)
約20.4 ~ 23.8秒203トークン回答合計
再生ボタンを押すと、文脈プリフィル後に生成が開始されます。
待機中
詳細条件を展開する 詳細条件4-bit · 4K · 通常のデコード折りたたむ
量子化精度必要 17.56GB
入力文脈長4K トークン
基本
基本
例質問:
203 トークン回答構成確認
他のデバイスと並べてみましょうか?
同じモデルでプリフィルから比較したり、トークン生成速度だけを並べて確認できます。
文書が長くなると、どう変わる?入力長ごとの待ち時間・速度・メモリを開く
詳細分析および全体 45ハードウェア比較
代表的な条件
機器・モデル別の速度体験
Mac mini M4 32GBのQwen3.8 27B応答速度
5.1 ~ 5.7 tok/s · 16.4 ~ 35.5秒
Qwen3.8 27BにMac mini M4 Pro 48GBは必要?
12.3 ~ 13.7 tok/s · 7.8 ~ 14.3秒
Mac Studio M4 Max 128GBでQwen3.8 27Bは十分?
27.9 ~ 60.4 tok/s · 5.8 ~ 10.5 秒
RTX 3090でQwen3.8 27B、買い替えは必要?
42.3 ~ 46.9 tok/s · 4.4 ~ 7.5秒
