プリフィル・トークン生成速度

自分の機器でローカルAIはどれくらい速い?

自分のMacやGPUで動くローカルLLMと速度を確認できます。プリフィル、生成速度、必要メモリ、電力、価格、TCOを同じ条件で比較します。

ローカルLLMが初めてなら:意味・導入・PC要件から →
307 GB/s
27B
14.7 ~ 17.1 tok/sデコード速度
モデル全体のロード(17.56GB / 56GB)
最初のトークン (TTFT)
8.6 ~ 10.0秒コンテキスト 4,096トークンを含む
プリフィル速度
412 ~ 479 tok/s8.6 ~ 9.9秒 (ユーザー提出記録に基づく推定)
全体消費時間(E2E)
約20.4 ~ 23.8秒203トークン回答合計
再生ボタンを押すと、文脈プリフィル後に生成が開始されます。
待機中
詳細条件を展開する 4-bit · 4K · 通常のデコード
量子化精度必要 17.56GB
入力文脈長4K トークン
基本
基本
例質問:
203 トークン回答

構成確認

MBP M5 Pro 64GB · メモリ 64GB

Qwen3.8 27B Q4_K_M の構成です。販売ページのメモリ容量が同じか確認してください。

すでに持っている方は実行設定へ

他のデバイスと並べてみましょうか?

同じモデルでプリフィルから比較したり、トークン生成速度だけを並べて確認できます。

文書が長くなると、どう変わる?入力長ごとの待ち時間・速度・メモリを開く
詳細分析および全体 45ハードウェア比較▼

代表的な条件

20件をすべて見る