計算基準
ローカルLLMの速度・コスト計算基準:1つの数字で結論を下すのではなく、同じ条件の範囲を比較します。
ローカルLLMデバイス別に、プリフィル、最初のトークン時間、デコード速度、メモリロード、電力消費、価格およびTCOを、どのような条件および補正基準に基づいて計算するかを説明します。
基本比較条件
デバイス詳細ページの代表比較は、Q4量子化、4K文脈、単一ユーザー条件に基づきます。モデルの重みおよび実行オーバヘッド、KVキャッシュが実際に使用可能なメモリ内に収まっているかをまず確認します。
プリフィルとデコード
プリフィルは入力トークンを処理する段階、デコードは回答トークンを順次生成する段階に分けられます。ハードウェアスペックと一致したベンチマーキング範囲を条件ごとに補正し、全体のフローから離れた値は代表範囲から除外します。
電力・価格・TCO
電力は瞬間最大値ではなく、ローカル推論の継続的な負荷範囲で計算されます。TCOは購入コスト、予想売却価格、電気料金、実際に代替するサブスクリプション料金を1年および2年で割って比較します。
制限
ランタイムバージョン、冷却、量子化ファイル、文脈長およびマルチGPU通信によって実際の結果が異なる可能性があります。そのため、購入直前には選択したモデルと正確なメモリ構成で速度体験ツールを再度確認することをお勧めします。
2026.09 更新