応答速度と加速
ローカルAI速度レポート:2026年9月
スピードテーブルを開くと、自然に最も高い数字から見つかります。しかし、そのデバイスが私にとって最も良い選択であるかどうかは、別の問題です。今回のテーブルでは、回答を生成する速度だけでなく、開始前の待ち時間も確認しています。順位を暗記するのではなく、候補を2つに絞った資料として読んでください。
この月のデバイス速度表
Qwen3.6 35B-A3B · 入力 4,096トークン · 出力 302トークン · 2026-09-05 保存予想値。範囲が重なる装置の優劣は確定しません。
| 機器 | 実行設定 | 最初のトークン | トークン生成 | 全体完了 |
|---|---|---|---|---|
| RTX 5090 32GB | llama.cpp CUDA · Q4_K_M | 0.582秒 | 111.5 ~ 280 tok/s | 約2.47秒 |
| 2× RTX 3090 48GB (NVLink) | llama.cpp CUDA · Q4_K_M · GPU2台分離 | 0.975秒 | 79.2 ~ 248.6 tok/s | 約3.48秒 |
| MBP M5 Max 128GB | MLX 4ビット | 2.093秒 | 43.1 ~ 92.1 tok/s | 約7.22秒 |
| DGX Spark 128GB | llama.cpp · Q4_K_M | 2.033秒 | 17 ~ 42.7 tok/s | 約14.41秒 |
| Mac mini M4 Pro 64GB | MLX 4ビット | 4.473秒 | 19.6 ~ 46.1 tok/s | 約15.41秒 |
| Ryzen AI Max+ 395 128GB | llama.cpp HIP · Q4_K_M | 37.873秒 | 15.9 ~ 40 tok/s | 約51.1秒 |
この表は、比較するシーンから見ていきます
この記録は、Qwen3.6 35B-A3Bの4ビットモデル、入力4,096トークンと回答302トークンの条件を使用しています。質問やモデルを自由に混ぜた最高記録の集合ではありません。同じタスクを担当するという仮定のもと、機器の差を確認するための固定条件です。
この値は、仕様およびベンチマーキーの補正を用いた計算結果です。すべてのデバイスを直接所有して測定した値ではありません。根拠のないMTP倍率を一括適用していません。複数のデバイス構成は、モデルを分割する条件の予想値をサポートランタイムがもつ状態を示しています。

まず、メモリ容量で候補を絞る
生成速度が速く見えるとしても、望むモデルとキャッシュを収容できないならば、同じ条件の候補とは言えません。特に、マックの全メモリとGPU専用VRAMをモデルだけが使用する空間のように比較するのは適切ではありません。使用可能な空間は、オペレーティングシステムと実行プログラムの割当を残した部分を確認してください。
大きなMoEモデルは活性計算量が小さいため速く動作する可能性があるが、全体の重みは保存しなければならない。今回のモデルで良かったデバイスが他の大規模モデルでも十分であると拡大解釈しないで、使用するモデルが異なる場合は計算機で変更して確認してください。

次に、どの待ち時間が長いかを見る
ドキュメントを投入して短く要約を要求する場合、最初のトークンまでの時間は重要です。短い指示で長い文章を書くときは、デコード速度がより長い期間影響を与えます。両方の値が常に1つのデバイスで良好であるとは限りません。
プリフィルを含めて同じモデルでテストした後、トークン生成だけを比較してみてください。最初は大きく見えていた差は、私の実際の作業では小さくなる可能性があります。逆に、総完了時間は似ているものの、答えが遅く開始される側の方がより不快に感じられる可能性があります。

「1ヶ月前よりも順位が上がった」という表現の条件
このページは2026年9月5日に保存された計算記録です。現在の計算機の設定や補正値が変更されても、テーブルを静かに上書きすることはしません。誤り訂正および新しい月の比較では、変更履歴を区別しなければ、過去のリンクを読む人でも同じ内容を理解することはできません。
今後、他の月と比較する際には、モデル・精度・入力長が維持されているかを最初に確認すべきです。条件が変わった表の順位変化をすぐに機器性能の向上として評価することはできません。ランタイム改善か計算基準の修正かは別問題です。
1位の機器が予算に合わなかったら
順位が1段階低い場合でも、自分の作業に十分な性能があれば購入候補として残ることができます。逆に価格差が小さく、毎日長い回答を待つ必要がある場合は、上位設備にコストをかける理由が生まれます。順位だけではその判断を代用することはできません。
関心のある2つのデバイスを比較画面に配置し、条件を共有してみましょう。「どちらが良いですか?」ではなく、「このモデルでこの長さのドキュメントを処理するとき、この差額が許容できるでしょうか?」と問えば、より具体的な答えを得られます。この表の役割は、購入を急ぐことではなく、次に確認すべき質問を減らすことにあります。