応答速度と加速

ローカルAI速度レポート:2026年9月

スピードテーブルを開くと、自然に最も高い数字から見つかります。しかし、そのデバイスが私にとって最も良い選択であるかどうかは、別の問題です。今回のテーブルでは、回答を生成する速度だけでなく、開始前の待ち時間も確認しています。順位を暗記するのではなく、候補を2つに絞った資料として読んでください。

この月のデバイス速度表

Qwen3.6 35B-A3B · 入力 4,096トークン · 出力 302トークン · 2026-09-05 保存予想値。範囲が重なる装置の優劣は確定しません。

機器実行設定最初のトークントークン生成全体完了
RTX 5090 32GBllama.cpp CUDA · Q4_K_M0.582秒111.5 ~ 280 tok/s約2.47秒
2× RTX 3090 48GB (NVLink)llama.cpp CUDA · Q4_K_M · GPU2台分離0.975秒79.2 ~ 248.6 tok/s約3.48秒
MBP M5 Max 128GBMLX 4ビット2.093秒43.1 ~ 92.1 tok/s約7.22秒
DGX Spark 128GBllama.cpp · Q4_K_M2.033秒17 ~ 42.7 tok/s約14.41秒
Mac mini M4 Pro 64GBMLX 4ビット4.473秒19.6 ~ 46.1 tok/s約15.41秒
Ryzen AI Max+ 395 128GBllama.cpp HIP · Q4_K_M37.873秒15.9 ~ 40 tok/s約51.1秒

この表は、比較するシーンから見ていきます

この記録は、Qwen3.6 35B-A3Bの4ビットモデル、入力4,096トークンと回答302トークンの条件を使用しています。質問やモデルを自由に混ぜた最高記録の集合ではありません。同じタスクを担当するという仮定のもと、機器の差を確認するための固定条件です。

この値は、仕様およびベンチマーキーの補正を用いた計算結果です。すべてのデバイスを直接所有して測定した値ではありません。根拠のないMTP倍率を一括適用していません。複数のデバイス構成は、モデルを分割する条件の予想値をサポートランタイムがもつ状態を示しています。

制限的な月次ベンチマーキング作業の図で、複数のローカルAIデバイスを同じ条件で検証する。
月間速度表は、同じモデルと量子化、入力長を固定して、機器間の実感される差を一目で比較します。

まず、メモリ容量で候補を絞る

生成速度が速く見えるとしても、望むモデルとキャッシュを収容できないならば、同じ条件の候補とは言えません。特に、マックの全メモリとGPU専用VRAMをモデルだけが使用する空間のように比較するのは適切ではありません。使用可能な空間は、オペレーティングシステムと実行プログラムの割当を残した部分を確認してください。

大きなMoEモデルは活性計算量が小さいため速く動作する可能性があるが、全体の重みは保存しなければならない。今回のモデルで良かったデバイスが他の大規模モデルでも十分であると拡大解釈しないで、使用するモデルが異なる場合は計算機で変更して確認してください。

プリフィルの入力読み取り段階と、回答を継続して書くデコード段階が二本の分岐で流れている図
長いドキュメントを読み込む速度と、回答トークンが連続して生成される速度を分離することで、適したデバイスが見えてきます。

次に、どの待ち時間が長いかを見る

ドキュメントを投入して短く要約を要求する場合、最初のトークンまでの時間は重要です。短い指示で長い文章を書くときは、デコード速度がより長い期間影響を与えます。両方の値が常に1つのデバイスで良好であるとは限りません。

プリフィルを含めて同じモデルでテストした後、トークン生成だけを比較してみてください。最初は大きく見えていた差は、私の実際の作業では小さくなる可能性があります。逆に、総完了時間は似ているものの、答えが遅く開始される側の方がより不快に感じられる可能性があります。

マックと単一GPU、デュアルGPU、小型AIシステムを同じ作業台に並べた機器構成図
デバイス数や表示メモリが増しても、1つのリクエストの速度や複数のリクエスト処理能力は同等の割合で増加しません。

「1ヶ月前よりも順位が上がった」という表現の条件

このページは2026年9月5日に保存された計算記録です。現在の計算機の設定や補正値が変更されても、テーブルを静かに上書きすることはしません。誤り訂正および新しい月の比較では、変更履歴を区別しなければ、過去のリンクを読む人でも同じ内容を理解することはできません。

今後、他の月と比較する際には、モデル・精度・入力長が維持されているかを最初に確認すべきです。条件が変わった表の順位変化をすぐに機器性能の向上として評価することはできません。ランタイム改善か計算基準の修正かは別問題です。

1位の機器が予算に合わなかったら

順位が1段階低い場合でも、自分の作業に十分な性能があれば購入候補として残ることができます。逆に価格差が小さく、毎日長い回答を待つ必要がある場合は、上位設備にコストをかける理由が生まれます。順位だけではその判断を代用することはできません。

関心のある2つのデバイスを比較画面に配置し、条件を共有してみましょう。「どちらが良いですか?」ではなく、「このモデルでこの長さのドキュメントを処理するとき、この差額が許容できるでしょうか?」と問えば、より具体的な答えを得られます。この表の役割は、購入を急ぐことではなく、次に確認すべき質問を減らすことにあります。