メモリとモデル
Mac Studio M5 Ultra、SSDが速くなるとローカルAIも速くなる?
M5 Ultra搭載Mac Studioを調べていると、SSD1も大幅に速くなったという話が目に入ります。高価な買い物を考える身にはうれしい話です。そこで、メモリを少し減らしてSSDに予算を回してもよいのでは、と考えたくなります。モデルを初めて開く場面と、読み込み済みのモデルに続けて話しかける場面を分けると、答えが見えてきます。
速いSSDで、どの待ち時間が減る?
チャットアプリでモデルを選んでも、すぐ回答が出るわけではありません。保存されているモデルを使える状態にし、質問や添付文書を処理し、最後にトークン2を生成します。画面上ではどれも待ち時間ですが、コンピューターがしている仕事は異なります。
SSDの改善が最も直接効くのは最初の段階です。コーディング用、画像用、会話用とモデルを入れ替えるなら、一日に何度も通る区間です。一つのモデルを起動したまま使う人は、最初の待ち時間が減っても、その後の会話では違いをあまり感じないかもしれません。
| 画面で起きていること | 主な処理 | SSDとの関係 |
|---|---|---|
| モデルを開いている | 重みの読み込みと実行準備 | ディスクから読む区間に直接影響 |
| 送信して最初の回答を待つ | プリフィルとキャッシュ処理 | 読み込み済みなら演算や文脈の条件が重要 |
| 回答が書き足される | トークンを続けて書くデコード | 通常のメモリ常駐実行ではメモリと演算が中心 |
ローカルLLMで発生する三つの待ち時間
モデルを開いている
- 主な処理
- 重みの読み込みと実行準備
- SSDとの関係
- ディスクから読む区間に直接影響
送信して最初の回答を待つ
- 主な処理
- プリフィルとキャッシュ処理
- SSDとの関係
- 読み込み済みなら演算や文脈の条件が重要
回答が書き足される
- 主な処理
- トークンを続けて書くデコード
- SSDとの関係
- 通常のメモリ常駐実行ではメモリと演算が中心

約14GB/sという数字の読み方
Tom’s GuideのM5 Ultraレビューでは、4TB SSD構成でBlackmagicの読み込み13,902MB/s、書き込み14,283MB/sを記録しています。その構成のディスク測定値であり、すべての容量の保証値でも、LLM3の生成速度に掛けられる倍率でもありません。
仮に70GBを読むとします。一定の7GB/sなら転送に10秒、14GB/sなら5秒です。これは転送だけを切り出した説明用の計算で、モデル読み込みの実測ではありません。ファイル処理、メモリ確保、実行準備もあるので、アプリの待ち時間全体が半分になるとは限りません。
2回目にモデルを開くと速かったとしても、SSDだけの効果とは限りません。OSが直前に読んだファイルをメモリに残している場合があります。このファイルキャッシュと、入力の計算結果を再利用するプロンプトキャッシュは別物です。両方を一括して初回・2回目と扱うと、ディスクと推論の性能を取り違えます。
モデルは起動済みなのに回答が遅いなら
モデルがユニファイドメモリ4に収まり、スワップやオフロード5なしで動く場合、生成中の主なデータ移動先はSSDではなくメモリと演算装置です。書庫から本を素早く取り出せても、机に広げた後の読書速度まで書庫が決めるわけではありません。SSDの読み込み速度から、そのまま毎秒トークン数は計算できません。
送信後しばらく静かで、その後は回答が速く出るなら、まず入力の長さを見ましょう。長い文書や会話履歴のプリフィル6に時間がかかっているかもしれません。最初の回答はすぐ出るのに続きが遅いなら、モデルサイズ、量子化7、実行エンジン、デコード8の高速化設定を確認します。両方に同じSSD増強を勧めることはできません。
このサイトの速度体験もプリフィルとデコードを分けています。表示される待ち時間は、SSDからモデルファイルを最初に読み込む時間ではありません。実行準備が整ったモデルが、その入力長でどう応答するかの比較に使えます。
一部をSSDに置いて実行する場合は別
モデル全体がメモリに収まるとは限りません。対応モデルとエンジンでは、大きな参照テーブルをSSDに残し、必要な項目だけ読むPLE9オフロードを使えます。資料一式を毎回運ぶのではなく、必要な索引カードを取り出すような仕組みです。この場合は生成中もディスクを読むため、SSD性能が再び重要になります。
MacStoriesでは、80コアGPU10・256GBのM5 UltraでQwen3.8-Flash-Next oQ8eのPLEテーブルをSSDに置いて実行しています。oMLX 0.7.0.dev2、MTP11深度3で文章生成の中央値は86.8 tok/s、回答中に観測したプロセスメモリは約187GBでした。重みだけの容量ではありません。実行例ではありますが、SSDだけを変えた比較実験ではありません。
MTPとPLEオフロードは役割が異なります。MTPは先のトークン候補を提案して生成の反復を減らし、PLEオフロードは一部データの保存場所を変えます。エンジンがその組み合わせに対応すれば併用できます。ただし全モデル共通の設定ではなく、通常のn-gram12投機的デコードと同じ機能でもありません。
大きなファイルを順番に読む速さと、小さな項目をあちこちから読む速さは異なります。読み終えた項目がOSのファイルキャッシュにどれだけ残るかも影響します。SSDのベンチマークが2倍でも、オフロード時のデコードを2倍とは見積もれません。

256GBと高速SSDで512GBメモリの代わりになる?
特定のモデル一つなら選択肢になり得ますが、すべてに使える置き換えの公式ではありません。選択的オフロードに対応しないモデルもあり、長い文脈のKVキャッシュ13や別のモデルもメモリを使います。ファイル容量と公称256GBだけを比べて、収まると判断することはできません。
OSのスワップも別に考える必要があります。エンジンが移すデータを選ぶPLEオフロードとは違い、メモリ不足で必要なデータを追い出しては読み直す状態になると、応答が途切れたり待ち時間が伸びたりします。速いSSDはその負担を軽くしても、メモリに余裕がある状態と同じにはなりません。
逆にモデルと文脈が十分収まっているなら、512GBに増やしても回答が自動的に2倍速くなるわけではありません。大容量メモリの価値は、より大きなモデル、長い文脈、複数モデルを使う余裕です。いつか試すかもしれない最大モデルより、毎日起動しておくモデルとアプリを先に書き出す方が判断しやすくなります。
まずメモリ。ただし、困っている場所を確かめる
毎日使うモデルでメモリがぎりぎりなら、先にメモリを確保します。安定して動かないまま読み込みだけ速くなっても、解決することは多くありません。モデル、KVキャッシュ、他のアプリの余裕を取り、その後によく使うモデルと作業ファイルのSSD容量を選ぶ順序が無難です。
メモリに余裕があり、複数の大きなモデルを切り替えるなら事情が変わります。切り替えのたびに読み込み時間がかかるので、高速ストレージの恩恵を何度も受けます。画像生成のチェックポイント14を頻繁に交換する場合も近い使い方です。ただし、大容量SSDほど必ず速いとは考えず、購入予定の容量の測定結果を確認しましょう。
たまに試すモデルをたくさん保存するなら、外付けSSDも選択肢です。日常的に使うファイルは内蔵に、それ以外は外部に置けます。ただし速度はドライブ、ケース、接続規格、ケーブル、発熱に左右されます。Thunderbolt 5という名前だけで、内蔵SSDと同じ速度とは計算できません。

すでにMacがあるなら、買う前に確認したいこと
普段使うモデルと質問を一つ決め、モデルを開く時間、回答が始まるまで、その後の生成速度を分けて見ます。アクティビティモニタではメモリプレッシャーとスワップも確認します。累積値だけでなく、その作業中に増えるか、応答の遅れと重なるかを見ましょう。
並べて比べるなら、モデルファイル、量子化、入力長、エンジンの版、MTP設定をそろえます。ファイルキャッシュとプロンプトキャッシュの状態も記録します。モデル交換が面倒なのか、長文処理が遅いのか、メモリが足りないのかが分かれば、変えるべき部分もはっきりします。
M5 Ultraを選ぶ理由はSSDだけでなくていい
良い機材を買えば今のもどかしさがなくなる、と期待するのは自然です。大切なのは、そのもどかしさの原因です。同じモデルと長く会話する人はメモリと応答速度を、複数モデルを行き来する人は読み込み時間も重視します。同じM5 Ultraでも、合う構成は人によって変わります。
まず使いたいモデルを選び、プリフィルとデコードを体感してみましょう。その速度で十分で、メモリにも余裕があれば、SSDは保存容量と切り替えの便利さで決められます。大きな数字より、自分が待っている区間を短くする部分に予算を使う方が納得しやすい買い物になります。
用語の注釈
SSD — フラッシュメモリを使うデータ保存装置です。電源を切ってもデータが保持され、システムメモリとは役割が異なります。
本文に戻るトークン — モデルが入力や出力を分けて処理する単位です。1トークンが1文字や一定の時間に相当するわけではありません。
本文に戻る大規模言語モデル — 大量のテキストデータで学習し、テキストを処理・生成する言語モデルです。機能や対応入力はモデルごとに異なります。
本文に戻るユニファイドメモリ — CPUとGPUが同じ物理メモリ領域を共有する構造です。メモリ総量が増えるわけではなく、利用可能量はシステムによります。
本文に戻るオフロード — 容量が足りないとき、モデルデータの一部をGPUメモリからシステムRAMやストレージへ移して処理する方法です。データ転送が追加されます。
本文に戻るプリフィル — LLMが入力プロンプトを読み、各トークンの内部表現を計算する段階です。プロンプトが長いほど処理するトークンが増えます。
本文に戻る量子化 — モデルの数値を少ないビット数で表す方法です。メモリ使用量のほか、精度や実行速度も変わることがあり、影響は形式と実装によります。
本文に戻るデコード — LLMでは入力処理後に出力トークンを生成する段階です。VAEやオーディオコーデックでは、圧縮表現や符号化データから元の形式を復元する処理を指すことがあります。
本文に戻るPLE埋め込みテーブル — Per-Layer Embeddingの略で、モデルの特定の層に埋め込み情報を加える構造です。Qwen Flash-Next系はn-gramテーブルを使い、対応する実行環境ではRAMやSSDへオフロードできます。
本文に戻るGPU — 多くの計算を並列に処理するプロセッサーです。AIモデルの実行ではモデル計算を担います。
本文に戻るMTP — 複数の将来トークンを予測する学習方式またはモデル構成です。生成速度への効果は実装や実行条件によります。
本文に戻るn-gram — 連続するn個のトークンまたは項目からなる列です。文脈検索や投機的生成に使われるほか、一部モデルでは埋め込みテーブルの項目にもなります。
本文に戻るKVキャッシュ — 過去トークンのAttention用キー・バリューを保存し、後続トークン生成で再利用するメモリです。容量はコンテキスト長やバッチサイズで変わります。
本文に戻るチェックポイント — 学習済みモデルの重みなどを保存したファイルです。同じモデル系列でも、版や用途によって異なるチェックポイントを使うことがあります。
本文に戻る