まず読み込み
ローカルLLMの始め方:導入と自分のPCに合うモデル選び
ローカルLLMを調べると、すぐ高価なGPUや大きなメモリ容量が目に入ります。最初の目標は、自分の質問に自分のPCが答える場面を見ること。その後なら、足りないものを具体的に判断できます。
要点
- 01
- 導入前にブラウザLLMで短い質問を試せます。
- 02
- 画面で選ぶならLM Studio、コマンドで繰り返すならOllamaが候補です。
- 03
- モデル以外に文脈と実行用メモリも必要です。小さなモデルと短い入力から始めます。
インストール前に一つ質問
ブラウザ体験のモデルを取得して短く質問します。初回取得には通信が必要で、推論は対応ブラウザのWebGPUで行います。モデルはQwen 3.5 0.8B Q4。大規模モデルの能力を測るものではなく、ローカル実行を見る出発点です。
手元の食材で作れる料理など、自分で妥当性を判断できる質問が向いています。最新ニュースや専門知識から始めると、知識の質と実行の成否を混同しやすくなります。

確認するメモリは二つ
Windowsではタスクマネージャーでシステムメモリと専用GPUメモリを確認します。共有メモリを専用VRAMに足して考えないでください。Macは「このMacについて」でチップとメモリを確認し、OSと共有する分も残します。
ファイルサイズは目安の一つです。会話が長くなると作業領域も必要で、他のアプリもメモリを使います。小型モデル一つと短い会話から始めれば、何を減らすと問題が解消するか分かります。

最初はアプリを一つ選ぶ
LM Studioは検索・ダウンロード・チャットを画面で進めやすく、Ollamaはモデル名を指定するコマンドや連携に向いています。両方を入れる必要はなく、使いやすい方で最初の回答を受け取りましょう。
同じモデル名でもGGUF、MLX、ブラウザ用MLCはそのまま交換できるファイルではありません。使うアプリの対応形式を選び、各導入ガイドの手順に沿って進めます。
動いたら同じ三つの質問で確認
短文の修正、内容を知っている文章の要約、条件付きの簡単な質問を用意します。速度だけでなく、長さの指定、作り話、条件の見落としも確認。同じ質問を残すとモデル変更後も比べやすくなります。
初回だけ遅ければモデルの読み込みかもしれません。文字が出る前の待ち時間と、出始めてからの遅さでは、改善すべき段階が違います。

いつ上位モデルや新しい機器が必要か
小型モデルが条件を落とすなら上位モデル、内容に満足していて遅いなら速度、長文だけ失敗するなら文脈とメモリを見ます。分けて考えると、買い替えで何を解決したいか明確になります。
速度比較ではモデルと入力長を固定して機器だけ変えます。予算や拡張性なら機器ガイド、手元の機器を生かすなら実行レシピへ。まず一問が終われば、十分な最初の一歩です。