まず読み込み

ローカルLLMの始め方:導入と自分のPCに合うモデル選び

ローカルLLMを調べると、すぐ高価なGPUや大きなメモリ容量が目に入ります。最初の目標は、自分の質問に自分のPCが答える場面を見ること。その後なら、足りないものを具体的に判断できます。

要点

01
導入前にブラウザLLMで短い質問を試せます。
02
画面で選ぶならLM Studio、コマンドで繰り返すならOllamaが候補です。
03
モデル以外に文脈と実行用メモリも必要です。小さなモデルと短い入力から始めます。

インストール前に一つ質問

ブラウザ体験のモデルを取得して短く質問します。初回取得には通信が必要で、推論は対応ブラウザのWebGPUで行います。モデルはQwen 3.5 0.8B Q4。大規模モデルの能力を測るものではなく、ローカル実行を見る出発点です。

手元の食材で作れる料理など、自分で妥当性を判断できる質問が向いています。最新ニュースや専門知識から始めると、知識の質と実行の成否を混同しやすくなります。

自分のPCで質問と推論を行う作業空間
自分のPCで質問と推論を行う作業空間

確認するメモリは二つ

Windowsではタスクマネージャーでシステムメモリと専用GPUメモリを確認します。共有メモリを専用VRAMに足して考えないでください。Macは「このMacについて」でチップとメモリを確認し、OSと共有する分も残します。

ファイルサイズは目安の一つです。会話が長くなると作業領域も必要で、他のアプリもメモリを使います。小型モデル一つと短い会話から始めれば、何を減らすと問題が解消するか分かります。

モデル以外に会話と実行のための空間も必要です。
モデル以外に会話と実行のための空間も必要です。

最初はアプリを一つ選ぶ

LM Studioは検索・ダウンロード・チャットを画面で進めやすく、Ollamaはモデル名を指定するコマンドや連携に向いています。両方を入れる必要はなく、使いやすい方で最初の回答を受け取りましょう。

同じモデル名でもGGUF、MLX、ブラウザ用MLCはそのまま交換できるファイルではありません。使うアプリの対応形式を選び、各導入ガイドの手順に沿って進めます。

動いたら同じ三つの質問で確認

短文の修正、内容を知っている文章の要約、条件付きの簡単な質問を用意します。速度だけでなく、長さの指定、作り話、条件の見落としも確認。同じ質問を残すとモデル変更後も比べやすくなります。

初回だけ遅ければモデルの読み込みかもしれません。文字が出る前の待ち時間と、出始めてからの遅さでは、改善すべき段階が違います。

同じ質問を残しておけば、モデルを変えても比較できます。
同じ質問を残しておけば、モデルを変えても比較できます。

いつ上位モデルや新しい機器が必要か

小型モデルが条件を落とすなら上位モデル、内容に満足していて遅いなら速度、長文だけ失敗するなら文脈とメモリを見ます。分けて考えると、買い替えで何を解決したいか明確になります。

速度比較ではモデルと入力長を固定して機器だけ変えます。予算や拡張性なら機器ガイド、手元の機器を生かすなら実行レシピへ。まず一問が終われば、十分な最初の一歩です。