モデル別実行レシピ
Gemma 4 12B:16GB機器のLM Studio・vLLM設定
Gemma 4 12Bを小型デバイスで試す場合、すべての機能を一度に有効にせず、テキスト回答の一つから確認する方がよいです。その回答が正常に終了する設定を残した上で、長いドキュメントや画像・音声を順に追加していきます。これにより、メモリや待ち時間の増加が発生する場所を特定します。
ハードウェア別速度チューニングおよびサーバーリシピ要約
重み、KVキャッシュ、プリフィルバッチ、同時リクエストと加速機能を分離し、バランス・速度・長い文脈プロファイルで提供します。
| ハードウェア | 適合度 | 推奨ランタイム | 運用プロフィール | 開始文脈 | トークン生成 |
|---|---|---|---|---|---|
| MBP M5 Pro 48GB (41GB) | 十分なメモリ | LM Studio | バランス重視の設定 · プリフィル優先 · 長い文脈 | 16,384トークン | 31.3 ~ 34.8 tok/s |
| Studio M5 Ultra 256GB (236GB) | 十分なメモリ | LM Studio | バランス重視の設定 · プリフィル優先 · 長い文脈 | 16,384トークン | 122.4 ~ 136 tok/s |
| Studio M5 Ultra 512GB (480GB) | 十分なメモリ | LM Studio | バランス重視の設定 · プリフィル優先 · 長い文脈 | 16,384トークン | 122.4 ~ 136 tok/s |
| RTX 4090 24GB (22.5GB) | 十分なメモリ | llama.cpp (CUDA) | バランス重視の設定 · プリフィル優先 · 長い文脈 | 16,384トークン | 107.1 ~ 118.5 tok/s |
| 2× RTX 3090 48GB (NVLink) (45GB) | 十分なメモリ | llama.cpp (マルチGPU) | バランス重視の設定 · プリフィル優先 · 長い文脈 | 16,384トークン | 129.8 ~ 180.3 tok/s |
| RTX PRO 6000 96GB (93GB) | 十分なメモリ | llama.cpp (CUDA) | バランス重視の設定 · プリフィル優先 · 長い文脈 | 16,384トークン | 198 ~ 218.3 tok/s |
| DGX Spark 128GB (116GB) | 十分なメモリ | llama.cpp (CUDA) | バランス重視の設定 · プリフィル優先 · 長い文脈 | 16,384トークン | 27.8 ~ 30.9 tok/s |
| Ryzen AI Max+ 395 128GB (116GB) | 十分なメモリ | llama.cpp (ROCm/HIP) | バランス重視の設定 · プリフィル優先 · 長い文脈 | 16,384トークン | 25.4 ~ 28.3 tok/s |
詳細ページから、プロフィール別に実行コマンド、適用値、停止すべき条件、および測定順序を確認できます。実行コマンドは、モデルファイルと実行プログラムが確認された組み合わせにのみ表示されます。
Q4ファイルかどうか、公式重みかどうかを確認します
デスクトップでは、現在のアプリがサポートしているGGUFまたはMLX Q4変換版を選択します。16GBクラスのデバイスでも、オペレーティングシステムやキャッシュの余裕により実行範囲が異なります。受取ファイルの実際のサイズを確認し、短いコンテキストから始めます。
公式のgoogle/gemma-4-12B-itのBF16重みは約24GBの規模です。以下に示すvLLMの例は、これを取り扱うより大きなNVIDIA環境のパスに相当し、Q4デスクトップコマンドとは異なります。同じモデル名のため、両者のメモリ条件を混同しないでください。
最初は、画像や音声の代わりに短い韓国語の質問を書きます。テキストの基準値を得た後、サポートされる入力の追加によってどの機能で負担が大きくなったかを区別できます。
LM Studioか公式サーバーのいずれかのパスを選択します
LM Studioでは、リストから確認した実際のモデル識別子を入力し、8K文脈の例から始めます。不足した場合はさらに減らして正常なロードが確認できるようにしてください。--gpu=maxは要求された設定であり、実際にどの部分がGPUに移されたかはアプリの表示およびログで確認します。
LM Studioのサーバーアドレスはここでは1234ポート、vLLMの例では8000です。他のコマンドのアドレスを混同しないでください。LM Studioのネットワーク提供設定でもローカルアクセス範囲を確認し、他のデバイスに公開する場合、事前に認証およびファイアウォールを準備してください。
プログラムが起動されたことだけではモデルが準備されているとは限りません。ロード完了および実際の文脈設定を確認した後、質問を送信します。待機中に複数のリクエストを重ねて送ると、最初の実行のメモリ状態を理解するのは難しくなります。
LM Studio CLI ローカルサービィング(デスクトップ 16GB~24GB)
# 1. 모델 목록 확인
lms ls
# 2. GPU 최대 오프로드 및 8K 컨텍스트로 모델 로드
lms load <gemma-4-12b-identifier> --gpu=max --context-length=8192
# 3. 로컬 서버 데몬 구동 (127.0.0.1:1234)
lms server start --port 1234モデルのロードが完了後、サーバーのアドレスとローカルネットワーク提供設定を確認します。
公式 vLLM テキストサービィング (NVIDIA GPU)
vllm serve google/gemma-4-12B-it --host 127.0.0.1 --port 8000 --max-model-len 8192 --gpu-memory-utilization 0.90NVIDIA環境で32GB以上の場合、公式インストラクションの重みを127.0.0.1:8000でサービィスします。
短い韓国語の回答で確認します
モデル名を実際の識別子に変更します。文が途中で中断されるかどうか、または要求された言語で回答されるかどうかをまず確認してください。ストリーミングを要求した場合、チャンクが到着する様子を見ることができますが、正確なtok/sは別途ランタイム測定値を使用します。
準備実行後、同じ質問に対して3回の最初のトークン生成速度・ピークメモリを記録します。その後、通常の要約を行うドキュメントに変更して差を確認します。簡単な自己紹介という事実だけでは、長い業務ドキュメントを十分に扱えるとは結論づけません。
生成結果の品質も確認してください。短い質問に対して正確に答えられる場合でも、日付や例外条件を漏らす可能性があります。正解を確認できるドキュメントをもとに質問を1つ残すことで、設定変更後の比較が容易になります。
OpenAI互換APIテスト
curl -N http://127.0.0.1:1234/v1/chat/completions -H "Content-Type: application/json" -d '{
"model": "<gemma-4-12b-identifier>",
"messages": [
{"role": "user", "content": "한국어로 자기소개를 간단히 작성해줘."}
],
"max_tokens": 512,
"stream": true
}'ローカルAPI呼び出しを、127.0.0.1:1234ポートで検証します。
画像と音声を追加する際には
現在、モデルファイルとアプリがサポートする入力かどうかをまず確認してください。一つずつ追加して、メモリの使用量がどの程度増加したかを見てください。テキストのみを使用する場合、残ったスペースはエンコーダーおよび入力処理に使用される可能性があります。
メモリが小さい場合に失敗したときは、まず文脈長や同時リクエスト数を下げます。キャッシュの精度やオフロードを変更する際も、1つずつ比較してください。すでにQ4モデルである場合、再びQ4に設定するだけでは、その他の原因による不足を解決できません。
問題が毎日の必要な入力のみに限られる場合、より大きなメモリを検討する必要はありません。逆に、テキスト処理が十分である場合、マルチモーダル最大条件のために全装置を起動する必要は并无しです。
小さなモデルを続けることも選択です
12Bが通常のドキュメントを十分に処理でき、待ち時間も問題がないなら、より大きなモデルにアップグレードする必要はありません。質問が不足している場合、その質問を次のモデルにそのまま送って比較することで、差異を分かりやすく確認できます。
安定的に使用したファイルとアプリケーションのバージョン、入力長を保存してください。再インストールまたは更新時に元に戻る基準になります。小さなデバイスで成功した1つのタスクが生まれれば、次に必要なパフォーマンスについてより具体的に話せるようになります。