ローカルAI技術・購入ガイド
ローカルLLMから画像・動画生成まで、作業方法やモデル選定、必要なメモリと機器のコストをわかりやすく説明します。
このリストを確認する順序
実行したいタスクを選びます。会話やドキュメント作業はLLMデバイスガイドから、図や短い動画は画像・動画生成ガイドから始め、メモリとモデルの説明をつなげて進めてください。
新規モデル
- Qwen3.8-27Bは32GBの機器で動かせるか
Qwen3.8-27Bオープンウェイトモデルの27B密集構造、Q4メモリ要件量、256K文脈、画像・動画入力およびMTPをローカルデバイス選定の観点から整理します。
- Qwen3.8-Flash-Next:有効6Bでも180Bを載せる理由
Qwen3.8-Flash-Nextの180Bプリフィル重み、6BアクティブMoE、51BPLEテーブルおよび4B MTPを区別し、DGX Sparkと256GBデバイスの実行可能性を説明します。
- Gemma 4の12Bと26B-A4B、自分の機器ならどちらか
Gemma 4 オープンウェイットモデルの12B デンシフィックおよび26B-A4B MoEを中心に、マルチモーダル入力、256Kコンテキスト、Q4メモリおよび16GB・24GBデバイス選択を説明します。
- GLM-5.3・DeepSeek-V4は個人のPCでも使えるか
GLM-5.3-Flash 320BおよびDeepSeek-V4-Flash-0731 304Bを用いて、オープンウェイットと個人用ローカル実行の違い、活性パラメータ、分散読み込みと圧縮版条件を説明します。
まず読み込み
- ローカルLLM用の機器選び:メモリ・速度・消費電力
ローカルLLMデバイスを選択する際には、VRAMとユニファイドメモリ、プリフィル、トークン生成速度、電気代およびTCOをどのような順序で考慮すべきかを説明します。
- プリフィル・TTFT・デコードは何が違うのか
ローカルLLMベンチマーキングでは、プリフィル処理量、最初のトークン生成時間(TTFT)、およびデコード時のトークン生成速度を区別して、実際の体験性能を読み取る方法です。
モデル別実行レシピ
- Qwen3.8-27Bの設定:MacのoMLXとRTXのllama.cpp
Qwen3.8-27BをMacおよびRTXで実行する際のQ4重み、KVキャッシュ、プリフィルバッチ、MTP、文脈長およびoMLX・llama.cppの実行コマンドをデバイス別に提供します。
- Qwen3.8-Flash-Next:DGX Spark 1台のSGLang設定
SGLang設定でQwen3.8-Flash-Next NVFP4を1台のDGX Sparkで実行します。NVMe PLE mmap、プリフィルチャンク、メモリ比率、NEXTN MTPおよび262Kの長い文脈構成を区別します。
- Gemma 4 12B:16GB機器のLM Studio・vLLM設定
Gemma 4 12Bモデルの16GB〜24GB単一GPUおよびMacデスクトップでのサービス方法、Q4 GGUFおよび公式google/gemma-4-12B-it重み設定、8K安全コンテキストとAPI検証を導入します。
- Gemma 4 26B-A4B:24〜32GB機器で動かす設定
25.2Bパラメータ(3.8Bアクティブ)のGemma 4 26B-A4Bを、24GB~32GBのデバイスで実行するQ4変換パスと、公式のgoogle/gemma-4-26B-A4B-itサーバーパスを区別して説明します。
- Qwen3.6 35B-A3B:vLLMとqwen3パーサーの設定
合計35B(3Bアクティブ) Qwen3.6 35B-A3B MoEモデルの24GB/32GB+メモリ条件、vLLM >= 0.19.0 reasoning parser設定、MTP高度オプションおよび127.0.0.1ローカルサービィングレシピを整理します。
- GLM-5.3-Flash:320Bのサーバー向けMoEを動かす
320B(18Bアクティブ)GLM-5.3-Flashの公式チェックポイントを複数のアクセラレータでサービングするvLLM・SGLang設定と、圧縮変換版を検討する際のメモリ条件を区別します。
- DeepSeek-V4-Flash:304Bモデルの分散実行設定
公式4×GB300 vLLMパスおよびSGLangパス、16K開始文脈およびローカルAPI確認手順を、総304B(13B活性)DeepSeek-V4-Flash-0731について整理します。
画像・動画生成
- ローカル画像生成:自分のPCで何が作れるのか
プリフィルとデコードを用いたローカル画像生成で、シアン、製品画像、ポスターおよび参考画像の編集方法、および解像度・長さ・メモリに応じた機器選定基準を説明します。
- FLUXとQwen Image、作りたいものからモデルを選ぶ
FLUX.2 Klein·DevとQwen-Image-2512を、速いスケッチ、文字表現、参考画像編集、そして正確な結果の基準で区別して説明します。
- ローカル動画生成:テキストや画像から映像を作る
Wan 2.2やMiniMaxのような最新のローカルビデオモデルを使用して、テキストまたは静止画像から短い動画を作成する方法、および解像度・フレーム・サウンドに応じたハードウェア選定について説明します。
- Wan 2.2とMiniMax、ローカル動画生成の選び方
Wan 2.2 TI2V-5B·T2V-14BおよびMiniMax H3-Baseの特徴、カメラモーション、音声同時生成および必要なメモリ基準を説明します。
- 画像・動画生成に必要なVRAMはどれくらいか
画像・動画生成において、モデル本体、テキストエンコーダー、VAEおよび中間作業空間がVRAMをどのように使用するか、また12GBから64GB以上の実行範囲について説明します。
応答速度と加速
- ローカルAI速度レポート:2026年9月
2026年9月現在まで、主要なMacおよびNVIDIA GPU、DGX Spark、AMD ユニファイドメモリデバイスのプリフィルおよびトークン生成速度を同等の条件で比較します。
- 長い入力ではローカルLLMの速度順位が逆転する
実際の機器選定の観点から、短いチャットのデコード順位と長いドキュメントのプリフィル・全完了時間順位が異なる理由を説明します。
- MTPとは:複数トークン予測の仕組みと適用条件
MTP(Multi-Token Prediction)が複数の未来トークンをどのように提案・検証するか、サポートされるモデルとランタイムがなぜ必要なのか、そしてどのような場合に高速化されるかを説明します。
- Lightning MTPとは:oMLXの高速化を理解する
Lightning MTPがApple Silicon用のoMLXでサポートされるモデルの内蔵MTPヘッドを活用する方法および対応条件、一般のMTPとの違い、注意点を説明します。
- 投機的デコーディング:トークンの先行予測と検証
投機的デコーディングは、小さな草案モデルまたは内蔵予測ヘッドによって候補トークンを生成し、メインモデルがそれらをまとめて検証して生成を加速する原理を説明します。
- Prompt Lookupとn-gram投機的デコーディング
Prompt Lookupは、追加の仮想モデルなしで、プロンプトおよび生成履歴の繰り返し構文(n-gram)から次のトークンを検出・検証する方法と、モデルの重みオフロードとの違いを説明します。
- Qwen3.8-Flash-NextのPLEをRAM・SSDに移す方法
Qwen3.8-Flash-Nextの180Bの常在重み中の51B PLEインベーディングテーブルをRAMおよびNVMe SSDでオフロードする原理、互換条件、ページキャッシュへの影響および検証チェックリストを整理します。
- SpecPrefillで最初のトークンまでの待ち時間を短くする
SpecPrefillが長い入力での最初のトークン時間(TTFT)を短縮する原理およびMac(oMLX)・NVIDIA実験経路、回答品質の変動性および概算値基準について説明します。
- LLMのメモリ帯域幅と演算性能、どちらが効くのか
ローカルLLMにおいて、メモリ帯域幅とGPU演算パフォーマンスがプリフィル、単一ユーザーデコード、およびバッチ処理それぞれに与える影響について説明します。
メモリとモデル
- 35BのMoEが、小さな密モデルより速いことがある理由
活性パラメータと総パラメータを区別し、大きなMoEモデルが小さなDenseモデルよりも速く生成される組み合わせとメモリ条件を説明します。
- ローカルLLMに必要なVRAM・ユニファイドメモリ容量
12B·27B·35B·70BクラスのローカルLLMが必要なVRAMおよびユニファイドメモリを、量子化、ランタイムの余裕、KVキャッシュおよび文脈長まで含めて評価する方法です。
- KVキャッシュとは:会話に必要なメモリを考える
KVキャッシュは、以前のトークンのアテンションキーとバリューを保存することで、再計算を減らす原理を持ち、文脈長、メモリ使用量、量子化との関係を説明します。
- プロンプトキャッシュで短くなるのはどの待ち時間か
プリフィルとデコードの両方で再利用可能なプロンプトキャッシュとプリフィックスキャッシュがTTFTを短縮する条件および制限について説明します。
- LLMの量子化:Q4・Q8・FP16をどう選ぶか
ローカルLLMの重みをQ4・Q8などの低いビットで圧縮する際、メモリ、速度、品質がどのように変化するか、および量子化形式の選定基準を説明します。
- MoEと密モデル:総パラメータ数と有効パラメータ数
専門家の混合モデルにおける総パラメータと、トークンごとに活性化されるパラメータが異なる理由および、ローカルデバイスのメモリとトークン速度に与える影響について説明します。
- コンテキスト長・RoPE・スライディングウィンドウ
モデルの最大コンテキスト長とは何かを意味し、長い文脈がプリフィル時間やKVキャッシュ、RoPE拡張、スライディングウィンドウに与える影響について説明します。
実行プログラムと拡張機能
- DGX Sparkを2台つなぐと、実際に何が変わるのか
DGX Spark 1台および2台の構成において、モデルのロード量、単一リクエスト生成速度、複数リクエスト処理量がそれぞれどのように異なるかを区別します。
- GGUFとMLX、ダウンロードするモデル形式の選び方
ローカルLLMにおけるGGUFおよびMLX用モデルファイルが、どのようなランタイムエコシステムに適しているか、また量子化表記と変換の互換性をどのように確認すべきかを説明します。
- 複数のGPUでローカルLLMを動かすには
2つのGPUのVRAMをローカルLLMに活用するレイヤー分割、テンソル並列とパイプライン並列の違い、PCIe・NVLink通信のボトルネックを説明します。
- FlashAttentionとPagedAttentionの違い
名前は似ているものの、異なる問題を解決するFlashAttentionとPagedAttentionが、注意計算、KVキャッシュメモリ管理およびサーバー処理量に与える影響を説明します。
- Continuous Batchingと一人で使うときの速度
連続バッチにおいて、長さが異なるLLMリクエストをバッチに加えたり削除したりすることでサーバー処理量を高め、そのことと単一ユーザーの遅延との違いを説明します。
購入とコスト
- ローカルLLMのTCO:1年・2年の総保有コスト
ローカルAIハードウェアの購入価格から減価償却費、予想売却価格、電気料金、維持費およびクラウドサブスクリプションの節約額を合算して、実際の総所有コストを算出する方法です。