ローカルAI技術・購入ガイド

ローカルLLMから画像・動画生成まで、作業方法やモデル選定、必要なメモリと機器のコストをわかりやすく説明します。

このリストを確認する順序

実行したいタスクを選びます。会話やドキュメント作業はLLMデバイスガイドから、図や短い動画は画像・動画生成ガイドから始め、メモリとモデルの説明をつなげて進めてください。

新規モデル

まず読み込み

モデル別実行レシピ

  • Qwen3.8-27Bの設定:MacのoMLXとRTXのllama.cpp

    Qwen3.8-27BをMacおよびRTXで実行する際のQ4重み、KVキャッシュ、プリフィルバッチ、MTP、文脈長およびoMLX・llama.cppの実行コマンドをデバイス別に提供します。

  • Qwen3.8-Flash-Next:DGX Spark 1台のSGLang設定

    SGLang設定でQwen3.8-Flash-Next NVFP4を1台のDGX Sparkで実行します。NVMe PLE mmap、プリフィルチャンク、メモリ比率、NEXTN MTPおよび262Kの長い文脈構成を区別します。

  • Gemma 4 12B:16GB機器のLM Studio・vLLM設定

    Gemma 4 12Bモデルの16GB〜24GB単一GPUおよびMacデスクトップでのサービス方法、Q4 GGUFおよび公式google/gemma-4-12B-it重み設定、8K安全コンテキストとAPI検証を導入します。

  • Gemma 4 26B-A4B:24〜32GB機器で動かす設定

    25.2Bパラメータ(3.8Bアクティブ)のGemma 4 26B-A4Bを、24GB~32GBのデバイスで実行するQ4変換パスと、公式のgoogle/gemma-4-26B-A4B-itサーバーパスを区別して説明します。

  • Qwen3.6 35B-A3B:vLLMとqwen3パーサーの設定

    合計35B(3Bアクティブ) Qwen3.6 35B-A3B MoEモデルの24GB/32GB+メモリ条件、vLLM >= 0.19.0 reasoning parser設定、MTP高度オプションおよび127.0.0.1ローカルサービィングレシピを整理します。

  • GLM-5.3-Flash:320Bのサーバー向けMoEを動かす

    320B(18Bアクティブ)GLM-5.3-Flashの公式チェックポイントを複数のアクセラレータでサービングするvLLM・SGLang設定と、圧縮変換版を検討する際のメモリ条件を区別します。

  • DeepSeek-V4-Flash:304Bモデルの分散実行設定

    公式4×GB300 vLLMパスおよびSGLangパス、16K開始文脈およびローカルAPI確認手順を、総304B(13B活性)DeepSeek-V4-Flash-0731について整理します。

画像・動画生成

応答速度と加速

メモリとモデル

実行プログラムと拡張機能

  • DGX Sparkを2台つなぐと、実際に何が変わるのか

    DGX Spark 1台および2台の構成において、モデルのロード量、単一リクエスト生成速度、複数リクエスト処理量がそれぞれどのように異なるかを区別します。

  • GGUFとMLX、ダウンロードするモデル形式の選び方

    ローカルLLMにおけるGGUFおよびMLX用モデルファイルが、どのようなランタイムエコシステムに適しているか、また量子化表記と変換の互換性をどのように確認すべきかを説明します。

  • 複数のGPUでローカルLLMを動かすには

    2つのGPUのVRAMをローカルLLMに活用するレイヤー分割、テンソル並列とパイプライン並列の違い、PCIe・NVLink通信のボトルネックを説明します。

  • FlashAttentionとPagedAttentionの違い

    名前は似ているものの、異なる問題を解決するFlashAttentionとPagedAttentionが、注意計算、KVキャッシュメモリ管理およびサーバー処理量に与える影響を説明します。

  • Continuous Batchingと一人で使うときの速度

    連続バッチにおいて、長さが異なるLLMリクエストをバッチに加えたり削除したりすることでサーバー処理量を高め、そのことと単一ユーザーの遅延との違いを説明します。

購入とコスト

  • ローカルLLMのTCO:1年・2年の総保有コスト

    ローカルAIハードウェアの購入価格から減価償却費、予想売却価格、電気料金、維持費およびクラウドサブスクリプションの節約額を合算して、実際の総所有コストを算出する方法です。