モデル別実行レシピ

DeepSeek-V4-Flash:304Bモデルの分散実行設定

公式例を参照すると、DeepSeek-V4-Flashを直接運用するための4×GB300のようなサーバー構成が表示されます。GPUを4台というだけの数字をコピーするだけでは、同じ条件にはなりません。このレシピは、公式サーバー経路の前提を維持しながら、確認すべき項目を説明しています。

ハードウェア別速度チューニングおよびサーバーリシピ要約

重み、KVキャッシュ、プリフィルバッチ、同時リクエストと加速機能を分離し、バランス・速度・長い文脈プロファイルで提供します。

ハードウェア適合度推奨ランタイム運用プロフィール開始文脈トークン生成
MBP M5 Pro 48GB (41GB)メモリ超過(非対応)メモリに収まりません検証待ち4,096トークン-
Studio M5 Ultra 256GB (236GB)実験的な実行圧縮ランタイム検証が必要検証待ち4,096トークン112.5 ~ 125 tok/s
Studio M5 Ultra 512GB (480GB)実験的な実行圧縮ランタイム検証が必要検証待ち4,096トークン112.5 ~ 125 tok/s
RTX 4090 24GB (22.5GB)メモリ超過(非対応)メモリに収まりません検証待ち4,096トークン-
2× RTX 3090 48GB (NVLink) (45GB)メモリ超過(非対応)メモリに収まりません検証待ち4,096トークン-
RTX PRO 6000 96GB (93GB)メモリ超過(非対応)メモリに収まりません検証待ち4,096トークン-
DGX Spark 128GB (116GB)メモリ超過(非対応)メモリに収まりません検証待ち4,096トークン-
Ryzen AI Max+ 395 128GB (116GB)メモリ超過(非対応)メモリに収まりません検証待ち4,096トークン-

詳細ページから、プロフィール別に実行コマンド、適用値、停止すべき条件、および測定順序を確認できます。実行コマンドは、モデルファイルと実行プログラムが確認された組み合わせにのみ表示されます。

13Bのアクティブと304Bの全体を区別します

このモデルの活性スケールは、1トークンあたりの使用されるパスを説明します。すべての重みを1つの消費者GPUに収めるということではありません。公式版 deepseek-ai/DeepSeek-V4-Flash-0731 とコミュニティ版のファイル・ランタイム条件も異なります。

公式のvLLMサンプルは、単一の4×GB300ノードと専門家並列を使用します。任意のGPU4台に交換した後でも、同じコマンドを実行するとは限りません。メモリにとどまらず、カーネルおよび接続条件を確認する必要があります。

大きなユニファイドメモリに圧縮版を収容する実験は、このフォーマルレシピと分離して検討してください。ロード予想値だけでは、そのモデル構造の実行サポートまで保証されません。

公式パスでも小さな文脈から始めます

以下は、データ並列4および専門家並列、DSpark構成を含む例です。オプション名を1つずつ別のエンジンに移すコマンドではなく、サポートされるサーバ環境の組み合わせです。初期コンテキストは16Kまでに制限し、基本的なロードおよび回答から確認します。

リモートコード実行オプションは、モデルストアのコードを実行できるため、使用するバージョンおよび内容を確認してください。正常な環境を維持し、再現可能なバージョンを残してください。最新のファイルを受け取ったことだけでは、以前の環境と同等であるとは限りません。

サーバーのアドレスは127.0.0.1を維持します。外部または組織ネットワークに公開する計画がある場合は、認証およびプロキシ・ファイアウォールを別途構成する必要があります。基本的なローカル実行の例は、共有サーバーのセキュリティ構成を代替しません。

vLLM公式分散サービィス(マルチGPUサーバノード)

vllm serve deepseek-ai/DeepSeek-V4-Flash-0731   --host 127.0.0.1   --port 8000   --trust-remote-code   --data-parallel-size 4   --enable-expert-parallel   --kv-cache-dtype fp8   --block-size 256   --moe-backend deep_gemm_mega_moe   --attention-config '{"use_fp4_indexer_cache": true}'   --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'   --max-model-len 16384   --gpu-memory-utilization 0.90

公式4×GB300 vLLM·DSpark構成を16K文脈と127.0.0.1バインディングで開始します。

回答チャンクと実際の生成量を確認します

短いリクエストを送り、チャンクが到着した後、最終的に応答が正常に終了するか確認します。準備実行後に、同じ入力に対して3回の最初のトークンの時間とデコード時間を記録し、実際の出力長も一緒に残します。画面で一瞬だけ速く見える部分だけを測定値として使うのを止めてください。

DSparkの候補選定および実際の時間も確認します。提示された候補数よりも、検証を通過した長さと全体の完了時間の方が重要です。他の質問では効果が異なる可能性があるため、実際に運用されるリクエストを含める必要があります。

複数のリクエストを同時に処理する予定であれば、単一リクエストベースに別途負荷テストを実施します。総 tok/s および各ユーザーの待機時間を別々に記録することで、サーバー運用に適した設定を選定できます。

ローカルチャット完成功能ストリーミングテスト

curl -N http://127.0.0.1:8000/v1/chat/completions   -H "Content-Type: application/json"   -d '{
    "model": "deepseek-ai/DeepSeek-V4-Flash-0731",
    "messages": [
      {"role": "user", "content": "DeepSeek-V4-Flash 분산 서빙 테스트."}
    ],
    "max_tokens": 512,
    "stream": true
  }'

127.0.0.1:8000のエンドポイントでストリーミング応答を確認します。

総メモリ量だけを見てはいけません

アクセラレータごとの重みとキャッシュ、専門家負荷が意図通りに配置されているかを確認します。全体にスペースが残っても、一方が不足している場合は実行が失敗する可能性があります。接続問題や特定のアクセラレータの待機が全体の結果に影響を与える可能性があります。

長い文脈は段階的に増加します。モデルの最大サポート長が実際にサーバーで使用される設定とは限りません。ピークメモリと最初のトークンの時間についても、ドキュメントの途中で正確に情報を検出できるかを確認します。

設定を変更した後、問題が生じた場合は、基本長と正常バージョンに戻して原因を分離してください。新しいアクセラレーション設定を追加することは、ロードまたは分散エラーの解決策にはなり得ません。

自分で運用することで、得たい成果があるか

この規模では、モデルの実行にとどまらず、管理および復元、電力とスペースについても考慮する必要があります。どのようなタスクで小型モデルよりも優れた結果を得られるか、複数のユーザーをどれだけ処理する必要があるかは、設備の選定において明確になります。

個人用コンピュータでローカルAIを始める人には、この構成が最低要件であるとは限りません。小さなモデルでまず仕事を終えることが可能です。大きなサーバーが必要になった場合には、その際の具体的な失敗事例とリクエスト量を、このレシピの検証基準として活用してください。