大規模モデル · 公式販売製品 · 2026-09-06 更新

70Bモデルを1台に収めるには、CUDA専用ツールを使用できません。

マック スチュディオ M4 Max 128GB ローカル LLM 大規模モデルパフォーマンス

単一の完品で70Bクラスから高精度モデルまで幅広く比較できるようにしています。

主要仕様

使用可能なメモリ
114GB
メモリ帯域幅
546GB/s
ローカルLLMの継続的負荷
約130W
韓国の参考価格(ウォン)
780–888万ウォン

良い人

  • 70Bクラス Q4
  • 複数モデルの同時保管
  • 大規模ユニファイドメモリ

購入前に確認

メモリは十分ですが、CUDA専用ツールが必要な作業には別途確認が必要です。

どのタスクに適するか

作業判断理由
70B チャット適切単一の完品で大規模Q4モデルを読み込むことが容易です。
長いドキュメント・RAG快適大規模ユニファイドメモリでモデルとキャッシュを同時に確保します。
画像生成適切メモリの余裕はありますが、CUDA専用ノードは確認してください。

基準:構成選択の基準

最初に衝突するボトルネック

大規模モデルのロードには強く、CUDA専用カーネルおよびマルチGPU拡張性が必要な作業については選択肢が減少します。

おすすめ購入構成

M4 Max · ユニファイドメモリ 128GB · SSD 1TB以上

より多くのお金をかける基準

70Bクラスのモデルを1台に収める場合に検討すべきです。35B未満を使用する場合はM4 Pro 48GBが経済的です。

4Kコンテキスト・Q4モデル別予想パフォーマンス

モデル必要なメモリトークン生成最初のトークンプリフィル
Gemma 4 12B
MLX 4ビット
8GB57.2 ~ 63.4 tok/s4.3 ~ 8.3秒496 ~ 959 tok/s
Qwen3.8-Flash-Next
MLX 4ビット
107.13GB22 ~ 42.9 tok/s4.4 ~ 8.6秒479 ~ 936 tok/s

単一ユーザーでの予想範囲であり、ランタイムや冷却、量子化ファイルによって異なる可能性があります。

よくある質問

Studio M4 Max 128GBでどのようなローカルLLMを実行できますか?

Gemma 4 12B、Qwen3.8-Flash-Nextなどを4K入力とデバイス別推奨フォーマットで比較できます。モデルおよびコンテキスト長によって必要なメモリは異なります。

Studio M4 Max 128GBのローカルLLMにおけるパワーリソースはどのくらいですか?

継続的な負荷基準では約130Wで、実際の範囲は95–165Wと予想されます。

表示されたトークン速度は実測値ですか?

公式ハードウェア仕様および検証済みベンチマーキング範囲に基づき、計算機に合わせて補正した予想範囲です。ランタイム、冷却、量子化ファイルおよび文脈長によって変化する可能性があります。