大規模モデル · 公式販売製品 · 2026-09-06 更新
70Bモデルを1台に収めるには、CUDA専用ツールを使用できません。
マック スチュディオ M4 Max 128GB ローカル LLM 大規模モデルパフォーマンス
単一の完品で70Bクラスから高精度モデルまで幅広く比較できるようにしています。
主要仕様
- 使用可能なメモリ
- 114GB
- メモリ帯域幅
- 546GB/s
- ローカルLLMの継続的負荷
- 約130W
- 韓国の参考価格(ウォン)
- 780–888万ウォン
良い人
- 70Bクラス Q4
- 複数モデルの同時保管
- 大規模ユニファイドメモリ
購入前に確認
メモリは十分ですが、CUDA専用ツールが必要な作業には別途確認が必要です。
どのタスクに適するか
| 作業 | 判断 | 理由 |
|---|---|---|
| 70B チャット | 適切 | 単一の完品で大規模Q4モデルを読み込むことが容易です。 |
| 長いドキュメント・RAG | 快適 | 大規模ユニファイドメモリでモデルとキャッシュを同時に確保します。 |
| 画像生成 | 適切 | メモリの余裕はありますが、CUDA専用ノードは確認してください。 |
基準:構成選択の基準
最初に衝突するボトルネック
大規模モデルのロードには強く、CUDA専用カーネルおよびマルチGPU拡張性が必要な作業については選択肢が減少します。
おすすめ購入構成
M4 Max · ユニファイドメモリ 128GB · SSD 1TB以上
より多くのお金をかける基準
70Bクラスのモデルを1台に収める場合に検討すべきです。35B未満を使用する場合はM4 Pro 48GBが経済的です。
4Kコンテキスト・Q4モデル別予想パフォーマンス
| モデル | 必要なメモリ | トークン生成 | 最初のトークン | プリフィル |
|---|---|---|---|---|
| Gemma 4 12B MLX 4ビット | 8GB | 57.2 ~ 63.4 tok/s | 4.3 ~ 8.3秒 | 496 ~ 959 tok/s |
| Qwen3.8-Flash-Next MLX 4ビット | 107.13GB | 22 ~ 42.9 tok/s | 4.4 ~ 8.6秒 | 479 ~ 936 tok/s |
単一ユーザーでの予想範囲であり、ランタイムや冷却、量子化ファイルによって異なる可能性があります。
よくある質問
Studio M4 Max 128GBでどのようなローカルLLMを実行できますか?
Gemma 4 12B、Qwen3.8-Flash-Nextなどを4K入力とデバイス別推奨フォーマットで比較できます。モデルおよびコンテキスト長によって必要なメモリは異なります。
Studio M4 Max 128GBのローカルLLMにおけるパワーリソースはどのくらいですか?
継続的な負荷基準では約130Wで、実際の範囲は95–165Wと予想されます。
表示されたトークン速度は実測値ですか?
公式ハードウェア仕様および検証済みベンチマーキング範囲に基づき、計算機に合わせて補正した予想範囲です。ランタイム、冷却、量子化ファイルおよび文脈長によって変化する可能性があります。