Mac Studio(M2 / M3 / M4 Ultra、64~512GB)で使うLLMは? ?
2026年現在、Mac Studio(M2 Ultra、M3 Ultra、M4 Max)は、2,000億を超えるパラメータを持つモデルをローカルで実行できる、世界で唯一の一般消費者向けマシンです。M3 Ultra 512 GB(2025年初頭に発売され、2026年9月末にM5 Ultraに置き換えられました)では、ユニファイドメモリが512 GBに達し、価格は約11,000ユーロでした。この容量なら、Llama 4 Maverick 402BのQ4版やDeepSeek V3 671BのQ4版を実行できます。このガイドでは、各構成とその用途を詳しく説明します。
マシンを選んでいるところですか? 予算別のおすすめ → · 当社の製品ページ Mac Studio M5 Max →
このガイドで紹介する購入候補の別の選択肢: Mac Studio M5 Max(36 GB / 512 GB).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: Mac Studio M5 Max(36 GB / 512 GB) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#2026年のMac Studio
- Mac Studio M2 Ultra(2023)
- CPUは24コア、GPUは60または76コア、帯域幅は800 GB/s、RAMは64/128/192 GB。現在も中古で2,800ユーロから入手可能です。
- Mac Studio M4 Max (2025)
- CPU 16コア+GPU 40コア、546 GB/s、RAM 36〜128 GB。M2 Maxの後継です。Appleでは新品の販売が終了しており、2026年9月末にM5 Max(2,999ユーロから)に置き換えられました。
- Mac Studio M3 Ultra (2025)
- CPUは28コア、GPUは60または80コア、800 GB/s、RAMは96/256/512 GB。モンスター級です。M5 Ultraの登場までは4,499 €(96 GB)から11,299 €(512 GB)で販売されていました。2026年9月末時点ではAppleの製品ラインアップから外れています(中古品または残りの在庫)。
- 消費電力
- 待機時は15W、推論時は構成に応じて70〜130W。M3 Ultraの512GB構成では、405Bモデルの実行時にピークで約150Wに達します。
#1. M2 Ultra・M3 Ultra・M4 Maxの比較
- M4 Max
- Mac Studioのエントリーモデル。546GB/s、最大128GB。MBP M4 Maxより優れています。サーマルスロットリングがなく、価格も安いです(デスクトップ筐体)。
- M2 Ultra
- 初代Ultra。800GB/s、最大192GB。中古価格は2,800〜4,500ユーロ。70B〜123Bモデル向けとして、今でも競争力があります。
- M3 Ultra
- 最新のUltra(2025年)。帯域幅はM2 Ultraと同じ800 GB/sですが、M3アーキテクチャを採用しています(実際の性能は20%向上)。RAMは96〜512 GB。200Bを超えるモデルまで扱いたい方に。
#2. RAMをどこまで使えるか?
- 96 GB(M3 Ultra の基本構成)
- M3 Ultraのカタログ価格は4,499ユーロで、新品での販売は終了しています(M5 Ultra 96 GB:6,599ユーロ)。gpt-oss 120B(MXFP4、63 GB)を約50 tok/s、約30BのMoE(Qwen 3.6 35B-A3B)を約70 tok/sで動作させ、長いコンテキストにも余裕があります。約120Bまでの大規模MoEにとってのスイートスポットです。
- 256GB(M3 Ultra + 256)
- M3 Ultraのカタログ価格は7,299€。現在は新品で販売されていません。Llama 4 Maverick 402B Q4(230GB)を約34 tok/sで実行でき、DeepSeek V3 671B Q2(約240GB)も読み込めます。400B以上のモデルを使いたい方に。
- 512 GB(M3 Ultraの最大構成)
- M3 Ultra のカタログ価格は 11,299 €。新品販売は終了しています(M5 Ultra 512 GB:2026 年 10 月下旬)。DeepSeek V3 671B Q4(380 GB)が収まり、Qwen3-235B-A22B は Q8 で動作し、大型 MoE では 128k 以上のコンテキストを扱えます。研究・R&D 向けの領域です。
- 192GB(M2 Ultra 最大)
- Qwen3-235B-A22B Q4(133GB)およびMaverick 402B Q3をロード。256GB M3 Ultra相当の機能を、少し安価な中古モデルで実現。良いバランスです。
#3. Ultra専用モデル
| モデル | Quant | 必要なRAM | M2 Ultra 192 | M3 Ultra 256 | M3 Ultra 512 |
|---|---|---|---|---|---|
| gpt-oss 120B | MXFP4 | 63 GB | ✓ 42 t/s | ✓ 50 t/s | ✓ 50 t/s |
| Qwen3-235B-A22B | Q4_K_M | 133 GB | ✓ 26 t/s | ✓ 30 t/s | ✓ 30 t/s |
| Llama 4 Maverick 402B | Q4_K_M | 230GB | — | ✓ 34 t/s | ✓ 34 t/s |
| Llama 4 Maverick 402B | Q8_0 | 410 GB | — | — | ✓ 22 t/s |
| DeepSeek V3 671B | Q2_K | 240GB | — | ✓ 20 t/s | ✓ 20 t/s |
| DeepSeek V3 671B | Q4_K_M | 380 GB | — | — | ✓ 16 t/s |
#4. 120B、235B、671Bのベンチマーク
| モデル | Q4_K_M | Q5_K_M | Q6_K | Flash Attn 16k |
|---|---|---|---|---|
| gpt-oss 120B | 50 t/s | — | — | 48 t/s |
| Qwen3-235B-A22B | 30 t/s | 28 t/s | 26 t/s | 27 t/s |
| Llama 4 Maverick 402B | 34 t/s | 30 t/s | 28 t/s | 31 t/s |
| DeepSeek V3 671B | 16 t/s | 14 t/s | — | 15 t/s |
#5. LLMワークステーションの設定
#6. M3 Ultra 512 GBでDeepSeek V3 671Bを実行
これはMac Studio 512GB構成を代表する用途です。モデルのサイズはQ4_K_Mで380GBで、512GB構成ならRAMに収まります。コンテキスト16kで約16トークン/秒です(MoE、総パラメータ数671Bのうち約37Bがアクティブ)。ほとんどのタスクで、最高水準のプロプライエタリモデルに近い品質を発揮します。
Mac Studioでどのようなモデルを動かせるかは、もうおわかりですね。Mac キットには、チップとメモリ容量別の参照表(第4章)、長いコンテキストでのメモリ予算の計算方法(第5章)、Ollamaをバックグラウンドで動かすための設定手順(第7章)が載っています。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
- ダウンロード
- Hugging Face経由で約380 GB。接続環境に応じて、4〜8時間を見込んでください。
- 読み込み時間
- 初回は約60秒(SSD → RAM)。その後は、モデルがメモリに残っている限り、瞬時に読み込めます。
- 推論時の消費電力
- ~150W。70~75°Cまで温まり、ファンは音が聞こえますが、騒がしくありません(同等のPCと比べてはるかに静かです)。
- どのような場合に価値があるか
- R&D、100%オフラインのフロンティアモデルを求めているチーム、内部ベンチマーク、機密データセット。本番環境では、クラウドAPIの方が経済的です。
#Mac Studio と PC(2×RTX 5090)の比較
- 2026年の価格
- Mac Studio M3 Ultra 512 GB:2026年9月まではカタログ価格が約11,300ユーロでしたが、現在は新品で販売されていません(M5 Ultra 512 GBの発表は10月末)。RTX 5090を2枚搭載したPC+プラットフォーム:約15,000ユーロ。
- LLM用の利用可能なメモリ
- Mac:512 GBのユニファイドメモリ。PC:32 GBのVRAM × 2枚 = 64 GB。400B以上のモデル(Maverick 402B、DeepSeek 671B)は、PCではそもそも読み込めません。
- ~30B (Qwen 3.6 35B-A3B) での処理速度
- PC 5090 ダイオ:~120 tok/s (CUDA、VRAMを消費する)。Mac M3 Ultra:~70 tok/s。VRAMに収まる点でPCが優位です。
- DeepSeek 671B / Maverick 402Bでの速度
- Mac:16〜34 tok/s(MoE)。PC:モデルの大部分をCPU側にオフロードしなければ実行できません(2 tok/s未満)。
- 消費電力
- Mac Studio:ピーク時の消費電力は150 W。5090を2枚搭載したPC:最大900 W。PC側の電気代は3倍を見込む。
- 騒音
- Mac:わずかに音が聞こえます。5090を2枚搭載した PC:非常にうるさいです(GPU ファンが全速回転)。
- 判定
- Mac Studioは、扱えるモデルの容量(200B以上のモデル)と効率で優れています。PCは、VRAMに収まるモデル(約30 GB以下)での純粋な速度で優れています。利用したいモデルの特性に応じて選んでください。
#よくある質問
gpt-oss 120B用のMac Studioはどのモデルが適していますか?+
Mac Studio M3 Ultraの512 GBモデルには、11,000ユーロの価値がありますか?+
Mac Studio M3 Ultra 256GB か 512GB か?+
Mac Studioをサーバーラックに設置できますか?+
Mac Studio M4 MaxはMBP M4 Maxよりも優れているのでしょうか?+
Mac Studio の 24時間365日推論処理における想定寿命はどのくらいですか?+
価格は変動が激しいため、当サイトでは毎週月曜日と木曜日に、ローカルAI向けグラフィックカードの最低価格とVRAM 1 GBあたりの価格を確認しています。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。