Ryzen AI Max+ 395(Strix Halo):LLM用128GBメモリ locaux
Ryzen AI Max+ 395(コード名:Strix Halo)は、AMDがローカルAI分野に正面から挑むためのAPUです。この分野は、これまでユニファイドメモリを搭載したMacと24 GBのメモリを搭載したGPUが主導してきました。最大の強みは、CPU、GPU、NPUで共有する最大128 GBのメモリで、その大部分をモデルに割り当てられることです。本ガイドでは、Ryzen AI Max+ 395でLLMを実際にどこまで動かせるのかを率直に整理します。どの70BモデルやMoEモデルが利用可能になるのか、専用GPUやMacと比べてどの程度の速度で動くのか、そしてROCmとVulkanでどう設定するのかを解説します。
マシンを選んでいるところですか? 予算別のおすすめ → · 当社の製品ページ Ryzen AI Max搭載ミニPC(128GB) →
このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#Ryzen AI Max+ 395がローカルLLMの状況を一変させる理由
大型モデルをローカルで動かすと、ほぼ必ず同じ壁にぶつかります。ビデオメモリの容量です。RTX 4090は24GB、RTX 5090は32GBが上限で、それ以上が必要なら、複数のカードを組み合わせるかMac Studioを選ぶ必要があります。Ryzen AI Max+ 395は、この壁に別の角度から取り組みます。容量の限られた専用VRAMの代わりに、大容量のユニファイドメモリをCPU、内蔵GPU、NPUで共有する仕組みです。128GBを搭載した機種では、推論用に90GBを超える容量をGPUに割り当てられます。
具体的には、これまでPCにはなかった種類のマシンが登場することになります。価格帯の幅が非常に広いミニPCやノートPCで、専用グラフィックカードやマルチGPU構成なしに70Bモデル、さらにはそれよりはるかに大きい混合エキスパート(MoE)モデルをロードできる可能性がありますが、実際に可能かどうかは確認が必要です。大容量メモリを必要とするローカルAI用途で、Mac Studioに対抗できる初めての有力なx86マシンです。
#チップの詳細
Ryzen AI Max+ 395は、単一のダイ上に3つの演算エンジンを統合したモノリシックAPUで、すべてが同じメモリコントローラーに接続されています。LLMでは主にGPUとメモリが重要ですが、全体として整合性のある構成になっています。
- CPU — Zen 5 16コア
- Zen 5の16コア/32スレッド。前処理、CPUへの部分的なオフロード、そしてGPUでの推論そのもの以外のあらゆる処理に役立ちます。
- GPU — Radeon 8060S (RDNA 3.5)
- RDNA 3.5アーキテクチャの演算ユニットを40基搭載しています。PC市場で最大規模の内蔵GPUで、ROCmまたはVulkanを介した推論を担います。
- NPU — XDNA 2、約50 TOPS
- 低消費電力のAI専用アクセラレータです。最適化された一部の処理には適していますが、現在、ほとんどのLLMランタイム(Ollama、llama.cpp)が対象としているのはNPUではなくGPUです。
- メモリ — LPDDR5X、最大 128 GB
- 256ビットバス、LPDDR5X 8000 MT/s、約256GB/sの共有帯域を提供。CPU、GPU、NPU間で統合されています。
#128 GBの統合メモリが真の強み
通常のGPUでは、VRAMとシステムRAMは別々のメモリ領域です。VRAMに収まりきらないモデルはPCIe経由でシステムRAMに移され、推論性能が大幅に低下します。Ryzen AI Max+ 395では、物理的なメモリ領域は一つだけです。GPUは、Apple Silicon搭載Macのユニファイドメモリとまったく同じように、ユニファイドメモリに直接アクセスします。二つのメモリ領域間でのコピーも、PCIeによるボトルネックもありません。
モデルが実際に利用できるメモリ量は、「システム」メモリと「GPU」メモリへの配分によって決まります。ファームウェアと OS に応じて、一定量を GPU 用に予約する(BIOS の UMA 設定)、残りをドライバーに動的に割り当てさせる(Linux の GTT)、またはその両方を行います。実際には、128 GB のマシンで、推論用に 96 GB、さらにはそれ以上を GPU から利用できるようにすることもよくあります。
- 単一のプール
- 128GBが共有されています。モデルが使用しない分はシステムに残り、逆にシステムが使用しない分もモデルに残ります。
- GPUに十分なメモリを割り当て可能
- BIOSやドライバーの設定によっては、モデルの重みとコンテキストキャッシュに90GB以上を割り当てられます。
- PCIeによるボトルネックなし
- 専用GPUで収まりきらないデータをシステムRAMにオフロードする場合とは異なり、ここではすべてが同じ高速メモリ空間に収まります。
- 長いコンテキストでも快適に利用
- メモリ容量に余裕があるため、長いコンテキストウィンドウを利用できます。一方、24GBのGPUでは、モデルのサイズかコンテキストの長さのどちらかを犠牲にする必要があります。
#どのモデルがメモリに収まるか(70B Q4、MoE)
約90GBの使用可能なメモリを持つRyzen AI Max+ 395は、16~24GBのGPUに比べて可能なモデルの選択肢を大きく変えるものです。以下は、Q4での通常のVRAM基準を考慮した具体的なレベルです:7B ≈ 5GB、14B ≈ 9GB、32B ≈ 19GB、70B ≈ 40GB。
- Q4_K_Mの70Bモデル(約40 GB)
- 十分に収まり、長いコンテキストにも余裕があります。これが主な用途です。70Bの密モデルまたは同等のモデルは、RTX 4090を1枚使うだけでは実行できません。
- 70B Q8_0(約75GB)
- こちらも収まり、品質の低下はほとんどありません。一般向けの GPU では、複数の GPU を使わない限り考えられません。
- Qwen 3.6 35B-A3BやGLM 4.7 FlashなどのMoEモデル
- Mixture-of-Expertsは特に適しています。すべての重みをメモリに読み込むため、必要なメモリ容量は大きくなりますが、トークンごとに有効になるパラメータは数十億にとどまるため、良好な速度を維持できます。
- 大きなMoE(Q4で200B以上)
- Qwen3-235B-A22Bのようなモデルは、強く量子化すれば90GBに収まる場合があります。生成速度は、モデル全体のサイズではなく、アクティブなパラメータ数に依存します。
- DeepSeek 671B および類似モデル
- Q4でも大きすぎます(重みだけで100GBを大幅に超えます)。ディスクへのオフロードなしでは利用は困難です。大容量メモリを搭載したMac Studioか、llama.cpp専用のワークステーションを選んでください。
#実際のパフォーマンス:帯域幅が鍵を握る
何かを購入する前に、まず理解しておくべき点です。密なモデルのトークン生成は、GPU の純粋な演算性能ではなく、メモリ帯域幅によって制限されます。理論上の最大生成速度は、メモリ帯域幅をメモリ上のモデルサイズで割ることで、おおよそ計算できます。
Ryzen AI Max+ 395のメモリ帯域幅は約256 GB/sです。そのため、Q4の70Bモデル(約40 GB)の理論上の上限は約6 tokens/sで、実際の生成では4〜5 tokens/s程度が観測されます。生成される文章を読むには十分ですが、高速ではありません。一方、MoE 30B-A3Bはトークンごとに重みのごく一部しか読み込まないため、容易に数十 tokens/sに達します。プロンプトの前処理はGPUの40 CUを活用し、まずまずの性能を発揮します。
- 70B デンスモデル Q4
- 生成速度は約 4~5 tok/s。文章作成や分析には快適ですが、非常にインタラクティブなチャットには遅いです。
- 32Bの密なモデル(Q4)
- はるかにスムーズ(~19 GB/トークン)、日常使用における品質と速度のバランスが良好です。
- MoE 30B-A3B
- 毎秒数十トークン:速度は総パラメータ数の300億ではなく、実際に稼働する約30億のパラメータに依存します。
- RTX比較
- RTX 4090(約1000 GB/s)は純粋なスループットでStrix Haloを圧倒しますが、メモリ容量は24 GBが上限で、単独では70Bモデルを読み込めません。
#ミニPC・ノートパソコン・Mac Studio:率直な比較
Ryzen AI Max+ 395を搭載した製品には、複数の形態があります。チップは同じなので、選択の決め手は携帯性、持続的な冷却性能、価格です。対抗する比較基準は、依然として、大容量のユニファイドメモリを備えたMac StudioとそのM-Max/Ultraの各モデルです。
- ミニPC(例:Framework Desktop、GMKtec EVO-X2)
- 最高の持続パフォーマンス/価格比。長時間推論に安定した冷却、コンパクト、静音、24時間365日稼働の家庭用サーバーに最適。
- ラップトップ(例:HP ZBook Ultra G1a、Asus ROG Flow Z13)
- 持ち運べる環境でも同じメモリ容量を利用できますが、長時間の負荷では熱による性能低下が起こり、推論中のバッテリー駆動時間も限られます。どこでも作業するには便利ですが、サーバー用途にはあまり向きません。
- Mac Studio(M-Max / Ultra)
- メモリ帯域幅がはるかに高く(数百GB/s、Ultraでは最大約800 GB/s)、MLXエコシステムも高度に最適化されています。密なモデルではより高速ですが、同じメモリ容量で比較すると、価格はかなり高くなります。
- Mac mini M4 Pro
- 最大メモリ容量は少ないものの、32Bまでのモデルには非常に適しています。70B以上のモデルが必要なければ、検討してください。
まとめると、Strix Haloは大容量メモリ構成での価格とx86/Linuxエコシステムの面で優れ、Mac Studioは生成速度とソフトウェアの成熟度の面で優れています。大きな出費をせずに70Bを「手の届く」形で使うなら、128 GBメモリを搭載したRyzen AI Max+ 395のミニPCが、現時点で最も適したx86の選択肢です。
#LinuxでのROCmおよびVulkanの設定
Linuxで内蔵GPUを利用する方法は、ROCm(AMDの計算処理用ソフトウェアスタック)とVulkan(移植性が高く、この新しいGPUでは動かすのが比較的簡単な場合が多い)の2つです。どちらの場合も、GPUが十分な量のメモリにアクセスできるようにすることが重要です。
- 01BIOSでGPUへのメモリ割り当てを設定するBIOS/UEFIを開き、UMA Frame Buffer Size(または「Dedicated GPU Memory」)という設定項目を探してください。メモリの大きな割合をGPU用に予約してください。残りはamdgpuドライバーがGTTメモリを介して動的に割り当てます。
- 02ドライバーが認識するGTTメモリを確認するLinuxでは、GPUへの動的なメモリ割り当てにamdgpuドライバーのGTT機構が使われます。比較的新しいカーネル(6.10以降)と最新のamdgpuファームウェアを使うことで、推論に利用できるメモリの割合を最大化できます。
- 03GPUをターゲットとしたスタックをインストールする最も簡単なのは、Vulkan バックエンドを備えた Ollama または llama.cpp のビルドを使うことです。煩雑な ROCm の設定をせずに Radeon 8060S を検出できます。ROCm を使う場合は、公式パッケージをインストールし、GPU が一覧に表示されていることを確認してください。
- 04GPUターゲットを強制的に設定する(必要に応じて)内蔵GPUがROCmの公式ターゲット一覧に含まれているとは限らないため、Ollama/llama.cppで利用できるように、環境変数でGFXアーキテクチャのバージョンを指定する必要がある場合があります。
- 05モデルを起動し、オフロードを確認するモデルを起動し、GPU(CPUではなく)上で正常に動作していることを確認した上で、パフォーマンスについての結論を下してください。
#Windowsでの設定
Windowsでは、ドライバー周りはより「プラグアンドプレイ」に近い使い勝手ですが、メモリの割り当ては依然として注意が必要な点です。基本的な考え方は同じで、GPUに十分なメモリを割り当て、そのメモリを活用できるランタイムを使います。
- 01最新版 AMD Adrenalin ドライバーのインストールRyzen AI Max+ 395では、最新のドライバーを使用してください。内蔵GPUでのLLMサポートとメモリ割り当ては、バージョンを重ねるごとに改善されています。最近のドライバーでは、ユニファイドメモリのかなりの部分をVRAMとして利用できるようになります。
- 02専用グラフィックメモリを設定するBIOS(UMA Frame Buffer Size)またはAMDのユーティリティで、グラフィックス用の専用メモリを増やし、大きなモデルが収まる容量を確保してください。設定値が低すぎると、モデルの一部の処理がCPUに回ります。
- 03LM Studio または Ollama のインストールLM StudioはAMD GPUを検出し、適切なバックエンドを提案します。コマンドラインを使わない場合には、これが最も簡単な選択肢です。Windows版Ollamaも動作し、http://localhost:11434でエンドポイントを公開します。
- 04GGUFをロードし、GPUオフロードを確認するLM Studio で 70B モデルを Q4 で読み込み、GPU オフロードのスライダーを最大にしてください。各層の処理が CPU ではなく GPU に割り当てられていることを確認してください。
#トラブルシューティングとヒント
- モデルが GPU ではなく CPU で動作している
- 「ollama ps」または「rocm-smi」で確認してください。多くの場合、割り当てられたGPUメモリが少なすぎます。BIOSでUMA Frame Bufferを増やすか、LinuxでGTTを確認してください。
- ROCm は Radeon 8060S を検出できません
- RDNA 3.5の内蔵GPUは、公式リストに含まれていない場合があります。HSA_OVERRIDE_GFX_VERSIONをエクスポートするか、上書き設定なしで検出できるVulkanバックエンドに切り替えてください。
- 70Bのデンス型モデルで生成が異常に遅い
- これは想定どおりです。256 GB/sでは、約4~5 tok/sが現実的な上限です。さらに速度を上げたい場合は、MoEモデルか、より小さなモデルに切り替えてください。バグではありません。
- GPUに90GBを割り当てることができません
- BIOSファームウェアやドライバー/カーネルが古すぎると、メモリの割り当てが制限されます。BIOSに加え、WindowsではAdrenalinドライバー、Linuxではカーネルとamdgpuファームウェアを更新してください。
- 長いコンテキストでクラッシュする
- KVキャッシュはメモリ上の重みに追加されます。~90GBの制限に近づく場合はnum_ctxまたはモデルサイズを減らしてください。
#Strix Haloを搭載したマシン(2026年8月)
チップの成功は搭載製品ラインナップに表れています。すでに十数台の機器に搭載されており、小型PCからブランドワークステーション、ポータブルコンソールからモジュール式筐体まで幅広く対応しています。以下の参考価格は2026年8月に確認された128 GB構成のものです。価格は変動が激しいためご注意ください。
| マシン | フォーマット | 特徴 | 参考価格 |
|---|---|---|---|
| Bosgame M5 | Mini-PC | この価格帯で最も安いモデル | ~1 700 $ |
| GMKtec EVO-X2 | Mini-PC | 8K出力×4 | 価格の変動が大きいため、要確認 |
| Beelink GTR9 Pro | Mini-PC | デュアル10 GbE | ~2 000 $ |
| Framework Desktop | モジュール式ケース | 修理可能で、開発者の間で熱烈な支持を集める | 価格の変動が大きいため、要確認 |
| Corsair AI Workstation 300 | SFF | 実績のあるブランド、充実した保証 | 2 000-3 400 $ |
| Minisforum MS-S1 MAX | Mini-PC | PCIe x16 スロット:唯一の拡張可能なスロット | ~2 500 $ |
| HP Z2 Mini G1a | ワークステーション 2.7 L | ISV認証済み、プロ向けチャネル(PRO 395) | 2 400-3 500 $ |
| Geekom A9 Mega | Mini-PC | 標準搭載の2TB SSD | ~3 200 $ |
| Peladn YO1 | 2.4LミニPC | 「70Bをデプロイする」ために販売されています | ~1 850 $ |
| Acemagic M1A Pro+ | Mini-PC | 最大で 24 テラバイトのストレージをサポート | n.c. |
| Aoostar NEX395 | Mini-PC | TDP 140 W(最も高性能) | 中国で展開、EUでは今後展開予定 |
| GPD Win 5 | 携帯ゲーム機 | 手元で使える70Bモデル | 発表済み |
| Minix ER939-AI | Mini-PC | ダブル10 GbE | n.c. |
私たちの購入アドバイスは1行で言い表せます。仕様が同等の場合(チップはどこでも同じです)、価格、保証、冷却性能で判断してください。各マシンのテストは、レビュー&テストセクションに順次掲載されます。
#よくある質問
128GB のメモリは、本当に LLM に使用可能ですか?+
Strix Halo で利用可能な最大のモデルはどれですか?+
Strix HaloはRTX 5090を置き換えることができますか?+
Strix Halo搭載マシンはどれを選ぶべきですか?+
Strix HaloでローカルAIを使うには、WindowsとLinuxのどちらが適していますか?+
#さらに詳しく
Ryzen AI Max+ 395は、ローカルAI向けのハードウェアとモデルをより広く検討するうえでの一つの選択肢です。本ガイドの内容をさらに掘り下げる、本サイトのガイドはこちらです:
- ローカルAI向けGPUの選び方
- 予算やターゲットモデルに応じて、Strix HaloがRTXやMacとどのように比較されるかを示す購入ガイドです。
- AMD GPU (ROCm) でのOllama使用
- ROCm の詳しい設定方法。プラットフォームを入手した後、Radeon 8060S の性能を最大限に引き出すのに役立ちます。
- 量子化の選択(Q4、Q5、Q8、FP16)
- メモリに余裕がある場合に、高速なQ4と品質の損失がほぼないQ8のどちらを選ぶか判断するために。128 GBのマシンは、まさにこの条件に当てはまります。
価格は変動が激しいため、当サイトでは毎週月曜日と木曜日に、ローカルAI向けグラフィックカードの最低価格とVRAM 1 GBあたりの価格を確認しています。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。