中級 14 分APU

Ryzen AI Max+ 395(Strix Halo):LLM用128GBメモリ locaux

Ryzen AI Max+ 395(コード名:Strix Halo)は、AMDがローカルAI分野に正面から挑むためのAPUです。この分野は、これまでユニファイドメモリを搭載したMacと24 GBのメモリを搭載したGPUが主導してきました。最大の強みは、CPU、GPU、NPUで共有する最大128 GBのメモリで、その大部分をモデルに割り当てられることです。本ガイドでは、Ryzen AI Max+ 395でLLMを実際にどこまで動かせるのかを率直に整理します。どの70BモデルやMoEモデルが利用可能になるのか、専用GPUやMacと比べてどの程度の速度で動くのか、そしてROCmとVulkanでどう設定するのかを解説します。

マシンを選んでいるところですか? 予算別のおすすめ → · 当社の製品ページ Ryzen AI Max搭載ミニPC(128GB) →

著者 Samir K.·更新 2026-08-27·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#Ryzen AI Max+ 395がローカルLLMの状況を一変させる理由

大型モデルをローカルで動かすと、ほぼ必ず同じ壁にぶつかります。ビデオメモリの容量です。RTX 4090は24GB、RTX 5090は32GBが上限で、それ以上が必要なら、複数のカードを組み合わせるかMac Studioを選ぶ必要があります。Ryzen AI Max+ 395は、この壁に別の角度から取り組みます。容量の限られた専用VRAMの代わりに、大容量のユニファイドメモリをCPU、内蔵GPU、NPUで共有する仕組みです。128GBを搭載した機種では、推論用に90GBを超える容量をGPUに割り当てられます。

具体的には、これまでPCにはなかった種類のマシンが登場することになります。価格帯の幅が非常に広いミニPCやノートPCで、専用グラフィックカードやマルチGPU構成なしに70Bモデル、さらにはそれよりはるかに大きい混合エキスパート(MoE)モデルをロードできる可能性がありますが、実際に可能かどうかは確認が必要です。大容量メモリを必要とするローカルAI用途で、Mac Studioに対抗できる初めての有力なx86マシンです。

i
Strix Halo、Ryzen AI Max、Radeon 8060S:これは何を指すのでしょうか?
「Strix Halo」は世代のコードネームです。「Ryzen AI Max+ 395」はRyzen AI Maxシリーズのハイエンドモデルです。内蔵GPUの名称はRadeon 8060Sです。この3つは同じチップの異なる側面を指しており、製品情報によって、これら3つの名称を目にすることになります。

#チップの詳細

Ryzen AI Max+ 395は、単一のダイ上に3つの演算エンジンを統合したモノリシックAPUで、すべてが同じメモリコントローラーに接続されています。LLMでは主にGPUとメモリが重要ですが、全体として整合性のある構成になっています。

CPU — Zen 5 16コア
Zen 5の16コア/32スレッド。前処理、CPUへの部分的なオフロード、そしてGPUでの推論そのもの以外のあらゆる処理に役立ちます。
GPU — Radeon 8060S (RDNA 3.5)
RDNA 3.5アーキテクチャの演算ユニットを40基搭載しています。PC市場で最大規模の内蔵GPUで、ROCmまたはVulkanを介した推論を担います。
NPU — XDNA 2、約50 TOPS
低消費電力のAI専用アクセラレータです。最適化された一部の処理には適していますが、現在、ほとんどのLLMランタイム(Ollama、llama.cpp)が対象としているのはNPUではなくGPUです。
メモリ — LPDDR5X、最大 128 GB
256ビットバス、LPDDR5X 8000 MT/s、約256GB/sの共有帯域を提供。CPU、GPU、NPU間で統合されています。
!
メモリは基板にはんだ付けされているため、購入時に選ぶ必要があります
Strix HaloのLPDDR5Xは基板にはんだ付けされており、SO-DIMMメモリモジュールは使われていません。後から増設することはできません。70B以上のモデルを使う予定なら、最初から128 GB版を選んでください。32 GB版や64 GB版では、大規模LLM向けのプラットフォームとしての魅力を十分に活かせません。
i
このチップが歴史的である理由
10年間、自宅で大規模モデルを動かすには、VRAMを確保するために高価なGPUを積み上げる必要がありました。Strix Haloは状況を覆します。AMDはZen 5コア16個、RTX 4060-4070クラスのGPU、50 TOPSのNPUを、単一の128 GBプールと一体に統合しました。これにより、70Bの量子化モデルが、2026年9月末時点で約5,700 €のRTX 5090が32 GBで頭打ちになるのに対し、完全に収まるようになりました。これは、ローカル推論用に「対応」したのではなく、ローカル推論のために設計された初の一般向けチップです。

#128 GBの統合メモリが真の強み

通常のGPUでは、VRAMとシステムRAMは別々のメモリ領域です。VRAMに収まりきらないモデルはPCIe経由でシステムRAMに移され、推論性能が大幅に低下します。Ryzen AI Max+ 395では、物理的なメモリ領域は一つだけです。GPUは、Apple Silicon搭載Macのユニファイドメモリとまったく同じように、ユニファイドメモリに直接アクセスします。二つのメモリ領域間でのコピーも、PCIeによるボトルネックもありません。

モデルが実際に利用できるメモリ量は、「システム」メモリと「GPU」メモリへの配分によって決まります。ファームウェアと OS に応じて、一定量を GPU 用に予約する(BIOS の UMA 設定)、残りをドライバーに動的に割り当てさせる(Linux の GTT)、またはその両方を行います。実際には、128 GB のマシンで、推論用に 96 GB、さらにはそれ以上を GPU から利用できるようにすることもよくあります。

単一のプール
128GBが共有されています。モデルが使用しない分はシステムに残り、逆にシステムが使用しない分もモデルに残ります。
GPUに十分なメモリを割り当て可能
BIOSやドライバーの設定によっては、モデルの重みとコンテキストキャッシュに90GB以上を割り当てられます。
PCIeによるボトルネックなし
専用GPUで収まりきらないデータをシステムRAMにオフロードする場合とは異なり、ここではすべてが同じ高速メモリ空間に収まります。
長いコンテキストでも快適に利用
メモリ容量に余裕があるため、長いコンテキストウィンドウを利用できます。一方、24GBのGPUでは、モデルのサイズかコンテキストの長さのどちらかを犠牲にする必要があります。

#どのモデルがメモリに収まるか(70B Q4、MoE)

約90GBの使用可能なメモリを持つRyzen AI Max+ 395は、16~24GBのGPUに比べて可能なモデルの選択肢を大きく変えるものです。以下は、Q4での通常のVRAM基準を考慮した具体的なレベルです:7B ≈ 5GB、14B ≈ 9GB、32B ≈ 19GB、70B ≈ 40GB。

Q4_K_Mの70Bモデル(約40 GB)
十分に収まり、長いコンテキストにも余裕があります。これが主な用途です。70Bの密モデルまたは同等のモデルは、RTX 4090を1枚使うだけでは実行できません。
70B Q8_0(約75GB)
こちらも収まり、品質の低下はほとんどありません。一般向けの GPU では、複数の GPU を使わない限り考えられません。
Qwen 3.6 35B-A3BやGLM 4.7 FlashなどのMoEモデル
Mixture-of-Expertsは特に適しています。すべての重みをメモリに読み込むため、必要なメモリ容量は大きくなりますが、トークンごとに有効になるパラメータは数十億にとどまるため、良好な速度を維持できます。
大きなMoE(Q4で200B以上)
Qwen3-235B-A22Bのようなモデルは、強く量子化すれば90GBに収まる場合があります。生成速度は、モデル全体のサイズではなく、アクティブなパラメータ数に依存します。
DeepSeek 671B および類似モデル
Q4でも大きすぎます(重みだけで100GBを大幅に超えます)。ディスクへのオフロードなしでは利用は困難です。大容量メモリを搭載したMac Studioか、llama.cpp専用のワークステーションを選んでください。
→
MoEはこのマシンに最適です
70B のデンスモデルは、トークンごとに 40 GB の重みを読み取ります。帯域幅がボトルネックになります。同じフットプリントでも、アクティブなパラメータが 3B しかない MoE は、トークンごとにメモリの一小部分しか読み取らないため、はるかに高速に動作します。Strix Halo では、速度が重要な場合は MoE アーキテクチャを優先してください。

#実際のパフォーマンス:帯域幅が鍵を握る

何かを購入する前に、まず理解しておくべき点です。密なモデルのトークン生成は、GPU の純粋な演算性能ではなく、メモリ帯域幅によって制限されます。理論上の最大生成速度は、メモリ帯域幅をメモリ上のモデルサイズで割ることで、おおよそ計算できます。

Ryzen AI Max+ 395のメモリ帯域幅は約256 GB/sです。そのため、Q4の70Bモデル(約40 GB)の理論上の上限は約6 tokens/sで、実際の生成では4〜5 tokens/s程度が観測されます。生成される文章を読むには十分ですが、高速ではありません。一方、MoE 30B-A3Bはトークンごとに重みのごく一部しか読み込まないため、容易に数十 tokens/sに達します。プロンプトの前処理はGPUの40 CUを活用し、まずまずの性能を発揮します。

70B デンスモデル Q4
生成速度は約 4~5 tok/s。文章作成や分析には快適ですが、非常にインタラクティブなチャットには遅いです。
32Bの密なモデル(Q4)
はるかにスムーズ(~19 GB/トークン)、日常使用における品質と速度のバランスが良好です。
MoE 30B-A3B
毎秒数十トークン:速度は総パラメータ数の300億ではなく、実際に稼働する約30億のパラメータに依存します。
RTX比較
RTX 4090(約1000 GB/s)は純粋なスループットでStrix Haloを圧倒しますが、メモリ容量は24 GBが上限で、単独では70Bモデルを読み込めません。
i
キャパシティと速度のバランス:適切な選択
Ryzen AI Max+ 395 に投資して得られるのは、速度ではなくメモリ容量です。「どの24 GBのグラフィックカードにも読み込めない大きなモデルを動かしたい」という用途には非常に優れています。「7B~14Bモデルで毎秒のトークン数を最大にしたい」という用途なら、専用 GPU のほうが速く、価格も安いです。

#ミニPC・ノートパソコン・Mac Studio:率直な比較

Ryzen AI Max+ 395を搭載した製品には、複数の形態があります。チップは同じなので、選択の決め手は携帯性、持続的な冷却性能、価格です。対抗する比較基準は、依然として、大容量のユニファイドメモリを備えたMac StudioとそのM-Max/Ultraの各モデルです。

ミニPC(例:Framework Desktop、GMKtec EVO-X2)
最高の持続パフォーマンス/価格比。長時間推論に安定した冷却、コンパクト、静音、24時間365日稼働の家庭用サーバーに最適。
ラップトップ(例:HP ZBook Ultra G1a、Asus ROG Flow Z13)
持ち運べる環境でも同じメモリ容量を利用できますが、長時間の負荷では熱による性能低下が起こり、推論中のバッテリー駆動時間も限られます。どこでも作業するには便利ですが、サーバー用途にはあまり向きません。
Mac Studio(M-Max / Ultra)
メモリ帯域幅がはるかに高く(数百GB/s、Ultraでは最大約800 GB/s)、MLXエコシステムも高度に最適化されています。密なモデルではより高速ですが、同じメモリ容量で比較すると、価格はかなり高くなります。
Mac mini M4 Pro
最大メモリ容量は少ないものの、32Bまでのモデルには非常に適しています。70B以上のモデルが必要なければ、検討してください。

まとめると、Strix Haloは大容量メモリ構成での価格とx86/Linuxエコシステムの面で優れ、Mac Studioは生成速度とソフトウェアの成熟度の面で優れています。大きな出費をせずに70Bを「手の届く」形で使うなら、128 GBメモリを搭載したRyzen AI Max+ 395のミニPCが、現時点で最も適したx86の選択肢です。

#LinuxでのROCmおよびVulkanの設定

Linuxで内蔵GPUを利用する方法は、ROCm(AMDの計算処理用ソフトウェアスタック)とVulkan(移植性が高く、この新しいGPUでは動かすのが比較的簡単な場合が多い)の2つです。どちらの場合も、GPUが十分な量のメモリにアクセスできるようにすることが重要です。

  1. 01
    BIOSでGPUへのメモリ割り当てを設定する
    BIOS/UEFIを開き、UMA Frame Buffer Size(または「Dedicated GPU Memory」)という設定項目を探してください。メモリの大きな割合をGPU用に予約してください。残りはamdgpuドライバーがGTTメモリを介して動的に割り当てます。
  2. 02
    ドライバーが認識するGTTメモリを確認する
    Linuxでは、GPUへの動的なメモリ割り当てにamdgpuドライバーのGTT機構が使われます。比較的新しいカーネル(6.10以降)と最新のamdgpuファームウェアを使うことで、推論に利用できるメモリの割合を最大化できます。
  3. 03
    GPUをターゲットとしたスタックをインストールする
    最も簡単なのは、Vulkan バックエンドを備えた Ollama または llama.cpp のビルドを使うことです。煩雑な ROCm の設定をせずに Radeon 8060S を検出できます。ROCm を使う場合は、公式パッケージをインストールし、GPU が一覧に表示されていることを確認してください。
  4. 04
    GPUターゲットを強制的に設定する(必要に応じて)
    内蔵GPUがROCmの公式ターゲット一覧に含まれているとは限らないため、Ollama/llama.cppで利用できるように、環境変数でGFXアーキテクチャのバージョンを指定する必要がある場合があります。
  5. 05
    モデルを起動し、オフロードを確認する
    モデルを起動し、GPU(CPUではなく)上で正常に動作していることを確認した上で、パフォーマンスについての結論を下してください。
ターミナル — GPUを確認し、モデルを起動する
# Vérifier que le GPU AMD est détecté par ROCm
rocminfo | grep -i "gfx"

# Voir l'occupation mémoire du GPU en temps réel
rocm-smi

# Lancer un gros MoE 2026 avec Ollama
ollama run qwen3.6:35b

# Confirmer que le modèle est sur GPU (et pas CPU)
ollama ps
ターミナル — ROCmのGFXターゲットを強制指定する(検出されない場合)
# Le Radeon 8060S (RDNA 3.5) n'est pas toujours reconnu par défaut.
# Indiquez la version GFX pour qu'Ollama accepte le GPU.
export HSA_OVERRIDE_GFX_VERSION=11.0.0
ollama serve
→
まずVulkan、次にROCm
この登場して間もないプラットフォームでは、llama.cpp/OllamaのVulkanバックエンドを使うと、GPUを動作させるまでの手順が最も少なく済むことが多いです。依存関係が少なく、GPUも自動検出されます。ROCmは、すべてが動作するようになってから性能を調整するために使ってください。当サイトのVulkanガイドでは、詳しいコンパイル手順を説明しています。

#Windowsでの設定

Windowsでは、ドライバー周りはより「プラグアンドプレイ」に近い使い勝手ですが、メモリの割り当ては依然として注意が必要な点です。基本的な考え方は同じで、GPUに十分なメモリを割り当て、そのメモリを活用できるランタイムを使います。

  1. 01
    最新版 AMD Adrenalin ドライバーのインストール
    Ryzen AI Max+ 395では、最新のドライバーを使用してください。内蔵GPUでのLLMサポートとメモリ割り当ては、バージョンを重ねるごとに改善されています。最近のドライバーでは、ユニファイドメモリのかなりの部分をVRAMとして利用できるようになります。
  2. 02
    専用グラフィックメモリを設定する
    BIOS(UMA Frame Buffer Size)またはAMDのユーティリティで、グラフィックス用の専用メモリを増やし、大きなモデルが収まる容量を確保してください。設定値が低すぎると、モデルの一部の処理がCPUに回ります。
  3. 03
    LM Studio または Ollama のインストール
    LM StudioはAMD GPUを検出し、適切なバックエンドを提案します。コマンドラインを使わない場合には、これが最も簡単な選択肢です。Windows版Ollamaも動作し、http://localhost:11434でエンドポイントを公開します。
  4. 04
    GGUFをロードし、GPUオフロードを確認する
    LM Studio で 70B モデルを Q4 で読み込み、GPU オフロードのスライダーを最大にしてください。各層の処理が CPU ではなく GPU に割り当てられていることを確認してください。
PowerShell — WindowsでのOllama
# Vérifier la version d'Ollama
ollama --version

# Lancer un gros MoE 2026 ; l'endpoint local reste sur :11434
ollama run qwen3.6:35b

# Vérifier l'exécution sur GPU
ollama ps
i
推奨スタック
最も快適なのは、Ollama(推論デーモン、:11434の OpenAI 互換エンドポイント)と、Open WebUI や LM Studio のようなインターフェースを組み合わせる構成です。この点に Strix Halo 固有の要素はありません。GPU を活用できれば、その後のワークフローは他のマシンと同じです。

#トラブルシューティングとヒント

モデルが GPU ではなく CPU で動作している
「ollama ps」または「rocm-smi」で確認してください。多くの場合、割り当てられたGPUメモリが少なすぎます。BIOSでUMA Frame Bufferを増やすか、LinuxでGTTを確認してください。
ROCm は Radeon 8060S を検出できません
RDNA 3.5の内蔵GPUは、公式リストに含まれていない場合があります。HSA_OVERRIDE_GFX_VERSIONをエクスポートするか、上書き設定なしで検出できるVulkanバックエンドに切り替えてください。
70Bのデンス型モデルで生成が異常に遅い
これは想定どおりです。256 GB/sでは、約4~5 tok/sが現実的な上限です。さらに速度を上げたい場合は、MoEモデルか、より小さなモデルに切り替えてください。バグではありません。
GPUに90GBを割り当てることができません
BIOSファームウェアやドライバー/カーネルが古すぎると、メモリの割り当てが制限されます。BIOSに加え、WindowsではAdrenalinドライバー、Linuxではカーネルとamdgpuファームウェアを更新してください。
長いコンテキストでクラッシュする
KVキャッシュはメモリ上の重みに追加されます。~90GBの制限に近づく場合はnum_ctxまたはモデルサイズを減らしてください。

#Strix Haloを搭載したマシン(2026年8月)

チップの成功は搭載製品ラインナップに表れています。すでに十数台の機器に搭載されており、小型PCからブランドワークステーション、ポータブルコンソールからモジュール式筐体まで幅広く対応しています。以下の参考価格は2026年8月に確認された128 GB構成のものです。価格は変動が激しいためご注意ください。

販売中または発表済みのRyzen AI Max+ 395搭載マシン(2026年8月時点の参考価格、128GB構成)
マシンフォーマット特徴参考価格
Bosgame M5Mini-PCこの価格帯で最も安いモデル~1 700 $
GMKtec EVO-X2Mini-PC8K出力×4価格の変動が大きいため、要確認
Beelink GTR9 ProMini-PCデュアル10 GbE~2 000 $
Framework Desktopモジュール式ケース修理可能で、開発者の間で熱烈な支持を集める価格の変動が大きいため、要確認
Corsair AI Workstation 300SFF実績のあるブランド、充実した保証2 000-3 400 $
Minisforum MS-S1 MAXMini-PCPCIe x16 スロット:唯一の拡張可能なスロット~2 500 $
HP Z2 Mini G1aワークステーション 2.7 LISV認証済み、プロ向けチャネル(PRO 395)2 400-3 500 $
Geekom A9 MegaMini-PC標準搭載の2TB SSD~3 200 $
Peladn YO12.4LミニPC「70Bをデプロイする」ために販売されています~1 850 $
Acemagic M1A Pro+Mini-PC最大で 24 テラバイトのストレージをサポートn.c.
Aoostar NEX395Mini-PCTDP 140 W(最も高性能)中国で展開、EUでは今後展開予定
GPD Win 5携帯ゲーム機手元で使える70Bモデル発表済み
Minix ER939-AIMini-PCダブル10 GbEn.c.

私たちの購入アドバイスは1行で言い表せます。仕様が同等の場合(チップはどこでも同じです)、価格、保証、冷却性能で判断してください。各マシンのテストは、レビュー&テストセクションに順次掲載されます。

#よくある質問

128GB のメモリは、本当に LLM に使用可能ですか?+
はい、大部分は利用できます。メモリは統合されており、WindowsではGPUに最大96GBを割り当てられます。Linuxでは、適切に設定すればさらに多く割り当てられます。そのため、Q4で量子化した70Bモデル(約40GB)は全体がGPUメモリに収まり、コンテキスト用の余裕も残ります。
Strix Halo で利用可能な最大のモデルはどれですか?+
量子化した70Bモデルは快適に動作します。AMDは、メモリ割り当てを増やすことで、LM Studioを使って約1,200億パラメータまでのモデルを動作させる実演を行いました。それを超えると、制約は容量ではなく速度になります。256GB/sのメモリ帯域幅では、非常に大きな密なモデルの生成が遅くなります。MoEモデル(GLMやQwen3-30B-A3Bなど)は特にこの環境に適しています。アクティブなパラメータは少なく、多くのパラメータをメモリに収められるためです。
Strix HaloはRTX 5090を置き換えることができますか?+
いいえ — 彼らは同じゲームをプレイしていません。RTX 5090 は、その 32 GB に収まるすべてのデータに対してははるかに速いです。Strix Halo は、モデルがこの限界を超えるとすぐに優位性を発揮し、5090が単純にロードできない内容を処理します。その結果、全体のマシンコストは、カード単体の価格よりも低くなります。
Strix Halo搭載マシンはどれを選ぶべきですか?+
どのマシンも同じチップを搭載しているため、実際の選択基準は、価格(Bosgame M5が最も競争力のある価格)、保証とアフターサービスの信頼性(Corsair、HP、Frameworkには安心感があります)、拡張性(PCIe x16スロットを備えているのはMinisforum MS-S1 MAXだけ)、そして冷却性能です。購入前に、当サイトの各マシンのレビューをご覧ください。
Strix HaloでローカルAIを使うには、WindowsとLinuxのどちらが適していますか?+
どちらでも動作します。LinuxではGPUに割り当てられるメモリ容量が最も大きく、llama.cpp/ROCmで最高の性能が得られます。WindowsではLM Studioがこのチップにネイティブ対応しているため、より簡単に使えます。当サイトの設定ガイドでは、両方のシステムを項目ごとに解説しています。

#さらに詳しく

Ryzen AI Max+ 395は、ローカルAI向けのハードウェアとモデルをより広く検討するうえでの一つの選択肢です。本ガイドの内容をさらに掘り下げる、本サイトのガイドはこちらです:

ローカルAI向けGPUの選び方
予算やターゲットモデルに応じて、Strix HaloがRTXやMacとどのように比較されるかを示す購入ガイドです。
AMD GPU (ROCm) でのOllama使用
ROCm の詳しい設定方法。プラットフォームを入手した後、Radeon 8060S の性能を最大限に引き出すのに役立ちます。
量子化の選択(Q4、Q5、Q8、FP16)
メモリに余裕がある場合に、高速なQ4と品質の損失がほぼないQ8のどちらを選ぶか判断するために。128 GBのマシンは、まさにこの条件に当てはまります。

価格は変動が激しいため、当サイトでは毎週月曜日と木曜日に、ローカルAI向けグラフィックカードの最低価格とVRAM 1 GBあたりの価格を確認しています。

このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。