Ryzen AI 9 HX:50 TOPS の NPU は本当に LLM に役立つか? ?
Ryzen AI 9 HX 370は、XDNA 2 NPUの50 TOPSを誇っています。AMDのマーケティングがIntelやAppleに対抗して盛んにアピールする数字です。LLMをローカルで動かしたい人にとって本当に知りたいのは、このNPUが役に立つのか、それとも引き続き内蔵GPUのRadeon 890Mに頼る必要があるのか、という点です。本ガイドでは、LLM向けのRyzen AIスタック(LM Studio Ryzen AI、Lemonade SDK)を率直に検証し、CPUのみでの実行およびiGPUでの実行と比較して、誇張せずに結論を示します。
マシンを選んでいるところですか? 予算別のおすすめ →
ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。
#ローカルでLLMを実行するのにNPUを使うのはなぜですか?
NPU(Neural Processing Unit)は、推論でよく使われるINT8およびINT4の行列演算に特化したアクセラレータです。Ryzen AI 9 HX 370のXDNA 2ブロックは、約2Wの消費電力で最大50 TOPSのINT8性能を発揮します。一見すると、持ち運んで使うにはこれ以上ないバランスです。ファンを回さず、40分でバッテリーを使い切ることもなく、LLMを動かせるからです。
「Ryzen AI 9 HX LLM NPU」というキーワードはAMDのデモで至る所に登場しますが、実際にはソフトウェアのエコシステムはまだ発展途上です。ほとんどのLLMスタック(llama.cpp、Ollama、vLLM)はNPUをまったく使わず、AVX-512を使うCPUか、Vulkan/ROCm経由の内蔵GPUですべての処理を実行します。XDNA 2を活用するには、AMDまたはコミュニティがコンパイルした専用ランタイムを使う必要があります。
#XDNA 2の実際:チップから分かること
Strix Point(Ryzen AI 300世代)に搭載されたXDNA 2アーキテクチャは、XDNA 1と比べてTOPSを倍増させ(16 → 50 TOPS)、ブロック浮動小数点のFP8とFP16へのネイティブ対応を導入しています。LLMをまともに処理できるAMD初のNPUですが、2つの大きな制約があります。
- メモリ帯域
- NPUはシステムメモリを共有します(Strix Point搭載機ではLPDDR5X-7500または8000)。そのメモリ帯域幅は約120〜128 GB/sで、CPU、GPU、OSと共有されます。NPUが理論上の最大演算性能を発揮することはできません。
- 量子化は必須です
- AMDの公式パイプラインでは、最適化されたONNX形式でINT4またはINT8に量子化されたモデルが必要です。一般的なGGUF Q4_K_Mモデルはそのままでは動作せず、変換が必要です。
- ONNX プリコンパイル
- 各モデルをXDNA 2向けにコンパイルする必要があります(サブグラフをNPUに割り当て、残りはCPUに割り当てます)。この工程で95%のユーザーが挫折します。
- マルチユーザー機能はありません
- NPUを使用できるのは一度に1つのプロセスだけです。LLMがNPUを占有している場合、ほかのWindowsのAI機能(Studio Effectsや、利用している場合はRecall)は、そのNPUを同時に使用できません。
#ハードウェアとソフトウェアの前提条件
- CPU
- Ryzen AI 9 HX 370、HX 365、またはHX PRO 370(Strix Point、コードネームKrackan)。Ryzen AI 7/5も、NPUの性能は控えめですが、同じソフトウェアスタックで動作します。
- RAM
- 快適に使うには、最低 32 GB の LPDDR5X が必要です。並行して iGPU で 14B モデルも試したい場合は、64 GB が目安です。
- OS
- Windows 11 24H2以降。Linux用のXDNA NPUドライバーは存在します(カーネル6.11からアップストリームに組み込み済み)が、ユーザー向けのツール整備は大幅に遅れています。
- NPUドライバー
- AMD Ryzen AI Software 1.3以上(amd.comから別途ダウンロード、Adrenalinドライバーに含まれません)
- ストレージ
- 事前コンパイル済みのONNXモデル用に、約20 GBのストレージ空き容量が必要です(同等のGGUFモデルよりサイズが大きいため)。
#1. LM Studio Ryzen AI:最も簡単な方法
AMDは、XDNA 2向けに事前設定されたLM Studioの公式フォークを配布しています。PythonやONNX Runtimeに手を加えずに試したい方に推奨される方法です。
- 01バイナリをダウンロードamd.com/lmstudio(公式ページ「LM Studio for Ryzen AI」)にアクセスしてください。Windows用バイナリはAMDが署名しています。
- 02標準インストールインストーラーはLM StudioをProgram Filesに配置し、ONNX RyzenAI Execution Providerランタイムを自動的に設定します。
- 03NPUに最適化されたモデルを選択Discover タブで「Ryzen AI」バッジを条件に絞り込んでください。XDNA 2 向けに事前コンパイルされた Qwen 3.5 9B、Granite 4.2 3B、Granite 4.2 8B が見つかります(名前の末尾は -hybrid)。
- 04ロードおよびテスト読み込み時に LM Studio は実行環境のセレクタ(GPU、CPU、または「Ryzen AI Hybrid」(NPU + iGPU))を表示します。NPUを活用するには「Hybrid」を選択してください。
- 05NPUが処理を行っていることを確認タスクマネージャーを開き、パフォーマンスタブ → NPUを確認してください。生成中にNPUの使用率は60~95%まで上昇する必要があります。0%のままなら、実行はCPU上で行われていると判断できます。
#2. Lemonade SDK:LM Studioでできることの先へ
Lemonade SDK は AMD の開発者向け公式ツールです。2つの目的があります。(1) 独自の GGUF/HF モデルをハイブリッド ONNX 形式にコンパイルすること、(2) Open WebUI や Continue.dev などから使用可能な OpenAI 互換 API を公開すること。
#3. 代替としてRadeon 890Mを使う:多くの場合、最善の選択
Ryzen AI 9 HX 370には、Radeon 890MのiGPU(RDNA 3.5、16 CU)も搭載されています。標準版のLM StudioまたはOllamaでは、このiGPUをVulkan経由で利用でき、純粋な処理速度ではNPUを上回ることもあります。以下で使い方を説明します。
- 動的VRAM割当
- Radeon 890MはシステムRAMを共有しています。UEFI BIOSで「UMA Frame Buffer Size」を検索し、LLMテスト前に少なくとも8GB(可能であれば16GB)に設定してください。
- ドライバー
- 計算処理向けに最適化されたVulkanの処理経路を利用するには、Adrenalin 24.10以降が必要です。Lenovo/AsusのOEMドライバーは、最新より2バージョン遅れていることがよくあります。
- ROCmをLinuxで使用
- ROCm 6.3以降は、2026年4月からStrix Pointを公式にサポートしています。Ubuntu 24.04では利用可能ですが、iGPUの性能は依然として共有メモリの帯域幅に制約されます。
#ベンチマーク:NPU と iGPU と CPU の比較
Asus Zenbook S 14(Ryzen AI 9 HX 370、32 GB LPDDR5X-7500、Windows 11 24H2、AMD Ryzen AI Software 1.3、Adrenalin 24.10.1)で測定した目安の値です。短いプロンプト(約50トークン)、生成トークン数256、temperature 0.7。5回の実行の平均値です。
- Qwen 3.5 9B — CPU AVX-512
- 4.1トークン/秒 · パッケージ消費電力28W · ファンの音が聞こえる
- Qwen 3.5 9B — Radeon 890M (Vulkan)
- 9.8 tok/s · パッケージ電力35 W · ファンが継続的に強く回転
- Qwen 3.5 9Bのハイブリッド実行 — NPU + iGPU(LM Studio Ryzen AI)
- 11.2トークン/秒 · パッケージ消費電力18W · ファンの音は控えめ
- Granite 4.2 3B — NPUのみ
- 24 tok/s · パッケージ消費電力9 W · ファン停止
- Granite 4.2 8B — NPU + iGPU
- 13.5 tok/s · パッケージ消費電力19 W · ファンの動作音は控えめ
- Gemma 4 12B — Radeon 890M (Vulkan)
- 4.2 tok/s · 38 W · NPU単体では大きすぎる
#NPUが特に活躍する使用例
- 常時サポートを提供するチャットボット
- Granite 4.2 3BまたはQwen 3.5 4BをNPU上で実行すると約5Wの消費電力となり、バッテリーへの影響はほとんどなく24時間連続使用が可能です。プロダクティビティアプリへの統合に最適です。
- メールやドキュメントの自動要約
- 短時間のバッチ処理、4〜8kトークンのコンテキスト、3B〜8Bのモデル。NPUに最適です。ファンを止めたまま、作業中にバックグラウンドで静かに処理できます。
- リアルタイムの音声認識+要約
- Whisper(iGPU上で)+ Granite 4.2 8B(NPU上で)をパイプラインで実行 — これは、両方のブロックが独立しているため可能になっています。
- 機内モードでの長時間利用
- バッテリー駆動では、NPU+iGPUを使うとLLMを積極的に使用できる時間は4~5時間となり、CPUとiGPUだけの構成では1時間30分です。
#注意点および制限事項
- コンテキスト制限
- AMD のプリコンパイル済みモデルの多くは、コンテキスト長の上限が 4096 トークンです。32k 以上にするには再コンパイルが必要で、メモリ消費も大幅に増えます。
- NPU単独では8Bを超えるモデルには対応できません
- 8Bを超えると、INT4でもNPUの帯域幅が不足します。13Bを超えると、必ずiGPUが処理を引き継ぎます。
- 利用できないモデル
- Qwen 3.5、DeepSeek、Gemma 4のすべてに公式の事前コンパイル済み版が用意されているわけではありません。特定のモデルを動かすつもりでマシン構成を購入する前に、Ryzen AIハブを確認してください。
- 不具合を引き起こすWindows更新
- 一部の24H2の累積更新プログラムにより、NPUの列挙が一時的に無効になったことがあります。AMD Ryzen AI Softwareパッケージを最新の状態に保ち、累積更新プログラムを適用するたびにデバイスマネージャーを確認してください。
- ファインチューニング非対応
- XDNA 2 が行えるのは推論だけです。学習や LoRA チューニングには、専用 GPU が必要です。それに尽きます。
#さらに詳しく
次のステップに応じて、深掘りするための3つのアプローチ:
- 量子化を理解する
- XDNA 2 NPUが処理できるのはINT4とINT8だけです。『量子化の選択方法(Q4、Q5、Q8、FP16)』では、Q4_K_MがCPU/GPUで標準であり続ける理由と、NPUでINT4を使うと何が変わるのかを説明しています。
- 実際にGPUを搭載した構成と比較
- デスクトップPCにするか迷っている場合は、「ローカルAI用GPUの選定ガイド」でRTX 4070、4090、M-Maxを比較し、用途別に購入判断の基準を示しています。
- より一般的なOllamaのセットアップ
- Radeon 890Mで標準的なソフトウェア構成を使い続ける場合は、Windows向けのOllamaインストールガイドで、Vulkanの設定と共有VRAM/RAMの管理を確認できます。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。