中級 13 分NPU

Ryzen AI 9 HX:50 TOPS の NPU は本当に LLM に役立つか? ?

Ryzen AI 9 HX 370は、XDNA 2 NPUの50 TOPSを誇っています。AMDのマーケティングがIntelやAppleに対抗して盛んにアピールする数字です。LLMをローカルで動かしたい人にとって本当に知りたいのは、このNPUが役に立つのか、それとも引き続き内蔵GPUのRadeon 890Mに頼る必要があるのか、という点です。本ガイドでは、LLM向けのRyzen AIスタック(LM Studio Ryzen AI、Lemonade SDK)を率直に検証し、CPUのみでの実行およびiGPUでの実行と比較して、誇張せずに結論を示します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-08-27·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。

#ローカルでLLMを実行するのにNPUを使うのはなぜですか?

NPU(Neural Processing Unit)は、推論でよく使われるINT8およびINT4の行列演算に特化したアクセラレータです。Ryzen AI 9 HX 370のXDNA 2ブロックは、約2Wの消費電力で最大50 TOPSのINT8性能を発揮します。一見すると、持ち運んで使うにはこれ以上ないバランスです。ファンを回さず、40分でバッテリーを使い切ることもなく、LLMを動かせるからです。

「Ryzen AI 9 HX LLM NPU」というキーワードはAMDのデモで至る所に登場しますが、実際にはソフトウェアのエコシステムはまだ発展途上です。ほとんどのLLMスタック(llama.cpp、Ollama、vLLM)はNPUをまったく使わず、AVX-512を使うCPUか、Vulkan/ROCm経由の内蔵GPUですべての処理を実行します。XDNA 2を活用するには、AMDまたはコミュニティがコンパイルした専用ランタイムを使う必要があります。

i
XDNA 2が実際に実現できること
NPUは、短いコンテキストで小型モデルのINT8/INT4推論を行うために設計されています。学習やファインチューニング、あるいは32Bモデルの実行において、GPUの代わりにはなりません。「バックグラウンドで応答する軽量な3B〜8Bのアシスタント」をイメージしてください。「AIワークステーション」ではありません。

#XDNA 2の実際:チップから分かること

Strix Point(Ryzen AI 300世代)に搭載されたXDNA 2アーキテクチャは、XDNA 1と比べてTOPSを倍増させ(16 → 50 TOPS)、ブロック浮動小数点のFP8とFP16へのネイティブ対応を導入しています。LLMをまともに処理できるAMD初のNPUですが、2つの大きな制約があります。

メモリ帯域
NPUはシステムメモリを共有します(Strix Point搭載機ではLPDDR5X-7500または8000)。そのメモリ帯域幅は約120〜128 GB/sで、CPU、GPU、OSと共有されます。NPUが理論上の最大演算性能を発揮することはできません。
量子化は必須です
AMDの公式パイプラインでは、最適化されたONNX形式でINT4またはINT8に量子化されたモデルが必要です。一般的なGGUF Q4_K_Mモデルはそのままでは動作せず、変換が必要です。
ONNX プリコンパイル
各モデルをXDNA 2向けにコンパイルする必要があります(サブグラフをNPUに割り当て、残りはCPUに割り当てます)。この工程で95%のユーザーが挫折します。
マルチユーザー機能はありません
NPUを使用できるのは一度に1つのプロセスだけです。LLMがNPUを占有している場合、ほかのWindowsのAI機能(Studio Effectsや、利用している場合はRecall)は、そのNPUを同時に使用できません。

#ハードウェアとソフトウェアの前提条件

CPU
Ryzen AI 9 HX 370、HX 365、またはHX PRO 370(Strix Point、コードネームKrackan)。Ryzen AI 7/5も、NPUの性能は控えめですが、同じソフトウェアスタックで動作します。
RAM
快適に使うには、最低 32 GB の LPDDR5X が必要です。並行して iGPU で 14B モデルも試したい場合は、64 GB が目安です。
OS
Windows 11 24H2以降。Linux用のXDNA NPUドライバーは存在します(カーネル6.11からアップストリームに組み込み済み)が、ユーザー向けのツール整備は大幅に遅れています。
NPUドライバー
AMD Ryzen AI Software 1.3以上(amd.comから別途ダウンロード、Adrenalinドライバーに含まれません)
ストレージ
事前コンパイル済みのONNXモデル用に、約20 GBのストレージ空き容量が必要です(同等のGGUFモデルよりサイズが大きいため)。
!
まずNPUを確認してください
デバイス マネージャー → ニューラル プロセッサで、「AMD Ryzen AI NPU」が黄色の警告三角形なしで表示されている必要があります。そうでなければ、汎用のチップセットドライバーがインストールされています。専用のAMD Ryzen AI Softwareパッケージをインストールしてください。

#1. LM Studio Ryzen AI:最も簡単な方法

AMDは、XDNA 2向けに事前設定されたLM Studioの公式フォークを配布しています。PythonやONNX Runtimeに手を加えずに試したい方に推奨される方法です。

  1. 01
    バイナリをダウンロード
    amd.com/lmstudio(公式ページ「LM Studio for Ryzen AI」)にアクセスしてください。Windows用バイナリはAMDが署名しています。
  2. 02
    標準インストール
    インストーラーはLM StudioをProgram Filesに配置し、ONNX RyzenAI Execution Providerランタイムを自動的に設定します。
  3. 03
    NPUに最適化されたモデルを選択
    Discover タブで「Ryzen AI」バッジを条件に絞り込んでください。XDNA 2 向けに事前コンパイルされた Qwen 3.5 9B、Granite 4.2 3B、Granite 4.2 8B が見つかります(名前の末尾は -hybrid)。
  4. 04
    ロードおよびテスト
    読み込み時に LM Studio は実行環境のセレクタ(GPU、CPU、または「Ryzen AI Hybrid」(NPU + iGPU))を表示します。NPUを活用するには「Hybrid」を選択してください。
  5. 05
    NPUが処理を行っていることを確認
    タスクマネージャーを開き、パフォーマンスタブ → NPUを確認してください。生成中にNPUの使用率は60~95%まで上昇する必要があります。0%のままなら、実行はCPU上で行われていると判断できます。
コマンドラインから NPU を確認
# Lister les périphériques de calcul disponibles
Get-PnpDevice -Class "ComputeAccelerator" | Format-Table FriendlyName, Status

# Doit afficher : AMD Ryzen AI NPU - OK

#2. Lemonade SDK:LM Studioでできることの先へ

Lemonade SDK は AMD の開発者向け公式ツールです。2つの目的があります。(1) 独自の GGUF/HF モデルをハイブリッド ONNX 形式にコンパイルすること、(2) Open WebUI や Continue.dev などから使用可能な OpenAI 互換 API を公開すること。

Lemonade SDKのインストール
# Python 3.11 recommandé
python -m venv .venv
.\.venv\Scripts\Activate.ps1

# Installation du SDK
pip install lemonade-sdk[npu]

# Test : lister les modèles déjà disponibles
lemonade list
OpenAIと互換性のあるサーバーを起動
# Charge Qwen 3.5 9B précompilé en mode hybride NPU+iGPU
lemonade serve --model qwen3.5-9b-instruct-hybrid --port 8000

# L'endpoint http://localhost:8000/v1/chat/completions est désormais utilisable
# par toute app qui parle OpenAI (Open WebUI, Continue, etc.)
→
カスタムモデルのコンパイル
ご自身のモデルの場合、コマンド `lemonade onnx-export --source granite-4.2-8b-instruct --target hybrid` で、コンパイル済みのONNXフォルダーを生成します。初回のコンパイルには15〜30分、INT4の8Bモデルには約8〜12 GBのディスク容量を見込んでください。

#3. 代替としてRadeon 890Mを使う:多くの場合、最善の選択

Ryzen AI 9 HX 370には、Radeon 890MのiGPU(RDNA 3.5、16 CU)も搭載されています。標準版のLM StudioまたはOllamaでは、このiGPUをVulkan経由で利用でき、純粋な処理速度ではNPUを上回ることもあります。以下で使い方を説明します。

Radeon 890MでOllamaを動かす(Vulkan)
# Installation Ollama Windows (build avec Vulkan)
winget install Ollama.Ollama

# Forcer le backend Vulkan
$env:OLLAMA_VULKAN = "1"

# Lancer un Qwen 3.5 9B
ollama serve
ollama run qwen3.5:9b
動的VRAM割当
Radeon 890MはシステムRAMを共有しています。UEFI BIOSで「UMA Frame Buffer Size」を検索し、LLMテスト前に少なくとも8GB(可能であれば16GB)に設定してください。
ドライバー
計算処理向けに最適化されたVulkanの処理経路を利用するには、Adrenalin 24.10以降が必要です。Lenovo/AsusのOEMドライバーは、最新より2バージョン遅れていることがよくあります。
ROCmをLinuxで使用
ROCm 6.3以降は、2026年4月からStrix Pointを公式にサポートしています。Ubuntu 24.04では利用可能ですが、iGPUの性能は依然として共有メモリの帯域幅に制約されます。

#ベンチマーク:NPU と iGPU と CPU の比較

Asus Zenbook S 14(Ryzen AI 9 HX 370、32 GB LPDDR5X-7500、Windows 11 24H2、AMD Ryzen AI Software 1.3、Adrenalin 24.10.1)で測定した目安の値です。短いプロンプト(約50トークン)、生成トークン数256、temperature 0.7。5回の実行の平均値です。

Qwen 3.5 9B — CPU AVX-512
4.1トークン/秒 · パッケージ消費電力28W · ファンの音が聞こえる
Qwen 3.5 9B — Radeon 890M (Vulkan)
9.8 tok/s · パッケージ電力35 W · ファンが継続的に強く回転
Qwen 3.5 9Bのハイブリッド実行 — NPU + iGPU(LM Studio Ryzen AI)
11.2トークン/秒 · パッケージ消費電力18W · ファンの音は控えめ
Granite 4.2 3B — NPUのみ
24 tok/s · パッケージ消費電力9 W · ファン停止
Granite 4.2 8B — NPU + iGPU
13.5 tok/s · パッケージ消費電力19 W · ファンの動作音は控えめ
Gemma 4 12B — Radeon 890M (Vulkan)
4.2 tok/s · 38 W · NPU単体では大きすぎる
i
これらの数字が示す内容
NPUは絶対的に最も速いとは言えません — 7B〜8BモデルではiGPUがそれに追いつきます。しかし、同等の処理速度でNPUは2倍の消費電力と2倍の発熱を抑えます。これが本当の価値です。バッテリーでLLMセッションを3時間維持し、熱劣化なしで運用できる点です。

#NPUが特に活躍する使用例

常時サポートを提供するチャットボット
Granite 4.2 3BまたはQwen 3.5 4BをNPU上で実行すると約5Wの消費電力となり、バッテリーへの影響はほとんどなく24時間連続使用が可能です。プロダクティビティアプリへの統合に最適です。
メールやドキュメントの自動要約
短時間のバッチ処理、4〜8kトークンのコンテキスト、3B〜8Bのモデル。NPUに最適です。ファンを止めたまま、作業中にバックグラウンドで静かに処理できます。
リアルタイムの音声認識+要約
Whisper(iGPU上で)+ Granite 4.2 8B(NPU上で)をパイプラインで実行 — これは、両方のブロックが独立しているため可能になっています。
機内モードでの長時間利用
バッテリー駆動では、NPU+iGPUを使うとLLMを積極的に使用できる時間は4~5時間となり、CPUとiGPUだけの構成では1時間30分です。
→
NPUとiGPUを適切に組み合わせる
LM Studio Ryzen AI の「Hybrid」モードは、レイヤーを自動的に振り分けます。Attention ブロックは NPU(密な INT4 演算)に、FFN は iGPU(メモリ帯域幅をより有効に活用できる側)に配置されます。性能と消費電力のバランスが最も良いのは、このモードであり、NPU 単独ではありません。

#注意点および制限事項

コンテキスト制限
AMD のプリコンパイル済みモデルの多くは、コンテキスト長の上限が 4096 トークンです。32k 以上にするには再コンパイルが必要で、メモリ消費も大幅に増えます。
NPU単独では8Bを超えるモデルには対応できません
8Bを超えると、INT4でもNPUの帯域幅が不足します。13Bを超えると、必ずiGPUが処理を引き継ぎます。
利用できないモデル
Qwen 3.5、DeepSeek、Gemma 4のすべてに公式の事前コンパイル済み版が用意されているわけではありません。特定のモデルを動かすつもりでマシン構成を購入する前に、Ryzen AIハブを確認してください。
不具合を引き起こすWindows更新
一部の24H2の累積更新プログラムにより、NPUの列挙が一時的に無効になったことがあります。AMD Ryzen AI Softwareパッケージを最新の状態に保ち、累積更新プログラムを適用するたびにデバイスマネージャーを確認してください。
ファインチューニング非対応
XDNA 2 が行えるのは推論だけです。学習や LoRA チューニングには、専用 GPU が必要です。それに尽きます。
!
NPUは専用GPUを置き換えることはできません
Qwen 3.6 35Bや70Bモデルの実行、あるいはファインチューニングが目的なら、Ryzen AI 9 HX 370は適したマシンではありません。RTX 4070 / 4080 / 4090を搭載したデスクトップPCは、依然として他の選択肢に負けません。NPUは携帯性のための選択肢であり、GPUの代替ではありません。

#さらに詳しく

次のステップに応じて、深掘りするための3つのアプローチ:

量子化を理解する
XDNA 2 NPUが処理できるのはINT4とINT8だけです。『量子化の選択方法(Q4、Q5、Q8、FP16)』では、Q4_K_MがCPU/GPUで標準であり続ける理由と、NPUでINT4を使うと何が変わるのかを説明しています。
実際にGPUを搭載した構成と比較
デスクトップPCにするか迷っている場合は、「ローカルAI用GPUの選定ガイド」でRTX 4070、4090、M-Maxを比較し、用途別に購入判断の基準を示しています。
より一般的なOllamaのセットアップ
Radeon 890Mで標準的なソフトウェア構成を使い続ける場合は、Windows向けのOllamaインストールガイドで、Vulkanの設定と共有VRAM/RAMの管理を確認できます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。