NPUとは何ですか?LLMのローカル利用において役立ちますか? ?
NPU(Neural Processing Unit)は、2024年以降に販売されたノートパソコンの大半でチップに組み込まれている低消費電力プロセッサです。背景のぼかし、リアルタイム字幕、写真検索など、継続的に行う小規模なAIタスクに特化しています。目玉の指標であるTOPSは、ローカルLLMを動かす能力についてはほとんど何も示しません。生成速度はメモリ帯域幅に依存し、NPUはCPUと同じ低速なRAMを共有しているためです。
NPU(Neural Processing Unit)は、ニューラルネットワークの計算に特化したプロセッサで、2024年以降に販売されたノートパソコンの大半でチップに組み込まれています。背景のぼかしやリアルタイム字幕などの小規模なAIタスクを、わずか数ワットで継続的に実行します。その目玉となる数値、TOPSは、あらゆる「AI PC」のラベルで売り文句として使われています。しかし、2026年9月20日時点では、この数値から、そのマシンがローカルでLLMを動かす能力はほとんど判断できません。その理由と、代わりに何を見るべきかを説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。
#NPU とは何ですか?
計算の観点では、ニューラルネットワークは、低精度の数値を使った膨大な一連の行列乗算を何十億回も繰り返すものと捉えられます。一般的なプロセッサでも処理できますが、一度に少数の演算を行うため、速度は遅くなります。グラフィックスカードは、数十〜数百ワットの電力を消費しながら、数千の演算ユニットで並列に高速処理します。NPUは、この処理だけを行うために設計されたシリコンの一部分です。8ビットと4ビットの整数演算専用の固定された演算ユニット、コストの高いデータの往復を避けるためにそのすぐ隣に配置された小容量メモリ、そしてデータの移動を最小限に抑えるスケジューラを備えています。この徹底した特化により、ピーク速度はGPUに比べて控えめですが、ワットあたりの効率ははるかに高くなります。これはバッテリー駆動では非常に重要です。
この考え方は、現在使われているマーケティング上の呼び名よりも以前から存在しています。Appleは2017年からiPhoneにNeural Engineを搭載しており、Apple Silicon搭載のすべてのMacにも、その登場時から搭載しています。GoogleのPixel向けチップも、数世代前からTPUブロックを内蔵しています。2024年に実際に変わったのは、Intel、AMD、Qualcommが同時期に、一般消費者向けノートPC用プロセッサに高性能なNPUを搭載し、Microsoftがすぐに、Copilot+ PCという製品ブランド名の下で、Windowsの一連の機能の利用条件としてそのNPUを要求したことです。ここ2年間、店頭で「AI PC」という表示が急増したのは、技術そのものよりも、こうした動きが重なったためです。
#CPU、GPU、NPUの違いとは?
| CPU | GPU | NPU | |
|---|---|---|---|
| 設計目的 | 汎用的な論理処理、低レイテンシ | 超並列計算、グラフィックス | ニューラルネットワークの推論のみ |
| AI処理時の消費電力 | 15 à 125 W | 30W(統合型)から575W(RTX 5090)まで | 1 à 10 W |
| 使用メモリ | システムのRAM | 専用のVRAM、または内蔵型の場合はRAM | システムのRAM |
| ソフトウェアサポート | 汎用 | 非常に幅広い:CUDA、ROCm、Metal、Vulkan | 狭く、各メーカー固有 |
| 活躍する領域 | オーケストレーション、必要時の代替として使う小型モデル | LLM、画像生成、トレーニング | バッテリーで常時動作する軽量 AI |
3つのチップは競合するものではなく、互いに補完するものです。それぞれ、速度、消費電力、汎用性のバランスが異なるために存在しています。「AI PC」では、4時間のビデオ会議中、NPUがWebカメラの映像効果を処理し、GPUは動作しないままです。そのため、GPUを連続使用した場合に消費されるはずのバッテリーをかなり節約できます。同じマシンで140億パラメータのアシスタントを動かそうとすると、処理はすべてGPUが担います。必要なメモリ帯域幅と成熟したソフトウェアサポートの両方が揃っているのがGPUだからです。現在、この規模のLLMをNPUで実行できる一般向けのランタイムはありません。
#TOPS:何を測定し、何を隠しているか
TOPSは「1秒あたり1兆回の演算」(Tera Operations Per Second)を意味し、仕様書間で比較可能にするため、ほぼ常に8ビット整数で測定されます。これは、有利な条件下で実験室で測定されるピーク演算性能です。メモリからこれらの計算ユニットまでデータが届く速度については何も示していません。実際には、これが言語モデルの速度を制限する要因です。データに飢えたNPUは、TOPSが高いかどうかに関係なく、大部分の時間を待機に費やします。
| プロセッサファミリー | 公称NPU性能 | Copilot+ に該当(40 TOPS以上) |
|---|---|---|
| Intel Core Ultraシリーズ1(Meteor Lake) | ≈11 TOPS | いいえ |
| Apple M4 (Neural Engine) | 38 TOPS | 対象外(macOS) |
| Qualcomm Snapdragon X Elite および X Plus | 45TOPS | はい |
| Intel Core Ultra 200V (Lunar Lake) | 48 TOPS | はい |
| AMD Ryzen AI 300 | 50 TOPS | はい |
| AMD Ryzen AI Max+ 395 (Strix Halo) | 50 TOPS | はい |
| Intel Core Ultra 300 (Panther Lake, CES 2026年1月) | 最大50 TOPS (NPU 5) | はい |
| AMD Ryzen AI 400 / PRO 400 « Gorgon Point » (CES 2026年1月) | 最大60 TOPS | はい |
| Qualcomm Snapdragon X2 Elite(2026年1月CES) | 80 TOPS | はい |
2026年1月のCESで発表され、2026年9月28日時点ですでに市販のノートパソコンに搭載されているこの新世代は、公称値がCopilot+の最低基準を大きく上回っています。Snapdragon X2 Eliteは、前世代の45 TOPSに対して80 TOPSと、スコアをほぼ倍増させています。ただし、これによってこのページの結論が変わることはありません。以下で説明する共有メモリの帯域幅に関する議論は、公称TOPS値がどれほど印象的に見えても、これらの新しいチップにも同じように当てはまります。
#NPUがLLMの処理を加速しない理由は?
1つのトークンを生成するには、モデルはメモリ内のほぼすべての重み、すなわち最初のアクティブなパラメータから最後のアクティブなパラメータまでを読み戻す必要があります。14Bパラメータのモデルが Q4 量子化の場合、サイズは約 9 GB です。したがって、1秒あたり 20 トークンを生成するには、メモリと計算ユニットの間で 1秒あたり 180 GB のデータ転送を行うことになります。計算自体、すなわち乗算そのものは、この恒常的な転送と比較すると安価です。したがって、生成速度は製品仕様書に記載されている TOPS や TFLOPS の計算性能ではなく、利用可能なメモリ帯域幅に依存します。これが、TOPS が大きく異なる2つのチップがまったく同じ速度でテキストを書き出せる理由です。
| モデルの配置先 | 帯域幅 | 9GBモデル用の上限 |
|---|---|---|
| ノートPCのLPDDR5X(NPUと内蔵GPUが共有するメモリ) | ≈ 70 から 135 GB/s | ≈ 8 〜 15 tok/s |
| Ryzen AI Max+ 395 の統合メモリ | 256 GB/s | 約 28 tok/s |
| RTX 4070 (GDDR6X) | 504GB/秒 | 約56トークン/秒 |
| RTX 5070 Ti (GDDR7) | 896 GB/s | ≈100 tok/s |
| RTX 5090(GDDR7) | 1,792 GB/s | 約200トークン/秒 |
50 TOPSのNPUも、最新のチップに搭載される80 TOPSのNPUも、表の最初の行に該当します。どちらもプロセッサと共有する同じLPDDR5Xメモリを使用するため、公称TOPSがいくつであっても、物理的にそのメモリが許す速度を超えることはできません。したがって、メモリの容量と帯域幅が同じであれば、45 TOPSのノートPCも80 TOPSのノートPCも、まったく同じ速度でテキストを生成します。
NPUが実際に役立つのは、プロンプトの読み込みです。この段階では、モデルがすでにあるテキスト全体を一度に処理し、単語を一つずつ生成するわけではないため、帯域幅よりも主に計算能力が求められます。読み込みをNPUに、生成を内蔵GPUに任せるハイブリッド構成では、十分にサポートされている小型モデルを使う場合、最初の単語が表示されるまでの待ち時間と全体の消費電力を減らせます。これはバッテリー駆動時間と体感的な応答性の向上であり、応答性の改善はレイテンシで測定できます。より大きなモデルを動かしたり、連続生成の速度を上げたりするための方法ではありません。
#本質的な制約:ソフトウェア
- Ollama、llama.cpp、LM Studio
- GPUまたはCPUで動作します。Copilot+ノートPCでは、内蔵GPUまたはプロセッサを使用し、NPUは使用しません。
- Windows
- マイクロソフトの組み込みモデルおよび Foundry Local 環境は、ONNX Runtime を使って NPU に焦点を当てています。一部の小型モデルが対象です。
- AMD
- Ryzen AI SoftwareとLemonadeサーバーは、一部のONNXモデルを、NPUと内蔵GPUを併用するハイブリッドモードで実行します。
- Intel
- OpenVINOは、サポートされているモデルに対してNPUをターゲットにできるようになっています。
- Qualcomm
- QNNツールチェーンとAI Hubは、Hexagon NPU向けに変換済みのモデルを提供しています。
- Apple
- Core MLはNeural Engineを使用しますが、Macで実際に使用されるLLMツール(MLX、llama.cpp、Ollama)はGPUを介してMetal経由で動作します。
これらのツールに共通するのは、NPU を使う場合、メーカーがすでに変換・検証した限られたモデルの中から選ぶ必要があるという点です。通常は10億~80億パラメータのモデルで、Hugging Face で見つけた任意の GGUF をダウンロードしてそのまま実行できるわけではありません。この変換には、メーカーごとに異なる形式とツールチェーンが必要です。そのため、llama.cpp が GPU 向けに実現したような、NPU 対応を統一するコミュニティプロジェクトはまだありません。
#購入前に、代わりに何を確認すべきか
- 01GPUが使用できるメモリ専用グラフィックカードのVRAM、またはMacやStrix Halo搭載マシンのユニファイドメモリです。このメモリによって、どのモデルを読み込めるかが決まります。
- 02このメモリの帯域幅それが、1秒あたりに生成されるトークン数を直接決めます。
- 03ソフトウェア環境NVIDIA は手間なく使え、Apple Silicon もほぼ同じように使えます。AMD は Linux 上で十分にサポートされています。
- 04NPUのTOPSWindowsのCopilot+機能を使いたい場合や、ビデオ会議中のバッテリー駆動時間を長くしたい場合に役立ちます。現時点では、オープンウェイトLLMには効果がありません。
- ローカルAI用のハードウェア:当サイトのマシン紹介
- Ryzen AI Max+ 395ミニPC:ユニファイドメモリが状況を一変させるケース
- ローカル LLM にはどの GPU が適しているか?
- Microsoft:Copilot+対応デバイスおよびそのNPU
- 出典:ウィキペディア、NPUの歴史とアーキテクチャ
- 出典:AMDの発表、Ryzen AI 400 (CES 2026)
#FAQ
NPUとはどういう意味ですか?+
NPUはGPUよりもAI用途で優れているか?+
Ollama または LM Studio は NPU を使用していますか?+
ローカルでAIを実行するにはNPUが必要ですか?+
何 TOPS が必要ですか?+
2026年の新しいNPUチップは、ローカルAIに何か変化をもたらしますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。