初心者 11 分NPU

NPUとは何ですか?LLMのローカル利用において役立ちますか? ?

端的な回答

NPU(Neural Processing Unit)は、2024年以降に販売されたノートパソコンの大半でチップに組み込まれている低消費電力プロセッサです。背景のぼかし、リアルタイム字幕、写真検索など、継続的に行う小規模なAIタスクに特化しています。目玉の指標であるTOPSは、ローカルLLMを動かす能力についてはほとんど何も示しません。生成速度はメモリ帯域幅に依存し、NPUはCPUと同じ低速なRAMを共有しているためです。

NPU(Neural Processing Unit)は、ニューラルネットワークの計算に特化したプロセッサで、2024年以降に販売されたノートパソコンの大半でチップに組み込まれています。背景のぼかしやリアルタイム字幕などの小規模なAIタスクを、わずか数ワットで継続的に実行します。その目玉となる数値、TOPSは、あらゆる「AI PC」のラベルで売り文句として使われています。しかし、2026年9月20日時点では、この数値から、そのマシンがローカルでLLMを動かす能力はほとんど判断できません。その理由と、代わりに何を見るべきかを説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-28·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。

#NPU とは何ですか?

計算の観点では、ニューラルネットワークは、低精度の数値を使った膨大な一連の行列乗算を何十億回も繰り返すものと捉えられます。一般的なプロセッサでも処理できますが、一度に少数の演算を行うため、速度は遅くなります。グラフィックスカードは、数十〜数百ワットの電力を消費しながら、数千の演算ユニットで並列に高速処理します。NPUは、この処理だけを行うために設計されたシリコンの一部分です。8ビットと4ビットの整数演算専用の固定された演算ユニット、コストの高いデータの往復を避けるためにそのすぐ隣に配置された小容量メモリ、そしてデータの移動を最小限に抑えるスケジューラを備えています。この徹底した特化により、ピーク速度はGPUに比べて控えめですが、ワットあたりの効率ははるかに高くなります。これはバッテリー駆動では非常に重要です。

この考え方は、現在使われているマーケティング上の呼び名よりも以前から存在しています。Appleは2017年からiPhoneにNeural Engineを搭載しており、Apple Silicon搭載のすべてのMacにも、その登場時から搭載しています。GoogleのPixel向けチップも、数世代前からTPUブロックを内蔵しています。2024年に実際に変わったのは、Intel、AMD、Qualcommが同時期に、一般消費者向けノートPC用プロセッサに高性能なNPUを搭載し、Microsoftがすぐに、Copilot+ PCという製品ブランド名の下で、Windowsの一連の機能の利用条件としてそのNPUを要求したことです。ここ2年間、店頭で「AI PC」という表示が急増したのは、技術そのものよりも、こうした動きが重なったためです。

#CPU、GPU、NPUの違いとは?

CPUGPUNPU
設計目的汎用的な論理処理、低レイテンシ超並列計算、グラフィックスニューラルネットワークの推論のみ
AI処理時の消費電力15 à 125 W30W(統合型)から575W(RTX 5090)まで1 à 10 W
使用メモリシステムのRAM専用のVRAM、または内蔵型の場合はRAMシステムのRAM
ソフトウェアサポート汎用非常に幅広い:CUDA、ROCm、Metal、Vulkan狭く、各メーカー固有
活躍する領域オーケストレーション、必要時の代替として使う小型モデルLLM、画像生成、トレーニングバッテリーで常時動作する軽量 AI

3つのチップは競合するものではなく、互いに補完するものです。それぞれ、速度、消費電力、汎用性のバランスが異なるために存在しています。「AI PC」では、4時間のビデオ会議中、NPUがWebカメラの映像効果を処理し、GPUは動作しないままです。そのため、GPUを連続使用した場合に消費されるはずのバッテリーをかなり節約できます。同じマシンで140億パラメータのアシスタントを動かそうとすると、処理はすべてGPUが担います。必要なメモリ帯域幅と成熟したソフトウェアサポートの両方が揃っているのがGPUだからです。現在、この規模のLLMをNPUで実行できる一般向けのランタイムはありません。

#TOPS:何を測定し、何を隠しているか

TOPSは「1秒あたり1兆回の演算」(Tera Operations Per Second)を意味し、仕様書間で比較可能にするため、ほぼ常に8ビット整数で測定されます。これは、有利な条件下で実験室で測定されるピーク演算性能です。メモリからこれらの計算ユニットまでデータが届く速度については何も示していません。実際には、これが言語モデルの速度を制限する要因です。データに飢えたNPUは、TOPSが高いかどうかに関係なく、大部分の時間を待機に費やします。

メーカーによるデータは、測定方法が異なるため、数ポイントの差は意味を持ちません
プロセッサファミリー公称NPU性能Copilot+ に該当(40 TOPS以上)
Intel Core Ultraシリーズ1(Meteor Lake)≈11 TOPSいいえ
Apple M4 (Neural Engine)38 TOPS対象外(macOS)
Qualcomm Snapdragon X Elite および X Plus45TOPSはい
Intel Core Ultra 200V (Lunar Lake)48 TOPSはい
AMD Ryzen AI 30050 TOPSはい
AMD Ryzen AI Max+ 395 (Strix Halo)50 TOPSはい
Intel Core Ultra 300 (Panther Lake, CES 2026年1月)最大50 TOPS (NPU 5)はい
AMD Ryzen AI 400 / PRO 400 « Gorgon Point » (CES 2026年1月)最大60 TOPSはい
Qualcomm Snapdragon X2 Elite(2026年1月CES)80 TOPSはい

2026年1月のCESで発表され、2026年9月28日時点ですでに市販のノートパソコンに搭載されているこの新世代は、公称値がCopilot+の最低基準を大きく上回っています。Snapdragon X2 Eliteは、前世代の45 TOPSに対して80 TOPSと、スコアをほぼ倍増させています。ただし、これによってこのページの結論が変わることはありません。以下で説明する共有メモリの帯域幅に関する議論は、公称TOPS値がどれほど印象的に見えても、これらの新しいチップにも同じように当てはまります。

#NPUがLLMの処理を加速しない理由は?

1つのトークンを生成するには、モデルはメモリ内のほぼすべての重み、すなわち最初のアクティブなパラメータから最後のアクティブなパラメータまでを読み戻す必要があります。14Bパラメータのモデルが Q4 量子化の場合、サイズは約 9 GB です。したがって、1秒あたり 20 トークンを生成するには、メモリと計算ユニットの間で 1秒あたり 180 GB のデータ転送を行うことになります。計算自体、すなわち乗算そのものは、この恒常的な転送と比較すると安価です。したがって、生成速度は製品仕様書に記載されている TOPS や TFLOPS の計算性能ではなく、利用可能なメモリ帯域幅に依存します。これが、TOPS が大きく異なる2つのチップがまったく同じ速度でテキストを書き出せる理由です。

理論上限=メモリ帯域幅÷モデルサイズ(Q4のQwen 3 14B。QuelLLMのカタログでは9 GB)。実際のシステムはこの上限に近づきますが、到達はしません。
モデルの配置先帯域幅9GBモデル用の上限
ノートPCのLPDDR5X(NPUと内蔵GPUが共有するメモリ)≈ 70 から 135 GB/s≈ 8 〜 15 tok/s
Ryzen AI Max+ 395 の統合メモリ256 GB/s約 28 tok/s
RTX 4070 (GDDR6X)504GB/秒約56トークン/秒
RTX 5070 Ti (GDDR7)896 GB/s≈100 tok/s
RTX 5090(GDDR7)1,792 GB/s約200トークン/秒

50 TOPSのNPUも、最新のチップに搭載される80 TOPSのNPUも、表の最初の行に該当します。どちらもプロセッサと共有する同じLPDDR5Xメモリを使用するため、公称TOPSがいくつであっても、物理的にそのメモリが許す速度を超えることはできません。したがって、メモリの容量と帯域幅が同じであれば、45 TOPSのノートPCも80 TOPSのノートPCも、まったく同じ速度でテキストを生成します。

NPUが実際に役立つのは、プロンプトの読み込みです。この段階では、モデルがすでにあるテキスト全体を一度に処理し、単語を一つずつ生成するわけではないため、帯域幅よりも主に計算能力が求められます。読み込みをNPUに、生成を内蔵GPUに任せるハイブリッド構成では、十分にサポートされている小型モデルを使う場合、最初の単語が表示されるまでの待ち時間と全体の消費電力を減らせます。これはバッテリー駆動時間と体感的な応答性の向上であり、応答性の改善はレイテンシで測定できます。より大きなモデルを動かしたり、連続生成の速度を上げたりするための方法ではありません。

#本質的な制約:ソフトウェア

Ollama、llama.cpp、LM Studio
GPUまたはCPUで動作します。Copilot+ノートPCでは、内蔵GPUまたはプロセッサを使用し、NPUは使用しません。
Windows
マイクロソフトの組み込みモデルおよび Foundry Local 環境は、ONNX Runtime を使って NPU に焦点を当てています。一部の小型モデルが対象です。
AMD
Ryzen AI SoftwareとLemonadeサーバーは、一部のONNXモデルを、NPUと内蔵GPUを併用するハイブリッドモードで実行します。
Intel
OpenVINOは、サポートされているモデルに対してNPUをターゲットにできるようになっています。
Qualcomm
QNNツールチェーンとAI Hubは、Hexagon NPU向けに変換済みのモデルを提供しています。
Apple
Core MLはNeural Engineを使用しますが、Macで実際に使用されるLLMツール(MLX、llama.cpp、Ollama)はGPUを介してMetal経由で動作します。

これらのツールに共通するのは、NPU を使う場合、メーカーがすでに変換・検証した限られたモデルの中から選ぶ必要があるという点です。通常は10億~80億パラメータのモデルで、Hugging Face で見つけた任意の GGUF をダウンロードしてそのまま実行できるわけではありません。この変換には、メーカーごとに異なる形式とツールチェーンが必要です。そのため、llama.cpp が GPU 向けに実現したような、NPU 対応を統一するコミュニティプロジェクトはまだありません。

#購入前に、代わりに何を確認すべきか

  1. 01
    GPUが使用できるメモリ
    専用グラフィックカードのVRAM、またはMacやStrix Halo搭載マシンのユニファイドメモリです。このメモリによって、どのモデルを読み込めるかが決まります。
  2. 02
    このメモリの帯域幅
    それが、1秒あたりに生成されるトークン数を直接決めます。
  3. 03
    ソフトウェア環境
    NVIDIA は手間なく使え、Apple Silicon もほぼ同じように使えます。AMD は Linux 上で十分にサポートされています。
  4. 04
    NPUのTOPS
    WindowsのCopilot+機能を使いたい場合や、ビデオ会議中のバッテリー駆動時間を長くしたい場合に役立ちます。現時点では、オープンウェイトLLMには効果がありません。

#FAQ

NPUとはどういう意味ですか?+
Neural Processing Unit、つまりニューラル処理ユニットです。ニューラルネットワークを効率よく実行するための専用回路で、最近のノートパソコンやスマートフォンのチップの多くに、CPUやGPUとともに搭載されています。ビデオ会議で背景をぼかすといった小規模なAIタスクを継続的に処理し、バッテリーを熱くしたり、残量を急速に減らしたりせずに動作します。
NPUはGPUよりもAI用途で優れているか?+
NPUは、小規模なタスクを継続的に処理する場合、GPUよりも大幅に消費電力を抑えられます。消費電力はおよそ1〜10 Wで、GPUでは30 W以上です。大規模なモデル、LLM、画像生成モデルでは、GPUのほうがはるかに高速で、ソフトウェアの対応もはるかに充実しています。両者は競合するものではありません。そもそも担う処理も、対象となるモデルの規模も異なります。
Ollama または LM Studio は NPU を使用していますか?+
いいえ、2026年9月28日時点では使っていません。ハードウェアに応じてCUDA、ROCm、Metal、Vulkanを介してGPUで動作し、最後の手段としてCPUで動作します。NPUを活用するには各メーカー専用のツールが必要です。Windows向けのONNX Runtime、AMD向けのRyzen AI Software、Intel向けのOpenVINOがあり、それぞれ利用できる変換済みモデルの一覧は限られています。
ローカルでAIを実行するにはNPUが必要ですか?+
いいえ、まったく必要ありません。十分な性能のGPUまたは十分な容量のユニファイドメモリを備えたマシンなら、2024年以前からそうだったように、NPUが一切なくてもローカルモデルを実行できます。NPUが必要なのはWindows固有のCopilot+機能を有効にする場合だけで、Ollama、LM Studio、その他の一般的な推論ツールには必要ありません。
何 TOPS が必要ですか?+
40 TOPSは、MicrosoftのCopilot+ PC認定の基準値です。2026年1月のCESで登場したPanther Lake、Ryzen AI 400、Snapdragon X2 Eliteのチップは、それぞれ50 TOPS、60 TOPS、最大80 TOPSに達しています。Copilot+の基準値を超えた性能差は、実際の使用ではほとんど体感できず、ローカルで動かすLLMの生成速度にはまったく影響しません。
2026年の新しいNPUチップは、ローカルAIに何か変化をもたらしますか?+
いいえ、LLMについては変わりません。Panther Lake、Ryzen AI 400、Snapdragon X2 Eliteでは公称TOPSが増えていますが、NPUは引き続きプロセッサと同じシステムメモリを使用しており、それに伴うメモリ帯域幅の向上はありません。言語モデルの生成速度を制限するボトルネックは、前世代のチップとまったく同じです。

このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。