中級 11 分NPU

Snapdragon X Elite:PC上でLLMをローカルで実行 ARM

Snapdragon X Eliteを搭載したCopilot+ PCによって、ARMアーキテクチャが再びWindowsの世界で中心的な存在となりました。内蔵NPUと数時間のバッテリー駆動時間は、AI用途にとって魅力的な利点です。ただし、Snapdragon X EliteでLLMをローカル実行する場合、NVIDIA製GPUを搭載したx86 PCと同じ体験は得られません。このガイドでは、現時点で実際に動作するものと、まだマーケティング上の約束にとどまるものを区別し、これらのARMマシンで実用的なローカルアシスタントを使えるようにする方法を整理します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Thomas P.·更新 2026-08-27·Windows 11でテスト済み
推奨ハードウェア

ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#Snapdragon X Elite がローカルLLMにおいて注目される理由

Snapdragon X EliteはQualcomm製のARM SoCです。最大12コアのOryon CPU、内蔵Adreno GPU、45 TOPSと公表されているHexagon NPUを備え、とりわけ重要なのが、CPU、GPU、NPUで共有するLPDDR5Xユニファイドメモリです。このユニファイドメモリはApple Siliconの方式を思わせます。読み込んだモデルには、コピーなしですべての計算エンジンからアクセスでき、別途搭載された8 GBや12 GBのVRAMに制限されません。

もう一つの利点は、熱プロファイルです。これらのチップは、ファンレスまたはほぼ無音のウルトラポータブル向けに設計されており、オフィスワークでの使用時、バッテリー持続時間は数十時間に達します。バックグラウンドで動作するローカル LLM(メールの要約、言い換え、小さなスクリプトなど)にとっては、これまでにない活用領域です。ファンが暴走することも、20 分でバッテリーが消耗することもありません。

i
このガイドが目指す内容
ARM 搭載の Windows PC で快適に使えるローカル会話アシスタント(3B〜24B)を目指します。RTX 4090 の代替を目指すものではありません。このハードウェアで、品質、速度、バッテリー持続時間の最適なバランスを探ります。

#本質的な課題:Windows on ARM

最初の障壁は処理性能ではなく、ソフトウェアの互換性です。Windows 11 on ARMは、エミュレーション層(Prism)を介してx86/x64アプリケーションを実行します。しかし、このエミュレーションには性能面の負担があり、AI用途ではハードウェアアクセラレーションを活用できなくなることもよくあります。AVX命令を使ってx86向けにコンパイルされたバイナリは、Adreno GPUもHexagon NPUも認識できません。

幸い、主要なローカルAIツールには、現在ARM64ネイティブビルドが用意されています。このガイド全体を通して覚えておくべき重要な違いは、「インストールできる」ツールが必ずしも「ARMネイティブ」のツールとは限らないという点です。エミュレーションでは、マシンの利点の大部分を失ってしまいます。

Ollama
Windows ARM64用のネイティブビルドを提供します。推論はOryon CPU上で実行され、ほかのプラットフォームと同様、デフォルトでは http://localhost:11434 でリクエストを待ち受けます。
LM Studio
Snapdragon搭載のWindows向けにARM64ネイティブ版を提供し、ARM用にコンパイルされた llama.cpp ランタイムを搭載しています。
llama.cpp
ARM64向けにネイティブでコンパイルでき、ベクトル命令を活用します。これらのチップ向けに最も最適化された基盤エンジンです。
避けるべきこと
Prismのエミュレーションで実行するx64版全般:動作はしますが、遅く、専用ハードウェアにはアクセスできません。
!
常にアーキテクチャを確認してください
ダウンロードページで「ARM64」または「Windows on ARM」と明記されているものを探してください。「Windows x64」しか選択肢がない場合、アプリはエミュレーションで動作し、このマシンの最大の利点を失ってしまいます。

#Hexagon NPU:誤解と実態

これが誤解の核心です。Copilot+のマーケティングでは、あらゆるローカルLLMが自動的にその恩恵を受けるかのように、Hexagon NPUの45 TOPSを強調しています。実際には、2026年時点でOllamaやLM Studioを使って実行するLLMのほぼすべては、NPUではなくCPUコア上で動作します。

なぜでしょうか。NPU を活用するには、Qualcomm のランタイム向けに専用の変換と量子化を施したモデルが必要だからです。QNN(Qualcomm AI Engine Direct)と ONNX 形式を使い、通常は ONNX Runtime の QNN 実行プロバイダーを介して実行します。これらは、llama.cpp が使用する GGUF ファイルとは異なります。NPU は、一定のペースで処理する予測可能な負荷を得意としています。一方、メモリ帯域幅が支配的な自己回帰型のテキスト生成には、一般に思われているほど適していません。

NPUを使用するもの
Qualcomm の SDK/AI Hub を通じてパッケージ化されたデモやアプリケーションで、ONNX 形式に事前変換されたモデル(多くは小型モデルや視覚・音声処理向けのモデル)を使用します。
NPUを使用しないもの
Ollama、LM Studio、llama.cppは、通常の使用ではCPUを利用します(場合によっては、実験的なバックエンドを介してAdreno GPUも利用します)。
現実のパフォーマンス
これらのマシンでは、生成速度を主に左右するのはOryonコアとLPDDR5Xのメモリ帯域幅であり、NPUの公称TOPS値ではありません。
→
NPUを目当てにこのマシンを選ばないでください
ローカルで動く高速なチャットボットが目的なら、高速なメモリを備えた性能のよいARM CPUを使う場合と同じように考えましょう。NPUは特定のアプリケーションで役立つ追加機能であり、普段使うOllamaを動かすエンジンではありません。

#前提条件および確認手順

何かをインストールする前に、ARMマシンであることを確認し、搭載RAMの容量を把握してください。メモリがユニファイドメモリなので、実行できるモデルのサイズはこの容量で決まります。

PowerShell — アーキテクチャと RAM の確認
# Architecture du processeur (doit renvoyer ARM64)
$env:PROCESSOR_ARCHITECTURE

# Mémoire physique totale, en Go
(Get-CimInstance Win32_ComputerSystem).TotalPhysicalMemory / 1GB
OS
Windows 11 24H2以降、最新版(最新のビルドではPrismのエミュレーションおよびARM対応が大幅に改善されています)。
RAM
3B〜9Bのモデルを快適に使うには最低16 GB。20B〜27Bのモデルを使い、システム用の余裕も確保するなら32 GB。
ストレージ
ダウンロードされたモデル数に応じて10GBから30GBの空き容量を確保してください(7B Q4_K_Mモデルは約5GBを消費します)。
現実的に期待できること
小型モデルでは快適に、8〜9Bではまずまずの使い勝手で利用できますが、それより大きなモデルでは待つ覚悟が必要です。専用GPU並みの生成速度は期待できません。

#ローカルLLMのインストール手順

今日最も簡単で信頼性の高い方法は、OllamaのARM64ネイティブビルドです。必要に応じてグラフィカルインターフェースを追加できます。以下の手順に従ってください。

  1. 01
    ARM64版 Ollama をダウンロード
    ollama.com/download にアクセスし、Windows のインストーラをダウンロードしてください。最近のバージョンでは、インストーラが ARM64 アーキテクチャを検出し、ネイティブバイナリを自動的にインストールします。その後、サービスが正常に動作しているかを確認してください。
  2. 02
    サービスを確認する
    ターミナルを開き、「ollama --version」を実行してください。デーモンは http://localhost:11434 でリクエストを待ち受けています。このURLにリクエストを送ると、「Ollama is running」という応答が返るはずです。
  3. 03
    最初のモデルをダウンロードする
    より重いモデルを読み込む前に、一連の処理全体が正しく動くことを確認するため、小さなモデルから始めてください。Q4_K_Mで量子化した3Bモデルは、応答性を試すのに最適です。
  4. 04
    コマンドラインでチャットする
    モデルを起動し、生成速度を確認してください。スムーズに動作するなら、RAMの容量が足りる範囲で、モデルのサイズを7B、次に14Bへと段階的に大きくしてください。
  5. 05
    インターフェースを追加(オプション)
    充実したUIを使うには、ARM64版のLM Studioをインストールしてください。ウェブインターフェースを好む場合は、Open WebUIをOllamaのエンドポイントに接続してください。
ターミナル — 最初のモデル
# Modèle léger pour valider la chaîne
ollama pull granite4.2:3b
ollama run granite4.2:3b

# Une fois validé, monter en gamme
ollama pull qwen3.5:9b
→
実際の速度の測定
Ollamaで「ollama run <modèle> --verbose」を実行すると、応答の最後にトークン/秒が表示されます。公表された宣伝文句に頼るよりも、ご自身のマシンでモデルを比較するための実態に即した指標です。

#16GB〜32GBのRAMに適したモデル

メモリはユニファイドメモリで、システムと共有されています。そのため、すべてのRAMをモデルに使えると考えないでください。Windowsとアプリケーション用に、常に4〜6GBを確保してください。Q4_K_Mでのメモリ使用量の目安はGPUの場合と同じです。3Bは約2GB、9Bは約6〜7GB、24Bは約14GBです。

16GBのRAM
快適な範囲:Q4_K_Mの3Bから9Bモデル。軽快さにはGranite 4.2 3B、品質にはQwen 3.5 9BまたはGranite 4.2 8B。gpt-oss 20B(約14 GB)でも動作は可能ですが、余裕はほとんどありません。
32GBのRAM
Q4_K_Mなら、システム用のメモリに十分な余裕を残しながら、20〜27Bクラスを無理なく利用できます。gpt-oss 20BやMistral Small 24B(約14GBで、後者はフランス語が非常に得意)から、Qwen 3.8 27B(約18GB、262kのコンテキスト)までが対象です。32B以上の密モデルも読み込めますが、このCPUでは低速です。Qwen 3.6 35B-A3B(約23GB、アクティブパラメータ数は3B)のようなMoEモデルは、はるかに軽快に動作します。
量子化
ここでは、Q4_K_Mが品質・サイズ・速度の最も良い妥協点です。品質を優先し、RAM容量に余裕がある場合に限り、Q5_K_Mに切り替えてください。FP16はこのクラスのマシンでは不必要に重いため、避けてください。
最適なユースケース
言い換え、要約、翻訳、簡単なコーディング支援、オフラインのQ&Aなど、良質な9B〜24Bモデルで十分にこなせるタスクです。
i
量子化で押さえておきたいポイント
CPUとメモリ帯域幅で速度が決まるマシンでは、動作の遅い大きなモデルよりも、Q4_K_Mの小さなモデルの方が快適に使えることが多いです。スムーズな動作を優先してください。

#バッテリー持ちと静音性:真の強み

Snapdragon X Eliteの強みがはっきり表れるのは、この点です。RTXを搭載したx86のゲーミングノートPCは、AI負荷がかかると数分でバッテリーを使い切り、ファンが轟音を立てます。それに対して、これらのARMマシンは、電源に接続していてもいなくても、発熱を抑え、静かにテキストを生成します。電車、カフェ、会議室で作業するような持ち運び用途では、これは程度の差ではなく、使い方を根本から変える違いです。

純粋な生成速度は、まずまずですが控えめです。3Bモデルでは毎秒数十トークン程度、24Bの密なモデルでは毎秒数トークンまで下がると見込んでください。小型モデルならスムーズな会話に十分ですが、大型モデルで長い文章を生成する場合は、より時間がかかります。高速なOryonコアのおかげで、最初のトークンが出るまでの待ち時間は許容範囲に収まります。

静音
ファンが過度に高速回転することなく生成でき、低TDPの機種ではほぼファンレスで動作することが多いです。
バッテリー駆動時間
専用GPUではほぼ電源への接続が必要になるのに対し、バッテリー駆動でも実用的に推論を行えます。持ち歩いて使うローカルアシスタントに最適です。
熱特性
軽いLLM処理を長時間続けても、限界まで負荷をかけたx86の薄型軽量ノートPCとは異なり、激しいスロットリングは発生しません。
デメリット
専用 GPU に比べて、非常に低い速度で制限されるデュアル速度:大きなモデルでは、トークン/秒の性能が快適さを支えています。

#x86や専用GPUと比べた場合の限界

期待外れにならないよう、はっきりさせておきましょう。Snapdragon X Eliteは、最近のNVIDIA製グラフィックカードを搭載したPCには性能で及びません。エントリークラスのRTX 3060 12GBでも14Bモデルをはるかに速く動かせますし、RTX 4090 24GBはまったく別次元の性能です。Snapdragonの強みは絶対的な処理性能ではなく、消費電力あたりの性能と携帯性です。

エコシステムはまだ成熟途上
ARM64への対応は急速に進んでいますが、x86への対応ほど成熟していません。一部のツール、拡張機能、GPUバックエンドは対応が遅れているか、実験段階にあります。
一般ユーザー向けの GPU アクセラレーションはありません
llama.cppのAdreno向けバックエンドはまだ初期段階にあり、実際の推論は主にCPUに依存しています。
十分に活用されていないNPU
前述のとおり、一般的なLLMランタイムでは、この45 TOPSの性能をまだ活用できていません。
サイズの上限
dense で二十億以上のパラメータになると、体験は著しく低下します。非常に大きなモデルは専用GPUの領域に留まります(少数アクティブを持つMoEモデルは例外で、それらはより良好な性能を発揮します)。
!
期待値の適切な設定
3B〜24BのLLMを使う際のバッテリー持続時間と静音性を重視するなら、Snapdragon X Eliteを購入するか、手元のものを使ってください。32Bや70Bの大型デンスモデルを高速に動かすことが最優先なら、必要なのはARM PCではなく専用GPUです。

#さらに詳しく

Snapdragon X Eliteへの理解を深めるには、NPUを使う他のアプローチと比較し、ローカルインストールの基礎を身につけることが役立ちます。さらに理解を深めるためのガイドはこちらです:

Ryzen AI 9 HX:50 TOPSのNPUはLLMに本当に役立つのか?
このNPUをめぐる議論をx86側から扱う内容です。率直な検証結果は、本ガイドの結論とも一致しています。
Ollama のインストール:Windows、macOS、Linux
Ollamaのデーモンとコマンドを徹底的に使いこなすためのガイドです。ARM64ビルドにも適用できます。
量子化の選択(Q4、Q5、Q8)
品質と速度のトレードオフを細かく調整するためです。CPUが処理の大部分を担うマシンでは、このバランスが決め手になります。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。