Snapdragon X Elite:PC上でLLMをローカルで実行 ARM
Snapdragon X Eliteを搭載したCopilot+ PCによって、ARMアーキテクチャが再びWindowsの世界で中心的な存在となりました。内蔵NPUと数時間のバッテリー駆動時間は、AI用途にとって魅力的な利点です。ただし、Snapdragon X EliteでLLMをローカル実行する場合、NVIDIA製GPUを搭載したx86 PCと同じ体験は得られません。このガイドでは、現時点で実際に動作するものと、まだマーケティング上の約束にとどまるものを区別し、これらのARMマシンで実用的なローカルアシスタントを使えるようにする方法を整理します。
マシンを選んでいるところですか? 予算別のおすすめ →
ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#Snapdragon X Elite がローカルLLMにおいて注目される理由
Snapdragon X EliteはQualcomm製のARM SoCです。最大12コアのOryon CPU、内蔵Adreno GPU、45 TOPSと公表されているHexagon NPUを備え、とりわけ重要なのが、CPU、GPU、NPUで共有するLPDDR5Xユニファイドメモリです。このユニファイドメモリはApple Siliconの方式を思わせます。読み込んだモデルには、コピーなしですべての計算エンジンからアクセスでき、別途搭載された8 GBや12 GBのVRAMに制限されません。
もう一つの利点は、熱プロファイルです。これらのチップは、ファンレスまたはほぼ無音のウルトラポータブル向けに設計されており、オフィスワークでの使用時、バッテリー持続時間は数十時間に達します。バックグラウンドで動作するローカル LLM(メールの要約、言い換え、小さなスクリプトなど)にとっては、これまでにない活用領域です。ファンが暴走することも、20 分でバッテリーが消耗することもありません。
#本質的な課題:Windows on ARM
最初の障壁は処理性能ではなく、ソフトウェアの互換性です。Windows 11 on ARMは、エミュレーション層(Prism)を介してx86/x64アプリケーションを実行します。しかし、このエミュレーションには性能面の負担があり、AI用途ではハードウェアアクセラレーションを活用できなくなることもよくあります。AVX命令を使ってx86向けにコンパイルされたバイナリは、Adreno GPUもHexagon NPUも認識できません。
幸い、主要なローカルAIツールには、現在ARM64ネイティブビルドが用意されています。このガイド全体を通して覚えておくべき重要な違いは、「インストールできる」ツールが必ずしも「ARMネイティブ」のツールとは限らないという点です。エミュレーションでは、マシンの利点の大部分を失ってしまいます。
- Ollama
- Windows ARM64用のネイティブビルドを提供します。推論はOryon CPU上で実行され、ほかのプラットフォームと同様、デフォルトでは http://localhost:11434 でリクエストを待ち受けます。
- LM Studio
- Snapdragon搭載のWindows向けにARM64ネイティブ版を提供し、ARM用にコンパイルされた llama.cpp ランタイムを搭載しています。
- llama.cpp
- ARM64向けにネイティブでコンパイルでき、ベクトル命令を活用します。これらのチップ向けに最も最適化された基盤エンジンです。
- 避けるべきこと
- Prismのエミュレーションで実行するx64版全般:動作はしますが、遅く、専用ハードウェアにはアクセスできません。
#Hexagon NPU:誤解と実態
これが誤解の核心です。Copilot+のマーケティングでは、あらゆるローカルLLMが自動的にその恩恵を受けるかのように、Hexagon NPUの45 TOPSを強調しています。実際には、2026年時点でOllamaやLM Studioを使って実行するLLMのほぼすべては、NPUではなくCPUコア上で動作します。
なぜでしょうか。NPU を活用するには、Qualcomm のランタイム向けに専用の変換と量子化を施したモデルが必要だからです。QNN(Qualcomm AI Engine Direct)と ONNX 形式を使い、通常は ONNX Runtime の QNN 実行プロバイダーを介して実行します。これらは、llama.cpp が使用する GGUF ファイルとは異なります。NPU は、一定のペースで処理する予測可能な負荷を得意としています。一方、メモリ帯域幅が支配的な自己回帰型のテキスト生成には、一般に思われているほど適していません。
- NPUを使用するもの
- Qualcomm の SDK/AI Hub を通じてパッケージ化されたデモやアプリケーションで、ONNX 形式に事前変換されたモデル(多くは小型モデルや視覚・音声処理向けのモデル)を使用します。
- NPUを使用しないもの
- Ollama、LM Studio、llama.cppは、通常の使用ではCPUを利用します(場合によっては、実験的なバックエンドを介してAdreno GPUも利用します)。
- 現実のパフォーマンス
- これらのマシンでは、生成速度を主に左右するのはOryonコアとLPDDR5Xのメモリ帯域幅であり、NPUの公称TOPS値ではありません。
#前提条件および確認手順
何かをインストールする前に、ARMマシンであることを確認し、搭載RAMの容量を把握してください。メモリがユニファイドメモリなので、実行できるモデルのサイズはこの容量で決まります。
- OS
- Windows 11 24H2以降、最新版(最新のビルドではPrismのエミュレーションおよびARM対応が大幅に改善されています)。
- RAM
- 3B〜9Bのモデルを快適に使うには最低16 GB。20B〜27Bのモデルを使い、システム用の余裕も確保するなら32 GB。
- ストレージ
- ダウンロードされたモデル数に応じて10GBから30GBの空き容量を確保してください(7B Q4_K_Mモデルは約5GBを消費します)。
- 現実的に期待できること
- 小型モデルでは快適に、8〜9Bではまずまずの使い勝手で利用できますが、それより大きなモデルでは待つ覚悟が必要です。専用GPU並みの生成速度は期待できません。
#ローカルLLMのインストール手順
今日最も簡単で信頼性の高い方法は、OllamaのARM64ネイティブビルドです。必要に応じてグラフィカルインターフェースを追加できます。以下の手順に従ってください。
- 01ARM64版 Ollama をダウンロードollama.com/download にアクセスし、Windows のインストーラをダウンロードしてください。最近のバージョンでは、インストーラが ARM64 アーキテクチャを検出し、ネイティブバイナリを自動的にインストールします。その後、サービスが正常に動作しているかを確認してください。
- 02サービスを確認するターミナルを開き、「ollama --version」を実行してください。デーモンは http://localhost:11434 でリクエストを待ち受けています。このURLにリクエストを送ると、「Ollama is running」という応答が返るはずです。
- 03最初のモデルをダウンロードするより重いモデルを読み込む前に、一連の処理全体が正しく動くことを確認するため、小さなモデルから始めてください。Q4_K_Mで量子化した3Bモデルは、応答性を試すのに最適です。
- 04コマンドラインでチャットするモデルを起動し、生成速度を確認してください。スムーズに動作するなら、RAMの容量が足りる範囲で、モデルのサイズを7B、次に14Bへと段階的に大きくしてください。
- 05インターフェースを追加(オプション)充実したUIを使うには、ARM64版のLM Studioをインストールしてください。ウェブインターフェースを好む場合は、Open WebUIをOllamaのエンドポイントに接続してください。
#16GB〜32GBのRAMに適したモデル
メモリはユニファイドメモリで、システムと共有されています。そのため、すべてのRAMをモデルに使えると考えないでください。Windowsとアプリケーション用に、常に4〜6GBを確保してください。Q4_K_Mでのメモリ使用量の目安はGPUの場合と同じです。3Bは約2GB、9Bは約6〜7GB、24Bは約14GBです。
- 16GBのRAM
- 快適な範囲:Q4_K_Mの3Bから9Bモデル。軽快さにはGranite 4.2 3B、品質にはQwen 3.5 9BまたはGranite 4.2 8B。gpt-oss 20B(約14 GB)でも動作は可能ですが、余裕はほとんどありません。
- 32GBのRAM
- Q4_K_Mなら、システム用のメモリに十分な余裕を残しながら、20〜27Bクラスを無理なく利用できます。gpt-oss 20BやMistral Small 24B(約14GBで、後者はフランス語が非常に得意)から、Qwen 3.8 27B(約18GB、262kのコンテキスト)までが対象です。32B以上の密モデルも読み込めますが、このCPUでは低速です。Qwen 3.6 35B-A3B(約23GB、アクティブパラメータ数は3B)のようなMoEモデルは、はるかに軽快に動作します。
- 量子化
- ここでは、Q4_K_Mが品質・サイズ・速度の最も良い妥協点です。品質を優先し、RAM容量に余裕がある場合に限り、Q5_K_Mに切り替えてください。FP16はこのクラスのマシンでは不必要に重いため、避けてください。
- 最適なユースケース
- 言い換え、要約、翻訳、簡単なコーディング支援、オフラインのQ&Aなど、良質な9B〜24Bモデルで十分にこなせるタスクです。
#バッテリー持ちと静音性:真の強み
Snapdragon X Eliteの強みがはっきり表れるのは、この点です。RTXを搭載したx86のゲーミングノートPCは、AI負荷がかかると数分でバッテリーを使い切り、ファンが轟音を立てます。それに対して、これらのARMマシンは、電源に接続していてもいなくても、発熱を抑え、静かにテキストを生成します。電車、カフェ、会議室で作業するような持ち運び用途では、これは程度の差ではなく、使い方を根本から変える違いです。
純粋な生成速度は、まずまずですが控えめです。3Bモデルでは毎秒数十トークン程度、24Bの密なモデルでは毎秒数トークンまで下がると見込んでください。小型モデルならスムーズな会話に十分ですが、大型モデルで長い文章を生成する場合は、より時間がかかります。高速なOryonコアのおかげで、最初のトークンが出るまでの待ち時間は許容範囲に収まります。
- 静音
- ファンが過度に高速回転することなく生成でき、低TDPの機種ではほぼファンレスで動作することが多いです。
- バッテリー駆動時間
- 専用GPUではほぼ電源への接続が必要になるのに対し、バッテリー駆動でも実用的に推論を行えます。持ち歩いて使うローカルアシスタントに最適です。
- 熱特性
- 軽いLLM処理を長時間続けても、限界まで負荷をかけたx86の薄型軽量ノートPCとは異なり、激しいスロットリングは発生しません。
- デメリット
- 専用 GPU に比べて、非常に低い速度で制限されるデュアル速度:大きなモデルでは、トークン/秒の性能が快適さを支えています。
#x86や専用GPUと比べた場合の限界
期待外れにならないよう、はっきりさせておきましょう。Snapdragon X Eliteは、最近のNVIDIA製グラフィックカードを搭載したPCには性能で及びません。エントリークラスのRTX 3060 12GBでも14Bモデルをはるかに速く動かせますし、RTX 4090 24GBはまったく別次元の性能です。Snapdragonの強みは絶対的な処理性能ではなく、消費電力あたりの性能と携帯性です。
- エコシステムはまだ成熟途上
- ARM64への対応は急速に進んでいますが、x86への対応ほど成熟していません。一部のツール、拡張機能、GPUバックエンドは対応が遅れているか、実験段階にあります。
- 一般ユーザー向けの GPU アクセラレーションはありません
- llama.cppのAdreno向けバックエンドはまだ初期段階にあり、実際の推論は主にCPUに依存しています。
- 十分に活用されていないNPU
- 前述のとおり、一般的なLLMランタイムでは、この45 TOPSの性能をまだ活用できていません。
- サイズの上限
- dense で二十億以上のパラメータになると、体験は著しく低下します。非常に大きなモデルは専用GPUの領域に留まります(少数アクティブを持つMoEモデルは例外で、それらはより良好な性能を発揮します)。
#さらに詳しく
Snapdragon X Eliteへの理解を深めるには、NPUを使う他のアプローチと比較し、ローカルインストールの基礎を身につけることが役立ちます。さらに理解を深めるためのガイドはこちらです:
- Ryzen AI 9 HX:50 TOPSのNPUはLLMに本当に役立つのか?
- このNPUをめぐる議論をx86側から扱う内容です。率直な検証結果は、本ガイドの結論とも一致しています。
- Ollama のインストール:Windows、macOS、Linux
- Ollamaのデーモンとコマンドを徹底的に使いこなすためのガイドです。ARM64ビルドにも適用できます。
- 量子化の選択(Q4、Q5、Q8)
- 品質と速度のトレードオフを細かく調整するためです。CPUが処理の大部分を担うマシンでは、このバランスが決め手になります。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。