Intel Arc GPU(B580、A770)上のローカルLLM:Ollamaと IPEX-LLM
Intel Arc GPU上でローカルLLMを実行するのは明らかに難しいです。その環境はCUDAに設計されています。しかし、IPEX-LLMとそのSYCLバックエンドを活用することで、intel arc + ollamaの組み合わせが実用的に使えるようになり、A770 16GBまたはB580 12GBのVRAM/ユーロ比は非常に優れています。本ガイドでは、スタックのインストール方法、実際に得られるtokens/sec、そして本質的な制限について説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。
#なぜIntel ArcがローカルAIに適しているのか?
2026年、どのモデルを動かせるかを左右する支出項目はVRAMです。そして、Intel Arcが価格面で攻めているのはまさにこの点です。Arc A770は16GBのGDDR6を搭載し、中古なら300ユーロ未満で見つかることがよくあります。一方、新しいArc B580(Battlemageアーキテクチャ)は12GBを搭載し、発売時の価格は約250ユーロです。この価格では、これほどのメモリ容量を備えた新品のNVIDIA製カードはありません。
つまり、利点は明快です。VRAM容量によって、処理の一部をCPU側に移さずに読み込めるモデルのサイズが決まります。16 GBあれば、Q4_K_MのQwen 3.5 9BやGranite 4.2 8Bは余裕を持ってメモリに収まり、Q4のGemma 4 12Bも十分に動かせます。妥協点はソフトウェアです。IntelではCUDAを使えないため、独自のoneAPI/SYCLスタックとIPEX-LLMライブラリを使う必要があります。
#B580 と A770:どちらを選ぶべきか
この2枚のGPUの役割は、まったく同じというわけではありません。B580はより新しく、電力効率が高く、現在のドライバーによるサポートも優れていますが、容量は最大12 GBです。A770はより古く(Alchemist、2022年)、消費電力も大きい一方、16 GBの容量によって、より大きなモデルや長いコンテキストを利用できます。
- Arc B580 (Battlemage)
- 12 GB GDDR6、新品で約250ユーロ。効率がより高く、ドライバーもより成熟しています。主に7B〜8Bモデルを高速に動かしたい場合に適した選択肢です。
- Arc A770 (Alchemist)
- 16GB GDDR6で、中古なら300€未満で見つかることが多いです。VRAMがより多いため、14Bモデルや長いコンテキストに対応できますが、その分、消費電力も高くなります。
- Arc A750 / B570
- 8 GB / 10 GB:7BモデルをQ4で動かす応急的な選択肢にはなりますが、容量には余裕がなく、VRAMの限界にすぐ達します。予算が限られる場合にのみ検討してください。
#ハードウェア要件およびドライバー
何かをインストールする前に、まず基本的な設定が適切であることを確認してください。最も重要なのはResizable BAR(ReBAR)です。Arc GPUでは、これは必須です。ReBARがないと、性能が大幅に低下し、一部の読み込みにも失敗します。
- 01Resizable BARを有効にするマザーボードのBIOS/UEFIで「Resizable BAR」(および「Above 4G Decoding」)を有効にしてください。これはArcが正しく動作するために不可欠です。
- 02GPUドライバーの更新Windowsの場合はIntel Arcの最新ドライバー(Intel Arc Control)をインストールしてください。Linuxの場合は6.2以降のカーネルを使用し、i915/xeドライバーおよびIntelのCompute Runtime(intel-opencl-icd、level-zero)を適用してください。
- 03認識されているか確認するLinuxでは、clinfoまたはsycl-lsコマンドの出力に、Arc GPUがLevel Zeroデバイスとして表示されるはずです。これが、oneAPI層がそのカードを正しく認識している証拠になります。
#IPEX-LLM および SYCL バックエンドのインストール
IPEX-LLMは、IntelのGPU上でLLMの推論を最適化するIntelのライブラリです。oneAPIとllama.cppのSYCLバックエンドを利用し、Arc向けに事前コンパイルされたOllamaを提供します。使用する必要があるのは、この「IPEX-LLM」版のOllamaです。CUDA/ROCm/Metalにしか対応していない標準のOllamaバイナリではありません。
最も簡単なのは、Pythonパッケージipex-llm[cpp]を使う方法です。このパッケージは、IntelバックエンドにリンクされたOllamaのバイナリを生成するinit-ollamaコマンドをインストールします。既存の環境に影響を与えないよう、専用の環境を作成してください。
Windowsでは、Intelがすぐに使える「Ollama portable」のアーカイブも配布しています。解凍してstart-ollama.batを直接実行してください。Pythonをインストールする必要はありません。試すにはこれが最も手早い方法です。
#Arc上でOllamaを起動する
バイナリの生成後は、通常どおりOllamaデーモンを起動します。http://localhost:11434で待ち受けますが、SYCLにGPUを使用し、すべてをGPUへオフロードするよう指示する環境変数をいくつか設定します。
別のターミナルでモデルをダウンロードし、会話を始めてください。まずは小さなモデルで一連の動作を確認してから、12Bモデルを読み込んでください。
最初のプロンプトでは、SYCL カーネルのコンパイルによってわずかな遅延が生じます。SYCL_CACHE_PERSISTENT により、次回以降の起動は大幅に速くなります。GPU が処理を行っていることを確認するには、Intel の専用ツールで GPU の使用状況を監視してください。
#B580およびA770で測定されたトークン/秒
以下の数値は、一般的なモデルを Q4_K_M で使用し、短いコンテキストで生成のみを行った際に観測された目安です(読み込み時間は含みません)。ドライバー、IPEX-LLM のバージョン、冷却状況によって変動しますが、得られる性能の現実的な目安になります。
- Granite 4.2 3B (Q4) — B580
- 約45〜55トークン/秒。チャットや短時間で済むタスクをスムーズにこなせます。
- Granite 4.2 8B (Q4) — B580
- 約25〜32トークン/秒。日常的にアシスタントとして使うには快適です。
- Qwen 3.5 9B(Q4)— A770
- 約20〜28 tok/s。小規模なモデルではB580より一段劣りますが、十分に実用的で、画像認識機能も備えています。
- Gemma 4 12B (Q4) — A770
- 約11~16トークン/秒。16 GBのメモリが決め手となり、マルチモーダルモデルがCPUオフロードなしでメモリに収まります。
- Gemma 4 12B (Q4) — B580
- 約9〜13 tok/s。コンテキストによっては12 GBの容量ぎりぎりになります。コンテキストが長いとオフロードが必要になり、生成速度が大きく低下することがあります。
判定は明確です。8-9B モデルでは、両方のカードが快適なリアルタイム体験を提供し、多くの場合 RTX 3060 12 GB と同等です。12B では、A770 が VRAM により優位を保ちます。参考までに、RTX 3060 12 GB は NVIDIA 側のエントリーレベルの基準であり、Arc はこのカテゴリで競っており、RTX 4080 との競争ではありません。
#NVIDIAと比べた場合の制約
正直に言えば、Arcは予算を抑えるうえで賢い選択肢ですが、CUDAカードを妥協なしに置き換えられるわけではありません。購入前に知っておくべき点を以下に示します。
- ソフトウェアエコシステム
- IPEX-LLMとSYCLバックエンドに依存します。一部の新しいプロジェクト(新しいランタイムやllama.cppの機能など)は、CUDA向けに比べて対応が遅れます。Ollamaの「標準」版だけでは不十分です。
- サポートされる量子化方法
- 標準的なGGUF形式(Q4_K_M、Q5_K_M、Q8_0、FP16)は利用できます。一方、特殊な量子化方式やごく最近の量子化方式の一部は、最適化されていない可能性があり、場合によってはCPUでの計算に切り替わることもあります。
- ファインチューニングと高度なフレームワーク
- IPEX-LLMで学習やLoRAを行うことは可能ですが、NVIDIAの場合と比べてドキュメントもツールもはるかに少なくなっています。本格的なファインチューニングでは、CUDAが依然として最適な選択肢です。
- ドライバーの成熟度
- 状況は急速に改善していますが、ドライバーやIPEX-LLMのバージョンによっては、それまで動いていた機能が動かなくなるなどの不具合が生じる可能性があります。むやみに更新する前に、動作するバージョンを固定しておいてください。
#一般的なトラブルシューティング
- モデルはGPUではなくCPU上で実行されています
- ONEAPI_DEVICE_SELECTOR=level_zero:0 と OLLAMA_NUM_GPU=999 の設定を確認し、sycl-ls にカードが表示されていることも確認してください。ReBARが無効だと、CPU処理へのフォールバックが強制されることもあります。
- GPUが動作しているのに処理速度が非常に遅い
- ほとんどの場合、原因はBIOSでResizable BARが有効になっていないことです。まずここを確認してください。
- VRAMは十分にあるように見えるのに「out of memory」エラーが出る
- コンテキスト(num_ctx)が大きいほど、メモリ使用量が増えます。コンテキストウィンドウを小さくするか、より軽量な量子化形式(Q5/Q8ではなくQ4)に切り替えてください。
- 最初のプロンプトが非常に遅く、その後正常に動作
- SYCLカーネルのコンパイルが原因です。起動するたびにこの処理の負担が発生しないよう、SYCL_CACHE_PERSISTENT=1が環境変数として確実にexportされていることを確認してください。
- GPU は sycl-ls に表示されません
- 計算ランタイムが不足しています:Linuxではintel-opencl-icdおよびlevel-zeroをインストールし、WindowsではArcドライバーを再インストールしてください。
#さらに詳しく
お使いのArcでOllamaが動くようになれば、その後の手順はほかのマシンと同じです。本サイトの以下のガイドで、このガイドの続きとなる内容を紹介しています。
- 量子化の選択(Q4、Q5、Q8、FP16)
- VRAM容量が限られるArcでは、量子化の選択が決め手になります。品質とメモリ使用量のトレードオフを理解し、12GBまたは16GBを最大限に活用しましょう。
- ローカルAI向けGPUの選び方
- ArcをRTXやMacと比較して位置づけ直し、用途に合った購入先かどうかを確認する。
- Ollama のインストール:Windows、macOS、Linux
- 基本的なインストールとポート11434でのAPIの使い方を解説するガイド。Arcで動かす環境にOpen WebUIを接続する際に役立ちます。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。