中級 12 分GPU

Intel Arc GPU(B580、A770)上のローカルLLM:Ollamaと IPEX-LLM

Intel Arc GPU上でローカルLLMを実行するのは明らかに難しいです。その環境はCUDAに設計されています。しかし、IPEX-LLMとそのSYCLバックエンドを活用することで、intel arc + ollamaの組み合わせが実用的に使えるようになり、A770 16GBまたはB580 12GBのVRAM/ユーロ比は非常に優れています。本ガイドでは、スタックのインストール方法、実際に得られるtokens/sec、そして本質的な制限について説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Thomas P.·更新 2026-08-27·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。

#なぜIntel ArcがローカルAIに適しているのか?

2026年、どのモデルを動かせるかを左右する支出項目はVRAMです。そして、Intel Arcが価格面で攻めているのはまさにこの点です。Arc A770は16GBのGDDR6を搭載し、中古なら300ユーロ未満で見つかることがよくあります。一方、新しいArc B580(Battlemageアーキテクチャ)は12GBを搭載し、発売時の価格は約250ユーロです。この価格では、これほどのメモリ容量を備えた新品のNVIDIA製カードはありません。

つまり、利点は明快です。VRAM容量によって、処理の一部をCPU側に移さずに読み込めるモデルのサイズが決まります。16 GBあれば、Q4_K_MのQwen 3.5 9BやGranite 4.2 8Bは余裕を持ってメモリに収まり、Q4のGemma 4 12Bも十分に動かせます。妥協点はソフトウェアです。IntelではCUDAを使えないため、独自のoneAPI/SYCLスタックとIPEX-LLMライブラリを使う必要があります。

i
VRAM およびモデルのサイズ
Q4_K_Mでの簡単な目安:7Bモデルは約5 GB、14Bは約9 GB、32Bは約19 GBを使用します。A770の16 GBなら14Bまで余裕をもって対応できます。B580の12 GBなら7B〜8Bは余裕があり、14Bも動かせますが、メモリの余裕は少なくなります。

#B580 と A770:どちらを選ぶべきか

この2枚のGPUの役割は、まったく同じというわけではありません。B580はより新しく、電力効率が高く、現在のドライバーによるサポートも優れていますが、容量は最大12 GBです。A770はより古く(Alchemist、2022年)、消費電力も大きい一方、16 GBの容量によって、より大きなモデルや長いコンテキストを利用できます。

Arc B580 (Battlemage)
12 GB GDDR6、新品で約250ユーロ。効率がより高く、ドライバーもより成熟しています。主に7B〜8Bモデルを高速に動かしたい場合に適した選択肢です。
Arc A770 (Alchemist)
16GB GDDR6で、中古なら300€未満で見つかることが多いです。VRAMがより多いため、14Bモデルや長いコンテキストに対応できますが、その分、消費電力も高くなります。
Arc A750 / B570
8 GB / 10 GB:7BモデルをQ4で動かす応急的な選択肢にはなりますが、容量には余裕がなく、VRAMの限界にすぐ達します。予算が限られる場合にのみ検討してください。
→
決定的な基準
迷う場合は、モデル名ではなくVRAMのサイズを基準に判断してください。16GB(A770)は、14BモデルやRAGへの拡張に余裕を持たせることができます。一方、12GBのB580はより新しい構成ですが、VRAMの制限により拡張性に劣ります。

#ハードウェア要件およびドライバー

何かをインストールする前に、まず基本的な設定が適切であることを確認してください。最も重要なのはResizable BAR(ReBAR)です。Arc GPUでは、これは必須です。ReBARがないと、性能が大幅に低下し、一部の読み込みにも失敗します。

  1. 01
    Resizable BARを有効にする
    マザーボードのBIOS/UEFIで「Resizable BAR」(および「Above 4G Decoding」)を有効にしてください。これはArcが正しく動作するために不可欠です。
  2. 02
    GPUドライバーの更新
    Windowsの場合はIntel Arcの最新ドライバー(Intel Arc Control)をインストールしてください。Linuxの場合は6.2以降のカーネルを使用し、i915/xeドライバーおよびIntelのCompute Runtime(intel-opencl-icd、level-zero)を適用してください。
  3. 03
    認識されているか確認する
    Linuxでは、clinfoまたはsycl-lsコマンドの出力に、Arc GPUがLevel Zeroデバイスとして表示されるはずです。これが、oneAPI層がそのカードを正しく認識している証拠になります。
ターミナル — カードの確認(Linux)
# Lister les périphériques SYCL visibles par oneAPI
sycl-ls

# Sortie attendue : une ligne [level_zero:gpu] ... Intel(R) Arc(TM) ...
# Si le GPU n'apparaît pas, le compute runtime n'est pas installé.
!
Resizable BAR が必要です
これは Arc でのパフォーマンス低下の第一の要因です。トークン/秒が極端に低い場合、またはモデルが GPU にロードされない場合は、他のすべての操作の前に BIOS で ReBAR を確認してください。

#IPEX-LLM および SYCL バックエンドのインストール

IPEX-LLMは、IntelのGPU上でLLMの推論を最適化するIntelのライブラリです。oneAPIとllama.cppのSYCLバックエンドを利用し、Arc向けに事前コンパイルされたOllamaを提供します。使用する必要があるのは、この「IPEX-LLM」版のOllamaです。CUDA/ROCm/Metalにしか対応していない標準のOllamaバイナリではありません。

最も簡単なのは、Pythonパッケージipex-llm[cpp]を使う方法です。このパッケージは、IntelバックエンドにリンクされたOllamaのバイナリを生成するinit-ollamaコマンドをインストールします。既存の環境に影響を与えないよう、専用の環境を作成してください。

ターミナル — IPEX-LLMをインストール(conda/Linux)
# Environnement isolé
conda create -n ipex-llm python=3.11 -y
conda activate ipex-llm

# Installer IPEX-LLM avec le backend llama.cpp/Ollama
pip install --pre --upgrade ipex-llm[cpp]

# Générer les binaires Ollama optimisés Intel dans le dossier courant
mkdir ollama-arc && cd ollama-arc
init-ollama

Windowsでは、Intelがすぐに使える「Ollama portable」のアーカイブも配布しています。解凍してstart-ollama.batを直接実行してください。Pythonをインストールする必要はありません。試すにはこれが最も手早い方法です。

i
oneAPI はすでに含まれています
最近のipex-llm[cpp]パッケージには、必要なoneAPIの依存関係が含まれています。Ollamaを基本的な用途で使う場合、通常はoneAPI Base Toolkitを別途インストールしたり、setvars.shを「source」で読み込んだりする必要はもうありません。

#Arc上でOllamaを起動する

バイナリの生成後は、通常どおりOllamaデーモンを起動します。http://localhost:11434で待ち受けますが、SYCLにGPUを使用し、すべてをGPUへオフロードするよう指示する環境変数をいくつか設定します。

ターミナル — サーバーを起動する
# Sélectionner le GPU Arc via Level Zero
export ONEAPI_DEVICE_SELECTOR=level_zero:0
# Cache de compilation SYCL (accélère les lancements suivants)
export SYCL_CACHE_PERSISTENT=1
# Forcer l'offload de toutes les couches sur le GPU
export OLLAMA_NUM_GPU=999

# Démarrer le daemon (depuis le dossier ollama-arc)
./ollama serve

別のターミナルでモデルをダウンロードし、会話を始めてください。まずは小さなモデルで一連の動作を確認してから、12Bモデルを読み込んでください。

ターミナル — 最初のモデル
# Télécharger et lancer un modèle 8-9B en Q4_K_M
./ollama run qwen3.5:9b

# ou un modèle plus léger pour un premier test
./ollama run granite4.2:3b

最初のプロンプトでは、SYCL カーネルのコンパイルによってわずかな遅延が生じます。SYCL_CACHE_PERSISTENT により、次回以降の起動は大幅に速くなります。GPU が処理を行っていることを確認するには、Intel の専用ツールで GPU の使用状況を監視してください。

ターミナル — GPUを監視(Linux)
# Occupation et mémoire du GPU Intel en temps réel
sudo xpu-smi dump -d 0 -m 0,1,2

# Alternative légère si xpu-smi n'est pas installé
intel_gpu_top
→
インターフェースを接続する
デーモンは標準のOllama APIをポート11434で公開しています。そのため、NVIDIA搭載マシンの場合とまったく同じように、Open WebUIやLM StudioをこのAPIに接続できます。クライアント側では何も変わりません。

#B580およびA770で測定されたトークン/秒

以下の数値は、一般的なモデルを Q4_K_M で使用し、短いコンテキストで生成のみを行った際に観測された目安です(読み込み時間は含みません)。ドライバー、IPEX-LLM のバージョン、冷却状況によって変動しますが、得られる性能の現実的な目安になります。

Granite 4.2 3B (Q4) — B580
約45〜55トークン/秒。チャットや短時間で済むタスクをスムーズにこなせます。
Granite 4.2 8B (Q4) — B580
約25〜32トークン/秒。日常的にアシスタントとして使うには快適です。
Qwen 3.5 9B(Q4)— A770
約20〜28 tok/s。小規模なモデルではB580より一段劣りますが、十分に実用的で、画像認識機能も備えています。
Gemma 4 12B (Q4) — A770
約11~16トークン/秒。16 GBのメモリが決め手となり、マルチモーダルモデルがCPUオフロードなしでメモリに収まります。
Gemma 4 12B (Q4) — B580
約9〜13 tok/s。コンテキストによっては12 GBの容量ぎりぎりになります。コンテキストが長いとオフロードが必要になり、生成速度が大きく低下することがあります。

判定は明確です。8-9B モデルでは、両方のカードが快適なリアルタイム体験を提供し、多くの場合 RTX 3060 12 GB と同等です。12B では、A770 が VRAM により優位を保ちます。参考までに、RTX 3060 12 GB は NVIDIA 側のエントリーレベルの基準であり、Arc はこのカテゴリで競っており、RTX 4080 との競争ではありません。

i
プロンプト処理
Arcでは、生成速度よりもプロンプトの処理速度(prompt eval)が弱点になることがよくあります。長いコンテキストを使うRAGでは、VRAM容量が同じNVIDIAのGPUよりも、最初の「思考」に時間がかかると考えてください。

#NVIDIAと比べた場合の制約

正直に言えば、Arcは予算を抑えるうえで賢い選択肢ですが、CUDAカードを妥協なしに置き換えられるわけではありません。購入前に知っておくべき点を以下に示します。

ソフトウェアエコシステム
IPEX-LLMとSYCLバックエンドに依存します。一部の新しいプロジェクト(新しいランタイムやllama.cppの機能など)は、CUDA向けに比べて対応が遅れます。Ollamaの「標準」版だけでは不十分です。
サポートされる量子化方法
標準的なGGUF形式(Q4_K_M、Q5_K_M、Q8_0、FP16)は利用できます。一方、特殊な量子化方式やごく最近の量子化方式の一部は、最適化されていない可能性があり、場合によってはCPUでの計算に切り替わることもあります。
ファインチューニングと高度なフレームワーク
IPEX-LLMで学習やLoRAを行うことは可能ですが、NVIDIAの場合と比べてドキュメントもツールもはるかに少なくなっています。本格的なファインチューニングでは、CUDAが依然として最適な選択肢です。
ドライバーの成熟度
状況は急速に改善していますが、ドライバーやIPEX-LLMのバージョンによっては、それまで動いていた機能が動かなくなるなどの不具合が生じる可能性があります。むやみに更新する前に、動作するバージョンを固定しておいてください。
!
Arcが適さないのはどんな人か
「最初からすぐ動く」という高い互換性を最優先したい場合、集中的にファインチューニングを行いたい場合、あるいは最新の研究プロジェクトを動かしたい場合は、NVIDIAを選び続けてください。Arcは、安価なVRAMを得るために多少の試行錯誤を受け入れられる人に向いています。

#一般的なトラブルシューティング

モデルはGPUではなくCPU上で実行されています
ONEAPI_DEVICE_SELECTOR=level_zero:0 と OLLAMA_NUM_GPU=999 の設定を確認し、sycl-ls にカードが表示されていることも確認してください。ReBARが無効だと、CPU処理へのフォールバックが強制されることもあります。
GPUが動作しているのに処理速度が非常に遅い
ほとんどの場合、原因はBIOSでResizable BARが有効になっていないことです。まずここを確認してください。
VRAMは十分にあるように見えるのに「out of memory」エラーが出る
コンテキスト(num_ctx)が大きいほど、メモリ使用量が増えます。コンテキストウィンドウを小さくするか、より軽量な量子化形式(Q5/Q8ではなくQ4)に切り替えてください。
最初のプロンプトが非常に遅く、その後正常に動作
SYCLカーネルのコンパイルが原因です。起動するたびにこの処理の負担が発生しないよう、SYCL_CACHE_PERSISTENT=1が環境変数として確実にexportされていることを確認してください。
GPU は sycl-ls に表示されません
計算ランタイムが不足しています:Linuxではintel-opencl-icdおよびlevel-zeroをインストールし、WindowsではArcドライバーを再インストールしてください。

#さらに詳しく

お使いのArcでOllamaが動くようになれば、その後の手順はほかのマシンと同じです。本サイトの以下のガイドで、このガイドの続きとなる内容を紹介しています。

量子化の選択(Q4、Q5、Q8、FP16)
VRAM容量が限られるArcでは、量子化の選択が決め手になります。品質とメモリ使用量のトレードオフを理解し、12GBまたは16GBを最大限に活用しましょう。
ローカルAI向けGPUの選び方
ArcをRTXやMacと比較して位置づけ直し、用途に合った購入先かどうかを確認する。
Ollama のインストール:Windows、macOS、Linux
基本的なインストールとポート11434でのAPIの使い方を解説するガイド。Arcで動かす環境にOpen WebUIを接続する際に役立ちます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。