上級 12 分llama.cpp
Vulkanを使うllama.cpp(GPU universel)
Vulkan はメーカーを問わず使えるグラフィックス API で、NVIDIA、AMD、Intel Arc に加え、内蔵 GPU(iGPU)でも動作します。Vulkan バックエンドを有効にして llama.cpp をコンパイルすれば、CUDA や ROCm にまつわる面倒を完全に回避し、どこでも動作する構成を用意できます。その代わり、ネイティブバックエンドより性能が10~20%低下しますが、異なるメーカーのハードウェアが混在する環境では、多くの場合、妥当な選択です。
#なぜVulkanを使うのか?
- Vendor-agnostic
- 同じバイナリはGeForce、Radeon、Arc、Irisに対応します。ツールの配布やモデルのテストに便利で、カードを購入する前に検証できます。
- 簡単なインストール
- Vulkanドライバーは標準グラフィックスドライバーに含まれています。複数ギガバイトのToolkitをインストールする必要はありません。
- 旧型カード
- GTX 1060 6 GB や RX 580 は、CUDA では対応が打ち切られ、ROCm ではサポートされない場合でも、Vulkan 経由で動作します。
- Intel Arc
- Arc A580/A750/A770 は Vulkan で正しくサポートされており、一方で oneAPI はそれほど安定していません。
#対応GPU
- NVIDIA
- Maxwell以降のすべてのカード(GTX 900シリーズ以降)。最近のNVIDIAドライバーはすべてVulkanに対応しています。
- AMD
- Polaris (RX 400/500)、Vega、Navi (RX 5000/6000/7000/9000)。Linux向けMesa、Windows向け公式ドライバー。
- Intel Arc
- Alchemist (A380-A770) および Battlemage。ローカルAIにおいて、パフォーマンスと価格のバランスが非常に優れています。
- iGPU Intel
- Xe(Tiger Lake以降)、Xe2(Lunar Lake、Arrow Lake)。専用GPUのないノートパソコンで小型モデルを動かすのに役立ちます。
#前提条件
#1. Build
Vulkanシェーダーはビルド時にコンパイルされます。CPUに応じて3〜8分かかります。
ローカルAIキット
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
#2. テスト
起動時にllama.cppはVulkan経由で検出されたGPUを表示します:ggml_vulkan: Found 1 Vulkan devices: ... Intel(R) Arc(TM) A770。複数のGPUを搭載している場合、メインGPUのインデックスを指定するために -mg N を使用してください。
#3. CUDA / ROCmとの性能比較
Qwen 3.5 9B Q4_K_MでFlash Attentionを有効にした場合のトークン/秒(おおよその目安):
- RTX 4070 — CUDAネイティブ対応
- ~82 tok/s(基準値)
- RTX 4070 — Vulkan
- ~70 tok/s (-15 %)
- RX 7800 XT — ROCm
- ~56 tok/s。
- RX 7800 XT — Vulkan
- 約48トークン/秒(-15%)。ROCmがうまく動作しないときには、最速になることもあります。
- Arc A770 16GB — Vulkan
- 約43 tok/s。コストパフォーマンスが最も優れています。
- Intel Xe iGPU(Lunar Lake)
- ~8〜13 tok/s。2〜3Bモデルでは利用可能ですが、9Bモデルではやや厳しいです。
#Vulkanを選ぶタイミング
- Intel Arc カードをお持ちです
- 2026年時点では、Vulkan は oneAPI より優れています。性能は安定しており、特殊なインストール作業も不要です。
- ROCmがうまく動かない
- AMD カードが公式サポート対象外で、override を使ってもクラッシュする場合、Vulkan が使える代替手段です。
- マルチベンダー設定
- GeForceとIntel Arcを併用するマシンや、Thunderbolt接続のeGPUを状況に応じて使い分けるノートPC。Vulkanはこうした構成にも対応できます。
- ツールの配布
- 実行環境が事前に分からないマシンでも動作するアプリを開発する場合は、Vulkan版のバイナリが最も高い互換性を備えています。
i
Mac向けではありません
macOS では、Vulkan は MoltenVK(Metal への変換レイヤー)を介して動作します。代わりに llama.cpp のネイティブ Metal バックエンドを使用してください。その方が高速です。
このガイドは役に立ちましたか?
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。
QuelLLM キット用途別のリファレンスガイド
すべてのキットを永久に利用 — 49 €目次
共有