上級 12 分llama.cpp

Vulkanを使うllama.cpp(GPU universel)

Vulkan はメーカーを問わず使えるグラフィックス API で、NVIDIA、AMD、Intel Arc に加え、内蔵 GPU(iGPU)でも動作します。Vulkan バックエンドを有効にして llama.cpp をコンパイルすれば、CUDA や ROCm にまつわる面倒を完全に回避し、どこでも動作する構成を用意できます。その代わり、ネイティブバックエンドより性能が10~20%低下しますが、異なるメーカーのハードウェアが混在する環境では、多くの場合、妥当な選択です。

著者 Mohamed Meguedmi·更新 2026-08-27·Windows・macOS・Linuxでテスト済み

#なぜVulkanを使うのか?

Vendor-agnostic
同じバイナリはGeForce、Radeon、Arc、Irisに対応します。ツールの配布やモデルのテストに便利で、カードを購入する前に検証できます。
簡単なインストール
Vulkanドライバーは標準グラフィックスドライバーに含まれています。複数ギガバイトのToolkitをインストールする必要はありません。
旧型カード
GTX 1060 6 GB や RX 580 は、CUDA では対応が打ち切られ、ROCm ではサポートされない場合でも、Vulkan 経由で動作します。
Intel Arc
Arc A580/A750/A770 は Vulkan で正しくサポートされており、一方で oneAPI はそれほど安定していません。

#対応GPU

NVIDIA
Maxwell以降のすべてのカード(GTX 900シリーズ以降)。最近のNVIDIAドライバーはすべてVulkanに対応しています。
AMD
Polaris (RX 400/500)、Vega、Navi (RX 5000/6000/7000/9000)。Linux向けMesa、Windows向け公式ドライバー。
Intel Arc
Alchemist (A380-A770) および Battlemage。ローカルAIにおいて、パフォーマンスと価格のバランスが非常に優れています。
iGPU Intel
Xe(Tiger Lake以降)、Xe2(Lunar Lake、Arrow Lake)。専用GPUのないノートパソコンで小型モデルを動かすのに役立ちます。

#前提条件

Ubuntu / Debian
sudo apt update
sudo apt install libvulkan-dev vulkan-tools glslang-tools \
  cmake build-essential git
Fedora
sudo dnf install vulkan-headers vulkan-tools \
  glslang-devel cmake gcc-c++ git
Windows
# Installer le SDK Vulkan LunarG (fournit les headers et shaderc)
winget install KhronosGroup.VulkanSDK
VulkanがGPUを認識していることを確認する
vulkaninfo | grep -i "deviceName"
# Doit afficher votre GPU

#1. Build

ターミナル
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp

cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j

Vulkanシェーダーはビルド時にコンパイルされます。CPUに応じて3〜8分かかります。

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

#2. テスト

起動する
./build/bin/llama-cli \
  -m ./models/qwen3.5-9b-q4_k_m.gguf \
  -p "Bonjour" -n 128 -ngl 99

起動時にllama.cppはVulkan経由で検出されたGPUを表示します:ggml_vulkan: Found 1 Vulkan devices: ... Intel(R) Arc(TM) A770。複数のGPUを搭載している場合、メインGPUのインデックスを指定するために -mg N を使用してください。

#3. CUDA / ROCmとの性能比較

Qwen 3.5 9B Q4_K_MでFlash Attentionを有効にした場合のトークン/秒(おおよその目安):

RTX 4070 — CUDAネイティブ対応
~82 tok/s(基準値)
RTX 4070 — Vulkan
~70 tok/s (-15 %)
RX 7800 XT — ROCm
~56 tok/s。
RX 7800 XT — Vulkan
約48トークン/秒(-15%)。ROCmがうまく動作しないときには、最速になることもあります。
Arc A770 16GB — Vulkan
約43 tok/s。コストパフォーマンスが最も優れています。
Intel Xe iGPU(Lunar Lake)
~8〜13 tok/s。2〜3Bモデルでは利用可能ですが、9Bモデルではやや厳しいです。

#Vulkanを選ぶタイミング

Intel Arc カードをお持ちです
2026年時点では、Vulkan は oneAPI より優れています。性能は安定しており、特殊なインストール作業も不要です。
ROCmがうまく動かない
AMD カードが公式サポート対象外で、override を使ってもクラッシュする場合、Vulkan が使える代替手段です。
マルチベンダー設定
GeForceとIntel Arcを併用するマシンや、Thunderbolt接続のeGPUを状況に応じて使い分けるノートPC。Vulkanはこうした構成にも対応できます。
ツールの配布
実行環境が事前に分からないマシンでも動作するアプリを開発する場合は、Vulkan版のバイナリが最も高い互換性を備えています。
i
Mac向けではありません
macOS では、Vulkan は MoltenVK(Metal への変換レイヤー)を介して動作します。代わりに llama.cpp のネイティブ Metal バックエンドを使用してください。その方が高速です。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。