Ollama + AMD GPU(ROCm):Radeon RX 6000〜の設定 9000
AMDは長らくCUDAに後れを取っていましたが、ROCm 6で十分に差を縮め、Radeon RX 6000、7000、9000シリーズをLLM推論に十分活用できるようになりました。このガイドでは、適切なインストール手順、Ollamaの設定、公式リストに載っていないカードを動かすためのオーバーライドを解説します。
#なぜROCmを使うのか
AMDのGPUを使うには、llama.cppを利用するOllamaは、AMDにおけるCUDA相当の仕組みであるROCmを経由する必要があります。ROCmがなければ、推論時にGPUが認識されず、すべてCPUで動作します。
#公式に互換性が確認されているカード
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
- RX 7900 XTX / XT / GRE
- gfx1100。公式サポート。RTX 4080の性能の約80%です。
- RX 7800 / 7700 XT
- gfx1101。ROCm 6.1以降で公式サポートされています。
- RX 6900 / 6800 / 6700 XT
- gfx1030/1031。大容量カードには公式サポート、小型カードにはオーバーライド対応。
- Instinct MI200 / MI300
- データセンター向けカード。完全なネイティブサポート。
#1. ROCmをインストールする
最も手厚くサポートされている2つのディストリビューションは、Ubuntu 22.04/24.04とRHEL/Fedoraです。Debian、Archなどでは、追加の工夫や調整が必要です。
#2. Ollama および ROCm
Ollama 0.3以降ではROCmが自動的に検出されます。ROCmより先にOllamaをインストールした場合は、Ollamaを再インストールしてください。その際、スクリプトがAMDのGPUを検出し、適切なライブラリをインストールします。
#3. 対応していないカードを強制的に使用
rocminfoに使用しているGPUが表示されない場合、またはOllamaがCPUを使い続ける場合、変数 HSA_OVERRIDE_GFX_VERSION を使うと、ROCmにGPUの情報を偽装させることができます。
- RX 6600 / 6700
- HSA_OVERRIDE_GFX_VERSION=10.3.0
- RX 5700 XT
- HSA_OVERRIDE_GFX_VERSION=10.1.0(サポートは不安定)
- RX 6800 / 6900
- ネイティブでサポートされており、オーバーライドは不要です。
#4. 期待されるパフォーマンス
Qwen 3.5 9B Q4_K_M(6.6 GB、2026年における8 GB環境の定番モデル)での、推論時の速度の目安をトークン/秒で示します。
- RX 7900 XTX (24 GB)
- ~90 tok/s。RTX 4080と同等のパフォーマンスです。
- RX 7800 XT (16 GB)
- 約62トークン/秒。性能はRTX 4070と4070 Tiの中間です。
- RX 6900 XT(16 GB)
- ~52 tok/s。RTX 3080 10 GB相当です。
- RX 6700 XT (12 GB, override)
- 約33 tok/s。RTX 3060と3060 Tiの中間です。
#トラブルシューティング
- rocminfoは空です
- ドライバーがインストールされていないか、ユーザーが render グループに属していない場合があります。groups $USER を確認してください。
- ROCmがあるのにOllamaがCPUを使用する
- アーキテクチャの互換性が原因であることがよくあります。1つ上の世代に対応するHSA_OVERRIDEを試してください。
- 大きなモデルでのクラッシュ(メモリ不足)
- rocm-smiでVRAM使用量を確認できます。容量を超える場合は、num_ctxを減らすか、Q3_K_Mに切り替えてください。
- ROCmのバージョンがOllamaと互換性がない
- OllamaはROCm 6.x向けにパッケージ化されています。ROCm 5では動作しません。更新してください。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。