Radeon RX 7800 XT(16 GB)でどのLLMを使うべきか ?
Radeon RX 7800 XTは、特に16 GBのVRAMと624 GB/sの帯域幅により、ローカルAI向けのお買い得な選択肢です。Q4量子化なら200億〜240億パラメータのモデルを読み込めますが、12 GBのカードではそれができません。Llama 2 7BのQ4_0について公開されている測定では、Vulkanでの生成速度は毎秒118トークンです。価格そのものよりVRAM 1 GBあたりのコストが重要なので、/prix-gpu-iaで比較してください。
グラフィックカードがお買い得かどうかは、表示価格ではなく、使いたいモデルがそのメモリに収まるかどうかで判断します。RX 7800 XTは、RDNA 3世代の16GBカードの中で、ROCmとOllamaの両方で公式に対応機種として挙げられている数少ない製品の一つです。このガイドでは、実行できるモデル、公表された測定結果に基づく速度、そして毎週変わる価格に依存せずに購入候補を評価する方法を説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16GB (ASUS Prime OC).
なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16GB (ASUS Prime OC) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。
#RX 7800 XTがローカルLLM用にお買い得な理由
RX 7800 XTは、このクラスでは珍しい三つの強みを兼ね備えています。256ビットバスに接続された16 GBのGDDR6により、624 GB/sのメモリ帯域幅を実現しています。この帯域幅がLLMの生成速度の上限を決める要因です。AMDはROCmの公式対応リストにこのカードを掲載しており(RDNA 3、ターゲット gfx1101)、OllamaもLinuxとWindowsの両方で対応カードとして挙げています。さらに、公開測定では、Vulkan環境でQ4_0の7Bモデルを使った生成速度が毎秒118.27トークンで、同じ一連の測定におけるRX 7900 GREを上回っています。NVIDIAに対する弱点は生成速度ではなくプロンプトの読み込みで、RTX 4070 Ti Superの3倍の時間がかかります。
- アーキテクチャ
- RDNA 3、チップレット構成のNavi 32:GCDが1つ、MCDが4つで、2023年9月6日に発売されました。したがって、モノリシック構成ではありません。
- 計算
- 3,840基のストリームプロセッサ、60基の演算ユニット。
- メモリ
- 16 GB GDDR6、バス256ビット、624 GB/sです。
- 消費電力
- カードの消費電力は263 W。
- 価格
- ここでは価格を固定して記載していません。毎週月曜日と木曜日に最安値を調べて記録する/prix-gpu-iaを参照してください。
#価格が固定されていないオファーを評価する
「お得」という言葉は価格を前提としています。カードの価格は週ごとに変わります。10日後には誤っている可能性のある価格を挙げるのではなく、ここでは方法を示します。VRAMの1 GBあたりのコストを計算してください。7800 XTの場合は価格を16で、12 GBのカードの場合は12で割ります。サイトのトラッキングでは、各カードについてこの数値を公開しています。次に、唯一重要な質問を自分に問いかけましょう。追加の容量は、本当に使いたいモデルを可能にしますか?12 GBから16 GBへのアップグレードは20Bから24Bのモデルを可能にし、16 GBから24 GBへのアップグレードは30B以上のモデルを可能にします。
| 状況 | 必要な計算 | 結論 |
|---|---|---|
| 7800 XTの購入オファー | 価格 ÷ 16 GB | 12GBおよび24GBのGPUカードのGBあたりのコストを比較してください。/prix-gpu-ia |
| 12GBカードとの価格差 | 差額 ÷ 追加の4 GB | 1 GB あたりの平均価格を下回るため、16 GB はお得な選択肢です |
| RTX 16GBモデルとの差異 | 自分にとってのCUDAの価値 | ツールがそれを必要とする場合、またはプロンプトの読み込みが重要な場合にのみ、その費用を支払ってください。 |
| 中古グラフィックスカード | 購入前に12GBから14GBのモデルでテスト | 実際の読み込みテストがなければ断ってください |
具体的な価格を示さずに、判断の例を挙げます。12 GBのカードと7800 XTの差額が、24Bモデルのためにいずれにせよ支出するつもりだった金額に相当するなら、答えは決まります。逆に、8〜12Bのモデルしか使わないなら、追加の4 GBは役に立たず、RX 7700 XTまたはRX 6700 XTで十分です。
#16 GBのVRAMに収まるもの
16 GBのうち、カードを画面出力に使わない場合は、モデルとKVキャッシュに約15 GBを使えると見込んでください。以下に示すQuelLLMカタログの値はQ4の重みの容量です。コンテキスト用のメモリはこれに加算されるため、大きなモデルでは残りの余裕がすぐに制約になります。
| モデル | モデル容量 | コンテキストの余裕 | 判定 |
|---|---|---|---|
| Gemma 4 12B(Q8) | 約 13 GB | ≈ 2 GB | 収まる(コンテキストが短い場合) |
| gpt-oss 20BのQ4版 | 約 13 GB | ≈ 2 GB | メモリに収まる。コンテキストは短〜中程度 |
| Devstral Small 2 24B (Q4) | ≈ 14 GB | 約 1 GB | ぎりぎり収まるが、コンテキストは非常に短い |
| Gemma 4 26B-A4B Q4 | 約 16 GB | なし | あまりにも正確すぎる |
| Granite 4.1 30B(Q4) | ≈ 17GB | なし | 収まりません |
表のキーワードはマージンです。24BのQ4は収まりますが、コンテキストは数千トークン程度しかありません。長いファイルを含むコード使用の場合、KVキャッシュの量子化により1〜2ギガバイトが解放され、RX 7900 XTのような20 GBのカードで問題を解決できます。16 GBのモデルに関するサイトの表は、カードのブランドに依存せず、量子化のトレードオフを詳細に示しています。
gpt-oss 20B のような混合エキスパート(MoE)モデルについて、少し説明します。各トークンの処理では一部のパラメータだけが働くため、生成が速くなりますが、すべての重みをメモリに保持する必要があります。モデルが16GBに収まるかどうかを決めるのは、アクティブな部分のサイズではなく、全体のサイズです。そのため、上の表では20BのMoEモデルと12Bの密なモデルが並び、どちらも重みのサイズが約13GBとなっています。
#実測の生成速度:Vulkan または ROCm
以下の数値は本サイトの測定値ではありません。llama.cppのリポジトリにおける2つの公開ディスカッション(Vulkan用とROCm用)に由来するもので、いずれも Llama 2 7B を Q4_0 で llama-bench によりテストしています。llama.cppのコミット、システム、ドライバーはシリーズごとに異なるため、2つのシリーズ間の差は参考指標であり、最終的なランキングではありません。
| Backend | Flash Attention | 読み込み pp512 | tg128 生成 |
|---|---|---|---|
| Vulkan | いいえ | 2 017,33 t/s | 118,27 t/s |
| Vulkan | はい | 2 197,05 t/s | 124,86 t/s |
| ROCm | いいえ | 2 151,81 t/s | 100,94 t/s |
| ROCm | はい | 2 304,63 t/s | 95,99 t/s |
ここから二つの教訓が得られます。まず、これらのテストでは、このカード上でVulkanはROCmよりも高速に生成します(Flash Attentionなしで、1秒あたり118トークン対101トークン)。一方、ROCmはプロンプトの読み込みがわずかに速いです。次に、Flash AttentionはVulkanを高速化しますが、ROCmでの生成はわずかに遅くなります。会話での応答速度を最優先とする場合は、ROCmが有利だと推測するのではなく、お使いのモデルで両方のバックエンドを試してください。
理論上限に対してどれだけ性能が出ているかを見ると、過度に心配せずに済みます。624GB/sをモデルの重みの容量3.82GBで割ると163トークン/秒となり、このGPUはVulkanでその72%に達しています。この比率をより大きなモデルに適用すれば、おおよその性能を見積もれますが、ご自身の環境で確認する必要があります。
| モデル (Q4) | モデル容量 | 理論上の上限 | 概算 |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈ 104 tokens/s | ≈ 75トークン/秒 |
| Gemma 4 12B | ≈ 7 GB | ≈ 89トークン/秒 | ≈64トークン/秒 |
| Phi-4 14B | ≈ 9 GB | 約69トークン/秒 | 約50トークン/秒 |
| Devstral Small 2 24B | ≈ 14 GB | ≈45トークン/秒 | ≈32トークン/秒 |
#16 GBのNVIDIAカードとの比較:決め手はプロンプトの処理
16 GBのRTXとの比較では、2つの指標がポイントになります。生成速度では、RX 7800 XTはVulkanで測定されたNVIDIA製カードと同程度です。プロンプトの読み込み速度では差が非常に大きく、RTX 4070 Ti Superの3分の1です。この2つ目の数値は、長い文書や長い会話履歴を扱い、最初の単語が出るのを待つ用途では大きく影響します。短いチャットや、扱うコンテキストがそれほど長くないコードアシスタントでは、影響は小さくなります。
| カード | VRAM | 読み込み pp512 | tg128 生成 |
|---|---|---|---|
| RX 7800 XT | 16 GB | 2 017,33 t/s | 118,27 t/s |
| RTX 4070 Ti Super | 16 GB | 6 099,18 t/s | 129,45 t/s |
| RTX 5070 Ti | 16 GB | 6 213,63 t/s | 135,63 t/s |
#24Bモデルを16GBのメモリで動作させるための有効な手法
240億パラメータのモデルをQ4で量子化すると、約14 GBの容量を占め、KVキャッシュとシステムに割り当てられるのはわずか1 GB程度しかありません。プロセッサへのオーバーフローによる速度低下を避けるための4つの対策があります。第一に、KVキャッシュはトークンごとに増大するため、コンテキストウィンドウを実際に必要な範囲に制限することです。第二に、KVキャッシュを量子化することで、1 GBから2 GBのメモリを解放できます。第三に、ハードウェアアクセラレーションを有効にしたブラウザやゲームなど、VRAMを確保しているアプリケーションを閉じることです。第四に、プロセッサに統合グラフィックスが存在する場合、ディスプレイをそこに接続することで、AMDカードがディスプレイ表示に使用していたメモリを取り戻せます。
- コンテキスト
- コンテキストウィンドウは実際に必要なサイズに設定してください。ほとんどの会話では4,000~8,000トークンで十分です。
- KVキャッシュ
- 使用するタスクでの品質を確認しながら、8ビットに量子化してVRAMの空きを増やしてください。
- 表示
- 内蔵グラフィックスの映像出力がある場合は、それを使ってください。
- 確認
- 読み込み後、ollama psに100 % GPUと表示される必要があります。それ以外の割合は、モデルの一部がGPUメモリからシステムRAMへはみ出していることを示します。
コンテキストウィンドウのガイドでは、メモリ容量の少ないグラフィックスカードで、長い会話履歴がモデル自体と同じくらいのメモリを消費する理由を説明しています。
#セットアップ
- 01システムの選択Linuxでは、AMDがRadeon RX 7000をサポートするのはUbuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1およびRHEL 9.7のみです。WindowsではOllamaはROCm v7またはHIP7をベースにしています。
- 02Ollama のインストールOllama のドキュメントに従ってください。Linux では ROCm v7 ドライバーが必要です。Vulkan はデフォルトで有効になっており、フォールバックとして使われます。
- 03メモリに収まるモデルを読み込む12BモデルをQ8で、または20BモデルをQ4で試してから24Bモデルに進んでください。ollama psでGPUに完全に読み込まれているかを確認してください。
- 04VulkanとROCmを比較使用するモデルで、両方のバックエンドそれぞれについてFlash Attentionの有効時と無効時にllama-benchを実行し、用途に応じて最も速いものを選んでください。
#2026年の結論
- こんな場合にお買い得
- 20B から 24B のモデルをターゲットとしており、/prix-gpu-ia における VRAM 1 GB 単価が、近隣の 12 GB カードよりも低い場合です。
- 以下の条件では不向きです
- 8~12Bのモデルを使い続ける場合:12GBのカードで十分なので、使わないメモリ容量にお金を払うことになります。
- 避けるべきこと
- 中古のカードを購入する際に、12〜14 GBのモデルを読み込むテストをせずに買うこと。
- Ollamaドキュメント:対応AMDカード
- ROCm の GPU 互換性、AMD ドキュメント
- llama.cpp リポジトリの Vulkan スコアボード
- llama.cpp リポジトリの ROCm スコアボード
#よくある質問
RX 7800 XT:LLMを動かすためのお得な選択肢か?+
2026年においてRX 7800 XTはLLMに適していますか?+
RX 7800 XTではVulkanとROCmのどちらを使うべきですか?+
ローカルAIにはRX 7800 XTとRX 7700 XTのどちらを選ぶべきですか?+
16GBのRX 7800 XTに収まるモデルはどれですか?+
RX 7800 XT は Ollama でサポートされていますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。