中級 11 分Radeon RX 7000

Radeon RX 7800 XT(16 GB)でどのLLMを使うべきか ?

端的な回答

Radeon RX 7800 XTは、特に16 GBのVRAMと624 GB/sの帯域幅により、ローカルAI向けのお買い得な選択肢です。Q4量子化なら200億〜240億パラメータのモデルを読み込めますが、12 GBのカードではそれができません。Llama 2 7BのQ4_0について公開されている測定では、Vulkanでの生成速度は毎秒118トークンです。価格そのものよりVRAM 1 GBあたりのコストが重要なので、/prix-gpu-iaで比較してください。

グラフィックカードがお買い得かどうかは、表示価格ではなく、使いたいモデルがそのメモリに収まるかどうかで判断します。RX 7800 XTは、RDNA 3世代の16GBカードの中で、ROCmとOllamaの両方で公式に対応機種として挙げられている数少ない製品の一つです。このガイドでは、実行できるモデル、公表された測定結果に基づく速度、そして毎週変わる価格に依存せずに購入候補を評価する方法を説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16GB (ASUS Prime OC).

なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16GB (ASUS Prime OC) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。

#RX 7800 XTがローカルLLM用にお買い得な理由

RX 7800 XTは、このクラスでは珍しい三つの強みを兼ね備えています。256ビットバスに接続された16 GBのGDDR6により、624 GB/sのメモリ帯域幅を実現しています。この帯域幅がLLMの生成速度の上限を決める要因です。AMDはROCmの公式対応リストにこのカードを掲載しており(RDNA 3、ターゲット gfx1101)、OllamaもLinuxとWindowsの両方で対応カードとして挙げています。さらに、公開測定では、Vulkan環境でQ4_0の7Bモデルを使った生成速度が毎秒118.27トークンで、同じ一連の測定におけるRX 7900 GREを上回っています。NVIDIAに対する弱点は生成速度ではなくプロンプトの読み込みで、RTX 4070 Ti Superの3倍の時間がかかります。

アーキテクチャ
RDNA 3、チップレット構成のNavi 32:GCDが1つ、MCDが4つで、2023年9月6日に発売されました。したがって、モノリシック構成ではありません。
計算
3,840基のストリームプロセッサ、60基の演算ユニット。
メモリ
16 GB GDDR6、バス256ビット、624 GB/sです。
消費電力
カードの消費電力は263 W。
価格
ここでは価格を固定して記載していません。毎週月曜日と木曜日に最安値を調べて記録する/prix-gpu-iaを参照してください。

#価格が固定されていないオファーを評価する

「お得」という言葉は価格を前提としています。カードの価格は週ごとに変わります。10日後には誤っている可能性のある価格を挙げるのではなく、ここでは方法を示します。VRAMの1 GBあたりのコストを計算してください。7800 XTの場合は価格を16で、12 GBのカードの場合は12で割ります。サイトのトラッキングでは、各カードについてこの数値を公開しています。次に、唯一重要な質問を自分に問いかけましょう。追加の容量は、本当に使いたいモデルを可能にしますか?12 GBから16 GBへのアップグレードは20Bから24Bのモデルを可能にし、16 GBから24 GBへのアップグレードは30B以上のモデルを可能にします。

購入候補を評価するための目安(価格ではなく計算例)
状況必要な計算結論
7800 XTの購入オファー価格 ÷ 16 GB12GBおよび24GBのGPUカードのGBあたりのコストを比較してください。/prix-gpu-ia
12GBカードとの価格差差額 ÷ 追加の4 GB1 GB あたりの平均価格を下回るため、16 GB はお得な選択肢です
RTX 16GBモデルとの差異自分にとってのCUDAの価値ツールがそれを必要とする場合、またはプロンプトの読み込みが重要な場合にのみ、その費用を支払ってください。
中古グラフィックスカード購入前に12GBから14GBのモデルでテスト実際の読み込みテストがなければ断ってください

具体的な価格を示さずに、判断の例を挙げます。12 GBのカードと7800 XTの差額が、24Bモデルのためにいずれにせよ支出するつもりだった金額に相当するなら、答えは決まります。逆に、8〜12Bのモデルしか使わないなら、追加の4 GBは役に立たず、RX 7700 XTまたはRX 6700 XTで十分です。

#16 GBのVRAMに収まるもの

16 GBのうち、カードを画面出力に使わない場合は、モデルとKVキャッシュに約15 GBを使えると見込んでください。以下に示すQuelLLMカタログの値はQ4の重みの容量です。コンテキスト用のメモリはこれに加算されるため、大きなモデルでは残りの余裕がすぐに制約になります。

7800 XTに収まるモデル(重みのみ)
モデルモデル容量コンテキストの余裕判定
Gemma 4 12B(Q8)約 13 GB≈ 2 GB収まる(コンテキストが短い場合)
gpt-oss 20BのQ4版約 13 GB≈ 2 GBメモリに収まる。コンテキストは短〜中程度
Devstral Small 2 24B (Q4)≈ 14 GB約 1 GBぎりぎり収まるが、コンテキストは非常に短い
Gemma 4 26B-A4B Q4約 16 GBなしあまりにも正確すぎる
Granite 4.1 30B(Q4)≈ 17GBなし収まりません

表のキーワードはマージンです。24BのQ4は収まりますが、コンテキストは数千トークン程度しかありません。長いファイルを含むコード使用の場合、KVキャッシュの量子化により1〜2ギガバイトが解放され、RX 7900 XTのような20 GBのカードで問題を解決できます。16 GBのモデルに関するサイトの表は、カードのブランドに依存せず、量子化のトレードオフを詳細に示しています。

gpt-oss 20B のような混合エキスパート(MoE)モデルについて、少し説明します。各トークンの処理では一部のパラメータだけが働くため、生成が速くなりますが、すべての重みをメモリに保持する必要があります。モデルが16GBに収まるかどうかを決めるのは、アクティブな部分のサイズではなく、全体のサイズです。そのため、上の表では20BのMoEモデルと12Bの密なモデルが並び、どちらも重みのサイズが約13GBとなっています。

#実測の生成速度:Vulkan または ROCm

以下の数値は本サイトの測定値ではありません。llama.cppのリポジトリにおける2つの公開ディスカッション(Vulkan用とROCm用)に由来するもので、いずれも Llama 2 7B を Q4_0 で llama-bench によりテストしています。llama.cppのコミット、システム、ドライバーはシリーズごとに異なるため、2つのシリーズ間の差は参考指標であり、最終的なランキングではありません。

RX 7800 XTでLlama 2 7B Q4_0を実行した場合(llama.cppの公開測定値)
BackendFlash Attention読み込み pp512tg128 生成
Vulkanいいえ2 017,33 t/s118,27 t/s
Vulkanはい2 197,05 t/s124,86 t/s
ROCmいいえ2 151,81 t/s100,94 t/s
ROCmはい2 304,63 t/s95,99 t/s

ここから二つの教訓が得られます。まず、これらのテストでは、このカード上でVulkanはROCmよりも高速に生成します(Flash Attentionなしで、1秒あたり118トークン対101トークン)。一方、ROCmはプロンプトの読み込みがわずかに速いです。次に、Flash AttentionはVulkanを高速化しますが、ROCmでの生成はわずかに遅くなります。会話での応答速度を最優先とする場合は、ROCmが有利だと推測するのではなく、お使いのモデルで両方のバックエンドを試してください。

理論上限に対してどれだけ性能が出ているかを見ると、過度に心配せずに済みます。624GB/sをモデルの重みの容量3.82GBで割ると163トークン/秒となり、このGPUはVulkanでその72%に達しています。この比率をより大きなモデルに適用すれば、おおよその性能を見積もれますが、ご自身の環境で確認する必要があります。

624GB/sの上限の72%と推定(計算値、実測値ではありません)
モデル (Q4)モデル容量理論上の上限概算
Llama 3.1 8B≈ 6 GB≈ 104 tokens/s≈ 75トークン/秒
Gemma 4 12B≈ 7 GB≈ 89トークン/秒≈64トークン/秒
Phi-4 14B≈ 9 GB約69トークン/秒約50トークン/秒
Devstral Small 2 24B≈ 14 GB≈45トークン/秒≈32トークン/秒

#16 GBのNVIDIAカードとの比較:決め手はプロンプトの処理

16 GBのRTXとの比較では、2つの指標がポイントになります。生成速度では、RX 7800 XTはVulkanで測定されたNVIDIA製カードと同程度です。プロンプトの読み込み速度では差が非常に大きく、RTX 4070 Ti Superの3分の1です。この2つ目の数値は、長い文書や長い会話履歴を扱い、最初の単語が出るのを待つ用途では大きく影響します。短いチャットや、扱うコンテキストがそれほど長くないコードアシスタントでは、影響は小さくなります。

RX 7800 XT および 16 GB の RTX が Vulkan で動作 (Llama 2 7B Q4_0、Flash Attention なし)
カードVRAM読み込み pp512tg128 生成
RX 7800 XT16 GB2 017,33 t/s118,27 t/s
RTX 4070 Ti Super16 GB6 099,18 t/s129,45 t/s
RTX 5070 Ti16 GB6 213,63 t/s135,63 t/s

#24Bモデルを16GBのメモリで動作させるための有効な手法

240億パラメータのモデルをQ4で量子化すると、約14 GBの容量を占め、KVキャッシュとシステムに割り当てられるのはわずか1 GB程度しかありません。プロセッサへのオーバーフローによる速度低下を避けるための4つの対策があります。第一に、KVキャッシュはトークンごとに増大するため、コンテキストウィンドウを実際に必要な範囲に制限することです。第二に、KVキャッシュを量子化することで、1 GBから2 GBのメモリを解放できます。第三に、ハードウェアアクセラレーションを有効にしたブラウザやゲームなど、VRAMを確保しているアプリケーションを閉じることです。第四に、プロセッサに統合グラフィックスが存在する場合、ディスプレイをそこに接続することで、AMDカードがディスプレイ表示に使用していたメモリを取り戻せます。

コンテキスト
コンテキストウィンドウは実際に必要なサイズに設定してください。ほとんどの会話では4,000~8,000トークンで十分です。
KVキャッシュ
使用するタスクでの品質を確認しながら、8ビットに量子化してVRAMの空きを増やしてください。
表示
内蔵グラフィックスの映像出力がある場合は、それを使ってください。
確認
読み込み後、ollama psに100 % GPUと表示される必要があります。それ以外の割合は、モデルの一部がGPUメモリからシステムRAMへはみ出していることを示します。

コンテキストウィンドウのガイドでは、メモリ容量の少ないグラフィックスカードで、長い会話履歴がモデル自体と同じくらいのメモリを消費する理由を説明しています。

#セットアップ

  1. 01
    システムの選択
    Linuxでは、AMDがRadeon RX 7000をサポートするのはUbuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1およびRHEL 9.7のみです。WindowsではOllamaはROCm v7またはHIP7をベースにしています。
  2. 02
    Ollama のインストール
    Ollama のドキュメントに従ってください。Linux では ROCm v7 ドライバーが必要です。Vulkan はデフォルトで有効になっており、フォールバックとして使われます。
  3. 03
    メモリに収まるモデルを読み込む
    12BモデルをQ8で、または20BモデルをQ4で試してから24Bモデルに進んでください。ollama psでGPUに完全に読み込まれているかを確認してください。
  4. 04
    VulkanとROCmを比較
    使用するモデルで、両方のバックエンドそれぞれについてFlash Attentionの有効時と無効時にllama-benchを実行し、用途に応じて最も速いものを選んでください。
ターミナル
ollama ps
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#2026年の結論

こんな場合にお買い得
20B から 24B のモデルをターゲットとしており、/prix-gpu-ia における VRAM 1 GB 単価が、近隣の 12 GB カードよりも低い場合です。
以下の条件では不向きです
8~12Bのモデルを使い続ける場合:12GBのカードで十分なので、使わないメモリ容量にお金を払うことになります。
避けるべきこと
中古のカードを購入する際に、12〜14 GBのモデルを読み込むテストをせずに買うこと。

#よくある質問

FAQ
RX 7800 XT:LLMを動かすためのお得な選択肢か?+
200億〜240億パラメータのモデルを使いたい場合は、はい。16GBのVRAMにはQ4で収まりますが、12GBのカードには収まりません。表示価格だけでなく、当サイトの価格ページに掲載されているVRAM 1GBあたりのコストを基準に、お買い得かどうかを判断してください。
2026年においてRX 7800 XTはLLMに適していますか?+
公開測定によると、Vulkan 上で Q4_0 の 7B で 118 トークン/秒を生成し、16 GB で Q4 の 24B をロードできます。NVIDIA に対する弱点はプロンプトの読み取りで、これらの測定では RTX 4070 Ti Super より約 3 倍遅いです。
RX 7800 XTではVulkanとROCmのどちらを使うべきですか?+
llama.cppリポジトリの2つの公開ディスカッションでは、Vulkanの方が生成が速く(Flash Attentionなしで118対101トークン/秒)、ROCmの方がプロンプトの読み込みがわずかに速いです。設定が異なるため、ご自身のモデルで両方をテストし、より速い方を選択してください。
ローカルAIにはRX 7800 XTとRX 7700 XTのどちらを選ぶべきですか?+
7800 XTはVRAMが4GB多く、20〜24Bのモデルを使えるようになります。メモリ帯域幅も432GB/sに対して624GB/sです。8〜14Bのモデルだけを使うなら7700 XTで十分です。それ以外なら、通常は価格差に見合う価値があります。
16GBのRX 7800 XTに収まるモデルはどれですか?+
Gemma 4 12BのQ8とgpt-oss 20BのQ4はそれぞれ約13GB、Devstral Small 2 24BのQ4は約14GBで、短いコンテキストなら収まります。26〜30BのモデルはQ4でも重みのサイズが16GBを超え、全体を収めることはできません。
RX 7800 XT は Ollama でサポートされていますか?+
はい。Ollamaのドキュメントによると、LinuxでもWindowsでもサポートされており、LinuxではROCm v7ドライバーを使用します。AMDもROCmの対応一覧にこのカードを掲載しており、ターゲットはgfx1101ですが、対応OSはUbuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1、RHEL 9.7に限られます。Ollamaでデフォルトで有効になっているVulkanは、代替手段として使えます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。