中級 11 分Radeon RX 7000

Radeon RX 7900 XT(20 GB)で使うLLMはどれ? ?

端的な回答

Radeon RX 7900 XT(20 GB GDDR6、800 GB/s、315 W)は、Q4量子化で240〜260億パラメータのモデルを快適なコンテキスト長でオーバーフローなしにロードでき、短いコンテキスト長であれば30Bも動作します。速度ではなくメモリ容量がその特徴です。Llama 2 7Bでは、公開ベンチマークによるとVulkan環境で1秒あたり123トークンであり、16 GBのRX 7800 XTをわずかに上回る程度で、RX 7900 XTXとは大きく差があります。

VRAM 20GBは一般向けカードでは希少な容量であり、実行可能なモデルの範囲を大きく変えます。これは、24Bモデルが窮屈に動作する状態と、十分なコンテキストを確保して24Bモデルを動作させる状態の差です。本ガイドでは、この20GBが実際にもたらす効果と、800 GB/sの帯域幅が期待させる性能の差を整理し、公開されている測定値を引用しながら、このカードに関する誤解を修正します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16 GB.

なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16 GB →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#2026年に RX 7900 XT でできること

RX 7900 XTは、コンテキストを制限せずに240億〜260億パラメータのモデルを使いたい方に向いています。20 GBのVRAMには、Devstral Small 2 24B(Q4で約14 GB)を6 GBの余裕を残して収められます。16 GBのカードでは余裕は1 GBです。また、MoEモデルのGemma 4 26B-A4B(約16 GB)も4 GBの余裕を残して収められます。一方、速度面では、800 GB/sの帯域幅に期待する方には物足りない結果です。Vulkanでの基準の7Bモデルでは毎秒123.18トークンで、帯域幅が22%低いRX 7800 XTは毎秒118.27トークンです。AMDはこのカードをROCmの公式対応リストに掲載しており、OllamaもLinuxとWindowsで対応しています。

アーキテクチャ
RDNA 3、Navi 31、GCD 1つとMCD 5つ、2022年12月13日発売。
計算
5,376基のストリームプロセッサ、84基の演算ユニット。
メモリ
20GB GDDR6、バス幅320ビット、800GB/s
消費電力
グラフィックカードの消費電力は315 Wです。お使いのモデルのメーカーが推奨する電源を確認してください。
価格
ここでは記載されていません:/prix-gpu-ia を参照ください

#20GBのメモリの配分

グラフィックカードを画面出力に使わない場合、モデルとそのKVキャッシュに使える容量は約19 GBと見込んでください。表では、この容量からQuelLLMのカタログに掲載されているQ4のモデル容量を差し引き、コンテキストに使える余裕を示しています。判断の決め手は、この余裕です。モデルが「収まる」としても、残りが1 GBしかなければ、コンテキストは数千トークン程度に限られます。

7900 XTにQ4で収まるモデル(重みのみ、メモリ予算19 GB)
モデルモデル容量コンテキストの余裕判定
gpt-oss 20B約 13 GB≈ 6 GB十分な余裕があり、長いコンテキストにも対応
Devstral Small 2 24B≈ 14 GB≈ 5 GB快適に動作し、長いコンテキストも利用可能
Gemma 4 26B-A4B (MoE)約 16 GB≈ 3 GBメモリに収まり、中程度のコンテキストを利用可能
Granite 4.1 30B≈ 17GB≈ 2 GB収まる(コンテキストが短い場合)
Gemma 4 31B≈ 18 GB約 1 GBメモリの余裕が少なく、コンテキストは非常に短い

エキスパートモデルのケースには注記が必要です。MoEでは、各トークンごとにパラメータの一部のみが動作するため、同サイズのデンスモデルよりも生成が速くなりますが、重みの全体がメモリに収まる必要があります。26B-A4Bは、20 GBが差を生むタイプのモデルです。コンテキストを含む場合、16 GBでは大きすぎますが、20 GBでは快適に動作します。Qwen3.6 35B-A3Bファミリーのようなさらに大きなモデルについては、推測するのではなく、専用ガイドを参照してください。正確なサイズは選択した量子化に依存します。

マージンをコンテキストトークン数に変換するには、トークンあたりのKVキャッシュのコストが必要です。これはモデルのアーキテクチャ(層数、アテンションヘッド数、キャッシュの精度)に依存します。したがって、ギガバイトあたりのトークン数に関する普遍的なルールは存在しません。信頼できる方法は測定です。モデルを modest なコンテキストでロードし、rocm-smi で使用されているVRAMを記録し、ウィンドウを拡大して、もう一度繰り返します。サイトのVRAM計算ツールはカタログ内のモデルについてこの推定を自動化し、KVキャッシュの8ビット量子化はコンテキストの割合をほぼ半分にします。

#実測スループット:帯域幅だけで全てが決まるわけではない

数値は、Llama 2 7BのQ4_0とllama-benchを使用した、llama.cppリポジトリの公開ディスカッションから引用したものです。本サイトで測定した値ではありません。Vulkanでは、RX 7900 XTは512トークンのプロンプトを2,941.58トークン/秒で読み取り、123.18トークン/秒で生成します。Flash Attentionを使用すると、それぞれ2,701.13トークン/秒と120.62トークン/秒になります。ROCmについては、ディスカッションに読み取り3,098.38トークン/秒、生成116.15トークン/秒と記載されています。両系列は同様の傾向を示しており、生成速度は約120トークン/秒で頭打ちになります。

帯域幅から求めた理論上限は、800 GB/sをモデルの重みの容量3.82 GBで割った約209トークン/秒です。このカードはVulkanでは、その59%にしか達していません。これは、この一連の測定に含まれるAMDカードの中で最も低い効率です(RX 6700 XTは83%、RX 7900 GREは77%、RX 7800 XTは72%)。考えられる理由は、70億パラメータのモデルでは、大型チップのメモリ帯域幅を使い切るには小さすぎることです。より大きなモデルでは効率の向上が期待できますが、これらの測定シリーズにはそれを裏付ける結果がなく、24Bモデルの生成速度を提示するのは慎重さを欠きます。

RX 7900 XTでのLlama 2 7B Q4_0の測定結果(llama.cppの公開測定値)
BackendFlash Attention読み込み pp512tg128 生成
Vulkanいいえ2 941,58 t/s123,18 t/s
Vulkanはい2 701,13 t/s120,62 t/s
ROCmいいえ3 098,38 t/s116,15 t/s

大規模モデルでのおおよその値を見積もるには、測定された効率59%を理論上限に適用すると、控えめな目安が得られます。Q4で14 GBの24Bモデルなら、800を14で割った約57トークン/秒が理論上限となり、効率を適用すると約34トークン/秒になります。これは計算値であり、実測値ではありません。大規模モデルで効率がより高ければ、実際の生成速度もこれを上回ります。

#RX 7900 XTXとの比較:実際の差は、一般に言われているよりもはるかに大きい

7900 XTは7900 XTXより「10〜12%遅い」という記述をよく見かけます。しかし、公開されている測定値は別の結果を示しています。Vulkanで基準となる7Bモデルを動かすと、XTXの生成速度は毎秒182.63トークン、XTは毎秒123.18トークンで、XTXのほうが48%高速です。ストリームプロセッサ数の比率(6,144対5,376)だけでは、この差を説明できません。帯域幅とチップが差を広げています。XTの強みとして残るのは、導入価格です。20 GBあれば、24〜26Bモデルの要件の大部分を満たせます。

RX 7900 XTおよびRX 7900 XTX(Llama 2 7B Q4_0、公開されている測定値)
測定RX 7900 XTRX 7900 XTX
VRAM20 GB24 GB
Vulkan、テキスト生成 tg128123,18 t/s182,63 t/s
Vulkan、入力処理(pp512)2 941,58 t/s3 726,99 t/s

この修正によって、選択の判断が変わります。生成速度を重視するなら、48%の差は追加の4 GBのVRAMよりも重要になります。一方、主にコンテキスト用の容量を求めるなら、24BモデルではXTでXTXの利点の大部分を得られます。しかし、30B以上のモデルでは、XTXの24 GBによってコンテキストに関する妥協が不要になり、そこで価格差に見合う価値が生まれます。

#RTX 4070 Ti Superと比較すると、メモリは多いが速度は低い

RTX 4070 Ti Superのメモリ容量は16 GBで、4 GB少なくなっています。Vulkan環境で基準となる7Bモデルを実行すると、生成速度は毎秒129.45トークンでRX 7900 XTより5%速く、プロンプトの読み取り速度は毎秒6,099トークンで2倍です。したがって、XTは時に言われるように「より速い」のではなく、メモリ容量がより大きいのです。その強みは容量にあり、コンテキスト用のメモリも確保しながら24B〜26Bのモデルを実行できます。

Vulkan使用時のRX 7900 XTとRTX 4070 Ti Super(Llama 2 7B Q4_0、FAなし)
基準RX 7900 XTRTX 4070 Ti Super
VRAM20 GB16 GB
読み込み pp5122 941,58 t/s6 099,18 t/s
tg128 生成123,18 t/s129,45 t/s

#モデルが20GBを超えたとき

モデルが大きすぎてもエラーにはなりません。Ollamaとllama.cppは、できるだけ多くのレイヤーをGPUに配置し、残りをCPUに任せます。llama.cppでは、-nglオプションでGPUに送るレイヤー数を指定します。上記の測定で使われた値100は「すべて」を意味します。この値を下げるとVRAMを空けられますが、生成は遅くなります。各トークンの処理で、GDDR6よりもはるかに遅いシステムメモリを経由する必要があるためです。実用上の目安として、ollama psに100 % GPUと表示されている間は高速に動作します。CPU側にも割合が表示されるようになると、速度は段階的に低下します。

#20GB、16GB、または24GB:どのサイズを選ぶべきか

用途に応じたメモリ容量
想定用途16 GB20GB(RX 7900 XT)24 GB
8Bから14Bのモデルとのチャット十分不要不要
コードアシスタント 24B、長いコンテキスト余裕がない快適快適
中程度のコンテキスト長で使う26BのMoEあまりにも正確すぎる十分十分
30〜35Bのパラメータを持つ長コンテキストモデル不可能ぎりぎり必須

原則は、使うモデルのうち最も大きいものに必要な容量にお金を払うことです。いつか使うかもしれない容量に払うのではありません。コンテキストも含めて24Bモデルを使うことが目標なら、20 GBが快適に使える最初の段階です。それを超える容量は、追加する1 GBごとに、必要とする具体的なモデルがあるかを確認すべきです。

#セットアップ

  1. 01
    システムの選択
    AMDはRadeon RX 7000シリーズをUbuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1およびRHEL 9.7でのみサポートしています。Windowsでは、OllamaはROCm v7またはHIP7のスタックを使用し、Vulkanをフォールバックとして利用します。
  2. 02
    ドライバーのインストールとOllamaのセットアップ
    Linuxでは、OllamaはROCm v7ドライバーを必要とします。amdgpu-installツールでインストールし、その後Ollamaをインストールしてください。
  3. 03
    24Bモデルをロードする
    Q4_K_Mで量子化されたDevstral Small 2 24Bを取得して起動し、ollama psでモデルが100%GPU上で動作していることを確認してください。
  4. 04
    コンテキストを調整する
    VRAM使用量を監視しながら、コンテキストウィンドウを段階的に広げてください。目標は、合計使用量を19 GB未満に保つことです。
  5. 05
    VulkanとROCmを比較
    使用するモデルでllama-benchを使って測定してください。公開されている測定結果では、このカードでの両バックエンドの性能は近い値になっています。
ターミナル
ollama ps
rocm-smi --showmeminfo vram
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#2026年の結論

良い選択
24Bから26Bのモデルをコンテキスト付きで実行したい場合、かつ/prix-gpu-iaのVRAM 1GBあたりのコストが有利な場合に適しています。
いまひとつの選択肢
速度を最優先する場合:生成速度は16 GBのカードに近い水準で頭打ちになり、RTX 4070 Ti Superはプロンプトを2倍の速さで読み取ります。
不十分な選択
30B から 35B のモデルで長いコンテキストを使用する場合、24 GB が必要になります。

#よくある質問

FAQ
RX 7900 XTはローカルLLMに適していますか?+
はい、メモリ容量の点で適しています。20GBなら、Q4の24Bモデルを読み込み、十分なコンテキスト長を確保できますが、16GBではそれがぎりぎりです。VulkanでQ4_0の7Bモデルを動かした場合の生成速度は約123トークン/秒で、RX 7800 XTに近い水準です。
ローカルAI用にRX 7900 XTかRX 7900 XTXどちらが適していますか?+
XTXは24 GBのメモリを備え、Vulkan環境で基準となる7Bモデルを実行した場合、生成速度が48%速くなります(182.63トークン/秒に対し123.18トークン/秒)。XTでも24〜26Bのモデルには十分で、価格も安くなります。サイト内の専用ページで現在の価格を比較してください。
30Bモデルには20GBのVRAMは十分ですか?+
Granite 4.1 30Bのような30Bモデルは、Q4で約17 GBです。短いコンテキストなら収まり、約2 GBの余裕があります。長いコンテキストを使う場合や、Qwen3.6 35B-A3Bのような35Bモデルを使う場合は、24 GBが必要になります。このモデル専用のガイドを参照してください。
RX 7900 XTのトークン/秒はどれくらいですか?+
Q4_0のLlama 2 7Bについて、llama.cppリポジトリの公開ディスカッションでは、生成速度がVulkanで123.18トークン/秒、ROCmで116.15トークン/秒と報告されています。Q4の24Bモデルでは、計算上は約34トークン/秒です。これは推定値なので、ご自身の環境で測定してください。
LLM用にはRX 7900 XTとRTX 4070 Ti Superのどちらを選ぶべきですか?+
容量を重視するならXTです(20GB対16GB)。24B〜26Bのモデルを、コンテキスト用のメモリも含めて読み込めます。RTX 4070 Ti Superは、基準となる7Bモデルでの生成が5%速く、プロンプトの読み込みは2倍速く、CUDAのエコシステムも利用できます。どちらを選ぶかは、使いたいモデルによって決まります。
RX 7900 XTはWindows版Ollamaで動作しますか?+
はい。Ollamaのドキュメントには、このカードがWindowsではROCm v7またはHIP7のソフトウェアスタックで、LinuxではROCm v7ドライバーで使えると記載されています。AMDも、ROCmの対応カードとして、ターゲットgfx1100、対応OSはUbuntu 24.04.4、22.04.5、RHEL 10.1、RHEL 9.7と記載しています。代替手段としてVulkanも利用できます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。