Radeon RX 7900 XT(20 GB)で使うLLMはどれ? ?
Radeon RX 7900 XT(20 GB GDDR6、800 GB/s、315 W)は、Q4量子化で240〜260億パラメータのモデルを快適なコンテキスト長でオーバーフローなしにロードでき、短いコンテキスト長であれば30Bも動作します。速度ではなくメモリ容量がその特徴です。Llama 2 7Bでは、公開ベンチマークによるとVulkan環境で1秒あたり123トークンであり、16 GBのRX 7800 XTをわずかに上回る程度で、RX 7900 XTXとは大きく差があります。
VRAM 20GBは一般向けカードでは希少な容量であり、実行可能なモデルの範囲を大きく変えます。これは、24Bモデルが窮屈に動作する状態と、十分なコンテキストを確保して24Bモデルを動作させる状態の差です。本ガイドでは、この20GBが実際にもたらす効果と、800 GB/sの帯域幅が期待させる性能の差を整理し、公開されている測定値を引用しながら、このカードに関する誤解を修正します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16 GB.
なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16 GB →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#2026年に RX 7900 XT でできること
RX 7900 XTは、コンテキストを制限せずに240億〜260億パラメータのモデルを使いたい方に向いています。20 GBのVRAMには、Devstral Small 2 24B(Q4で約14 GB)を6 GBの余裕を残して収められます。16 GBのカードでは余裕は1 GBです。また、MoEモデルのGemma 4 26B-A4B(約16 GB)も4 GBの余裕を残して収められます。一方、速度面では、800 GB/sの帯域幅に期待する方には物足りない結果です。Vulkanでの基準の7Bモデルでは毎秒123.18トークンで、帯域幅が22%低いRX 7800 XTは毎秒118.27トークンです。AMDはこのカードをROCmの公式対応リストに掲載しており、OllamaもLinuxとWindowsで対応しています。
- アーキテクチャ
- RDNA 3、Navi 31、GCD 1つとMCD 5つ、2022年12月13日発売。
- 計算
- 5,376基のストリームプロセッサ、84基の演算ユニット。
- メモリ
- 20GB GDDR6、バス幅320ビット、800GB/s
- 消費電力
- グラフィックカードの消費電力は315 Wです。お使いのモデルのメーカーが推奨する電源を確認してください。
- 価格
- ここでは記載されていません:/prix-gpu-ia を参照ください
#20GBのメモリの配分
グラフィックカードを画面出力に使わない場合、モデルとそのKVキャッシュに使える容量は約19 GBと見込んでください。表では、この容量からQuelLLMのカタログに掲載されているQ4のモデル容量を差し引き、コンテキストに使える余裕を示しています。判断の決め手は、この余裕です。モデルが「収まる」としても、残りが1 GBしかなければ、コンテキストは数千トークン程度に限られます。
| モデル | モデル容量 | コンテキストの余裕 | 判定 |
|---|---|---|---|
| gpt-oss 20B | 約 13 GB | ≈ 6 GB | 十分な余裕があり、長いコンテキストにも対応 |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 5 GB | 快適に動作し、長いコンテキストも利用可能 |
| Gemma 4 26B-A4B (MoE) | 約 16 GB | ≈ 3 GB | メモリに収まり、中程度のコンテキストを利用可能 |
| Granite 4.1 30B | ≈ 17GB | ≈ 2 GB | 収まる(コンテキストが短い場合) |
| Gemma 4 31B | ≈ 18 GB | 約 1 GB | メモリの余裕が少なく、コンテキストは非常に短い |
エキスパートモデルのケースには注記が必要です。MoEでは、各トークンごとにパラメータの一部のみが動作するため、同サイズのデンスモデルよりも生成が速くなりますが、重みの全体がメモリに収まる必要があります。26B-A4Bは、20 GBが差を生むタイプのモデルです。コンテキストを含む場合、16 GBでは大きすぎますが、20 GBでは快適に動作します。Qwen3.6 35B-A3Bファミリーのようなさらに大きなモデルについては、推測するのではなく、専用ガイドを参照してください。正確なサイズは選択した量子化に依存します。
マージンをコンテキストトークン数に変換するには、トークンあたりのKVキャッシュのコストが必要です。これはモデルのアーキテクチャ(層数、アテンションヘッド数、キャッシュの精度)に依存します。したがって、ギガバイトあたりのトークン数に関する普遍的なルールは存在しません。信頼できる方法は測定です。モデルを modest なコンテキストでロードし、rocm-smi で使用されているVRAMを記録し、ウィンドウを拡大して、もう一度繰り返します。サイトのVRAM計算ツールはカタログ内のモデルについてこの推定を自動化し、KVキャッシュの8ビット量子化はコンテキストの割合をほぼ半分にします。
#実測スループット:帯域幅だけで全てが決まるわけではない
数値は、Llama 2 7BのQ4_0とllama-benchを使用した、llama.cppリポジトリの公開ディスカッションから引用したものです。本サイトで測定した値ではありません。Vulkanでは、RX 7900 XTは512トークンのプロンプトを2,941.58トークン/秒で読み取り、123.18トークン/秒で生成します。Flash Attentionを使用すると、それぞれ2,701.13トークン/秒と120.62トークン/秒になります。ROCmについては、ディスカッションに読み取り3,098.38トークン/秒、生成116.15トークン/秒と記載されています。両系列は同様の傾向を示しており、生成速度は約120トークン/秒で頭打ちになります。
帯域幅から求めた理論上限は、800 GB/sをモデルの重みの容量3.82 GBで割った約209トークン/秒です。このカードはVulkanでは、その59%にしか達していません。これは、この一連の測定に含まれるAMDカードの中で最も低い効率です(RX 6700 XTは83%、RX 7900 GREは77%、RX 7800 XTは72%)。考えられる理由は、70億パラメータのモデルでは、大型チップのメモリ帯域幅を使い切るには小さすぎることです。より大きなモデルでは効率の向上が期待できますが、これらの測定シリーズにはそれを裏付ける結果がなく、24Bモデルの生成速度を提示するのは慎重さを欠きます。
| Backend | Flash Attention | 読み込み pp512 | tg128 生成 |
|---|---|---|---|
| Vulkan | いいえ | 2 941,58 t/s | 123,18 t/s |
| Vulkan | はい | 2 701,13 t/s | 120,62 t/s |
| ROCm | いいえ | 3 098,38 t/s | 116,15 t/s |
大規模モデルでのおおよその値を見積もるには、測定された効率59%を理論上限に適用すると、控えめな目安が得られます。Q4で14 GBの24Bモデルなら、800を14で割った約57トークン/秒が理論上限となり、効率を適用すると約34トークン/秒になります。これは計算値であり、実測値ではありません。大規模モデルで効率がより高ければ、実際の生成速度もこれを上回ります。
#RX 7900 XTXとの比較:実際の差は、一般に言われているよりもはるかに大きい
7900 XTは7900 XTXより「10〜12%遅い」という記述をよく見かけます。しかし、公開されている測定値は別の結果を示しています。Vulkanで基準となる7Bモデルを動かすと、XTXの生成速度は毎秒182.63トークン、XTは毎秒123.18トークンで、XTXのほうが48%高速です。ストリームプロセッサ数の比率(6,144対5,376)だけでは、この差を説明できません。帯域幅とチップが差を広げています。XTの強みとして残るのは、導入価格です。20 GBあれば、24〜26Bモデルの要件の大部分を満たせます。
| 測定 | RX 7900 XT | RX 7900 XTX |
|---|---|---|
| VRAM | 20 GB | 24 GB |
| Vulkan、テキスト生成 tg128 | 123,18 t/s | 182,63 t/s |
| Vulkan、入力処理(pp512) | 2 941,58 t/s | 3 726,99 t/s |
この修正によって、選択の判断が変わります。生成速度を重視するなら、48%の差は追加の4 GBのVRAMよりも重要になります。一方、主にコンテキスト用の容量を求めるなら、24BモデルではXTでXTXの利点の大部分を得られます。しかし、30B以上のモデルでは、XTXの24 GBによってコンテキストに関する妥協が不要になり、そこで価格差に見合う価値が生まれます。
#RTX 4070 Ti Superと比較すると、メモリは多いが速度は低い
RTX 4070 Ti Superのメモリ容量は16 GBで、4 GB少なくなっています。Vulkan環境で基準となる7Bモデルを実行すると、生成速度は毎秒129.45トークンでRX 7900 XTより5%速く、プロンプトの読み取り速度は毎秒6,099トークンで2倍です。したがって、XTは時に言われるように「より速い」のではなく、メモリ容量がより大きいのです。その強みは容量にあり、コンテキスト用のメモリも確保しながら24B〜26Bのモデルを実行できます。
| 基準 | RX 7900 XT | RTX 4070 Ti Super |
|---|---|---|
| VRAM | 20 GB | 16 GB |
| 読み込み pp512 | 2 941,58 t/s | 6 099,18 t/s |
| tg128 生成 | 123,18 t/s | 129,45 t/s |
#モデルが20GBを超えたとき
モデルが大きすぎてもエラーにはなりません。Ollamaとllama.cppは、できるだけ多くのレイヤーをGPUに配置し、残りをCPUに任せます。llama.cppでは、-nglオプションでGPUに送るレイヤー数を指定します。上記の測定で使われた値100は「すべて」を意味します。この値を下げるとVRAMを空けられますが、生成は遅くなります。各トークンの処理で、GDDR6よりもはるかに遅いシステムメモリを経由する必要があるためです。実用上の目安として、ollama psに100 % GPUと表示されている間は高速に動作します。CPU側にも割合が表示されるようになると、速度は段階的に低下します。
#20GB、16GB、または24GB:どのサイズを選ぶべきか
| 想定用途 | 16 GB | 20GB(RX 7900 XT) | 24 GB |
|---|---|---|---|
| 8Bから14Bのモデルとのチャット | 十分 | 不要 | 不要 |
| コードアシスタント 24B、長いコンテキスト | 余裕がない | 快適 | 快適 |
| 中程度のコンテキスト長で使う26BのMoE | あまりにも正確すぎる | 十分 | 十分 |
| 30〜35Bのパラメータを持つ長コンテキストモデル | 不可能 | ぎりぎり | 必須 |
原則は、使うモデルのうち最も大きいものに必要な容量にお金を払うことです。いつか使うかもしれない容量に払うのではありません。コンテキストも含めて24Bモデルを使うことが目標なら、20 GBが快適に使える最初の段階です。それを超える容量は、追加する1 GBごとに、必要とする具体的なモデルがあるかを確認すべきです。
#セットアップ
- 01システムの選択AMDはRadeon RX 7000シリーズをUbuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1およびRHEL 9.7でのみサポートしています。Windowsでは、OllamaはROCm v7またはHIP7のスタックを使用し、Vulkanをフォールバックとして利用します。
- 02ドライバーのインストールとOllamaのセットアップLinuxでは、OllamaはROCm v7ドライバーを必要とします。amdgpu-installツールでインストールし、その後Ollamaをインストールしてください。
- 0324BモデルをロードするQ4_K_Mで量子化されたDevstral Small 2 24Bを取得して起動し、ollama psでモデルが100%GPU上で動作していることを確認してください。
- 04コンテキストを調整するVRAM使用量を監視しながら、コンテキストウィンドウを段階的に広げてください。目標は、合計使用量を19 GB未満に保つことです。
- 05VulkanとROCmを比較使用するモデルでllama-benchを使って測定してください。公開されている測定結果では、このカードでの両バックエンドの性能は近い値になっています。
#2026年の結論
- 良い選択
- 24Bから26Bのモデルをコンテキスト付きで実行したい場合、かつ/prix-gpu-iaのVRAM 1GBあたりのコストが有利な場合に適しています。
- いまひとつの選択肢
- 速度を最優先する場合:生成速度は16 GBのカードに近い水準で頭打ちになり、RTX 4070 Ti Superはプロンプトを2倍の速さで読み取ります。
- 不十分な選択
- 30B から 35B のモデルで長いコンテキストを使用する場合、24 GB が必要になります。
- ローカルAI向けグラフィックカードの価格(週2回調査)
- Ollamaドキュメント:対応AMDカード
- ROCm の GPU 互換性、AMD ドキュメント
- llama.cpp リポジトリの Vulkan スコアボード
#よくある質問
RX 7900 XTはローカルLLMに適していますか?+
ローカルAI用にRX 7900 XTかRX 7900 XTXどちらが適していますか?+
30Bモデルには20GBのVRAMは十分ですか?+
RX 7900 XTのトークン/秒はどれくらいですか?+
LLM用にはRX 7900 XTとRTX 4070 Ti Superのどちらを選ぶべきですか?+
RX 7900 XTはWindows版Ollamaで動作しますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。