Radeon RX 7900 GRE(16 GB)で使うLLMはどれ? ?
Radeon RX 7900 GRE(16 GB GDDR6、576 GB/s、260 W)は、RX 7800 XT と同様に Q4 量子化で 200億〜240億パラメータのモデルを動作させますが、生成速度では優位に立っていません。Llama 2 7B に関する公開測定値では、Vulkan 環境下で 116 トークン/秒であり、7800 XT の 118 トークン/秒を下回っています。その優位性は別処にあり、Vulkan 環境下でのプロンプト読み込み速度がわずかに速い点(2,336 トークン/秒に対し 2,017 トークン/秒)にあります。
7900 GREは、計算性能を強化する一方でメモリ性能を抑えた7800 XTのようなカードで、測定結果にもそれが表れています。このガイドでは、16 GBで何ができるのか、直接比較されるRX 7800 XTとRX 9070の2機種とどこが違うのか、そしてどのような用途なら価格に見合う価値があるのかを解説します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16 GB.
なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16 GB →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#2026年にRX 7900 GREでできること
RX 7900 GRE は Q4 から 15GB 未満のデータをすべて読み込みます。Gemma 4 12B は Q8 まで対応し、gpt-oss 20B および Devstral Small 2 24B は短いコンテキストで動作します。生成速度は、576 GB/s の上限に制限され、Vulkan を使用したスコアボードの7Bモデルで約116トークン/秒とされています。これは重要な点です。プロセスフローCPU数は5,120で、7800 XTの3,840に比べて多いですが、読み込み速度は速くなるものの、生成速度は向上しません。メモリ容量や帯域幅は隣接モデルと同等であり、AMDはROCmで正式にこのチップをリストアップしており、Ollama はLinuxおよびWindowsでサポートされています。
- アーキテクチャ
- RDNA 3、Navi 31(RX 7900 XTXと同じチップで、ここでは機能を削減した構成)、80基のコンピュートユニットと5,120基のストリームプロセッサ。
- メモリ
- 16GB GDDR6で256ビットバスを備え、576GB/sの帯域を提供します。
- 消費電力
- カードの消費電力は260Wです。
- 入手可能性
- 当初は中国限定で販売され(2023年7月27日)、2024年2月27日に世界市場で発売されました。発売時の価格は549ドルです。
- 現在の価格
- /prix-gpu-ia をご確認ください:価格は毎週変更されます。
#7900 GRE と 7800 XT の比較:メモリが決定的です
どちらのカードも16 GBのメモリを搭載しています。7800 XTの帯域幅は624 GB/s、7900 GREは576 GB/sで、8%低くなっています。トークンを生成するたびにすべての重みを読み直す生成処理では、帯域幅が性能を左右します。そのため、llama.cppのVulkanに関する議論では、7800 XTがGREをわずかに上回り、Flash Attentionを有効にすると、その差はさらに明確になります。一方、計算性能がものをいうVulkanでのプロンプト読み込みでは、GREが再び優位に立ち、16%高速です。ROCmでは、公開されている2組の測定結果のいずれでも、両方の測定項目で7800 XTが上回っています。
| 測定 | RX 7900 GRE | RX 7800 XT |
|---|---|---|
| Vulkan、プロンプト処理pp512、FAなし | 2 336,31 t/s | 2 017,33 t/s |
| Vulkan、tg128生成、FAなし | 116,11 t/s | 118,27 t/s |
| Vulkan、生成テスト tg128、FA 使用 | 110,50 t/s | 124,86 t/s |
| ROCm、pp512を参照、FAなし | 1 456,98 t/s | 2 151,81 t/s |
| ROCm、生成 tg128、FAなし | 96,07 t/s | 100,94 t/s |
これらの測定データは異なる投稿者によるもので、llama.cppのコミットも異なります。そのため、差はおおまかな目安であり、実験室で条件をそろえた比較ではありません。それでも、GREの生成速度が7800 XTを上回らないという点では一致しています。両方が同じ価格で見つかるなら、会話用途には7800 XTを、長いプロンプトを使う用途にはGREを選んでください。
#16 GBのVRAMに収まるもの
グラフィックカードが画面出力に使われていない場合、モデルとKVキャッシュに約15GBを見込んでください。Q4でのモデル容量はQuelLLMのカタログに基づいており、そこにコンテキスト分が加わります。
| モデル | モデル容量 | コンテキストの余裕 | 判定 |
|---|---|---|---|
| Gemma 4 12BのQ4量子化 | ≈ 7 GB | 約8GB | 十分な余裕があり、長いコンテキストにも対応 |
| Gemma 4 12B(Q8) | 約 13 GB | ≈ 2 GB | 収まる(コンテキストが短い場合) |
| gpt-oss 20BのQ4版 | 約 13 GB | ≈ 2 GB | メモリに収まる。コンテキストは短〜中程度 |
| Devstral Small 2 24B (Q4) | ≈ 14 GB | 約 1 GB | 収まるが余裕は少ない |
| Gemma 4 31BのQ4版 | ≈ 18 GB | なし | メモリに収まりません。20~24GBが必要です |
したがって、16 GBに収まるかどうかの境界は、収まる24Bモデルと収まらない31Bモデルの間にあります。24 GBのカードに移行せずにこの境界を越えるには、20 GBのRX 7900 XTが中間的な余裕を提供します。専用ガイドでは、その利点を詳しく説明しています。メーカーを問わず16 GBのカード全体についてモデルを比較するには、VRAM容量別のページをご覧ください。
#実測スループットと帯域幅の上限
このページの数値は、いずれも当サイトで測定したものではありません。llama.cppリポジトリの公開ディスカッションに掲載された値で、どのディスカッションでもQ4_0のLlama 2 7B(3.56 GiB)とllama-benchを使用しています。プロンプトの読み込み(pp512)は512トークンを取り込む速度を測定し、生成(tg128)は書き出す速度を測定します。RX 7900 GREをVulkanで動かした場合、ディスカッションでは生成速度がFlash Attentionなしで116.11トークン/秒、ありで110.50トークン/秒と報告されています。ROCmでは96.07トークン/秒です。
生成速度の理論上限は、メモリ帯域幅をモデルの重みサイズで割って求められます。ここでは 576 GB/s を 3.82 GB で割るため、約 151 トークン/秒です。このカードは、Flash Attention を使わない Vulkan 環境で、その 77%に達します。この効率をより大きなモデルに当てはめると、おおよその目安が得られます。ただし、これは実測値ではなく、ドライバーや llama.cpp のバージョンが変われば数値も変わります。
| モデル (Q4) | モデル容量 | 理論上の上限 | 概算 |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | 約96トークン/秒 | ≈ 72トークン/秒 |
| Gemma 4 12B | ≈ 7 GB | ≈82トークン/秒 | 約 62トークン/秒 |
| Phi-4 14B | ≈ 9 GB | ≈64トークン/秒 | ≈ 48トークン/秒 |
| Devstral Small 2 24B | ≈ 14 GB | 約41トークン/秒 | ≈ 31トークン/秒 |
#プロンプトの読み取りが実際にはどう影響するか
プロンプトの読み込みは、待機時間(秒)に換算しない限り抽象的に感じられます。計算は単純で、プロンプトのトークン数を pp512 の速度で割るだけです。これは 512 トークンで測定した速度が、より長いプロンプトでも維持されると仮定していますが、コンテキストが大きくなると読み込み速度が低下するため、これはおおむね成り立つ仮定にすぎません。したがって、以下の時間は、約 4,000 トークン(約 10 ページ)の文書に対する目安です。
| カードとバックエンド | pp512の速度 | 最初の単語までの待ち時間 |
|---|---|---|
| RX 7900 GRE、Vulkan | 2 336 t/s | ≈ 1,7 s |
| RX 7800 XT、Vulkan | 2 017 t/s | ≈ 2,0 s |
| RX 7900 GRE、ROCm | 1 457 t/s | ≈ 2,7 s |
| RX 9070、Vulkan | 3 164 t/s | ≈ 1,3 s |
これらのカード間の差は、短いドキュメントに対しては秒単位の分数で測られます。コード全体やPDFの大量データ、またはエージェントの各リクエストが大きなコンテキストを再読み込みする場合に、数十万トークンに達すると、その感度が高まります。低量使用の場合には、VRAMのGBあたりのコストに基づいてカードを選択してください。その基準ではなく、コストに基づいて選択してください。
#RX 9070との比較:同じVRAM容量、RDNA 4
RX 9070は、現行ラインナップにあるもう一つの16 GBカードです。メモリ帯域幅は576 GB/sに対して640 GB/s、TDPは260 Wに対して220 Wで、ストリームプロセッサは3,584基です。Vulkanでは、生成速度が119.71トークン/秒、プロンプト処理速度が3,164トークン/秒です。プロンプト処理は35%速く、生成速度はほぼ同じです。実用上の違いは別のところにあります。この2世代ではROCm、Ollama、Windowsの動作が異なり、RX 9070のページで詳しく説明しています。具体例として、OllamaのドキュメントではRX 9070がLinuxのROCm対応カード一覧に掲載されていますが、WindowsのROCm対応カード一覧には掲載されておらず、WindowsではVulkanを使います。一方、RX 7900 GREは両OSのROCm対応カード一覧に掲載されています。WindowsでROCmにこだわるならGREが有利ですが、Vulkanでもよければ、この違いはなくなります。
| 基準 | RX 7900 GRE | RX 9070 |
|---|---|---|
| 帯域幅 | 576GB/s | 640 GB/s |
| GPUの性能 | 260 W | 220 W |
| 読み込み pp512 | 2 336,31 t/s | 3 164,10 t/s |
| tg128 生成 | 116,11 t/s | 119,71 t/s |
#セットアップ
- 01システムの選択AMDはRadeon RX 7000シリーズをUbuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1およびRHEL 9.7でのみサポートしています。WindowsではOllamaはROCm v7またはHIP7を用います。
- 02Ollama のインストールLinuxではROCm v7ドライバーが必要です。Vulkanはデフォルトで有効になっており、代替手段として使え、このカードでも良好な結果が得られます。
- 03メモリに収まるモデルを読み込む短いコンテキストで、まず12Bまたは20Bモデルを試し、その後24Bモデルを試してください。ollama psで、モデル全体がGPUにロードされていることを確認してください。
- 042つのバックエンドを比較するVulkanで、次にROCmで、Flash Attentionを有効にした場合と無効にした場合の両方でllama-benchを実行してください。このカードでは、公開されている測定結果で、Vulkan使用時にFlash Attentionが生成速度を低下させています。
#どのような用途で7900 GREを選ぶべきか
このカードを特徴づけるのは、演算性能とメモリのバランスです。16 GBのメモリ容量と576 GB/sのメモリ帯域幅に対して、高い演算性能を備えています。最初の単語が表示されるまでの時間が、文章の生成速度と同じくらい重要な場合に適しています。例えば、長い文書を読み込むアシスタントや、プロンプトが数千トークンになるRAGの処理フローです。短いやり取りのチャットでは、この利点はなくなり、より広いメモリ帯域幅を持つ7800 XTが同等以上の性能を発揮します。
| 用途 | 推奨されるカード | 理由 |
|---|---|---|
| チャット、テキスト生成 | RX 7800 XTまたはRX 9070 | 帯域幅がより高く、生成速度は同等以上 |
| RAG、長文処理 | RX 9070、その後は RX 7900 GRE | プロンプトの読み込みが速くなる |
| 30〜32Bモデル | 3つとも該当しません | 20〜24GBのVRAMが必要です。 |
| 限られた予算で中古を選ぶ場合 | 三つの中で最も安い | /prix-gpu-ia の VRAM 1GB 当たりのコストは |
16GBの3枚をまとめると、7800 XTは会話用途で手軽に選べるカード、9070は読み取りが最も速く、消費電力220Wで最も省電力なカードです。7900 GREは、価格がほかの2枚を下回ったときに狙い目となるカードです。いずれも、より多くのメモリを必要とする300億パラメータのモデルを動かせるようにはなりません。
#2026年の結論
- 適切な選択肢
- GREを7800 XT以下の価格で見つけ、かつプロンプトが長い場合
- あまり適していない選択
- 7800 XTより高価で、用途が主に会話なら、生成では使われない演算性能にお金を払うことになります。
- 購入前の確認事項
- Linuxではrocminfo、Windowsではタスクマネージャーを使い、システムが16 GBのVRAMと正しいグラフィックカードのモデルを認識していることを確認してください。
- ローカルAI向けグラフィックカードの価格(週2回調査)
- Ollamaドキュメント:対応AMDカード
- ROCm の GPU 互換性、AMD ドキュメント
- llama.cpp リポジトリの Vulkan スコアボード
#よくある質問
RX 7900 GREはローカルLLMに適していますか?+
ローカルAIにはRX 7900 GREとRX 7800 XTのどちらを選ぶべきですか?+
16GBのRX 7900 GREで動作可能なモデルはどれですか?+
RX 7900 GREはOllamaと互換性がありますか?+
RX 7900 GREでVulkanかROCmか?+
RX 7900 GREでは、どのような場合に性能や容量が足りなくなりますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。