中級 11 分Radeon RX 7000

Radeon RX 7900 GRE(16 GB)で使うLLMはどれ? ?

端的な回答

Radeon RX 7900 GRE(16 GB GDDR6、576 GB/s、260 W)は、RX 7800 XT と同様に Q4 量子化で 200億〜240億パラメータのモデルを動作させますが、生成速度では優位に立っていません。Llama 2 7B に関する公開測定値では、Vulkan 環境下で 116 トークン/秒であり、7800 XT の 118 トークン/秒を下回っています。その優位性は別処にあり、Vulkan 環境下でのプロンプト読み込み速度がわずかに速い点(2,336 トークン/秒に対し 2,017 トークン/秒)にあります。

7900 GREは、計算性能を強化する一方でメモリ性能を抑えた7800 XTのようなカードで、測定結果にもそれが表れています。このガイドでは、16 GBで何ができるのか、直接比較されるRX 7800 XTとRX 9070の2機種とどこが違うのか、そしてどのような用途なら価格に見合う価値があるのかを解説します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16 GB.

なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16 GB →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#2026年にRX 7900 GREでできること

RX 7900 GRE は Q4 から 15GB 未満のデータをすべて読み込みます。Gemma 4 12B は Q8 まで対応し、gpt-oss 20B および Devstral Small 2 24B は短いコンテキストで動作します。生成速度は、576 GB/s の上限に制限され、Vulkan を使用したスコアボードの7Bモデルで約116トークン/秒とされています。これは重要な点です。プロセスフローCPU数は5,120で、7800 XTの3,840に比べて多いですが、読み込み速度は速くなるものの、生成速度は向上しません。メモリ容量や帯域幅は隣接モデルと同等であり、AMDはROCmで正式にこのチップをリストアップしており、Ollama はLinuxおよびWindowsでサポートされています。

アーキテクチャ
RDNA 3、Navi 31(RX 7900 XTXと同じチップで、ここでは機能を削減した構成)、80基のコンピュートユニットと5,120基のストリームプロセッサ。
メモリ
16GB GDDR6で256ビットバスを備え、576GB/sの帯域を提供します。
消費電力
カードの消費電力は260Wです。
入手可能性
当初は中国限定で販売され(2023年7月27日)、2024年2月27日に世界市場で発売されました。発売時の価格は549ドルです。
現在の価格
/prix-gpu-ia をご確認ください:価格は毎週変更されます。

#7900 GRE と 7800 XT の比較:メモリが決定的です

どちらのカードも16 GBのメモリを搭載しています。7800 XTの帯域幅は624 GB/s、7900 GREは576 GB/sで、8%低くなっています。トークンを生成するたびにすべての重みを読み直す生成処理では、帯域幅が性能を左右します。そのため、llama.cppのVulkanに関する議論では、7800 XTがGREをわずかに上回り、Flash Attentionを有効にすると、その差はさらに明確になります。一方、計算性能がものをいうVulkanでのプロンプト読み込みでは、GREが再び優位に立ち、16%高速です。ROCmでは、公開されている2組の測定結果のいずれでも、両方の測定項目で7800 XTが上回っています。

RX 7900 GREとRX 7800 XT(Llama 2 7B Q4_0、llama.cppの公開測定値)
測定RX 7900 GRERX 7800 XT
Vulkan、プロンプト処理pp512、FAなし2 336,31 t/s2 017,33 t/s
Vulkan、tg128生成、FAなし116,11 t/s118,27 t/s
Vulkan、生成テスト tg128、FA 使用110,50 t/s124,86 t/s
ROCm、pp512を参照、FAなし1 456,98 t/s2 151,81 t/s
ROCm、生成 tg128、FAなし96,07 t/s100,94 t/s

これらの測定データは異なる投稿者によるもので、llama.cppのコミットも異なります。そのため、差はおおまかな目安であり、実験室で条件をそろえた比較ではありません。それでも、GREの生成速度が7800 XTを上回らないという点では一致しています。両方が同じ価格で見つかるなら、会話用途には7800 XTを、長いプロンプトを使う用途にはGREを選んでください。

#16 GBのVRAMに収まるもの

グラフィックカードが画面出力に使われていない場合、モデルとKVキャッシュに約15GBを見込んでください。Q4でのモデル容量はQuelLLMのカタログに基づいており、そこにコンテキスト分が加わります。

7900 GREに収まるモデル(重みのみ)
モデルモデル容量コンテキストの余裕判定
Gemma 4 12BのQ4量子化≈ 7 GB約8GB十分な余裕があり、長いコンテキストにも対応
Gemma 4 12B(Q8)約 13 GB≈ 2 GB収まる(コンテキストが短い場合)
gpt-oss 20BのQ4版約 13 GB≈ 2 GBメモリに収まる。コンテキストは短〜中程度
Devstral Small 2 24B (Q4)≈ 14 GB約 1 GB収まるが余裕は少ない
Gemma 4 31BのQ4版≈ 18 GBなしメモリに収まりません。20~24GBが必要です

したがって、16 GBに収まるかどうかの境界は、収まる24Bモデルと収まらない31Bモデルの間にあります。24 GBのカードに移行せずにこの境界を越えるには、20 GBのRX 7900 XTが中間的な余裕を提供します。専用ガイドでは、その利点を詳しく説明しています。メーカーを問わず16 GBのカード全体についてモデルを比較するには、VRAM容量別のページをご覧ください。

#実測スループットと帯域幅の上限

このページの数値は、いずれも当サイトで測定したものではありません。llama.cppリポジトリの公開ディスカッションに掲載された値で、どのディスカッションでもQ4_0のLlama 2 7B(3.56 GiB)とllama-benchを使用しています。プロンプトの読み込み(pp512)は512トークンを取り込む速度を測定し、生成(tg128)は書き出す速度を測定します。RX 7900 GREをVulkanで動かした場合、ディスカッションでは生成速度がFlash Attentionなしで116.11トークン/秒、ありで110.50トークン/秒と報告されています。ROCmでは96.07トークン/秒です。

生成速度の理論上限は、メモリ帯域幅をモデルの重みサイズで割って求められます。ここでは 576 GB/s を 3.82 GB で割るため、約 151 トークン/秒です。このカードは、Flash Attention を使わない Vulkan 環境で、その 77%に達します。この効率をより大きなモデルに当てはめると、おおよその目安が得られます。ただし、これは実測値ではなく、ドライバーや llama.cpp のバージョンが変われば数値も変わります。

帯域幅576 GB/sによる上限の75%で推定(計算値、実測値ではありません)
モデル (Q4)モデル容量理論上の上限概算
Llama 3.1 8B≈ 6 GB約96トークン/秒≈ 72トークン/秒
Gemma 4 12B≈ 7 GB≈82トークン/秒約 62トークン/秒
Phi-4 14B≈ 9 GB≈64トークン/秒≈ 48トークン/秒
Devstral Small 2 24B≈ 14 GB約41トークン/秒≈ 31トークン/秒

#プロンプトの読み取りが実際にはどう影響するか

プロンプトの読み込みは、待機時間(秒)に換算しない限り抽象的に感じられます。計算は単純で、プロンプトのトークン数を pp512 の速度で割るだけです。これは 512 トークンで測定した速度が、より長いプロンプトでも維持されると仮定していますが、コンテキストが大きくなると読み込み速度が低下するため、これはおおむね成り立つ仮定にすぎません。したがって、以下の時間は、約 4,000 トークン(約 10 ページ)の文書に対する目安です。

4,000トークンのプロンプトの処理時間(pp512の測定値から算出)
カードとバックエンドpp512の速度最初の単語までの待ち時間
RX 7900 GRE、Vulkan2 336 t/s≈ 1,7 s
RX 7800 XT、Vulkan2 017 t/s≈ 2,0 s
RX 7900 GRE、ROCm1 457 t/s≈ 2,7 s
RX 9070、Vulkan3 164 t/s≈ 1,3 s

これらのカード間の差は、短いドキュメントに対しては秒単位の分数で測られます。コード全体やPDFの大量データ、またはエージェントの各リクエストが大きなコンテキストを再読み込みする場合に、数十万トークンに達すると、その感度が高まります。低量使用の場合には、VRAMのGBあたりのコストに基づいてカードを選択してください。その基準ではなく、コストに基づいて選択してください。

#RX 9070との比較:同じVRAM容量、RDNA 4

RX 9070は、現行ラインナップにあるもう一つの16 GBカードです。メモリ帯域幅は576 GB/sに対して640 GB/s、TDPは260 Wに対して220 Wで、ストリームプロセッサは3,584基です。Vulkanでは、生成速度が119.71トークン/秒、プロンプト処理速度が3,164トークン/秒です。プロンプト処理は35%速く、生成速度はほぼ同じです。実用上の違いは別のところにあります。この2世代ではROCm、Ollama、Windowsの動作が異なり、RX 9070のページで詳しく説明しています。具体例として、OllamaのドキュメントではRX 9070がLinuxのROCm対応カード一覧に掲載されていますが、WindowsのROCm対応カード一覧には掲載されておらず、WindowsではVulkanを使います。一方、RX 7900 GREは両OSのROCm対応カード一覧に掲載されています。WindowsでROCmにこだわるならGREが有利ですが、Vulkanでもよければ、この違いはなくなります。

RX 7900 GRE および RX 9070 は Vulkan で動作(Llama 2 7B Q4_0、FAなし)
基準RX 7900 GRERX 9070
帯域幅576GB/s640 GB/s
GPUの性能260 W220 W
読み込み pp5122 336,31 t/s3 164,10 t/s
tg128 生成116,11 t/s119,71 t/s

#セットアップ

  1. 01
    システムの選択
    AMDはRadeon RX 7000シリーズをUbuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1およびRHEL 9.7でのみサポートしています。WindowsではOllamaはROCm v7またはHIP7を用います。
  2. 02
    Ollama のインストール
    LinuxではROCm v7ドライバーが必要です。Vulkanはデフォルトで有効になっており、代替手段として使え、このカードでも良好な結果が得られます。
  3. 03
    メモリに収まるモデルを読み込む
    短いコンテキストで、まず12Bまたは20Bモデルを試し、その後24Bモデルを試してください。ollama psで、モデル全体がGPUにロードされていることを確認してください。
  4. 04
    2つのバックエンドを比較する
    Vulkanで、次にROCmで、Flash Attentionを有効にした場合と無効にした場合の両方でllama-benchを実行してください。このカードでは、公開されている測定結果で、Vulkan使用時にFlash Attentionが生成速度を低下させています。
ターミナル
ollama ps
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

#どのような用途で7900 GREを選ぶべきか

このカードを特徴づけるのは、演算性能とメモリのバランスです。16 GBのメモリ容量と576 GB/sのメモリ帯域幅に対して、高い演算性能を備えています。最初の単語が表示されるまでの時間が、文章の生成速度と同じくらい重要な場合に適しています。例えば、長い文書を読み込むアシスタントや、プロンプトが数千トークンになるRAGの処理フローです。短いやり取りのチャットでは、この利点はなくなり、より広いメモリ帯域幅を持つ7800 XTが同等以上の性能を発揮します。

用途別に選ぶ16 GBのAMDグラフィックカード
用途推奨されるカード理由
チャット、テキスト生成RX 7800 XTまたはRX 9070帯域幅がより高く、生成速度は同等以上
RAG、長文処理RX 9070、その後は RX 7900 GREプロンプトの読み込みが速くなる
30〜32Bモデル3つとも該当しません20〜24GBのVRAMが必要です。
限られた予算で中古を選ぶ場合三つの中で最も安い/prix-gpu-ia の VRAM 1GB 当たりのコストは

16GBの3枚をまとめると、7800 XTは会話用途で手軽に選べるカード、9070は読み取りが最も速く、消費電力220Wで最も省電力なカードです。7900 GREは、価格がほかの2枚を下回ったときに狙い目となるカードです。いずれも、より多くのメモリを必要とする300億パラメータのモデルを動かせるようにはなりません。

#2026年の結論

適切な選択肢
GREを7800 XT以下の価格で見つけ、かつプロンプトが長い場合
あまり適していない選択
7800 XTより高価で、用途が主に会話なら、生成では使われない演算性能にお金を払うことになります。
購入前の確認事項
Linuxではrocminfo、Windowsではタスクマネージャーを使い、システムが16 GBのVRAMと正しいグラフィックカードのモデルを認識していることを確認してください。

#よくある質問

FAQ
RX 7900 GREはローカルLLMに適していますか?+
はい。16GBのメモリには、Q4で量子化した200億〜240億パラメータのモデルを読み込めます。また、公開されている測定によると、Vulkan環境でQ4_0の7Bモデルを使った場合、毎秒約116トークンを生成します。RX 7800 XTに対する優位性は、プロンプトの読み取りに限られます。
ローカルAIにはRX 7900 GREとRX 7800 XTのどちらを選ぶべきですか?+
7800 XTを会話用途に使う場合、帯域幅は624 GB/sで、576 GB/sよりも高く、公表されたテストでは若干速いです。7900 GREはVulkanでプロンプトを約16%速く読み込みることができ、長文ドキュメントに適しています。価格が同じであれば、用途によって選択が変わります。
16GBのRX 7900 GREで動作可能なモデルはどれですか?+
Gemma 4 12B は Q4 または Q8、gpt-oss 20B は Q4、Devstral Small 2 24B は Q4 でメモリに収まります。ただし、後者 2 つはコンテキストを短くする必要があります。Gemma 4 のような 31B モデルは Q4 でも約 18 GB となり、カードの 16 GB を超えます。
RX 7900 GREはOllamaと互換性がありますか?+
はい。Ollamaのドキュメントでは、このカードはLinux(ROCm v7ドライバー使用)とWindowsの対応一覧に掲載されています。AMDもROCmの対応一覧にターゲットgfx1100として掲載していますが、対象OSはUbuntu 24.04.4、22.04.5、RHEL 10.1、RHEL 9.7に限られます。検出に失敗した場合は、Ollamaでデフォルトで有効になっているVulkanを代替手段として利用できます。
RX 7900 GREでVulkanかROCmか?+
llama.cppリポジトリの公開ディスカッションでは、このカードでVulkanはROCmよりも高速に生成し(Flash Attentionなしで毎秒116トークン対96トークン)、プロンプトの読み込みも速いと報告されています。テスト系列ごとに構成が異なるため、お使いのモデルで両方を試してください。
RX 7900 GREでは、どのような場合に性能や容量が足りなくなりますか?+
300 億パラメータ以上のモデルを使いたい場合や、24B モデルで非常に長いコンテキストを扱う場合、16 GB では足りなくなります。その場合、次の選択肢は 20 GB の RX 7900 XT または 24 GB のカードです。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。