初心者 11 分Radeon RX 7000

Radeon RX 7700 XT(12 GB)で使うLLMはどれか ?

端的な回答

Radeon RX 7700 XT(12 GB GDDR6、432 GB/s)は、LinuxでもWindowsでもROCmとOllamaに公式にサポートされています。80億~140億パラメータのモデルをQ4で妥協なく実行できますが、13~14 GBを必要とする20B~24Bのモデルには届きません。llama.cppのスコアボードには、このカードの処理速度は公開されていません。性能はRX 6700 XTとRX 7800 XTの間に位置します。

RX 7700 XTの価値は、主に12 GBのメモリで何ができるかと、製品ラインナップでの位置づけにあります。前世代より速く、サポートも充実していますが、20〜24Bのモデルを動かせる16 GBという容量には届きません。このカードで十分かどうかを判断できるよう、出典を示した測定値と、推定であることを明示した数値を紹介します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16 GB.

なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16 GB →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#2026年にRX 7700 XTでできること

RX 7700 XTは中規模のローカルLLMに適しています。12 GBのメモリには、Llama 3.1 8B、Gemma 4 12B、Phi-4 14BがQ4で収まり、コンテキスト用の余裕もあります。RX 6700 XTより12.5%高い432 GB/sの帯域幅が、生成速度の上限を決めます。スコアボードの基準となる7Bモデルでは約113トークン/秒で、RX 7800 XTの163トークン/秒と比較できます。6700 XTに対する明確な利点は、Windowsも含め、ROCmとOllamaの公式対応リストに掲載されていることです。弱点はメモリ容量で、200億〜240億パラメータのモデルには対応できません。この規模では、7800 XTの16 GBが貴重になります。

アーキテクチャ
RDNA 3、チップレット構成のNavi 32チップ(1 GCDと3 MCD)、2023年9月6日発売。
計算
ストリームプロセッサ3,456基、演算ユニット54基。
メモリ
12 GB GDDR6、バス192ビット、432 GB/s。
消費電力
カードの消費電力は245Wです。
価格
ここでは記載されていません:週ごとの最低価格は/prix-gpu-iaをご確認ください。

#ROCm、Ollama および Windows:公式サポート

これが前世代と異なる点です。AMDの互換性表には、RX 7700 XTがRX 7800 XTと同じくRDNA 3、ターゲットgfx1101として記載されています。Ollamaのドキュメントでも、LinuxとWindowsで対応するカードとして挙げられています。ただし、OS選びには注意点があります。AMDによると、Radeon RX 7000と9000シリーズがサポートされるのはUbuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1、RHEL 9.7のみです。他のディストリビューションでも動作する可能性はありますが、保証はありません。Vulkanは代替手段として使えます。バックエンドがインストールされていれば、OllamaがVulkanをデフォルトで有効にします。

RX 7700 XT のサポート
環境ステータス出典
ROCm は Linux で利用可能(Ubuntu 24.04.4、22.04.5、RHEL 10.1、9.7)公式サポート、対象はgfx1101AMDの互換性表
Linux上のOllamaサポートされるカード一覧Ollamaのドキュメント、ROCm v7が必要
Windows上のOllamaサポートされるカード一覧Ollamaのドキュメント、ROCm v7 / HIP7スタック
Vulkan (Ollama, llama.cpp)汎用的な代替手段Ollama ではデフォルトで有効です

#12GBのVRAMに収まるもの

12 GBのグラフィックスカードでは、そのカードで画面出力を行わない場合、モデルとKVキャッシュに使える容量は約11 GBと考えてください。記載されているモデルの重みの容量はQuelLLMのカタログに基づいています。KVキャッシュはそれに加算され、会話が長くなるほど増えます。

7700 XTに収まるモデル(Q4、モデルの重みのみ)
モデルQ4 での重みコンテキストの余裕判定
Llama 3.1 8B≈ 6 GB≈ 5 GB非常に快適
Gemma 4 12B≈ 7 GB約4GB快適に動作し、長いコンテキストも利用可能
Phi-4 14B≈ 9 GB≈ 2 GBメモリに収まりますが、コンテキスト長を制限する必要があります
gpt-oss 20B約 13 GBなしVRAMに収まらず、一部をCPUにオフロード
Devstral Small 2 24B≈ 14 GBなし最低16GBが必要です

14Bを超えるために、GPUカードを変更せずに活用できる手段は二つあります。KVキャッシュを量子化して1〜2GBを確保するか、トークンごとに一部のパラメータのみがアクティブになるMoE(Mixture of Experts)モデルを選択することです。メモリ使用量はモデルの全サイズに依存するため、20BのMoEモデルが12 GBに収まりやすくなるわけではありませんが、収まれば生成速度は向上します。

#スループット:分かっていることと推定していること

根拠の状況を正確に説明します。llama.cppリポジトリには、同じモデル(Llama 2 7BのQ4_0)でAMDのカードを一覧にした公開ディスカッションが2つあり、一方はVulkan、もう一方はROCmを使用しています。執筆時点では、どちらにもRX 7700 XTの記載はありません。私たち自身では何も測定していません。できるのは、測定済みの2枚のカードの間に位置づけることです。RX 6700 XTは生成速度が83.88トークン/秒(メモリ帯域幅384 GB/s)、RX 7800 XTは118.27トークン/秒(624 GB/s)で、どちらもVulkanでの測定値です。

帯域幅から計算すると、上限が求められます。432 GB/sをモデルの重みの容量3.82 GBで割ると、基準となる7Bモデルでは約113トークン/秒になります。同じ議論で取り上げられたAMDカードは、この上限の59~83%に達しています(6700 XTは83%、7800 XTは72%)。これを踏まえると、7700 XTで65~95トークン/秒という値はあり得そうです。ただし、これは検討用の仮説であり、測定結果ではありません。llama-benchで確認する必要があります。

7700 XTでのモデル別の理論上限(計算値)
モデル (Q4)モデル容量帯域幅432 GB/sでの理論上限上限の60~80%とした推定値
Llama 3.1 8B≈ 6 GB≈ 72トークン/秒約43〜58 tokens/s
Gemma 4 12B≈ 7 GB約 62トークン/秒約37から49トークン/秒
Phi-4 14B≈ 9 GB≈ 48トークン/秒≈ 29 から 38 tokens/s

会話用途では、1秒あたり10トークンを超える速度であれば快適に読み取れます。したがって、これらの推定値は、大きな誤差の幅を考慮しても、実用上の閾値を大きく上回っています。

#近いクラスの製品との比較:6700 XT、7800 XT、RTX 4070

選択は多くの場合、近接する3つのカードの間で行われます。Vulkan環境で公開された測定値は、議論の対象となっているAda世代の12 GBカードの一つであるRTX 4070の位置づけに役立ちます。生成速度は1秒あたり92.29トークン、プロンプト読み込み速度は3,179トークンです。12 GBという容量は7700 XTと同様であり、両カードは同じモデルに制限されます。違いはソフトウェアエコシステム、プロンプト読み込み、エネルギー効率、価格で決まります。RX 7700 XTの速度は測定待ちですが、他の3つは公開されています。

7700 XT および類似カード (Llama 2 7B Q4_0、Vulkan、Flash Attention なし)
カードVRAM帯域幅読み込み pp512tg128 生成
RX 6700 XT12 GB384 GB/s1 051,20 t/s83,88 t/s
RX 7700 XT12 GB432 GB/s未公表未公表
RTX 407012 GB記載なし3 179,37 t/s92,29 t/s
RX 7800 XT16 GB624 GB/s2 017,33 t/s118,27 t/s

この表の読み方: 7700 XT から 7800 XT への移行は、単に速度が向上するだけでなく、VRAM が 4 GB 増え、20B から 24B のモデルにアクセス可能になります。実際に実行できるものを根本的に変えるのは、この基準だけです。用途が 8B や 12B の場合、7700 XT は制約になりません。一方、24B のコードモデルをターゲットにしている場合、制約になります。

#Linuxで使い始める

  1. 01
    システムを確認する
    あなたのディストリビューションがAMDがこのカードに対応しているものとしてリストしているUbuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1、またはRHEL 9.7のいずれかであることを確認してください。
  2. 02
    ROCm ドライバーのインストール
    OllamaはLinuxでROCm v7ドライバーを要求します。AMDのドキュメントに記載されているamdgpu-installツールを使ってインストールしてください。
  3. 03
    Ollamaをインストールした後、モデルをインストール
    Q4_K_Mで量子化されたGemma 4 12B、または8Bモデルをダウンロードし、ollama runで実行してください。
  4. 04
    GPUが処理に使われていることを確認する
    ollama ps を実行してください。プロセッサの列に GPU 上での実行が表示される必要があります。カードが検出されない場合は、ollama ユーザーを render グループに追加してください。
  5. 05
    測定および比較
    公開ディスカッションのGGUFを使用してllama-benchを実行し、自らのカードの性能を他の測定結果と比較し、自らの結果を公開してください。
ターミナル
ollama ps
rocminfo | grep -i gfx
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

Windowsでは、Ollamaのドキュメントに、Radeon RX 7000向けのROCm v7またはHIP7スタックが記載されています。インストールするのは、最新のRadeonドライバーと、その後にOllamaだけです。OllamaとAMD GPUに関するガイドでは、複数のGPUを搭載したシステムで使用するカードを選ぶために役立つ環境変数を詳しく説明しています。

#12GBが不足するとき

境界は明確です。モデルの重みが11 GBを超えると、VRAMに全体を収められなくなります。するとOllamaとllama.cppは一部のレイヤーをCPU側にオフロードします。システムメモリはGDDR6よりはるかに遅いため、速度が大幅に低下します。よくあるのは、24Bのコード用モデル、14Bモデルでの長いコンテキスト、またはRAG用に2つ目のモデルを同時に読み込む場合の3つです。いずれも解決に必要なのは計算性能ではなく、VRAM容量です。

12GBに留めるべきでしょうか?
用途12GBは十分ですか?次に変化する点
8B〜12Bモデルを使ったチャット、要約、翻訳はいなし
14Bを使用したコードアシスタント、短いコンテキストはいKVキャッシュの監視
コードモデル 24B または gpt-oss 20Bいいえ16 GB以上を選ぶ
生成モデル、埋め込みモデル、リランカーを同時に読み込んだ状態でのRAGぎりぎり16GBを確保して、データのやり取りを避ける
14Bモデルで32,000トークン以上のコンテキストいいえKVキャッシュを量子化するか、16 GBのGPUを選ぶ

中古で購入する前に、次の3点を具体的に確認してください。カードの消費電力は245 Wなので、それに適した電源と、正しく接続された2つのPCIe電源コネクタが必要です。LLMの用途では、カードの細かなモデルの違いはあまり重要ではありません。メモリ容量はどのメーカーでも12 GBで共通しており、異なるのは冷却性能だけです。これは長時間の生成セッションでは重要になります。最後に、購入を確定する前に、実際に9〜10 GBのモデルを使ってカードをテストしてください。12 GBのメモリの大部分を使用し、LLM特有の重みの連続的な再読み取りに負荷をかけられるのは、このテストだけです。ゲームを動かすテストとはまったく異なります。

#2026年の結論

すでにご所有の場合
そのまま使い続けてください。14Bまでのモデルには公式に対応しており、回避策は必要ありません。
中古で購入する場合
/prix-gpu-ia で、その価格を RX 7800 XT の価格と比較してください。価格差が小さければ、7800 XT の追加 4 GB のメモリには、その差額を払う価値があります。
24Bを狙う場合
最初から16GB以上のカードを選んでください。制約になるのは処理性能ではなく、メモリ容量です。

#よくある質問

FAQ
RX 7700 XT はローカルLLMに適していますか?+
はい。Q4に量子化した80億〜140億パラメータのモデルに適しており、ROCmとOllamaによる公式サポートもあります。ただし、メモリ容量が12 GBなので、200億〜240億パラメータのモデルには届きません。これが、16 GBを搭載するRX 7800 XTと比べた主な弱点です。
12GBのメモリを搭載したRX 7700 XTでは、どのモデルを動かせますか?+
Q4のLlama 3.1 8B、Gemma 4 12B、Phi-4 14Bは、モデルの重みが6〜9 GBで、コンテキスト用の空き容量も残ります。20B〜24BモデルはQ4で13〜14 GBあるため、VRAMに収まらず、一部の処理がCPU側に移り、速度が大幅に低下します。
RX 7700 XT のトークン/秒はどれくらいですか?+
llama.cppリポジトリのディスカッションには、公開された測定値がありません。計算上は、Q4_0の7Bモデルで約113トークン/秒が上限となり、近い仕様のAMD製カードでは通常、この上限の59~83%の速度が観測されています。数値を提示する前に、llama-benchでご自身で測定してください。
Windows環境でRX 7700 XTをOllamaで使用できますか?+
はい。Ollamaのドキュメントでは、このカードがWindowsで対応するRadeon RXの一覧に掲載されており、ROCm v7またはHIP7のソフトウェアスタックが必要です。Linuxでも一覧に掲載されており、ROCm v7ドライバーが必要です。Ollamaでデフォルトで有効になっているVulkanは、検出に失敗した場合の代替手段になります。
ローカルAIにはRX 7700 XTとRX 7800 XTのどちらが適していますか?+
20〜24Bのモデルを使いたいなら、16 GBのメモリを搭載し、帯域幅も432 GB/sに対して624 GB/sある7800 XTが適しています。使うモデルが80億〜140億パラメータの範囲に収まるなら、7700 XTで十分です。決める前に、その時点の価格を比較してください。
RX 7700 XT を ROCm で使用するには Ubuntu が必要ですか?+
AMDは、Radeon RX 7000シリーズの公式サポートを、Ubuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1およびRHEL 9.7でのみ提供しています。他のディストリビューションは動作する可能性がありますが、サポートは保証されません。WindowsではOllamaはROCm v7またはHIP7を用いて動作し、Vulkanはどこでも利用可能です。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。