中級 11 分Radeon RX 7000

Radeon RX 7900 XTX(24 GB)で使うLLMはどれか ?

端的な回答

RX 7900 XTX(24 GB GDDR6、AMDによると最大960 GB/s)は、Ollamaやllama.cppでローカルLLMを実行するのに非常に適したグラフィックカードです。Q4量子化時の重みが約20 GB未満に収まるモデルなら、27Bの密なモデルや30〜35BのMoEモデルなど、どのモデルも搭載できます。ROCm 7でサポートされています。24 GBを超えると、モデルの収まりきらない部分がシステムRAMに移されます。

7900 XTXは2022年のカードですが、24 GBのメモリを備えているため、今もAMDの代表的なカードです。このガイドでは、どのモデルをどのソフトウェアで動かせるか、公開ベンチマークによる速度はどの程度か、そしてどのような場合にRTXやより新しいカードを選ぶほうがよいかを説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16GB (ASUS Prime OC).

なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16GB (ASUS Prime OC) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。

#LLM向けRX 7900 XTX:24GBで何が変わるのか

Radeon RX 7900 XTXは、モデルが24 GBのVRAMに収まれば、ローカルLLMを難なく動かせます。Q4の7B〜9Bモデルは非常に快適に動作し、Q4の27Bモデル(重みの容量は約16 GB)でもコンテキスト用の余裕が残ります。総パラメータ数が300億〜350億で、そのうち30億がアクティブなMoEモデルも、ぎりぎり収まります。条件は二つです。Ollama、LM Studio、llama.cppのいずれかを使うこと。これらはすべて、このカードのドライバーに対応しています。そして、使用量を24 GB未満に抑えることです。それを超えるとモデルの一部がシステムRAMに移され、速度が急激に低下します。AMD RDNA 3の一般ユーザー向けラインナップで、最大のVRAM容量を備えています。

メーカーはローカルAIにとって重要な数値を提示しています。24 GBのGDDR6と、最大960 GB/sのメモリ帯域幅です。ここではメモリ帯域幅が最も有用な数値であり、テキスト生成では各トークンごとにモデルの重みの大部分を読み込むため、帯域幅が高いほど、毎秒のトークン数の上限も高くなります。

RX 7900 XTXの技術仕様(情報源:AMD)
特徴値
メモリ24 GB GDDR6
帯域幅最大960 GB/s
ストリームプロセッサ/コンピュートユニット6 144 / 96
AI アクセラレータ192
カードの典型的な性能355 W
推奨される最低電源容量800 W
記載されている行列形式FP16(123 TFLOPs)、INT8、INT4。FP8には対応していません。
i
電源:850 Wではなく800 W
AMD は、このカードに推奨する電源ユニットの最低容量を800 Wとしています。一部のパートナーカードメーカーは、さらに大きな容量を推奨しています。購入する正確なモデルの仕様に従い、CPU の消費電力が大きい場合は余裕を持たせてください。

#ドライバーとソフトウェア:2026年の互換性

AMD のグラフィックカードでは、まずソフトウェアスタックを確認する必要があります。AMD の Radeon ドキュメントにある ROCm 7.2.1 の互換性マトリックスには、Ubuntu 22.04、24.04、25.10 向けに 7900 XTX が掲載されています。一方、Ollama は Linux では AMD ROCm v7 ドライバーが必要だと明記し、Linux と Windows の両方で 7900 XTX を対応カードとして挙げています。実際の導入では、Linux では amdgpu-install ユーティリティを使ってインストールし、Windows では特別な操作をせずにカードが認識されます。

ROCmで問題が起きる場合は、別の方法もあります。Ollamaによると、WindowsとLinuxで追加のGPUに対応するにはVulkanを使い、そのバックエンドをインストールするとデフォルトで有効になります。Vulkanはllama.cppの代替バックエンドでもあり、llama.cppをVulkanで使うためのガイドではコンパイル方法を説明しています。vLLMの現在のドキュメントには、ROCm 6.3以上に対応するRadeon RX 7900(gfx1100とgfx1101)が記載されており、Python 3.12向けにROCm 7.0および7.2.1用のビルド済みパッケージが提供されています。

#7900 XTXを使うLinux環境にOllamaをインストールする

  1. 01
    ROCm ドライバーのインストール
    AMDのROCmドキュメントに従い、Ollamaの要件どおりにamdgpu-installユーティリティを使用してください。その後、ご自身のユーザーをrenderグループとvideoグループに追加し、再起動してください。
  2. 02
    カードが認識されていることを確認してください
    rocminfoを実行し、続いてrocm-smiを実行してください。7900 XTXのメモリ容量が24 GBと表示されるはずです。何も表示されない場合、OllamaはCPUでの実行に切り替わります。
  3. 03
    Ollama のインストール
    公式スクリプトを使用するか、Linux向けのOllamaインストールガイドに従ってから、24 GBに収まるモデルをダウンロードしてください。
  4. 04
    配置を確認
    最初の応答後にollama psを実行すると、モデルのうちGPUに配置されている割合が表示されます。表示は「100 % GPU」である必要があります。そうでなければ、モデルまたはコンテキストが大きすぎます。
検証
rocminfo | head -30
rocm-smi
ollama run gpt-oss:20b
ollama ps

#24GBのメモリに収まるモデルはどれか、そしてその処理速度は?

メモリ容量別のモデルの一覧は、ガイド「24 GB の VRAM に適した LLM」にあります。ここでは、このカードについての要点を紹介します。以下に示すモデルの重みの容量は QuelLLM のカタログに基づく Q4 での値で、コンテキスト用のメモリは含みません。理論上の速度上限は、帯域幅を各トークンの処理時に読み込む重みの容量で割った値です。この上限を超えることはできず、実際には上限にも達しません。

Q4でのモデルサイズ(QuelLLMカタログ)と、帯域幅960 GB/sに基づく理論上限
モデルQ4 の重み24GBでの空き容量理論上の上限
Qwen 3.5 9B6 GB18 GB160トークン/秒
gpt-oss 20B (MoE)13 GB11 GBアクティブな重みに依存
Devstral Small 2 24B14 GB10 GB約68トークン/秒
Qwen 3.8 27B16 GB8 GB60トークン/秒
Granite 4.1 30B17 GB7 GB約56トークン/秒
Qwen3-Coder 30B-A3B (MoE)19 GB5 GBアクティブな重みに依存
Qwen 3.6 35B-A3B (MoE)21 GB3 GBアクティブな重みに依存

この表には2つの読み方があります。まず、余裕についてです。24 GBに対して、21 GBのモデルではKVキャッシュとシステムに3 GBしか残らず、コンテキストは短くなります。Qwen 3.8 27Bは8 GBの余裕があるため、長いコンテキストにはより快適です。次に、MoEについてです。35B-A3Bのモデルは、各トークンごとにアクティブな30億パラメータのみを読み込むため、270億パラメータのデンスモデルよりもはるかに高速に生成しますが、それでもVRAMに完全に収める必要があります。

!
tokens/sの数値をでっち上げない
ネット上で見かける処理速度は、モデル、量子化、コンテキスト、ソフトウェアのバージョンによって異なります。当サイトが引用する、比較可能な公開データは、以下のllama.cppコミュニティの表にある小型モデルの測定結果だけです。ご自身のモデルについては、llama-benchまたはOllamaが返す統計情報を使って測定してください。

#このカードの公開ベンチマークで測定されていること

llama.cppコミュニティの参照表では、ROCm上で同じモデル(Llama 2 7B、Q4_0)を使い、プロンプト処理速度(pp512)と生成速度(tg128)を測定しています。7900 XTXでは、ある参加者がFlash Attentionなしでプロンプト処理3552トークン/秒、生成167トークン/秒を記録し、Flash Attentionありではそれぞれ3874トークン/秒、170トークン/秒を記録しています。表の作成者は、同じチップでも、ドライバー、システム、グラフィックスカードのメーカーによって結果が変わると注意しています。

Llama 2 7B Q4_0、llama.cpp ROCm(コミュニティ作成の表、Flash Attentionなし)
カードAMDの帯域幅プロンプトpp512tg128 生成
RX 7900 XTX960 GB/s3 552 t/s167 t/s
RX 9070 XT640 GB/s5 055 t/s101 t/s
RX 9060 XT320 GB/s1 420 t/s68 t/s

この表は2つのことを示しています。生成速度は帯域幅に依存します。7900 XTX(960 GB/s)は 9070 XT(640 GB/s)より約1.65倍速く、9060 XT(320 GB/s)より2.5倍速く生成します。一方、プロンプトの読み取りは行列演算の計算能力に大きく依存し、より新しい世代の 9070 XT はこの点で 7900 XTX を上回っています。長い応答を伴うチャット用途では、帯域幅と24 GBのVRAMが重要ですが、大きなドキュメントを入力とするRAG用途では、プロンプトの読み取り速度の方がより重要になります。

i
小さなモデル、実際の使用条件との大きな隔たり
Q4_0 の 7B モデルは、前節の 24 GB のモデルよりもはるかに軽量です。これらの数値から 27B モデルの速度を推測しないでください。メモリ帯域幅が同じなら、速度はその数分の一になります。

#70B、30B MoE、デュアルカード:どこまで行けるか

サイトの目安では、Q4量子化した70Bの密モデルは重みだけで約40 GBとなり、VRAMのほぼ2倍です。そのため、16 GBを超える分をシステムRAMに置く必要があり、速度はGPUではなくRAMとPCIeバスに制約されます。検証可能な情報源がないため、この場合の速度は示していません。実用上は扱いにくいとだけ覚えておいてください。24 GBの制約に対する実用的な解決策は、全体的な品質が同程度の300億〜350億パラメータのMoEモデルです。

7900 XTXを2枚使うと、メモリ容量の面で状況が大きく変わります。llama.cppのデフォルトの分割モードでは、モデルをレイヤー単位でカード間に分割し、パイプライン方式で動作させます。カードごとの配分比率を指定するオプションもあります。合計48 GBを利用でき、Q4の70Bモデルと少量のコンテキストを収めるには十分です。メリットはメモリに収まるモデルの大きさであり、トークンあたりの処理速度ではありません。各トークンは2枚のカードを順番に通過するためです。ハードウェア面では、355 Wのカード2枚だけで710 Wになり、PCのほかの部品の消費電力がさらに加わります。そのため、十分な容量の電源、適切なPCIeスロット2つ、通気性のよいケースが必要です。

#コンテキストとKVキャッシュ:24GBの本当の制限

モデルのサイズは、使用するメモリの一部にすぎません。KVキャッシュはコンテキストの長さに応じて増加します。ドキュメントによると、Ollamaはデフォルトで4,096トークンのコンテキストウィンドウを使用し、OLLAMA_CONTEXT_LENGTH変数で変更できます。最近のモデルは128,000〜262,000トークンのコンテキスト長を公表していますが、その長さを利用するには追加のメモリが必要です。対策は2つあります。バックエンドとGPUが対応している場合にOllamaが自動的に使用するFlash Attentionを有効にすることと、OLLAMA_KV_CACHE_TYPEでKVキャッシュを量子化することです(デフォルトはf16、メモリ削減にはq8_0)。KVキャッシュの量子化に関するガイドで、これらの設定を詳しく説明しています。

コンテキストとKVキャッシュの削減
OLLAMA_CONTEXT_LENGTH=32768 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#7900 XTX、RTX 3090、4090:どう選ぶか

仕様上、RTX 3090も24GBを搭載しており、NVIDIAによればメモリはGDDR6Xです。したがって、選択を左右するのはソフトウェアスタック、環境、その時点の価格です。価格は変動するため、ここでは固定の値を示しません。購入前に、ローカルAI向けグラフィックカードの価格動向を確認してください。

24GBにおける判断基準
あなたの状況推奨されるカードなぜ
Linux、Ollama または llama.cpp、予算が厳しい状況RX 7900 XTXROCm 7とVulkanがサポートする24 GB
Windows、CUDAを必要とするツール(一部のファインチューニングプロジェクト)RTX 3090 または 4090ほとんどのプロジェクトでは、引き続きCUDAがデフォルトの対象です
本番環境でvLLMを使いたいモデルを確認してくださいvLLM は ROCm で 7900 をリストアップしています。サポートはバージョンにより異なります
長いコンテキストと大きなMoE24 GB搭載のすべてのカードブランドよりもVRAMが重要
24 GBを超えるメモリが必要RTX 5090 (32 GB) またはデュアルカード24 GBのカードでは、どれも70BモデルをQ4でメモリに収められません

新品と中古のグラフィックカードで迷っている場合は、7900 XTXが2022年12月に発売されたことを念頭に置いてください。中古品ではメーカー保証がすでに切れていることが多く、マイニングや連続稼働に使われたカードは、購入前に温度を確認しておくべきです。

→
20GBおよび16GBの代替案
24 GBのカードが予算を超える場合は、RX 7900 XT(20 GB)とRX 9070 XT(16 GB)にそれぞれガイドがあります。9070 XTはより新しく、AMDがFP8対応を記載していますが、メモリ容量は8 GB少なくなります。

#よくある質問

よくある質問
RX 7900 XTXはローカルLLMに適していますか?+
はい。主な理由は、24 GB の VRAM と、AMD が公表している 960 GB/s のメモリ帯域幅です。Q4 では約270億パラメータまでのモデルに加え、300億〜350億パラメータの MoE も、システム RAM に処理を逃がすことなく実行できます。ROCm 7 または Vulkan を使用する環境で、Ollama、llama.cpp、LM Studio に対応しています。
RX 7900 XTXでどのモデルを選択すべきですか?+
一般的な用途なら、Q4のQwen 3.8 27Bのような270億パラメータの密なモデルが適しています。重みは約16 GBなので、コンテキスト用に8 GBが残ります。速度重視なら、gpt-oss 20BやQwen 3.6 35B-A3BのようなMoEです。コーディングなら、Devstral Small 2 24BまたはQwen3-Coder 30B-A3Bです。必ずollama psで、すべてがGPU上に載っていることを確認してください。
RX 7900 XTXを2枚同時に使用できますか?+
はい、llama.cppでは、デフォルトモードでレイヤーとKVキャッシュがカード間で分散されます。48 GBが得られ、Q4の70Bには十分ですが、カードがパイプライン方式で動作するため、トークンあたりの速度は向上しません。2枚のカード合計で710 Wを超える消費電力を想定し、1,000 Wを大きく上回る電源を用意してください。
RX 7900 XTXがFP8をサポートしていますか?+
AMDの仕様表によると、対応していません。このカードの行列演算についてはFP16、INT8、INT4が記載されていますが、FP8は記載されていません。RDNA 4世代のRadeon RX 9000にはFP8の記載があります。Q4またはQ5で量子化されたGGUFモデルを使うほとんどの用途では、この点による直接的な影響はありません。
RX 7900 XTXではROCmとVulkanのどちらを使うべきですか?+
まずはROCmから始めてください。ROCm v7ドライバーを使う、Linux版Ollamaの公式な方法です。インストールでつまずいた場合は、Ollamaでデフォルトで有効になっているVulkanを使えば、ROCmなしで動かし始められます。ただし、一般に性能はドライバーによって変わります。判断する前に、使用するモデルでllama-benchを実行し、両者を比較してください。
7900 XTXはvLLMと互換性がありますか?+
はい。vLLMのドキュメントには、ROCm 6.3以上で利用できるGPUとしてRadeon RX 7900(gfx1100およびgfx1101)が記載されており、ROCm 7.0および7.2.1向けのビルド済みパッケージも提供されています。ただし、インストールはOllamaよりも手間や制約が多く、特に複数のユーザーに同時にサービスを提供する場合に役立ちます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。