Radeon RX 7900 XTX(24 GB)で使うLLMはどれか ?
RX 7900 XTX(24 GB GDDR6、AMDによると最大960 GB/s)は、Ollamaやllama.cppでローカルLLMを実行するのに非常に適したグラフィックカードです。Q4量子化時の重みが約20 GB未満に収まるモデルなら、27Bの密なモデルや30〜35BのMoEモデルなど、どのモデルも搭載できます。ROCm 7でサポートされています。24 GBを超えると、モデルの収まりきらない部分がシステムRAMに移されます。
7900 XTXは2022年のカードですが、24 GBのメモリを備えているため、今もAMDの代表的なカードです。このガイドでは、どのモデルをどのソフトウェアで動かせるか、公開ベンチマークによる速度はどの程度か、そしてどのような場合にRTXやより新しいカードを選ぶほうがよいかを説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16GB (ASUS Prime OC).
なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16GB (ASUS Prime OC) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。
#LLM向けRX 7900 XTX:24GBで何が変わるのか
Radeon RX 7900 XTXは、モデルが24 GBのVRAMに収まれば、ローカルLLMを難なく動かせます。Q4の7B〜9Bモデルは非常に快適に動作し、Q4の27Bモデル(重みの容量は約16 GB)でもコンテキスト用の余裕が残ります。総パラメータ数が300億〜350億で、そのうち30億がアクティブなMoEモデルも、ぎりぎり収まります。条件は二つです。Ollama、LM Studio、llama.cppのいずれかを使うこと。これらはすべて、このカードのドライバーに対応しています。そして、使用量を24 GB未満に抑えることです。それを超えるとモデルの一部がシステムRAMに移され、速度が急激に低下します。AMD RDNA 3の一般ユーザー向けラインナップで、最大のVRAM容量を備えています。
メーカーはローカルAIにとって重要な数値を提示しています。24 GBのGDDR6と、最大960 GB/sのメモリ帯域幅です。ここではメモリ帯域幅が最も有用な数値であり、テキスト生成では各トークンごとにモデルの重みの大部分を読み込むため、帯域幅が高いほど、毎秒のトークン数の上限も高くなります。
| 特徴 | 値 |
|---|---|
| メモリ | 24 GB GDDR6 |
| 帯域幅 | 最大960 GB/s |
| ストリームプロセッサ/コンピュートユニット | 6 144 / 96 |
| AI アクセラレータ | 192 |
| カードの典型的な性能 | 355 W |
| 推奨される最低電源容量 | 800 W |
| 記載されている行列形式 | FP16(123 TFLOPs)、INT8、INT4。FP8には対応していません。 |
#ドライバーとソフトウェア:2026年の互換性
AMD のグラフィックカードでは、まずソフトウェアスタックを確認する必要があります。AMD の Radeon ドキュメントにある ROCm 7.2.1 の互換性マトリックスには、Ubuntu 22.04、24.04、25.10 向けに 7900 XTX が掲載されています。一方、Ollama は Linux では AMD ROCm v7 ドライバーが必要だと明記し、Linux と Windows の両方で 7900 XTX を対応カードとして挙げています。実際の導入では、Linux では amdgpu-install ユーティリティを使ってインストールし、Windows では特別な操作をせずにカードが認識されます。
ROCmで問題が起きる場合は、別の方法もあります。Ollamaによると、WindowsとLinuxで追加のGPUに対応するにはVulkanを使い、そのバックエンドをインストールするとデフォルトで有効になります。Vulkanはllama.cppの代替バックエンドでもあり、llama.cppをVulkanで使うためのガイドではコンパイル方法を説明しています。vLLMの現在のドキュメントには、ROCm 6.3以上に対応するRadeon RX 7900(gfx1100とgfx1101)が記載されており、Python 3.12向けにROCm 7.0および7.2.1用のビルド済みパッケージが提供されています。
#7900 XTXを使うLinux環境にOllamaをインストールする
- 01ROCm ドライバーのインストールAMDのROCmドキュメントに従い、Ollamaの要件どおりにamdgpu-installユーティリティを使用してください。その後、ご自身のユーザーをrenderグループとvideoグループに追加し、再起動してください。
- 02カードが認識されていることを確認してくださいrocminfoを実行し、続いてrocm-smiを実行してください。7900 XTXのメモリ容量が24 GBと表示されるはずです。何も表示されない場合、OllamaはCPUでの実行に切り替わります。
- 03Ollama のインストール公式スクリプトを使用するか、Linux向けのOllamaインストールガイドに従ってから、24 GBに収まるモデルをダウンロードしてください。
- 04配置を確認最初の応答後にollama psを実行すると、モデルのうちGPUに配置されている割合が表示されます。表示は「100 % GPU」である必要があります。そうでなければ、モデルまたはコンテキストが大きすぎます。
#24GBのメモリに収まるモデルはどれか、そしてその処理速度は?
メモリ容量別のモデルの一覧は、ガイド「24 GB の VRAM に適した LLM」にあります。ここでは、このカードについての要点を紹介します。以下に示すモデルの重みの容量は QuelLLM のカタログに基づく Q4 での値で、コンテキスト用のメモリは含みません。理論上の速度上限は、帯域幅を各トークンの処理時に読み込む重みの容量で割った値です。この上限を超えることはできず、実際には上限にも達しません。
| モデル | Q4 の重み | 24GBでの空き容量 | 理論上の上限 |
|---|---|---|---|
| Qwen 3.5 9B | 6 GB | 18 GB | 160トークン/秒 |
| gpt-oss 20B (MoE) | 13 GB | 11 GB | アクティブな重みに依存 |
| Devstral Small 2 24B | 14 GB | 10 GB | 約68トークン/秒 |
| Qwen 3.8 27B | 16 GB | 8 GB | 60トークン/秒 |
| Granite 4.1 30B | 17 GB | 7 GB | 約56トークン/秒 |
| Qwen3-Coder 30B-A3B (MoE) | 19 GB | 5 GB | アクティブな重みに依存 |
| Qwen 3.6 35B-A3B (MoE) | 21 GB | 3 GB | アクティブな重みに依存 |
この表には2つの読み方があります。まず、余裕についてです。24 GBに対して、21 GBのモデルではKVキャッシュとシステムに3 GBしか残らず、コンテキストは短くなります。Qwen 3.8 27Bは8 GBの余裕があるため、長いコンテキストにはより快適です。次に、MoEについてです。35B-A3Bのモデルは、各トークンごとにアクティブな30億パラメータのみを読み込むため、270億パラメータのデンスモデルよりもはるかに高速に生成しますが、それでもVRAMに完全に収める必要があります。
#このカードの公開ベンチマークで測定されていること
llama.cppコミュニティの参照表では、ROCm上で同じモデル(Llama 2 7B、Q4_0)を使い、プロンプト処理速度(pp512)と生成速度(tg128)を測定しています。7900 XTXでは、ある参加者がFlash Attentionなしでプロンプト処理3552トークン/秒、生成167トークン/秒を記録し、Flash Attentionありではそれぞれ3874トークン/秒、170トークン/秒を記録しています。表の作成者は、同じチップでも、ドライバー、システム、グラフィックスカードのメーカーによって結果が変わると注意しています。
| カード | AMDの帯域幅 | プロンプトpp512 | tg128 生成 |
|---|---|---|---|
| RX 7900 XTX | 960 GB/s | 3 552 t/s | 167 t/s |
| RX 9070 XT | 640 GB/s | 5 055 t/s | 101 t/s |
| RX 9060 XT | 320 GB/s | 1 420 t/s | 68 t/s |
この表は2つのことを示しています。生成速度は帯域幅に依存します。7900 XTX(960 GB/s)は 9070 XT(640 GB/s)より約1.65倍速く、9060 XT(320 GB/s)より2.5倍速く生成します。一方、プロンプトの読み取りは行列演算の計算能力に大きく依存し、より新しい世代の 9070 XT はこの点で 7900 XTX を上回っています。長い応答を伴うチャット用途では、帯域幅と24 GBのVRAMが重要ですが、大きなドキュメントを入力とするRAG用途では、プロンプトの読み取り速度の方がより重要になります。
#70B、30B MoE、デュアルカード:どこまで行けるか
サイトの目安では、Q4量子化した70Bの密モデルは重みだけで約40 GBとなり、VRAMのほぼ2倍です。そのため、16 GBを超える分をシステムRAMに置く必要があり、速度はGPUではなくRAMとPCIeバスに制約されます。検証可能な情報源がないため、この場合の速度は示していません。実用上は扱いにくいとだけ覚えておいてください。24 GBの制約に対する実用的な解決策は、全体的な品質が同程度の300億〜350億パラメータのMoEモデルです。
7900 XTXを2枚使うと、メモリ容量の面で状況が大きく変わります。llama.cppのデフォルトの分割モードでは、モデルをレイヤー単位でカード間に分割し、パイプライン方式で動作させます。カードごとの配分比率を指定するオプションもあります。合計48 GBを利用でき、Q4の70Bモデルと少量のコンテキストを収めるには十分です。メリットはメモリに収まるモデルの大きさであり、トークンあたりの処理速度ではありません。各トークンは2枚のカードを順番に通過するためです。ハードウェア面では、355 Wのカード2枚だけで710 Wになり、PCのほかの部品の消費電力がさらに加わります。そのため、十分な容量の電源、適切なPCIeスロット2つ、通気性のよいケースが必要です。
#コンテキストとKVキャッシュ:24GBの本当の制限
モデルのサイズは、使用するメモリの一部にすぎません。KVキャッシュはコンテキストの長さに応じて増加します。ドキュメントによると、Ollamaはデフォルトで4,096トークンのコンテキストウィンドウを使用し、OLLAMA_CONTEXT_LENGTH変数で変更できます。最近のモデルは128,000〜262,000トークンのコンテキスト長を公表していますが、その長さを利用するには追加のメモリが必要です。対策は2つあります。バックエンドとGPUが対応している場合にOllamaが自動的に使用するFlash Attentionを有効にすることと、OLLAMA_KV_CACHE_TYPEでKVキャッシュを量子化することです(デフォルトはf16、メモリ削減にはq8_0)。KVキャッシュの量子化に関するガイドで、これらの設定を詳しく説明しています。
#7900 XTX、RTX 3090、4090:どう選ぶか
仕様上、RTX 3090も24GBを搭載しており、NVIDIAによればメモリはGDDR6Xです。したがって、選択を左右するのはソフトウェアスタック、環境、その時点の価格です。価格は変動するため、ここでは固定の値を示しません。購入前に、ローカルAI向けグラフィックカードの価格動向を確認してください。
| あなたの状況 | 推奨されるカード | なぜ |
|---|---|---|
| Linux、Ollama または llama.cpp、予算が厳しい状況 | RX 7900 XTX | ROCm 7とVulkanがサポートする24 GB |
| Windows、CUDAを必要とするツール(一部のファインチューニングプロジェクト) | RTX 3090 または 4090 | ほとんどのプロジェクトでは、引き続きCUDAがデフォルトの対象です |
| 本番環境でvLLMを使いたい | モデルを確認してください | vLLM は ROCm で 7900 をリストアップしています。サポートはバージョンにより異なります |
| 長いコンテキストと大きなMoE | 24 GB搭載のすべてのカード | ブランドよりもVRAMが重要 |
| 24 GBを超えるメモリが必要 | RTX 5090 (32 GB) またはデュアルカード | 24 GBのカードでは、どれも70BモデルをQ4でメモリに収められません |
新品と中古のグラフィックカードで迷っている場合は、7900 XTXが2022年12月に発売されたことを念頭に置いてください。中古品ではメーカー保証がすでに切れていることが多く、マイニングや連続稼働に使われたカードは、購入前に温度を確認しておくべきです。
- 24GBのVRAMに適したLLM:完全なモデル一覧
- AMD GPU(ROCm)でOllamaを使う:詳しい設定方法
- RX 7900 XT(20 GB)上で実行されるLLM
- RTX 3090(24 GB)で動かす LLM
- KV キャッシュの量子化で VRAM を節約
- ローカルAI向けグラフィックカードの価格
#よくある質問
RX 7900 XTXはローカルLLMに適していますか?+
RX 7900 XTXでどのモデルを選択すべきですか?+
RX 7900 XTXを2枚同時に使用できますか?+
RX 7900 XTXがFP8をサポートしていますか?+
RX 7900 XTXではROCmとVulkanのどちらを使うべきですか?+
7900 XTXはvLLMと互換性がありますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。