Radeon RX 9070 XT(16 GB)で使えるLLMは? ?
RX 9070 XT(16 GB GDDR6、AMDによると最大640 GB/s)は、LinuxでROCm 7を使う場合や、WindowsでVulkanを使う場合に、ローカルLLMの実行に適したグラフィックスカードです。gpt-oss 20BやMistral Small 24Bなど、Q4で重みのサイズが最大13〜14 GBのモデルを、VRAMに収めて読み込めます。270億パラメータのデンスモデルには容量が足りません。
RX 9070 XTは、AMDのRDNA 4世代のハイエンドRadeonです。このガイドでは、16GBのメモリで何ができるか、LinuxまたはWindowsでのインストール方法、公開されている測定結果から分かること、そしてRTX 5070 Tiや24GBのカードのほうが適している場合について説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このセットアップの場合: Radeon RX 9070 XT 16GB (ASUS Prime OC).
なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16GB (ASUS Prime OC) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。
#LLM向けのRX 9070 XT:16 GB、640 GB/s、優れた演算性能
Radeon RX 9070 XTは、RX 9000シリーズの一般向けRadeonの中で、LLM用途に最も高い能力を持つカードです。256ビットバスのGDDR6を16GB搭載し、AMDによるとメモリ帯域幅は最大640GB/sに達します。FP16とFP8での行列演算性能も、RX 7900 XTXを大きく上回ります。Q4で重みが約13〜14GB未満に収まるモデルなら、VRAMからあふれることなく実行できます。長いコンテキストでの9Bや12B、gpt-oss 20B、短いコンテキストでのMistral Small 24Bが該当します。限界となるのは容量です。270億パラメータのデンスモデルをQ4にしたもの(約16GB)は収まりません。
| 特徴 | 値 |
|---|---|
| メモリ | 16GB GDDR6、バス幅256ビット |
| 帯域幅 | 最大640 GB/s |
| ストリームプロセッサ/コンピュートユニット | 4 096 / 64 |
| AI アクセラレータ | 128 |
| FP16 / FP8 マトリクス計算 | 195 / 389 TFLOPs |
| カードの典型的な性能 | 304 W |
| 推奨される最低電源容量 | 750 W |
| 電源接続端子 | 2 x 8ピン |
#ソフトウェア:ROCm、Vulkan、LM Studio、vLLM
RX 9070 XTは、AMDのRadeonドキュメントにあるROCm 7.2.1の対応表(Ubuntu 22.04、24.04、25.10)に掲載されています。Ollamaは、ROCm v7ドライバーを使用するLinux環境でサポートされるカードとして掲載し、LLVMターゲットの表でgfx1201を9070 XTに対応付けています。LM Studioは、2025年7月のバージョン0.3.19で、ROCmを使ったLinux上のAMD 9000シリーズGPUへの対応を発表しました。vLLMは、AMDハードウェアの一覧にRadeon RX 9000(gfx1200とgfx1201)を掲載しています。
Windows 環境では、Ollama の ROCm サポートリストは RX 7000 までで止まっています。RX 9000 はリストに含まれていません。ただし、Ollama は、Vulkan が Windows と Linux で追加のサポートを提供し、デフォルトで有効化されると明記しています。したがって、Windows 上の 9070 XT は実際には Vulkan を通じて動作します。ollama ps を使用してモデルが GPU に正しく配置されていることを確認し、自分でコンパイルする場合は llama.cpp の Vulkan ガイドを参照してください。
#Linuxでの起動方法(Ollama)
- 01ROCm ドライバーのインストールOllamaが求めているとおり、AMDのROCmドキュメントに従ってamdgpu-installユーティリティを使用し、自分のユーザーをrenderグループとvideoグループに追加してから、再起動してください。
- 02検出の確認rocminfoでGPUエージェントが一覧に表示され、rocm-smiで16GBが表示される必要があります。そうでなければ、OllamaはCPUを使用します。
- 03最初のモデルを起動公式スクリプトでOllamaをインストールし、16GB以内のモデル(例:9B Q4)を起動してください。
- 04配置を確認する最初の応答後、ollama psには100 % GPUと表示されるはずです。GPUとCPUに処理が分散している場合は、モデルまたはコンテキストが大きすぎることを示します。
#16 GB に収まるモデル
重みは QuelLLM のカタログから取得し、特に記載がない場合は Q4 を使用します。KV キャッシュと約1ギガバイトの余裕を追加してください。VRAM 16 GB 向けの段階別完全リストは、VRAM 16 GB ガイドに記載されています。
| モデル | モデル容量 | 16GB に収まるか? | 理論上の上限 |
|---|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | はい、十分な余裕があります | ≈107トークン/秒 |
| Qwen 3.5 9B Q8 | 10 GB | はい | 64 tokens/s |
| Gemma 4 12B Q4 | 7 GB | はい、長いコンテキストでも可 | ≈ 91トークン/秒 |
| Gemma 4 12B Q8 | 13 GB | はい、短いコンテキスト | ≈ 49 tokens/s |
| gpt-oss 20B (MoE) | 13 GB | はい、コンテキスト長は中程度 | アクティブな重みに依存 |
| Mistral Small 24B Q4 | 14 GB | 余裕が少ない | ≈ 46 tokens/s |
| Qwen 3.8 27B Q4 | 16 GB | いいえ | - |
速度の上限は、帯域幅をトークンごとに読み込む重みの量で割った値です。どのグラフィックカードも、その値にぴったり達するわけではありません。gpt-oss 20BのようなMoEモデルは、トークンごとに読み込む重みの量がモデル全体の重みの量より少ないため、モデル全体がVRAMに収まることを条件に、同じサイズのDenseモデルより速く動作します。
#公表された測定結果
llama.cpp コミュニティの ROCm ベンチマーク表では、同じモデルである Llama 2 7B の Q4_0 を複数のグラフィックスカードで測定しています。RX 9070 XT については、ある参加者が、Flash Attention を使わずに、プロンプトの読み込み(pp512)で毎秒5,055トークン、生成(tg128)で毎秒101トークンと報告しています。表では、7900 XTX はそれぞれ毎秒3,552トークンと167トークン、9060 XT は毎秒1,420トークンと68トークンです。
| カード | AMDの帯域幅 | プロンプトの読み取り | 生成 |
|---|---|---|---|
| RX 7900 XTX | 960 GB/s | 3 552 t/s | 167 t/s |
| RX 9070 XT | 640 GB/s | 5 055 t/s | 101 t/s |
| RX 9060 XT | 320 GB/s | 1 420 t/s | 68 t/s |
2つの示唆があります。第一に、9070 XTは、帯域幅が低いにもかかわらず、長いプロンプトの読み取り速度が7900 XTXより約40%速いです。これは、より強力な行列計算の利点であり、RAG、長いドキュメント、多くのコンテキストを返すコードエージェントに有用です。第二に、生成速度では、50%高い帯域幅を持つ7900 XTXが依然として優位です。
#使用目的に応じてどのモデルを選ぶか
16GBの場合、適切な選択を左右するのは、モデルの最大サイズよりもコンテキスト用に残せるメモリの余裕です。目安は、重みを収めたうえで、KVキャッシュとバッファ用に少なくとも2GBの空きを確保することです。長い文書を扱う場合は、さらに多く確保してください。この表は、QuelLLMカタログのモデルの重みに基づいて、用途ごとの選択の出発点を示しています。
| 用途 | 初期モデル | Q4 の重み | 16 GBでの余裕 |
|---|---|---|---|
| 一般会話および文章作成 | Gemma 4 12B | 7 GB | 9 GB、長いコンテキストも利用可能 |
| コーディング、開発エージェント | Devstral Small 2 24B | 14 GB | 2 GB、短いコンテキスト |
| 高速推論(MoE) | gpt-oss 20B | 13 GB | 3 GB |
| 長いプロンプトを使うRAG | Qwen 3.5 9B | 6 GB | コンテキスト用10GB |
| 継続的な軽量タスク | Granite 4.2 8B | 4.6 GB | 11 GB |
RAGでは、9070 XTの行列計算性能が大きな強みです。数千トークンのプロンプトを高速に読み取れ、Q4の9BモデルならKVキャッシュ用に10 GBの余裕が残るため、長いコンテキストを扱えます。コード用途では、14 GBのモデルも収まりますが、コンテキストは短くなります。その場合は、KVキャッシュを量子化するか、コンテキストウィンドウを縮小する必要があります。
#コンテキストとKVキャッシュ:どちらの設定も重要です
Ollama のドキュメントでは、デフォルトのコンテキストウィンドウが 4 096 トークンであると記載されており、これは環境変数 OLLAMA_CONTEXT_LENGTH で変更できます。KV キャッシュは、Flash Attention が有効な場合、OLLAMA_KV_CACHE_TYPE で量子化され、デフォルトは f16 です。Ollama は、バックエンドとカードが対応している場合に自動的にこれを使用します。コンテキストは段階的に増やしながら ollama ps を監視してください。モデルの一部がプロセッサ(CPU)にオフロードされた時点で、一段階引き下げてください。
#RX 9070 XTでFP8:実際にどのような違いがあるか
AMD は 9070 XT について FP8 行列演算で 389 TFLOPs を示していますが、RX 7900 XTX の仕様書には記載されていません。実際には、Ollama と Q4 や Q5 の GGUF モデルを使用する場合、FP8 は消費されません。重みは量子化された整数だからです。FP8 は主に FP8 重みをロードするエンジン(vLLM など、RX 9000 をリストしているもの)に役立ちます。これは将来の余裕として捉え、即時的な利得として期待しないでください。そのためだけにカードを購入しないでください。16 GB の容量と帯域幅が、今日実行できるものを決定する二つの基準です。
#RX 9070 XT または RTX 5070 Ti
NVIDIAの仕様では、RTX 5070 Ti は256ビットのバスに16 GBのGDDR7を搭載しています。AMDのカードと同じ容量ですが、メモリの世代は異なります。容量が同じなら、メモリに収まるモデルも同じです。違いは生成速度、CUDAエコシステム、そして価格にありますが、ここでは価格を固定値で示しません。ローカルAI向けグラフィックスカードの価格追跡ページを確認してください。通常、選択の決め手になるのは価格です。
| あなたの状況 | 推奨されるカード | 理由 |
|---|---|---|
| Linux、OllamaまたはLM Studio、予算は控えめ | RX 9070 XT | ROCm 7 がサポートされています。16 GB、FP8計算が記載されています |
| Windowsを使っていて、デバッグは一切したくない | RTX 5070 Ti | CUDA エコシステム、より広範なドライバー対応 |
| CUDAを必要とするプロジェクト(一部のファインチューニングパイプライン) | RTX 5070 Ti | 多くのプロジェクトは引き続きCUDAを標準の対象としています |
| 長いプロンプトを使うRAG | RX 9070 XT または RTX 5070 Ti | 演算性能は帯域幅と同じくらい重要 |
| 270億パラメータ以上のモデル | 24GBのGPU | 16 GBのカードでは、どれも足りません |
#電源とケース
AMDは最低750Wの電源を推奨し、カードの標準的な消費電力を304Wとしています。8ピンコネクタは2つです。システム全体に必要な電源容量を決めるには、プロセッサ、ディスク、ファンの消費電力も加算してください。また、購入するメーカー製モデルの長さと厚さも確認してください。これらのカードは大型であることが多いためです。通気性の良いケースは、長時間の負荷による騒音とクロック周波数の低下を抑えます。カードが何時間もテキストを生成する場合、この点は重要です。常時稼働するAIサーバーでは、長期的にはアイドル時と負荷時の消費電力が購入価格と同じくらい重要になります。
- 16GBのVRAMで利用可能なLLM:完全リスト
- AMD GPU(ROCm)でOllamaを使う:インストール
- RX 7900 XTX(24 GB)で動かすLLM
- RX 9060 XT(8 / 16 GB)上で動作するLLM
- RX 9070 XT ハードウェア仕様
- ローカルAI向けグラフィックカードの価格
- 出典:AMDのRadeon RX 9070 XTスペックシート
- 出典:OllamaのGPUドキュメント
- ソース:LM Studio 0.3.19、AMD 9000シリーズ対応
- 出典:ROCm上でのllama.cppの性能一覧表
#よくある質問
RX 9070 XTはLLMのローカル実行に適していますか?+
RX 9070 XTでLM Studioを使うにはどうすればよいですか?+
RX 9070 XTではROCmとVulkanのどちらを使うべきですか?+
RX 9070 XTのトークン/秒はどれくらいですか?+
RX 9070 XT は FP8 をサポートしていますか?+
RX 9070 XTにはどの電源を選べばよいですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。