Radeon RX 9070(16 GB)で使えるLLM ?
Radeon RX 9070(RDNA 4、16 GB GDDR6、640 GB/s、220 W)は、Q4 量子化で 200 億から 240 億パラメータのモデルを動作させ、Vulkan 環境下では公開測定値によると Llama 2 7B の Q4_0 で約 120 トークン/秒を生成します。Linux では Ollama が ROCm v7 によりサポートしていますが、Windows では Ollama の ROCm サポート対象リストに含まれておらず、すでに良好な結果を出している Vulkan 経由で利用することになります。
RX 9070 は、この価格帯にある AMD の 16 GB 搭載グラフィックスカードの中で最新のモデルで、旧世代の RX 7000 シリーズに比べて消費電力が大幅に低くなっています。このガイドでは、動かせるモデル、公開された測定結果から分かる処理速度、Linux と Windows での違い、そして RX 9070 XT や 16 GB 搭載の RTX と比べた位置づけを説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このセットアップの場合: Radeon RX 9070 XT 16 GB.
なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16 GB →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#2026年に RX 9070 でできること
RX 9070は、Q4量子化された80億〜140億パラメータのモデルを難なく読み込めます。200億〜240億パラメータのモデルにも対応しますが、大きいモデルではコンテキストを短くする必要があります。256ビットのバス上で20.1 Gb/sで動作する16 GBのGDDR6メモリにより、メモリ帯域幅は640 GB/sです。これは、このページの旧版に記載されていた644 GB/sを訂正した数値です。Llama 2 7BのQ4_0では、llama.cppリポジトリの公開ディスカッションに、生成速度がVulkanで119.71トークン/秒、ROCmで114.48トークン/秒、プロンプト読み取り速度がVulkanで3,164トークン/秒と報告されており、RX 7800 XTや7900 GREより高速です。また、TDPが220 Wで、先行する16 GBモデルより40〜50 W低いことも強みです。
- アーキテクチャ
- RDNA 4、RX 9000 シリーズのチップで、9070 XT と同様の 256 ビットバスを備えています。
- 計算
- ストリームプロセッサ3,584基(9070 XTは4,096基)。
- メモリ
- 16 GB GDDR6、20.1 Gb/s、256ビットバス、640 GB/s
- 消費電力
- TDPは220W(9070 XTでは304W)です。
- 価格
- 記載なし:価格は毎週変動するため、/prix-gpu-ia を参照してください。
#Linux、Windows:ROCm または Vulkan
RDNA 4世代の特徴は、システムによって対応状況が異なることです。AMDはROCmの対応一覧にRX 9070(ターゲット:gfx1201)を掲載しており、Ollamaのドキュメントにも、ROCm v7ドライバーを使うLinux向けの対応カードとして記載されています。一方、Windows向けのOllamaのROCm対応一覧はRX 7900 XTXまでで、RX 9070は含まれていません。ただし、デフォルトで有効になっているVulkan経由では利用でき、処理速度も良好です。最後に、AMDのドキュメントでは、Radeon RX 9000がサポートされるのはUbuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1、RHEL 9.7のみと明記されています。
| 環境 | ステータス | 実際の影響 |
|---|---|---|
| Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7) | ROCm公式対応、ターゲットはgfx1201 | ROCm v7ドライバーを使用するOllama |
| Windows | OllamaのROCm対応リストに記載なし | Vulkanを経由する(デフォルトで有効) |
| Vulkan、すべてのシステム | 汎用的な経路 | 公開された測定結果では、ROCmと同程度のスループット |
#16 GBのVRAMに収まるもの
グラフィックカードが画面表示に使われていない場合、モデルとKVキャッシュに使えるメモリは約15 GBと考えてください。以下のQuelLLMカタログの値はQ4の重みのサイズで、コンテキストに必要なメモリは別途加わります。
| モデル | モデル容量 | コンテキストの余裕 | 判定 |
|---|---|---|---|
| Llama 3.1 8B(Q4) | ≈ 6 GB | ≈ 9 GB | 非常に快適で、非常に長いコンテキストを扱える |
| Gemma 4 12B(Q8) | 約 13 GB | ≈ 2 GB | 収まる(コンテキストが短い場合) |
| gpt-oss 20BのQ4版 | 約 13 GB | ≈ 2 GB | メモリに収まる。コンテキストは短〜中程度 |
| Devstral Small 2 24B (Q4) | ≈ 14 GB | 約 1 GB | 収まるが余裕は少ない |
| Gemma 4 26B-A4B Q4 | 約 16 GB | なし | あまりにも正確すぎる |
この 16 GB が、24B モデルは収まり、26〜30B モデルは収まらなくなる境界です。この容量の境界に関しては、どのメーカーの 16 GB カードも同等です。VRAM 容量別のページで比較しています。RX 9070 を特徴づけるのは、この容量に加えて得られる利点、つまりプロンプト処理の速さと消費電力の低さです。
#実測スループット:VulkanがROCmを上回る
これらの数値はllama.cppリポジトリの公開ディスカッションに由来し、いずれもLlama 2 7BのQ4_0(3.56 GiB)とllama-benchを使用しています。当サイトで測定したものではありません。RX 9070では、Vulkanのプロンプト読み込み速度は3,164.10トークン/秒、生成速度は119.71トークン/秒です。Flash Attentionを使用すると、それぞれ2,859.98と119.51になります。ROCmでは、それぞれ2,381.77と114.48です。両バックエンドの生成速度は近く、Vulkanがわずかに上回っています。プロンプト読み込み速度では、差がよりはっきりしています。測定系列ごとに構成、ドライバー、コミットが異なるため、これらの差はおおよその目安として捉えてください。
| Backend | Flash Attention | 読み込み pp512 | tg128 生成 |
|---|---|---|---|
| Vulkan | いいえ | 3 164,10 t/s | 119,71 t/s |
| Vulkan | はい | 2 859,98 t/s | 119,51 t/s |
| ROCm | いいえ | 2 381,77 t/s | 114,48 t/s |
生成速度の理論上限は、640 GB/sを3.82 GBで割った約167トークン/秒です。このカードはVulkanでその上限の71%に達します。この効率をより大きなモデルにも適用すると、おおよその速度を見積もれます。これらは計算値であり、実測値ではありません。また、より大きなモデルも基準となる7Bモデルと同じように動作することを前提としています。
| モデル (Q4) | モデル容量 | 理論上の上限 | 概算 |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈107トークン/秒 | 約76トークン/秒 |
| Gemma 4 12B | ≈ 7 GB | ≈ 91トークン/秒 | ≈ 65 tokens/s |
| Phi-4 14B | ≈ 9 GB | 約71トークン/秒 | 約50トークン/秒 |
| Devstral Small 2 24B | ≈ 14 GB | ≈ 46 tokens/s | ≈32トークン/秒 |
#RDNA 4がローカルLLMに与える変化
RDNA 4ではAI専用ハードウェアが追加されています。シリーズの仕様表によると、RX 9070は112個のAIアクセラレータを搭載し、9070 XTは128個を搭載しています。そのため、RDNA 3よりもはるかに高い生成速度を期待できそうです。しかし、公開されている測定結果はそれを示していません。同じ議論で示された数値では、Vulkan環境のRX 9070が119.71トークン/秒、RX 7800 XTが118.27トークン/秒です。LLMの生成速度はメモリ帯域幅に制約され、640 GB/sは7800 XTの624 GB/sと大きくは変わりません。AIアクセラレータの効果はむしろプロンプトの読み取りに現れ、RX 9070は7800 XTを57%上回ります。
購入時の判断として、会話の速さを目的にRDNA 4へお金をかけるべきではありません。プロンプトの読み込み、消費電力の低さ、そしてソフトウェアサポートが続く期間を重視して選んでください。新しいカードは、古いカードよりも長くサポートされます。8〜14Bモデルでのチャットが用途なら、中古のRX 7800 XTでも生成性能は近いものになります。
#RX 9070 XT に対しては、差が「10%」を超える
このページの旧バージョンでは、RX 9070は9070 XTより10〜12%遅いと記載されていました。Vulkan環境での基準となる7Bモデルにおいて、9070 XTは1秒あたり137.11トークンを生成し、119.71トークンに対して15%速く、プロンプトの読み取りは1秒あたり5,036トークンに対して3,164トークンで59%速いです。しかし、両カードは同じ16 GBのメモリと、仕様表によると同じ帯域幅を持っています。したがって、差は計算能力(4,096のストリームプロセッサ対3,584)に起因し、生成時には影響が小さく、プロンプト読み取り時には大きく影響します。
| 基準 | RX 9070 | RX 9070 XT |
|---|---|---|
| ストリームプロセッサ | 3 584 | 4 096 |
| TDP | 220 W | 304 W |
| 読み込み pp512 | 3 164,10 t/s | 5 036,04 t/s |
| tg128 生成 | 119,71 t/s | 137,11 t/s |
つまり、チャットでは9070は速度が15%低い代わりに消費電力が84 W少なく、妥当なトレードオフといえます。RAGや長いドキュメントの処理では、9070 XTは約1.6倍の速さで読み込みます。
#16 GBのRTXと比べると、プロンプトが依然として弱点
Vulkanで測定された16 GBのNVIDIAカードと比べると、RX 9070の生成速度はやや低く、RTX 4070 Ti Superを8%、RTX 5070 Tiを12%下回ります。プロンプトの読み取り速度は約半分です。直接の競合としてよく挙げられる12 GBのRTX 5070は、参照元のVulkanに関する議論には登場しません。そのため、このカードとの信頼できる数値比較はなく、比較できるのは16 GB対12 GBという容量差だけです。
| カード | 読み込み pp512 | tg128 生成 |
|---|---|---|
| RX 9070 | 3 164,10 t/s | 119,71 t/s |
| RTX 4070 Ti Super | 6 099,18 t/s | 129,45 t/s |
| RTX 5070 Ti | 6 213,63 t/s | 135,63 t/s |
#セットアップ
- 01システムの選択Linuxでは、AMDのサポート対象範囲に収まるよう、Ubuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1、またはRHEL 9.7を使用してください。Windowsでは、Vulkanを利用してください。
- 02Ollama のインストールLinuxでは、amdgpu-installを使用してROCm v7ドライバーをインストールし、その後にOllamaをインストールしてください。WindowsではOllamaをインストールします。Vulkanはデフォルトで有効になります。
- 03モデルの読み込み24Bモデルを選ぶ前に、12Bまたは20Bモデルを選択し、ollama psでモデルがGPU上で100%動作していることを確認してください。
- 04バックエンドを比較するお使いのモデルで、まずVulkan、次にROCmを使ってllama-benchを実行してください。公開されている測定結果では、Vulkanがわずかに上回っています。
次の世代を待つべきでしょうか?引用した測定結果には、8〜24Bのモデルを使うために待つことを正当化するものはありません。制約は16GBという容量であり、これを解消できるのは20〜24GBのカードだけです。30B以上のモデルを使いたいとすでに分かっているなら、このカードは見送ってください。そうでなければ、16GBのカードを買う理由は、将来登場するものではなく、今動かすものにあります。
#2026年の結論
- 良い選択
- 消費電力を抑えたカード(220W)で16GBを確保したく、WindowsでVulkanを使うことを受け入れられる場合。
- 9070 XTを推奨
- プロンプトが長い場合:読み取り速度は59%速くなり、電力消費は84W増加します
- RTX 16GBを推奨します
- CUDAが必要である場合、またはプロンプトの読み取り速度を2倍にしたい場合。
価格は急速に変化します。サイトは月曜日および木曜日に、AI用ローカルGPUの価格を、VRAMあたりのGB価格を含めて毎週追跡します。この最終的な数字が、RTX 5070またはRX 9070 XTと比較する際の基準となります。
- ローカル AI 向けグラフィックカードの価格、週 2 回更新
- Ollamaドキュメント:対応AMDカード
- ROCm の GPU 互換性、AMD ドキュメント
- llama.cpp リポジトリの Vulkan スコアボード
#よくある質問
ローカルLLMにはRX 9070とRX 9070 XTのどちらを選ぶべきですか?+
ローカルLLMにはRX 9070とRTX 5070のどちらを選ぶべきですか?+
RX 9070はOllamaでサポートされていますか?+
RX 9070は1秒あたり何トークンを生成できますか?+
16GBのRX 9070で動作可能なモデルは?+
RX 9070ではVulkanとROCmのどちらを選ぶべきですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。