中級 11 分Radeon RX 9000

Radeon RX 9070(16 GB)で使えるLLM ?

端的な回答

Radeon RX 9070(RDNA 4、16 GB GDDR6、640 GB/s、220 W)は、Q4 量子化で 200 億から 240 億パラメータのモデルを動作させ、Vulkan 環境下では公開測定値によると Llama 2 7B の Q4_0 で約 120 トークン/秒を生成します。Linux では Ollama が ROCm v7 によりサポートしていますが、Windows では Ollama の ROCm サポート対象リストに含まれておらず、すでに良好な結果を出している Vulkan 経由で利用することになります。

RX 9070 は、この価格帯にある AMD の 16 GB 搭載グラフィックスカードの中で最新のモデルで、旧世代の RX 7000 シリーズに比べて消費電力が大幅に低くなっています。このガイドでは、動かせるモデル、公開された測定結果から分かる処理速度、Linux と Windows での違い、そして RX 9070 XT や 16 GB 搭載の RTX と比べた位置づけを説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このセットアップの場合: Radeon RX 9070 XT 16 GB.

なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16 GB →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#2026年に RX 9070 でできること

RX 9070は、Q4量子化された80億〜140億パラメータのモデルを難なく読み込めます。200億〜240億パラメータのモデルにも対応しますが、大きいモデルではコンテキストを短くする必要があります。256ビットのバス上で20.1 Gb/sで動作する16 GBのGDDR6メモリにより、メモリ帯域幅は640 GB/sです。これは、このページの旧版に記載されていた644 GB/sを訂正した数値です。Llama 2 7BのQ4_0では、llama.cppリポジトリの公開ディスカッションに、生成速度がVulkanで119.71トークン/秒、ROCmで114.48トークン/秒、プロンプト読み取り速度がVulkanで3,164トークン/秒と報告されており、RX 7800 XTや7900 GREより高速です。また、TDPが220 Wで、先行する16 GBモデルより40〜50 W低いことも強みです。

アーキテクチャ
RDNA 4、RX 9000 シリーズのチップで、9070 XT と同様の 256 ビットバスを備えています。
計算
ストリームプロセッサ3,584基(9070 XTは4,096基)。
メモリ
16 GB GDDR6、20.1 Gb/s、256ビットバス、640 GB/s
消費電力
TDPは220W(9070 XTでは304W)です。
価格
記載なし:価格は毎週変動するため、/prix-gpu-ia を参照してください。

#Linux、Windows:ROCm または Vulkan

RDNA 4世代の特徴は、システムによって対応状況が異なることです。AMDはROCmの対応一覧にRX 9070(ターゲット:gfx1201)を掲載しており、Ollamaのドキュメントにも、ROCm v7ドライバーを使うLinux向けの対応カードとして記載されています。一方、Windows向けのOllamaのROCm対応一覧はRX 7900 XTXまでで、RX 9070は含まれていません。ただし、デフォルトで有効になっているVulkan経由では利用でき、処理速度も良好です。最後に、AMDのドキュメントでは、Radeon RX 9000がサポートされるのはUbuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1、RHEL 9.7のみと明記されています。

RX 9070のサポート
環境ステータス実際の影響
Linux (Ubuntu 24.04.4, 22.04.5, RHEL 10.1, 9.7)ROCm公式対応、ターゲットはgfx1201ROCm v7ドライバーを使用するOllama
WindowsOllamaのROCm対応リストに記載なしVulkanを経由する(デフォルトで有効)
Vulkan、すべてのシステム汎用的な経路公開された測定結果では、ROCmと同程度のスループット
i
重要な違い
Ollamaのドキュメントにあるターゲット一覧表では、例としてRX 9070にgfx1200、9070 XTにgfx1201が示されています。一方、AMDの表ではRX 9070にgfx1201が対応しています。ドキュメントの例ではなく、ご自身のマシンで実行したrocminfoコマンドの結果を基準にしてください。

#16 GBのVRAMに収まるもの

グラフィックカードが画面表示に使われていない場合、モデルとKVキャッシュに使えるメモリは約15 GBと考えてください。以下のQuelLLMカタログの値はQ4の重みのサイズで、コンテキストに必要なメモリは別途加わります。

RX 9070に収まるモデル(重みのみ)
モデルモデル容量コンテキストの余裕判定
Llama 3.1 8B(Q4)≈ 6 GB≈ 9 GB非常に快適で、非常に長いコンテキストを扱える
Gemma 4 12B(Q8)約 13 GB≈ 2 GB収まる(コンテキストが短い場合)
gpt-oss 20BのQ4版約 13 GB≈ 2 GBメモリに収まる。コンテキストは短〜中程度
Devstral Small 2 24B (Q4)≈ 14 GB約 1 GB収まるが余裕は少ない
Gemma 4 26B-A4B Q4約 16 GBなしあまりにも正確すぎる

この 16 GB が、24B モデルは収まり、26〜30B モデルは収まらなくなる境界です。この容量の境界に関しては、どのメーカーの 16 GB カードも同等です。VRAM 容量別のページで比較しています。RX 9070 を特徴づけるのは、この容量に加えて得られる利点、つまりプロンプト処理の速さと消費電力の低さです。

#実測スループット:VulkanがROCmを上回る

これらの数値はllama.cppリポジトリの公開ディスカッションに由来し、いずれもLlama 2 7BのQ4_0(3.56 GiB)とllama-benchを使用しています。当サイトで測定したものではありません。RX 9070では、Vulkanのプロンプト読み込み速度は3,164.10トークン/秒、生成速度は119.71トークン/秒です。Flash Attentionを使用すると、それぞれ2,859.98と119.51になります。ROCmでは、それぞれ2,381.77と114.48です。両バックエンドの生成速度は近く、Vulkanがわずかに上回っています。プロンプト読み込み速度では、差がよりはっきりしています。測定系列ごとに構成、ドライバー、コミットが異なるため、これらの差はおおよその目安として捉えてください。

RX 9070でのLlama 2 7B Q4_0の性能(llama.cppを使った公開測定)
BackendFlash Attention読み込み pp512tg128 生成
Vulkanいいえ3 164,10 t/s119,71 t/s
Vulkanはい2 859,98 t/s119,51 t/s
ROCmいいえ2 381,77 t/s114,48 t/s

生成速度の理論上限は、640 GB/sを3.82 GBで割った約167トークン/秒です。このカードはVulkanでその上限の71%に達します。この効率をより大きなモデルにも適用すると、おおよその速度を見積もれます。これらは計算値であり、実測値ではありません。また、より大きなモデルも基準となる7Bモデルと同じように動作することを前提としています。

640 GB/sの上限の71%と見積もられています(計算値であり、実測値ではありません)
モデル (Q4)モデル容量理論上の上限概算
Llama 3.1 8B≈ 6 GB≈107トークン/秒約76トークン/秒
Gemma 4 12B≈ 7 GB≈ 91トークン/秒≈ 65 tokens/s
Phi-4 14B≈ 9 GB約71トークン/秒約50トークン/秒
Devstral Small 2 24B≈ 14 GB≈ 46 tokens/s≈32トークン/秒

#RDNA 4がローカルLLMに与える変化

RDNA 4ではAI専用ハードウェアが追加されています。シリーズの仕様表によると、RX 9070は112個のAIアクセラレータを搭載し、9070 XTは128個を搭載しています。そのため、RDNA 3よりもはるかに高い生成速度を期待できそうです。しかし、公開されている測定結果はそれを示していません。同じ議論で示された数値では、Vulkan環境のRX 9070が119.71トークン/秒、RX 7800 XTが118.27トークン/秒です。LLMの生成速度はメモリ帯域幅に制約され、640 GB/sは7800 XTの624 GB/sと大きくは変わりません。AIアクセラレータの効果はむしろプロンプトの読み取りに現れ、RX 9070は7800 XTを57%上回ります。

購入時の判断として、会話の速さを目的にRDNA 4へお金をかけるべきではありません。プロンプトの読み込み、消費電力の低さ、そしてソフトウェアサポートが続く期間を重視して選んでください。新しいカードは、古いカードよりも長くサポートされます。8〜14Bモデルでのチャットが用途なら、中古のRX 7800 XTでも生成性能は近いものになります。

#RX 9070 XT に対しては、差が「10%」を超える

このページの旧バージョンでは、RX 9070は9070 XTより10〜12%遅いと記載されていました。Vulkan環境での基準となる7Bモデルにおいて、9070 XTは1秒あたり137.11トークンを生成し、119.71トークンに対して15%速く、プロンプトの読み取りは1秒あたり5,036トークンに対して3,164トークンで59%速いです。しかし、両カードは同じ16 GBのメモリと、仕様表によると同じ帯域幅を持っています。したがって、差は計算能力(4,096のストリームプロセッサ対3,584)に起因し、生成時には影響が小さく、プロンプト読み取り時には大きく影響します。

RX 9070 および RX 9070 XT はVulkanで動作(Llama 2 7B Q4_0、FAなし)
基準RX 9070RX 9070 XT
ストリームプロセッサ3 5844 096
TDP220 W304 W
読み込み pp5123 164,10 t/s5 036,04 t/s
tg128 生成119,71 t/s137,11 t/s

つまり、チャットでは9070は速度が15%低い代わりに消費電力が84 W少なく、妥当なトレードオフといえます。RAGや長いドキュメントの処理では、9070 XTは約1.6倍の速さで読み込みます。

#16 GBのRTXと比べると、プロンプトが依然として弱点

Vulkanで測定された16 GBのNVIDIAカードと比べると、RX 9070の生成速度はやや低く、RTX 4070 Ti Superを8%、RTX 5070 Tiを12%下回ります。プロンプトの読み取り速度は約半分です。直接の競合としてよく挙げられる12 GBのRTX 5070は、参照元のVulkanに関する議論には登場しません。そのため、このカードとの信頼できる数値比較はなく、比較できるのは16 GB対12 GBという容量差だけです。

Vulkan 使用時の RX 9070 と 16 GB の RTX(Llama 2 7B Q4_0、FA なし)
カード読み込み pp512tg128 生成
RX 90703 164,10 t/s119,71 t/s
RTX 4070 Ti Super6 099,18 t/s129,45 t/s
RTX 5070 Ti6 213,63 t/s135,63 t/s

#セットアップ

  1. 01
    システムの選択
    Linuxでは、AMDのサポート対象範囲に収まるよう、Ubuntu 24.04.4、Ubuntu 22.04.5、RHEL 10.1、またはRHEL 9.7を使用してください。Windowsでは、Vulkanを利用してください。
  2. 02
    Ollama のインストール
    Linuxでは、amdgpu-installを使用してROCm v7ドライバーをインストールし、その後にOllamaをインストールしてください。WindowsではOllamaをインストールします。Vulkanはデフォルトで有効になります。
  3. 03
    モデルの読み込み
    24Bモデルを選ぶ前に、12Bまたは20Bモデルを選択し、ollama psでモデルがGPU上で100%動作していることを確認してください。
  4. 04
    バックエンドを比較する
    お使いのモデルで、まずVulkan、次にROCmを使ってllama-benchを実行してください。公開されている測定結果では、Vulkanがわずかに上回っています。
ターミナル
ollama ps
rocminfo | grep -i gfx
./llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

次の世代を待つべきでしょうか?引用した測定結果には、8〜24Bのモデルを使うために待つことを正当化するものはありません。制約は16GBという容量であり、これを解消できるのは20〜24GBのカードだけです。30B以上のモデルを使いたいとすでに分かっているなら、このカードは見送ってください。そうでなければ、16GBのカードを買う理由は、将来登場するものではなく、今動かすものにあります。

#2026年の結論

良い選択
消費電力を抑えたカード(220W)で16GBを確保したく、WindowsでVulkanを使うことを受け入れられる場合。
9070 XTを推奨
プロンプトが長い場合:読み取り速度は59%速くなり、電力消費は84W増加します
RTX 16GBを推奨します
CUDAが必要である場合、またはプロンプトの読み取り速度を2倍にしたい場合。

価格は急速に変化します。サイトは月曜日および木曜日に、AI用ローカルGPUの価格を、VRAMあたりのGB価格を含めて毎週追跡します。この最終的な数字が、RTX 5070またはRX 9070 XTと比較する際の基準となります。

#よくある質問

FAQ
ローカルLLMにはRX 9070とRX 9070 XTのどちらを選ぶべきですか?+
9070 XTは、Vulkanで7Bモデルをテストした場合、15%速く、プロンプトの読み込み速度は59%速く、TDPは304W(従来220W)です。チャット用途では9070で十分ですが、RAGや長文処理ではXTが適しています。現在の価格を比較してください。
ローカルLLMにはRX 9070とRTX 5070のどちらを選ぶべきですか?+
RX 9070は、RTX 5070の12GBに対して16GBのメモリを備えており、200億~240億パラメータのモデルを利用できます。RTX 5070にはCUDAエコシステムという利点があり、プロンプトの読み取りもより高速です。RTX 5070のVulkanでの公開測定値は見つかっていないため、数値による比較はまだこれからです。
RX 9070はOllamaでサポートされていますか?+
Linuxでは、ROCm v7ドライバーで可能です。Ollamaのリストに記載されています。Windowsでは、OllamaのROCmリストにはRX 7900 XTXまでしか含まれず、Vulkan(デフォルトで有効)により使用可能です。モデルがGPUにロードされているか、`ollama ps` で確認してください。
RX 9070は1秒あたり何トークンを生成できますか?+
llama.cppリポジトリの公開ディスカッションでは、Q4_0に量子化したLlama 2 7Bの生成速度として、Vulkanで119.71トークン/秒、ROCmで114.48トークン/秒という数値が報告されています。Q4に量子化した24Bモデルでは、計算上は約32トークン/秒になります。これは推定値なので、お使いの環境で実測してください。
16GBのRX 9070で動作可能なモデルは?+
Llama 3.1 8BとGemma 4 12BはQ8まで、gpt-oss 20BとDevstral Small 2 24BはQ4で実行できます。後者の2モデルは、短いコンテキストで使用してください。26〜30BのモデルはQ4でも16GBのVRAMに収まらず、一部の処理がCPUに移るため、速度が大幅に低下します。
RX 9070ではVulkanとROCmのどちらを選ぶべきですか?+
llama.cppのリポジトリで公開されている測定結果では、Vulkanは生成がやや速く(毎秒119.71トークン対114.48トークン)、プロンプトの処理も速くなっています(3,164対2,382)。Windowsでは、いずれにしてもVulkanがデフォルトの実行経路です。判断する前に、使用するモデルで両方を試してください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。