中級 11 分Radeon RX 9000

Radeon RX 9070 XT(16 GB)で使えるLLMは? ?

端的な回答

RX 9070 XT(16 GB GDDR6、AMDによると最大640 GB/s)は、LinuxでROCm 7を使う場合や、WindowsでVulkanを使う場合に、ローカルLLMの実行に適したグラフィックスカードです。gpt-oss 20BやMistral Small 24Bなど、Q4で重みのサイズが最大13〜14 GBのモデルを、VRAMに収めて読み込めます。270億パラメータのデンスモデルには容量が足りません。

RX 9070 XTは、AMDのRDNA 4世代のハイエンドRadeonです。このガイドでは、16GBのメモリで何ができるか、LinuxまたはWindowsでのインストール方法、公開されている測定結果から分かること、そしてRTX 5070 Tiや24GBのカードのほうが適している場合について説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このセットアップの場合: Radeon RX 9070 XT 16GB (ASUS Prime OC).

なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16GB (ASUS Prime OC) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。

#LLM向けのRX 9070 XT:16 GB、640 GB/s、優れた演算性能

Radeon RX 9070 XTは、RX 9000シリーズの一般向けRadeonの中で、LLM用途に最も高い能力を持つカードです。256ビットバスのGDDR6を16GB搭載し、AMDによるとメモリ帯域幅は最大640GB/sに達します。FP16とFP8での行列演算性能も、RX 7900 XTXを大きく上回ります。Q4で重みが約13〜14GB未満に収まるモデルなら、VRAMからあふれることなく実行できます。長いコンテキストでの9Bや12B、gpt-oss 20B、短いコンテキストでのMistral Small 24Bが該当します。限界となるのは容量です。270億パラメータのデンスモデルをQ4にしたもの(約16GB)は収まりません。

RX 9070 XTの技術仕様(出典:AMD)
特徴値
メモリ16GB GDDR6、バス幅256ビット
帯域幅最大640 GB/s
ストリームプロセッサ/コンピュートユニット4 096 / 64
AI アクセラレータ128
FP16 / FP8 マトリクス計算195 / 389 TFLOPs
カードの典型的な性能304 W
推奨される最低電源容量750 W
電源接続端子2 x 8ピン
i
帯域幅:640GB/s(644GB/sではありません)
このガイドの以前の版を含め、一部のオンライン資料には644 GB/sと記載されています。AMDの公式仕様には「最大640 GB/s」と記載されており、計算にはこの値を使ってください。

#ソフトウェア:ROCm、Vulkan、LM Studio、vLLM

RX 9070 XTは、AMDのRadeonドキュメントにあるROCm 7.2.1の対応表(Ubuntu 22.04、24.04、25.10)に掲載されています。Ollamaは、ROCm v7ドライバーを使用するLinux環境でサポートされるカードとして掲載し、LLVMターゲットの表でgfx1201を9070 XTに対応付けています。LM Studioは、2025年7月のバージョン0.3.19で、ROCmを使ったLinux上のAMD 9000シリーズGPUへの対応を発表しました。vLLMは、AMDハードウェアの一覧にRadeon RX 9000(gfx1200とgfx1201)を掲載しています。

Windows 環境では、Ollama の ROCm サポートリストは RX 7000 までで止まっています。RX 9000 はリストに含まれていません。ただし、Ollama は、Vulkan が Windows と Linux で追加のサポートを提供し、デフォルトで有効化されると明記しています。したがって、Windows 上の 9070 XT は実際には Vulkan を通じて動作します。ollama ps を使用してモデルが GPU に正しく配置されていることを確認し、自分でコンパイルする場合は llama.cpp の Vulkan ガイドを参照してください。

#Linuxでの起動方法(Ollama)

  1. 01
    ROCm ドライバーのインストール
    Ollamaが求めているとおり、AMDのROCmドキュメントに従ってamdgpu-installユーティリティを使用し、自分のユーザーをrenderグループとvideoグループに追加してから、再起動してください。
  2. 02
    検出の確認
    rocminfoでGPUエージェントが一覧に表示され、rocm-smiで16GBが表示される必要があります。そうでなければ、OllamaはCPUを使用します。
  3. 03
    最初のモデルを起動
    公式スクリプトでOllamaをインストールし、16GB以内のモデル(例:9B Q4)を起動してください。
  4. 04
    配置を確認する
    最初の応答後、ollama psには100 % GPUと表示されるはずです。GPUとCPUに処理が分散している場合は、モデルまたはコンテキストが大きすぎることを示します。
検証
rocminfo | grep -i gfx
rocm-smi --showmeminfo vram
ollama ps

#16 GB に収まるモデル

重みは QuelLLM のカタログから取得し、特に記載がない場合は Q4 を使用します。KV キャッシュと約1ギガバイトの余裕を追加してください。VRAM 16 GB 向けの段階別完全リストは、VRAM 16 GB ガイドに記載されています。

モデルの重みのサイズ(QuelLLMカタログ)と640GB/sの帯域幅に基づく理論上限
モデルモデル容量16GB に収まるか?理論上の上限
Qwen 3.5 9B Q46 GBはい、十分な余裕があります≈107トークン/秒
Qwen 3.5 9B Q810 GBはい64 tokens/s
Gemma 4 12B Q47 GBはい、長いコンテキストでも可≈ 91トークン/秒
Gemma 4 12B Q813 GBはい、短いコンテキスト≈ 49 tokens/s
gpt-oss 20B (MoE)13 GBはい、コンテキスト長は中程度アクティブな重みに依存
Mistral Small 24B Q414 GB余裕が少ない≈ 46 tokens/s
Qwen 3.8 27B Q416 GBいいえ-

速度の上限は、帯域幅をトークンごとに読み込む重みの量で割った値です。どのグラフィックカードも、その値にぴったり達するわけではありません。gpt-oss 20BのようなMoEモデルは、トークンごとに読み込む重みの量がモデル全体の重みの量より少ないため、モデル全体がVRAMに収まることを条件に、同じサイズのDenseモデルより速く動作します。

!
「16 GB」ではできないこと
カタログによると、270億〜350億パラメータのQ4モデルのサイズは16〜21GBです。VRAMに収まらない分がシステムRAMにオフロードされ、速度が大幅に低下します。このクラスのモデルについては、24GB向けのガイドやRX 7900 XTXを検討してください。

#公表された測定結果

llama.cpp コミュニティの ROCm ベンチマーク表では、同じモデルである Llama 2 7B の Q4_0 を複数のグラフィックスカードで測定しています。RX 9070 XT については、ある参加者が、Flash Attention を使わずに、プロンプトの読み込み(pp512)で毎秒5,055トークン、生成(tg128)で毎秒101トークンと報告しています。表では、7900 XTX はそれぞれ毎秒3,552トークンと167トークン、9060 XT は毎秒1,420トークンと68トークンです。

Llama 2 7B Q4_0、llama.cpp ROCm(コミュニティ作成の表、Flash Attentionなし)
カードAMDの帯域幅プロンプトの読み取り生成
RX 7900 XTX960 GB/s3 552 t/s167 t/s
RX 9070 XT640 GB/s5 055 t/s101 t/s
RX 9060 XT320 GB/s1 420 t/s68 t/s

2つの示唆があります。第一に、9070 XTは、帯域幅が低いにもかかわらず、長いプロンプトの読み取り速度が7900 XTXより約40%速いです。これは、より強力な行列計算の利点であり、RAG、長いドキュメント、多くのコンテキストを返すコードエージェントに有用です。第二に、生成速度では、50%高い帯域幅を持つ7900 XTXが依然として優位です。

i
コミュニティがまとめた表は、統一条件でのベンチマークではありません
この同じ表では、RX 9070(非XT)の生成速度が114トークン/秒となっており、本来はより遅いはずなのに、101トークン/秒の9070 XTを上回っています。各行の数値は、異なるバージョンのllama.cppとドライバーで得られたものです。これらの数値は、おおよその目安として読み、厳密な順位としては決して扱わないでください。

#使用目的に応じてどのモデルを選ぶか

16GBの場合、適切な選択を左右するのは、モデルの最大サイズよりもコンテキスト用に残せるメモリの余裕です。目安は、重みを収めたうえで、KVキャッシュとバッファ用に少なくとも2GBの空きを確保することです。長い文書を扱う場合は、さらに多く確保してください。この表は、QuelLLMカタログのモデルの重みに基づいて、用途ごとの選択の出発点を示しています。

16 GB環境での用途別の出発点
用途初期モデルQ4 の重み16 GBでの余裕
一般会話および文章作成Gemma 4 12B7 GB9 GB、長いコンテキストも利用可能
コーディング、開発エージェントDevstral Small 2 24B14 GB2 GB、短いコンテキスト
高速推論(MoE)gpt-oss 20B13 GB3 GB
長いプロンプトを使うRAGQwen 3.5 9B6 GBコンテキスト用10GB
継続的な軽量タスクGranite 4.2 8B4.6 GB11 GB

RAGでは、9070 XTの行列計算性能が大きな強みです。数千トークンのプロンプトを高速に読み取れ、Q4の9BモデルならKVキャッシュ用に10 GBの余裕が残るため、長いコンテキストを扱えます。コード用途では、14 GBのモデルも収まりますが、コンテキストは短くなります。その場合は、KVキャッシュを量子化するか、コンテキストウィンドウを縮小する必要があります。

#コンテキストとKVキャッシュ:どちらの設定も重要です

Ollama のドキュメントでは、デフォルトのコンテキストウィンドウが 4 096 トークンであると記載されており、これは環境変数 OLLAMA_CONTEXT_LENGTH で変更できます。KV キャッシュは、Flash Attention が有効な場合、OLLAMA_KV_CACHE_TYPE で量子化され、デフォルトは f16 です。Ollama は、バックエンドとカードが対応している場合に自動的にこれを使用します。コンテキストは段階的に増やしながら ollama ps を監視してください。モデルの一部がプロセッサ(CPU)にオフロードされた時点で、一段階引き下げてください。

q8_0形式のKVキャッシュを使う32kコンテキスト
OLLAMA_CONTEXT_LENGTH=32768 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#RX 9070 XTでFP8:実際にどのような違いがあるか

AMD は 9070 XT について FP8 行列演算で 389 TFLOPs を示していますが、RX 7900 XTX の仕様書には記載されていません。実際には、Ollama と Q4 や Q5 の GGUF モデルを使用する場合、FP8 は消費されません。重みは量子化された整数だからです。FP8 は主に FP8 重みをロードするエンジン(vLLM など、RX 9000 をリストしているもの)に役立ちます。これは将来の余裕として捉え、即時的な利得として期待しないでください。そのためだけにカードを購入しないでください。16 GB の容量と帯域幅が、今日実行できるものを決定する二つの基準です。

#RX 9070 XT または RTX 5070 Ti

NVIDIAの仕様では、RTX 5070 Ti は256ビットのバスに16 GBのGDDR7を搭載しています。AMDのカードと同じ容量ですが、メモリの世代は異なります。容量が同じなら、メモリに収まるモデルも同じです。違いは生成速度、CUDAエコシステム、そして価格にありますが、ここでは価格を固定値で示しません。ローカルAI向けグラフィックスカードの価格追跡ページを確認してください。通常、選択の決め手になるのは価格です。

16GBのカードを選ぶ際の判断基準
あなたの状況推奨されるカード理由
Linux、OllamaまたはLM Studio、予算は控えめRX 9070 XTROCm 7 がサポートされています。16 GB、FP8計算が記載されています
Windowsを使っていて、デバッグは一切したくないRTX 5070 TiCUDA エコシステム、より広範なドライバー対応
CUDAを必要とするプロジェクト(一部のファインチューニングパイプライン)RTX 5070 Ti多くのプロジェクトは引き続きCUDAを標準の対象としています
長いプロンプトを使うRAGRX 9070 XT または RTX 5070 Ti演算性能は帯域幅と同じくらい重要
270億パラメータ以上のモデル24GBのGPU16 GBのカードでは、どれも足りません

#電源とケース

AMDは最低750Wの電源を推奨し、カードの標準的な消費電力を304Wとしています。8ピンコネクタは2つです。システム全体に必要な電源容量を決めるには、プロセッサ、ディスク、ファンの消費電力も加算してください。また、購入するメーカー製モデルの長さと厚さも確認してください。これらのカードは大型であることが多いためです。通気性の良いケースは、長時間の負荷による騒音とクロック周波数の低下を抑えます。カードが何時間もテキストを生成する場合、この点は重要です。常時稼働するAIサーバーでは、長期的にはアイドル時と負荷時の消費電力が購入価格と同じくらい重要になります。

#よくある質問

よくある質問
RX 9070 XTはLLMのローカル実行に適していますか?+
はい、16GBのメモリに収まるモデルなら適しています。長いコンテキストで使う9Bや12Bのモデル、gpt-oss 20B、短いコンテキストで使うMistral Small 24Bが該当します。640GB/sのメモリ帯域幅と行列演算性能により、特にプロンプトの読み込みが高速です。270億パラメータのデンスモデルには適していません。
RX 9070 XTでLM Studioを使うにはどうすればよいですか?+
LM Studioは、バージョン0.3.19以降、LinuxでROCmを使ったAMD 9000シリーズGPUへの対応を発表しています。Windowsでは、llama.cppのVulkanエンジンが補助的な選択肢です。いずれの場合も、14 GB未満のモデルを読み込み、すべてのレイヤーがGPU上にあることをインターフェースで確認してください。
RX 9070 XTではROCmとVulkanのどちらを使うべきですか?+
Linuxでは、ROCm 7がOllamaの公式な利用方法で、このカードのターゲットはgfx1201です。Windowsでは、OllamaのROCm対応リストにRX 9000が記載されていないため、デフォルトで有効なVulkanが実用的な選択肢です。使用するモデルでllama-benchを使って両者を比較してから判断してください。
RX 9070 XTのトークン/秒はどれくらいですか?+
モデルによって異なります。Q4_0のLlama 2 7Bについて、llama.cppのコミュニティによる表では、ROCm上での生成速度が101トークン/秒と記録されています。別のモデルでは、理論上の上限は640GB/sをモデルの重みのサイズで割った値です。重みが14GBの24Bモデルなら、速度低下の要因を一切考慮しない段階で約46トークン/秒になります。
RX 9070 XT は FP8 をサポートしていますか?+
仕様上は対応しています。AMDはFP8の行列演算性能を389 TFLOPsとしています。ただし、OllamaでQ4のGGUFモデルを使う場合、重みは量子化された整数なので、この性能を直接活用することはできません。FP8は、FP8の重みを読み込むエンジンで使われます。たとえばvLLMは、対応するハードウェアとしてRX 9000を挙げています。
RX 9070 XTにはどの電源を選べばよいですか?+
AMDは、電源容量を最低750 W、典型的な消費電力を304 Wとし、8ピン電源コネクタを2つ使用するとしています。PCのほかの部品の消費電力も加え、特にCPUが高性能な場合は余裕を持たせてください。お使いのカードのメーカーが公開しているモデルの仕様も確認してください。さらに大きな電源容量を推奨している場合があります。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。