初心者 11 分Radeon RX 9000

Radeon RX 9060 XT(8 / 16 GB)で動かすLLMはどれ? ?

端的な回答

RX 9060 XTは、16 GB版を選べばローカルLLMに使用できます。AMDによると、帯域幅は8 GB版と同じ320 GB/sですが、Q4の120億〜240億パラメータのモデルに十分なメモリがあります。8 GB版で扱えるのは90億パラメータまでのモデルです。LinuxではROCm 7でサポートされています。

RX 9060 XT は、ローカル AI 向けのエントリーモデルに位置付けられる Radeon RDNA 4 です。このガイドでは、メモリ容量が異なる2つのバージョンを比較し、それぞれに何が収まるか、320 GB/s の帯域幅によって決まる速度の上限、Linux と Windows での互換性を説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16GB (ASUS Prime OC).

なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16GB (ASUS Prime OC) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。

#RX 9060 XT:LLM用途で本格的に使えるのは16GB版だけ

ローカルでLLMを実行するには、Radeon RX 9060 XT の16 GBバージョンを選択してください。両バージョンは同じグラフィックスプロセッサと320 GB/sの帯域幅を共有しており、容量だけが異なります。この容量が、読み込めるモデルを決定します。8 GBでは、Q4量子化の70億〜90億パラメータのモデルに制限され、コンテキストは短くなります。16 GBでは、120億〜240億パラメータのモデル、より長いコンテキスト、そしてより忠実な量子化に対応できます。発売時、AMDは8 GB版を299ドル、16 GB版を349ドルとしており、メモリを2倍にするための差額は50ドルでした。

AMDの公表情報に基づくRX 9060 XTの8 GB版と16 GB版
特徴8 GB16 GB
メモリ8 GB GDDR616 GB GDDR6
メモリバスと帯域幅128 ビット、最大 320 GB/s128 ビット、最大 320 GB/s
カードの典型的な性能150 W160 W
推奨される最低電源容量450 W450 W
発売時の米国での希望小売価格(2025年5月)299 $349 $

価格は変動します。当日の価格やVRAM 1 GBあたりの価格は、ローカルAI向けグラフィックカードの価格推移をご覧ください。覚えておきたい原則は、安価なカードでは、16 GB版で利用可能になる機能やモデルを考えれば、追加費用は小さいということです。

#ROCm、VulkanおよびWindowsとの互換性

RX 9060 XTは、Radeon向けROCm 7.2.1の互換性マトリクスに、Ubuntu 22.04、24.04、25.10対応として掲載されています。Ollamaも、ROCm v7ドライバーを使うLinux環境でROCmがサポートするカードの一覧に、このカードを掲載しています。そのため、LinuxでROCmを使ってOllamaをインストールする手順は、ほかのRadeonカードと同じです。「AMD GPUでOllamaを使う」ガイドで、具体的な手順を説明しています。

Windowsでは注意が必要です。OllamaのドキュメントにあるWindowsでのROCm対応カード一覧はRX 7000までで、RX 9000には言及していません。一方、Ollamaは、WindowsとLinuxではVulkanによって対応範囲が広がり、デフォルトで有効になっていると説明しています。そのため、RX 9060 XTはWindowsでもVulkan経由で動作する可能性があります。ollama psで、モデルがCPUではなくGPU上で動いていることを確認してください。LM Studioとllama.cppにもVulkanバックエンドがあります。

i
自分で確認する必要がある点があります
当サイトはカードをテストしていません。上記の互換性は、AMD と Ollama が発表しているものです。インストール後、2つのコマンドで確認できます。Linux では rocm-smi でカードを表示し、回答後に ollama ps を実行して GPU に割り当てられた割合を読み取ってください。

#8GBと16GBに収まるもの

以下の重みは、特記がない限りQ4で、QuelLLMカタログからのものです。これらの重みに加えて、コンテキストとともに増加するKVキャッシュと、システムおよびバッファのための約1GBの余裕が必要です。したがって、重みだけでGPUを100%埋めるモデルは大きすぎます。

モデルのサイズ(QuelLLM カタログ)およびバージョンごとの評価
モデルモデル容量8 GB16 GB
Qwen 3.5 9B Q46 GBぎりぎり動作、短いコンテキストに限定快適
Qwen 3.5 9B Q810 GBいいえ快適
Gemma 4 12B Q47 GBメモリの余裕が少なすぎる快適
Gemma 4 12B Q813 GBいいえ余裕が少ない
gpt-oss 20B Q413 GBいいえはい、コンテキスト長は中程度
Mistral Small 24B Q414 GBいいえ余裕は少なく、コンテキスト用に2GB
Qwen 3.8 27B Q416 GBいいえいいえ、VRAM容量を超えます

実用上の結論は一言でまとめられます。16 GB版なら、120億〜240億パラメータのモデルが選択肢に入り、推論、コード、フランス語の能力が大幅に高いモデルを利用できます。16 GBのVRAMに関するガイドには完全な一覧が、8 GBに関するガイドには限られたメモリを最大限に活用するコツが掲載されています。

#期待される速度:帯域幅が上限を決定します

テキスト生成では、トークンごとにモデルの重みの大部分を読み取ります。そのため、最大速度は帯域幅を読み取る重みのサイズで割った値になります。320 GB/sの場合、Q4のQwen 3.5 9B(6 GB)では約53トークン/秒、Gemma 4 12B(7 GB)では46トークン/秒、Mistral Small 24B(14 GB)では23トークン/秒、同じQwen 3.5 9BのQ8版(10 GB)では約32トークン/秒が上限です。これらは理論上の上限であり、実際にその値にぴったり達することはありません。アクティブな重みだけを読み取るMoEモデルは、この制約を部分的に回避できます。

比較可能な公開の参考データは、llama.cppコミュニティのROCmに関する表だけです。RX 9060 XTについて、ある参加者は、Flash Attentionを使わずにQ4_0形式のLlama 2 7Bを動かし、プロンプトの読み込みで毎秒1,420トークン、生成で毎秒68トークンを記録しています。この小型モデルは、前の表にあるモデルよりもはるかに軽量です。示しているのは速度の大まかな目安であり、お使いの環境での12Bや24Bの速度ではありません。その速度は、ドライバー、システム、カードのメーカーによって変わります。

帯域幅320 GB/sでの理論上限(帯域幅 ÷ カタログ記載のQ4モデルの重み容量)
モデルトークンごとに読み込むモデルの重みのデータ量理論上の上限
Qwen 3.5 9B Q46 GB約53トークン/秒
Qwen 3.5 9B Q810 GB≈32トークン/秒
Gemma 4 12B Q47 GB≈ 46 tokens/s
Mistral Small 24B Q414 GB約23トークン/秒
→
Q8またはQ4:実際のコスト
Q4 から Q8 に切り替えると、トークンごとに読み込まれる重みの量がほぼ 2 倍になり、速度の上限はほぼ半分に低下します。帯域幅 320 GB/s のカードでは、チャット用途には Q4_K_M が最良のバランスを保ちます。Q8 は、滑らかさよりも精度が重要なタスクに限定して使用してください。

#16GBを超えないようにOllamaを設定する

16 GBでは、1 GB単位の余裕が重要です。エラーメッセージが出ないままCPUへのオフロードが起きて速度が落ちるのを防ぐ設定は3つあります。1つ目はコンテキスト長です。Ollamaのドキュメントによると、デフォルトは4,096トークンで、OLLAMA_CONTEXT_LENGTHで変更できます。コンテキスト長を2倍にするたびにKVキャッシュも増えます。2つ目はKVキャッシュ自体です。Flash Attentionが有効な場合、OLLAMA_KV_CACHE_TYPEで量子化できます(デフォルトはf16、削減する場合はq8_0)。3つ目は確認です。応答後にollama psを実行すると、GPUとCPUへの割り当てを確認できます。

コンテキスト長16k、KVキャッシュをq8_0に設定したサーバー
OLLAMA_CONTEXT_LENGTH=16384 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve
# dans un autre terminal
ollama run <nom-du-modèle>
ollama ps

考え方の例として、Mistral Small 24BのQ4版のような14 GBのモデルを16 GBのカードで動かすと、コンテキスト、キャッシュ、バッファに使える容量は約2 GBになります。ollama psでGPUとCPUへの分散が表示される場合は、モデルの一部をシステムRAMへはみ出させるのではなく、まずコンテキストを減らし、次にKVキャッシュを量子化し、その後にモデルの量子化を一段階下げてください。KVキャッシュの量子化に関するガイドで、この手順を詳しく説明しています。

#購入するか、待つか、24 GBモデルを狙うか

三つの状況が考えられます。最近のデスクトップPCと450 W以上の電源を持っている場合、9060 XT 16 GBは、小規模モデルの限定的な使用から、チャット、翻訳、軽度のコーディングといった本格的な使用に移行する簡単な手段です。270億から350億パラメータのモデルをターゲットにしている場合、16 GBとその320 GB/sでは不十分です:RX 7900 XTXのガイドにある24 GBのカードを検討してください。価格で判断がつかない場合、サイトの価格推移でVRAMのギガバイト単価を比較してください。ローカルAIにとって、これが適切な基準です。

#RX 9060 XTを2枚:32 GBをより安く確保できる?

この質問は検索で繰り返し見られます。llama.cppのデフォルトの分割モードでは、モデルを層単位でGPU間に分割してパイプライン処理し、オプションで各GPUへの割り当て比率を調整します。9060 XT 16 GBを2枚使うと、VRAMは合計32 GBになり、AMDによると標準的な消費電力は約320 Wです。これにより、Qwen 3.8 27BをQ4(重み16 GB)で長いコンテキストとともに読み込むか、300億〜350億パラメータのMoE(19〜21 GB)を読み込むことができます。

知っておくべき2つの制限があります。トークンあたりの速度は2倍になりません。カードは各トークンに対して順番に動作し、それぞれが320 GB/sの帯域幅を維持します。また、マザーボードには利用可能なPCIeスロットが2つ必要で、ケースには十分な通気性が求められます。7900 XTXのような単一の24 GBカードは、単一のバスで960 GB/sを提供します。そのカードに収まるモデルの場合、はるかに速く生成されます。

#FP8:理論上は利点があるものの、Ollamaでは影響は小さい

Radeon RX 9000シリーズはRDNA 4世代で、AMDは9060 XTのFP8演算性能を205 TFLOPsと記載しています。RX 7900 XTXの仕様表には、この記載はありません。OllamaやLM Studioでの一般的な利用では、この点はあまり重要ではありません。GGUF形式のモデルはFP8ではなく、整数形式(Q4、Q5、Q8)で量子化されているためです。この性能が役立つのは、FP8の重みを活用するエンジンを使う場合です。たとえばvLLMのドキュメントにはRX 9000シリーズが掲載されています。Ollamaを使い続けるのであれば、この性能を購入の決め手にしないでください。

#RX 9060 XTとRTX 5060 Ti:16 GBモデルの対決

NVIDIAは16 GB版と8 GB版のRTX 5060 Tiを提供しており、128ビットバスでGDDR7を搭載しています。一方、AMDのカードは128ビットバスでGDDR6です。より高速なメモリにより、NVIDIAは帯域幅、ひいては生成速度の面で優位に立っています。正確なスループットについては、NVIDIAの仕様表を参照してください。もう一つの利点はソフトウェア面です。CUDAはほとんどのAIプロジェクトのデフォルトターゲットです。

16GB構成での選択基準
あなたの優先事項選択理由
最大生成速度、CUDAが必要RTX 5060 Ti 16 GBGDDR7メモリ、CUDAエコシステム
Linux、Ollamaまたはllama.cpp、控えめな予算RX 9060 XT 16 GBROCm 7 および Vulkan は一般的な用途をカバーしています
Windows、デバッグはまったくやりたくないRTX 5060 Ti 16 GB最も幅広く使えるドライバーとツール
16GBを超えるモデルどちらでもない24GBを目標に:RX 7900 XTXまたはRTX 3090
予算が非常に限られているRX 9060 XT 8 GB90億パラメータのモデルに限定
!
当日の価格を確認せずに購入は勧められません
これらのカードの価格差は毎週変わり、選択が逆転することもあります。決める前に、当サイトの価格推移で比較してください。

#よくある質問

よくある質問
LLM用のRX 9060 XTは8 GB版と16 GB版、どちらを選ぶべきですか?+
16GB版を選んでください。AMDによると、どちらもメモリ帯域幅は320GB/sですが、8GB版ではQ4量子化した90億パラメータのモデルを短いコンテキストで使う場合に限られます。16GB版では、Gemma 4 12B、gpt-oss 20B、Mistral Small 24BをQ4で読み込めます。発売時の推奨価格の差は50ドルでした。
RX 9060 XTのトークン/秒はどれくらいですか?+
モデルによって異なります。理論上の上限は帯域幅(320 GB/s)を重みのサイズで割った値で、Q4の9Bモデルでは約53トークン/秒、24Bモデルでは約23トークン/秒です。Q4_0のLlama 2 7Bでは、llama.cppの表に投稿した参加者が、ROCmでの生成速度として68トークン/秒を報告しています。
RX 9060 XT は Ollama と互換性がありますか?+
Linuxでは対応しています。OllamaはこのカードをROCm v7の対応カード一覧に掲載しています。WindowsではOllamaのROCm対応一覧はRX 7000までですが、デフォルトで有効になっているVulkanが追加のサポートを提供します。ollama psで、モデルが100%GPU上に配置されていることを確認してください。
RX 9060 XTはFP8に対応していますか?+
AMDの仕様表にはFP8行列演算性能が205 TFLOPsと記載されていますが、RX 7900 XTXの仕様表にはこの記載はありません。OllamaやQ4のGGUFモデルは、この性能を直接活用するわけではありません。FP8が主に役立つのはvLLMで、vLLMはRadeon RX 9000を対応ハードウェアとして掲載しています。
2つのRX 9060 XTを接続して32 GBにできますか?+
llama.cppを使用すれば可能です。llama.cppはデフォルトでレイヤーをGPU間で分散配置します。32 GBの容量は得られますが、速度が2倍になるわけではありません。各カードは320 GB/sの帯域幅を維持し、交互に動作します。AMDの仕様によると、2枚のカードで約320 Wの消費電力を見込む必要があります。これにPCの残りの部分の消費電力が加わります。
RX 9060 XT にどの電源が必要ですか?+
AMDは両バージョンに最低450 Wの電源を推奨しており、標準的な消費電力は8 GB版が150 W、16 GB版が160 Wです。プロセッサとディスクの消費電力も加えて必要な電源容量を算出し、そのうえで購入するモデルの仕様を確認してください。カードメーカーによっては、AMDが示す最低容量よりも大きな電源容量を推奨しているためです。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。