Radeon RX 9060 XT(8 / 16 GB)で動かすLLMはどれ? ?
RX 9060 XTは、16 GB版を選べばローカルLLMに使用できます。AMDによると、帯域幅は8 GB版と同じ320 GB/sですが、Q4の120億〜240億パラメータのモデルに十分なメモリがあります。8 GB版で扱えるのは90億パラメータまでのモデルです。LinuxではROCm 7でサポートされています。
RX 9060 XT は、ローカル AI 向けのエントリーモデルに位置付けられる Radeon RDNA 4 です。このガイドでは、メモリ容量が異なる2つのバージョンを比較し、それぞれに何が収まるか、320 GB/s の帯域幅によって決まる速度の上限、Linux と Windows での互換性を説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16GB (ASUS Prime OC).
なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16GB (ASUS Prime OC) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。
#RX 9060 XT:LLM用途で本格的に使えるのは16GB版だけ
ローカルでLLMを実行するには、Radeon RX 9060 XT の16 GBバージョンを選択してください。両バージョンは同じグラフィックスプロセッサと320 GB/sの帯域幅を共有しており、容量だけが異なります。この容量が、読み込めるモデルを決定します。8 GBでは、Q4量子化の70億〜90億パラメータのモデルに制限され、コンテキストは短くなります。16 GBでは、120億〜240億パラメータのモデル、より長いコンテキスト、そしてより忠実な量子化に対応できます。発売時、AMDは8 GB版を299ドル、16 GB版を349ドルとしており、メモリを2倍にするための差額は50ドルでした。
| 特徴 | 8 GB | 16 GB |
|---|---|---|
| メモリ | 8 GB GDDR6 | 16 GB GDDR6 |
| メモリバスと帯域幅 | 128 ビット、最大 320 GB/s | 128 ビット、最大 320 GB/s |
| カードの典型的な性能 | 150 W | 160 W |
| 推奨される最低電源容量 | 450 W | 450 W |
| 発売時の米国での希望小売価格(2025年5月) | 299 $ | 349 $ |
価格は変動します。当日の価格やVRAM 1 GBあたりの価格は、ローカルAI向けグラフィックカードの価格推移をご覧ください。覚えておきたい原則は、安価なカードでは、16 GB版で利用可能になる機能やモデルを考えれば、追加費用は小さいということです。
#ROCm、VulkanおよびWindowsとの互換性
RX 9060 XTは、Radeon向けROCm 7.2.1の互換性マトリクスに、Ubuntu 22.04、24.04、25.10対応として掲載されています。Ollamaも、ROCm v7ドライバーを使うLinux環境でROCmがサポートするカードの一覧に、このカードを掲載しています。そのため、LinuxでROCmを使ってOllamaをインストールする手順は、ほかのRadeonカードと同じです。「AMD GPUでOllamaを使う」ガイドで、具体的な手順を説明しています。
Windowsでは注意が必要です。OllamaのドキュメントにあるWindowsでのROCm対応カード一覧はRX 7000までで、RX 9000には言及していません。一方、Ollamaは、WindowsとLinuxではVulkanによって対応範囲が広がり、デフォルトで有効になっていると説明しています。そのため、RX 9060 XTはWindowsでもVulkan経由で動作する可能性があります。ollama psで、モデルがCPUではなくGPU上で動いていることを確認してください。LM Studioとllama.cppにもVulkanバックエンドがあります。
#8GBと16GBに収まるもの
以下の重みは、特記がない限りQ4で、QuelLLMカタログからのものです。これらの重みに加えて、コンテキストとともに増加するKVキャッシュと、システムおよびバッファのための約1GBの余裕が必要です。したがって、重みだけでGPUを100%埋めるモデルは大きすぎます。
| モデル | モデル容量 | 8 GB | 16 GB |
|---|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | ぎりぎり動作、短いコンテキストに限定 | 快適 |
| Qwen 3.5 9B Q8 | 10 GB | いいえ | 快適 |
| Gemma 4 12B Q4 | 7 GB | メモリの余裕が少なすぎる | 快適 |
| Gemma 4 12B Q8 | 13 GB | いいえ | 余裕が少ない |
| gpt-oss 20B Q4 | 13 GB | いいえ | はい、コンテキスト長は中程度 |
| Mistral Small 24B Q4 | 14 GB | いいえ | 余裕は少なく、コンテキスト用に2GB |
| Qwen 3.8 27B Q4 | 16 GB | いいえ | いいえ、VRAM容量を超えます |
実用上の結論は一言でまとめられます。16 GB版なら、120億〜240億パラメータのモデルが選択肢に入り、推論、コード、フランス語の能力が大幅に高いモデルを利用できます。16 GBのVRAMに関するガイドには完全な一覧が、8 GBに関するガイドには限られたメモリを最大限に活用するコツが掲載されています。
#期待される速度:帯域幅が上限を決定します
テキスト生成では、トークンごとにモデルの重みの大部分を読み取ります。そのため、最大速度は帯域幅を読み取る重みのサイズで割った値になります。320 GB/sの場合、Q4のQwen 3.5 9B(6 GB)では約53トークン/秒、Gemma 4 12B(7 GB)では46トークン/秒、Mistral Small 24B(14 GB)では23トークン/秒、同じQwen 3.5 9BのQ8版(10 GB)では約32トークン/秒が上限です。これらは理論上の上限であり、実際にその値にぴったり達することはありません。アクティブな重みだけを読み取るMoEモデルは、この制約を部分的に回避できます。
比較可能な公開の参考データは、llama.cppコミュニティのROCmに関する表だけです。RX 9060 XTについて、ある参加者は、Flash Attentionを使わずにQ4_0形式のLlama 2 7Bを動かし、プロンプトの読み込みで毎秒1,420トークン、生成で毎秒68トークンを記録しています。この小型モデルは、前の表にあるモデルよりもはるかに軽量です。示しているのは速度の大まかな目安であり、お使いの環境での12Bや24Bの速度ではありません。その速度は、ドライバー、システム、カードのメーカーによって変わります。
| モデル | トークンごとに読み込むモデルの重みのデータ量 | 理論上の上限 |
|---|---|---|
| Qwen 3.5 9B Q4 | 6 GB | 約53トークン/秒 |
| Qwen 3.5 9B Q8 | 10 GB | ≈32トークン/秒 |
| Gemma 4 12B Q4 | 7 GB | ≈ 46 tokens/s |
| Mistral Small 24B Q4 | 14 GB | 約23トークン/秒 |
#16GBを超えないようにOllamaを設定する
16 GBでは、1 GB単位の余裕が重要です。エラーメッセージが出ないままCPUへのオフロードが起きて速度が落ちるのを防ぐ設定は3つあります。1つ目はコンテキスト長です。Ollamaのドキュメントによると、デフォルトは4,096トークンで、OLLAMA_CONTEXT_LENGTHで変更できます。コンテキスト長を2倍にするたびにKVキャッシュも増えます。2つ目はKVキャッシュ自体です。Flash Attentionが有効な場合、OLLAMA_KV_CACHE_TYPEで量子化できます(デフォルトはf16、削減する場合はq8_0)。3つ目は確認です。応答後にollama psを実行すると、GPUとCPUへの割り当てを確認できます。
考え方の例として、Mistral Small 24BのQ4版のような14 GBのモデルを16 GBのカードで動かすと、コンテキスト、キャッシュ、バッファに使える容量は約2 GBになります。ollama psでGPUとCPUへの分散が表示される場合は、モデルの一部をシステムRAMへはみ出させるのではなく、まずコンテキストを減らし、次にKVキャッシュを量子化し、その後にモデルの量子化を一段階下げてください。KVキャッシュの量子化に関するガイドで、この手順を詳しく説明しています。
#購入するか、待つか、24 GBモデルを狙うか
三つの状況が考えられます。最近のデスクトップPCと450 W以上の電源を持っている場合、9060 XT 16 GBは、小規模モデルの限定的な使用から、チャット、翻訳、軽度のコーディングといった本格的な使用に移行する簡単な手段です。270億から350億パラメータのモデルをターゲットにしている場合、16 GBとその320 GB/sでは不十分です:RX 7900 XTXのガイドにある24 GBのカードを検討してください。価格で判断がつかない場合、サイトの価格推移でVRAMのギガバイト単価を比較してください。ローカルAIにとって、これが適切な基準です。
#RX 9060 XTを2枚:32 GBをより安く確保できる?
この質問は検索で繰り返し見られます。llama.cppのデフォルトの分割モードでは、モデルを層単位でGPU間に分割してパイプライン処理し、オプションで各GPUへの割り当て比率を調整します。9060 XT 16 GBを2枚使うと、VRAMは合計32 GBになり、AMDによると標準的な消費電力は約320 Wです。これにより、Qwen 3.8 27BをQ4(重み16 GB)で長いコンテキストとともに読み込むか、300億〜350億パラメータのMoE(19〜21 GB)を読み込むことができます。
知っておくべき2つの制限があります。トークンあたりの速度は2倍になりません。カードは各トークンに対して順番に動作し、それぞれが320 GB/sの帯域幅を維持します。また、マザーボードには利用可能なPCIeスロットが2つ必要で、ケースには十分な通気性が求められます。7900 XTXのような単一の24 GBカードは、単一のバスで960 GB/sを提供します。そのカードに収まるモデルの場合、はるかに速く生成されます。
#FP8:理論上は利点があるものの、Ollamaでは影響は小さい
Radeon RX 9000シリーズはRDNA 4世代で、AMDは9060 XTのFP8演算性能を205 TFLOPsと記載しています。RX 7900 XTXの仕様表には、この記載はありません。OllamaやLM Studioでの一般的な利用では、この点はあまり重要ではありません。GGUF形式のモデルはFP8ではなく、整数形式(Q4、Q5、Q8)で量子化されているためです。この性能が役立つのは、FP8の重みを活用するエンジンを使う場合です。たとえばvLLMのドキュメントにはRX 9000シリーズが掲載されています。Ollamaを使い続けるのであれば、この性能を購入の決め手にしないでください。
#RX 9060 XTとRTX 5060 Ti:16 GBモデルの対決
NVIDIAは16 GB版と8 GB版のRTX 5060 Tiを提供しており、128ビットバスでGDDR7を搭載しています。一方、AMDのカードは128ビットバスでGDDR6です。より高速なメモリにより、NVIDIAは帯域幅、ひいては生成速度の面で優位に立っています。正確なスループットについては、NVIDIAの仕様表を参照してください。もう一つの利点はソフトウェア面です。CUDAはほとんどのAIプロジェクトのデフォルトターゲットです。
| あなたの優先事項 | 選択 | 理由 |
|---|---|---|
| 最大生成速度、CUDAが必要 | RTX 5060 Ti 16 GB | GDDR7メモリ、CUDAエコシステム |
| Linux、Ollamaまたはllama.cpp、控えめな予算 | RX 9060 XT 16 GB | ROCm 7 および Vulkan は一般的な用途をカバーしています |
| Windows、デバッグはまったくやりたくない | RTX 5060 Ti 16 GB | 最も幅広く使えるドライバーとツール |
| 16GBを超えるモデル | どちらでもない | 24GBを目標に:RX 7900 XTXまたはRTX 3090 |
| 予算が非常に限られている | RX 9060 XT 8 GB | 90億パラメータのモデルに限定 |
- 16GBのVRAMで利用可能なLLM:完全リスト
- 8GBのVRAMに適したLLM:ヒントと制限
- AMD GPU(ROCm)でのOllama:ステップバイステップのインストール手順
- RTX 5060 Ti(8 / 16 GB)上で動作するLLM
- RX 7900 XTX(24 GB)で動かすLLM
- ローカルAI向けグラフィックカードの価格
#よくある質問
LLM用のRX 9060 XTは8 GB版と16 GB版、どちらを選ぶべきですか?+
RX 9060 XTのトークン/秒はどれくらいですか?+
RX 9060 XT は Ollama と互換性がありますか?+
RX 9060 XTはFP8に対応していますか?+
2つのRX 9060 XTを接続して32 GBにできますか?+
RX 9060 XT にどの電源が必要ですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。