初心者 11 分Radeon RX 6000

Radeon RX 6700 XT(12 GB)で利用可能なLLMは? ?

端的な回答

RX 6700 XT(12GB、384GB/s)は、Q4で14Bまでのモデル(約9GB)を問題なく動かせます。Gemma 4 12Bのような12Bモデルなら、コンテキスト用の余裕もあります。ROCmではなくVulkanを使います。このカードは、ROCmの公式リストにもOllamaのリストにも載っていません。生成速度はRTX 3060 12GBに匹敵し、上回ることさえありますが、プロンプトの読み込み速度はそのほぼ半分です。

この2021年のカードは、そもそもAI向けに設計されたものではありません。それでも、ソフトウェア側で見捨てられたわけではありません。このガイドでは、現在何を実行できるのか、どのソフトウェア経路を使うのか、公開された測定結果による速度はどの程度か、そして使い続けることに固執するより買い替えたほうが経済的になるのはいつかを説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16 GB.

なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16 GB →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#2026年にRX 6700 XTでできること

Radeon RX 6700 XTは、次の3つの点を受け入れれば、ローカルLLM用の入門向けグラフィックスカードとして非常に適しています。12 GBのメモリには、Q4の140億パラメータモデル(重みは約9 GB)が収まりますが、24Bモデルは収まりません。AMDがこのカードをROCmの対応リストに掲載していないため、信頼できる実行方法はllama.cppまたはOllama経由のVulkanです。また、生成速度は384 GB/sの帯域幅に制約されますが、8B~12Bモデルでスムーズに会話するには十分です。llama.cppのリポジトリで公開された測定では、Q4_0の7BモデルはVulkanで毎秒83.88トークンを生成し、同じ議論の中で測定されたRTX 3060 12 GBをわずかに上回っています。最大の弱点はプロンプトの読み込みで、速度は半分になります。

アーキテクチャ
RDNA 2、Navi 22 チップ、2021年3月18日発売(Wikipedia の RX 6000 シリーズの記事)。
計算
ストリームプロセッサ2,560基、コンピュートユニット40基。
メモリ
12GB GDDR6、バス192ビット、384GB/s
消費電力
カード全体の消費電力は230 Wです。
価格
ここには記載していません。中古価格は毎週変動するため、/prix-gpu-ia をご確認ください。

#Ollama、ROCm、Vulkan:動作する構成を選ぶには

このカードで最もよくある落とし穴は、ROCmのガイドを探すことです。Ollamaのドキュメントでは、Linux向けにRadeon RX 6800から9070 XTまでが掲載されていますが、6700 XTは含まれていません。ROCmについては、AMDの互換性表に掲載されているRDNA 2のカードは、PRO W6800やV620などのプロ向けカードだけです。OllamaはVulkanによって対応範囲を補っており、Vulkanはバックエンドがインストールされていればデフォルトで有効になります。6700 XTでは、この方法が利用できます。ROCmにも回避策があり、変数HSA_OVERRIDE_GFX_VERSIONで近いLLVMターゲットを強制指定できますが、これは実験用途に限られます。

RX 6700 XT 向けの3つのソフトウェアの選択肢
パスこのカードへの対応状況どのような場合に選ぶべきか
Vulkan (Ollama, llama.cpp, LM Studio)動作確認済み(llama.cppで公開測定済み)WindowsでもLinuxでも標準の選択肢
公式ROCmROCmリストおよびOllamaのリストにカードが存在しません避けるべき:サポートの保証は一切ありません
ROCmを強制(HSA_OVERRIDE_GFX_VERSION)他のグラフィックスカード向けにOllamaが文書化している回避策検証済みの効果は期待せず、試す目的に限る
!
このカードではROCmを当てにしないでください
Ollama は、ROCm がすべての AMD グラフィックカードに対応しているわけではないと記載し、トラブル対処用に HSA_OVERRIDE_GFX_VERSION 変数を提示しています。6700 XT については、結果が公開されている Vulkan と比べて性能が向上することを示す情報源はありません。何かを試す前に、rocminfo コマンドでターゲットを確認してください。

#12GBのVRAMに収まるもの

このサイトでの計算方法は変わりません。Q4のモデルの重みの容量に、KVキャッシュの容量と、ドライバーおよび画面表示用の余裕を加えます。12 GBのカードが画面出力を担っていない場合、現実的なメモリ配分では、モデルとそのコンテキストに約11 GBを使えます。以下のサイズは、QuelLLMのカタログと当サイトで通常用いる目安に基づいており、モデルの重みだけの容量です。

12GBのGPUに収まるモデル(Q4、重みのみ)
モデルQ4 での重みコンテキスト用に残るメモリ容量判定
Llama 3.1 8B≈ 6 GB約 5 〜 6GB非常に快適で、長いコンテキストが可能です
Gemma 4 12B≈ 7 GB約4〜5GB余裕あり、中〜長程度のコンテキストに対応
Phi-4 14B≈ 9 GB約2〜3GBメモリに収まりますが、コンテキスト長を制限する必要があります
gpt-oss 20B約 13 GBマイナス収まらないため、一部の処理をCPUに移行
Devstral Small 2 24B≈ 14 GBマイナスQ4でも12GBには収まらない

KVキャッシュは会話の長さに応じて増加するため、14Bモデルが紙面上では「収まる」ものの、履歴が長くなると動作が鈍くなる理由が説明されています。サイトのVRAM計算ツールでは、ご使用のモデルとコンテキストに対する正確な合計を算出でき、KVキャッシュの量子化に関するガイドでは、1〜2GBを回復する方法が解説されています。12 GBのすべてのカードについて、専用ページではAMDに限定せず、モデルを比較しています。

#実測スループットと帯域幅の上限

このページに掲載している処理速度は、いずれも当サイトが測定したものではありません。数値の出典はllama.cppリポジトリの公開ディスカッションで、同じモデルであるQ4_0のLlama 2 7B(3.56 GiB)とllama-benchコマンドを使い、Vulkan環境で各グラフィックカードを比較しています。重要なのは2つの値です。pp512は512トークンのプロンプトの読み込み速度、tg128は128トークンの生成速度です。RX 6700 XTについては、読み込みが1,051トークン/秒、生成が83.88トークン/秒と記載されています。Flash Attentionを有効にした場合は、それぞれ1,011トークン/秒と81.86トークン/秒です。

この結果は、単純な上限と比較できます。生成時には、トークンごとにGPUがすべての重みを再読み込みする必要があるため、最高速度の目安は帯域幅をモデルのサイズで割った値になります。ここでは、帯域幅384 GB/sと重みのサイズ3.82 GBから、理論上の上限は100トークン/秒となります。このGPUはその83%に達しており、効率は良好です。同じ議論で取り上げられた、より新しい複数のGPUよりも高い効率を示しています。

一般的なモデルに対する推定(計算に基づく、実測ではありません)
モデル (Q4)モデル容量理論最大値 384 GB/s現実的な見積もり(83%)
Llama 3.1 8B≈ 6 GB≈64トークン/秒≈ 50 から 55 トークン/秒
Gemma 4 12B≈ 7 GB≈55トークン/秒≈45トークン/秒
Phi-4 14B≈ 9 GB≈ 43 tokens/s約35トークン/秒

これらの概算は、7Bモデルで測定した効率が、より大きなモデルでも得られることを前提としていますが、それは保証されていません。ドライバー、llama.cppのバージョン、量子化の違いによって、結果が数ポイント変わる可能性があります。プロンプトの読み込みについては、カード間の性能比だけを押さえてください。長い文書を扱うRAG用途で大きく影響するのは、このプロンプトの読み込みです。

#RTX 3060 12 GB との比較:生成は速いが、プロンプト処理は遅い

一般的な比較では、CUDAのおかげでRTX 3060 12 GBが優位に立つとされています。ただし、Vulkanで公開された測定結果を見ると、そう単純には言い切れません。生成では、RX 6700 XTが両方のモードでRTX 3060を上回ります。一方、プロンプトの読み込みでは、RTX 3060がほぼ2倍の性能を示します。この2系列の測定結果は同じディスカッションに掲載されていますが、llama.cppのバージョンが異なります。そのため、この差はおおよその規模を示す目安として捉え、確定した順位とは考えないでください。

Vulkan使用時のRX 6700 XTとRTX 3060(Llama 2 7B Q4_0、llama.cppのディスカッション)
測定RX 6700 XTRTX 3060 (12 GB)
プロンプト処理(pp512)、Flash Attentionなし1 051,20 t/s1 815,70 t/s
生成(tg128)、フラッシュアテンションなし83,88 t/s75,94 t/s
Flash Attention 使用時のプロンプト処理(pp512)1 010,90 t/s2 012,88 t/s
生成(tg128)、Flash Attention使用81,86 t/s80,59 t/s

実際の使い勝手としては、モデルと会話する場合、両カードは同等です。一方、長い文書について質問する場合は、RTX 3060のほうが最初の語が出力されるまでの時間が短くなります。CUDAにはエコシステム面でも引き続き優位性があり、覚えておくべき回避策が少なくて済みます。中古価格が同程度なら、RTX 3060 12 GBが引き続き無難な選択です。6700 XTがお得といえるのは、すでにPCに搭載されているか、大幅に安い場合に限られます。

#ステップバイステップの起動手順

  1. 01
    Vulkanドライバーの状態を確認する
    WindowsではRadeonドライバーにVulkanが含まれており、Ollamaは追加手順を必要としません。LinuxではOllamaのドキュメントに従い、Mesa(RADV)のVulkanコンポーネントまたはAMDドライバーをインストールしてください。
  2. 02
    Ollamaをインストールするか、llama.cppをコンパイルする
    Ollamaはバックエンドがインストールされた後、デフォルトでVulkanを有効にします。llama.cppでは、-DGGML_VULKAN=on をコンパイルオプションとして指定してください。
  3. 03
    LinuxでGPUへのアクセスを許可する
    カードが検出されない場合は、ollamaユーザーをrenderグループに追加してください。OllamaがVRAMの空き容量を読み取れるようにするには、rootとして実行するか、以下のコマンドで指定されているケイパビリティを付与してください。
  4. 04
    最初のモデルを起動
    8BモデルまたはGemma 4 12BをQ4_K_Mでダウンロードし、`ollama run`コマンドで起動してください。その後、`ollama ps`で、モデルがCPUではなくGPUに読み込まれていることを確認してください。
  5. 05
    お使いの環境で測定
    動作が遅い原因を探す前に、公開ディスカッションで使われたものと同じGGUFでllama-benchを実行し、自分のカードの結果をそこで公開されている結果と比較してください。
ターミナル
sudo setcap cap_perfmon+ep /usr/local/bin/ollama
# llama.cpp avec Vulkan
cmake .. -DGGML_VULKAN=on -DCMAKE_BUILD_TYPE=Release
./bin/llama-bench -m llama-2-7b.Q4_0.gguf -ngl 100 -fa 0,1

RADVで生成速度が低いと感じる場合、llama.cppのディスカッションでは、環境変数RADV_PERFTEST=nogttspillを設定して実行することを推奨しています。これにより、複数のパフォーマンス上の問題が解消されます。その他のVulkan設定については、専用のコンパイルガイドを参照してください。

#制限と、他の選択肢に移行するタイミング

三つの制約が浮かび上がります。まずメモリです。12 GB では、コードアシスタントや推論の品質を左右する、200 億〜320 億パラメータのモデルは使えません。次にプロンプトの処理で、長い文書を扱うセッションがつらくなります。最後にサポートです。公式の対応リストにないカードへの対応は、Vulkan や llama.cpp の更新で開発側がどこまで配慮してくれるかに左右され、長期的な保証はありません。

使い続ける場合と買い替える場合
あなたのニーズRX 6700 XTを使い続ける?買い替え候補
8B から 12B のモデルとの日常的なチャットはいなし
14Bのローカルコードアシスタントはい、短いコンテキストコンテキストが長くなる場合は16 GBのグラフィックスカード
20B〜30Bのモデル(gpt-oss 20B、Devstral 24B)いいえ、メモリが不足しています16~20GB のカード。専用ページは以下にあります
大規模ドキュメントに対するRAG可能ですが、最初の単語が出るまで時間がかかりますプロンプトの読み込み性能がより高いカード
公式サポートが保証されていますいいえRadeon RX 7000または9000、RTX

#2026年の結論

使う価値があります
すでにマシンに搭載している場合:2021年のカードの中では、今でも14BモデルをQ4で実行でき、生成時の効率が理論上限の80%を超える数少ないカードの一つです。
代わりにRTX 3060 12 GBを購入してください
一から構成を揃え、同じ予算を想定している場合:プロンプトの処理速度は2倍で、ソフトウェア上の回避策も不要です。
GPUを変更する
200億から300億パラメータのモデルを必要とする場合。価格は毎週変動しており、/prix-gpu-iaのページではVRAMのGBあたりのコストを確認できます。

#よくある質問

FAQ
RX 6700 XT LLM:どのようなモデルを実行できるか?+
Q4で最大140億パラメータまでのモデルです。重みは約9 GBで、これにコンテキスト用のメモリが加わります。例としてLlama 3.1 8B、Gemma 4 12B、Phi-4 14Bがあります。gpt-ossのような20Bモデル(約13 GB)や24Bモデルは12 GBを超えるため、一部の処理がCPUに移り、速度が大きく低下します。
6700 XTはOllamaで動作しますか?+
はい、Vulkan経由で動作します。OllamaのROCm対応リストにはこのカードは記載されておらず、Linux向けのリストはRX 6800から始まります。ただし、バックエンドがインストールされていれば、OllamaはデフォルトでVulkanを有効にします。ollama ps コマンドで、モデルがGPUに読み込まれていることを確認してください。
ROCm は RX 6700 XT で実用的に使えますか?+
公式には対応していません。このカードは、RDNA 2では業務用カードのみを挙げているAMDのROCm互換性表にも、Ollamaのリストにも載っていません。HSA_OVERRIDE_GFX_VERSIONという変数を使う回避策はありますが、まだ実験的なもので、測定結果が公開されているVulkanに対して性能が向上することを示す公開測定はありません。
RX 6700 XT では 1 秒あたり何トークンですか?+
Llama 2 7BのQ4_0について、llama.cppリポジトリの公開ディスカッションでは、Vulkanでの生成速度が83.88トークン/秒と報告されています。Gemma 4 12BのQ4については、帯域幅をモデルの重みのサイズで割ると、約45トークン/秒と推定できます。これは計算による推定値なので、引用する前に、ご自身の環境でllama-benchを使って検証してください。
LLMを動かすなら、RX 6700 XTとRTX 3060 12 GBのどちらを選ぶべきですか?+
生成では両者は同等で、Vulkanを使った公開測定ではRadeonがわずかに上回っています。プロンプト処理ではRTX 3060がほぼ2倍速く、CUDAを使えば回避策も不要です。中古で同じ価格なら、RTX 3060 12 GBが最も手軽な選択肢です。
ローカルAI向けにRX 6700 XTを使うのをやめるべきなのは、どのような場合ですか?+
12GBには収まらない200〜320億パラメータのモデルを使いたい場合、または長いプロンプトの処理が遅くて利用に支障が出る場合です。その場合は、Radeon RX 7800 XTや7900 XTのような16〜20GBのグラフィックスカードへの移行が、次の合理的な選択肢になります。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。