Radeon RX 6700 XT(12 GB)で利用可能なLLMは? ?
RX 6700 XT(12GB、384GB/s)は、Q4で14Bまでのモデル(約9GB)を問題なく動かせます。Gemma 4 12Bのような12Bモデルなら、コンテキスト用の余裕もあります。ROCmではなくVulkanを使います。このカードは、ROCmの公式リストにもOllamaのリストにも載っていません。生成速度はRTX 3060 12GBに匹敵し、上回ることさえありますが、プロンプトの読み込み速度はそのほぼ半分です。
この2021年のカードは、そもそもAI向けに設計されたものではありません。それでも、ソフトウェア側で見捨てられたわけではありません。このガイドでは、現在何を実行できるのか、どのソフトウェア経路を使うのか、公開された測定結果による速度はどの程度か、そして使い続けることに固執するより買い替えたほうが経済的になるのはいつかを説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: Radeon RX 9070 XT 16 GB.
なぜこの選択か? 完全な解説はこちら: Radeon RX 9070 XT 16 GB →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#2026年にRX 6700 XTでできること
Radeon RX 6700 XTは、次の3つの点を受け入れれば、ローカルLLM用の入門向けグラフィックスカードとして非常に適しています。12 GBのメモリには、Q4の140億パラメータモデル(重みは約9 GB)が収まりますが、24Bモデルは収まりません。AMDがこのカードをROCmの対応リストに掲載していないため、信頼できる実行方法はllama.cppまたはOllama経由のVulkanです。また、生成速度は384 GB/sの帯域幅に制約されますが、8B~12Bモデルでスムーズに会話するには十分です。llama.cppのリポジトリで公開された測定では、Q4_0の7BモデルはVulkanで毎秒83.88トークンを生成し、同じ議論の中で測定されたRTX 3060 12 GBをわずかに上回っています。最大の弱点はプロンプトの読み込みで、速度は半分になります。
- アーキテクチャ
- RDNA 2、Navi 22 チップ、2021年3月18日発売(Wikipedia の RX 6000 シリーズの記事)。
- 計算
- ストリームプロセッサ2,560基、コンピュートユニット40基。
- メモリ
- 12GB GDDR6、バス192ビット、384GB/s
- 消費電力
- カード全体の消費電力は230 Wです。
- 価格
- ここには記載していません。中古価格は毎週変動するため、/prix-gpu-ia をご確認ください。
#Ollama、ROCm、Vulkan:動作する構成を選ぶには
このカードで最もよくある落とし穴は、ROCmのガイドを探すことです。Ollamaのドキュメントでは、Linux向けにRadeon RX 6800から9070 XTまでが掲載されていますが、6700 XTは含まれていません。ROCmについては、AMDの互換性表に掲載されているRDNA 2のカードは、PRO W6800やV620などのプロ向けカードだけです。OllamaはVulkanによって対応範囲を補っており、Vulkanはバックエンドがインストールされていればデフォルトで有効になります。6700 XTでは、この方法が利用できます。ROCmにも回避策があり、変数HSA_OVERRIDE_GFX_VERSIONで近いLLVMターゲットを強制指定できますが、これは実験用途に限られます。
| パス | このカードへの対応状況 | どのような場合に選ぶべきか |
|---|---|---|
| Vulkan (Ollama, llama.cpp, LM Studio) | 動作確認済み(llama.cppで公開測定済み) | WindowsでもLinuxでも標準の選択肢 |
| 公式ROCm | ROCmリストおよびOllamaのリストにカードが存在しません | 避けるべき:サポートの保証は一切ありません |
| ROCmを強制(HSA_OVERRIDE_GFX_VERSION) | 他のグラフィックスカード向けにOllamaが文書化している回避策 | 検証済みの効果は期待せず、試す目的に限る |
#12GBのVRAMに収まるもの
このサイトでの計算方法は変わりません。Q4のモデルの重みの容量に、KVキャッシュの容量と、ドライバーおよび画面表示用の余裕を加えます。12 GBのカードが画面出力を担っていない場合、現実的なメモリ配分では、モデルとそのコンテキストに約11 GBを使えます。以下のサイズは、QuelLLMのカタログと当サイトで通常用いる目安に基づいており、モデルの重みだけの容量です。
| モデル | Q4 での重み | コンテキスト用に残るメモリ容量 | 判定 |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | 約 5 〜 6GB | 非常に快適で、長いコンテキストが可能です |
| Gemma 4 12B | ≈ 7 GB | 約4〜5GB | 余裕あり、中〜長程度のコンテキストに対応 |
| Phi-4 14B | ≈ 9 GB | 約2〜3GB | メモリに収まりますが、コンテキスト長を制限する必要があります |
| gpt-oss 20B | 約 13 GB | マイナス | 収まらないため、一部の処理をCPUに移行 |
| Devstral Small 2 24B | ≈ 14 GB | マイナス | Q4でも12GBには収まらない |
KVキャッシュは会話の長さに応じて増加するため、14Bモデルが紙面上では「収まる」ものの、履歴が長くなると動作が鈍くなる理由が説明されています。サイトのVRAM計算ツールでは、ご使用のモデルとコンテキストに対する正確な合計を算出でき、KVキャッシュの量子化に関するガイドでは、1〜2GBを回復する方法が解説されています。12 GBのすべてのカードについて、専用ページではAMDに限定せず、モデルを比較しています。
#実測スループットと帯域幅の上限
このページに掲載している処理速度は、いずれも当サイトが測定したものではありません。数値の出典はllama.cppリポジトリの公開ディスカッションで、同じモデルであるQ4_0のLlama 2 7B(3.56 GiB)とllama-benchコマンドを使い、Vulkan環境で各グラフィックカードを比較しています。重要なのは2つの値です。pp512は512トークンのプロンプトの読み込み速度、tg128は128トークンの生成速度です。RX 6700 XTについては、読み込みが1,051トークン/秒、生成が83.88トークン/秒と記載されています。Flash Attentionを有効にした場合は、それぞれ1,011トークン/秒と81.86トークン/秒です。
この結果は、単純な上限と比較できます。生成時には、トークンごとにGPUがすべての重みを再読み込みする必要があるため、最高速度の目安は帯域幅をモデルのサイズで割った値になります。ここでは、帯域幅384 GB/sと重みのサイズ3.82 GBから、理論上の上限は100トークン/秒となります。このGPUはその83%に達しており、効率は良好です。同じ議論で取り上げられた、より新しい複数のGPUよりも高い効率を示しています。
| モデル (Q4) | モデル容量 | 理論最大値 384 GB/s | 現実的な見積もり(83%) |
|---|---|---|---|
| Llama 3.1 8B | ≈ 6 GB | ≈64トークン/秒 | ≈ 50 から 55 トークン/秒 |
| Gemma 4 12B | ≈ 7 GB | ≈55トークン/秒 | ≈45トークン/秒 |
| Phi-4 14B | ≈ 9 GB | ≈ 43 tokens/s | 約35トークン/秒 |
これらの概算は、7Bモデルで測定した効率が、より大きなモデルでも得られることを前提としていますが、それは保証されていません。ドライバー、llama.cppのバージョン、量子化の違いによって、結果が数ポイント変わる可能性があります。プロンプトの読み込みについては、カード間の性能比だけを押さえてください。長い文書を扱うRAG用途で大きく影響するのは、このプロンプトの読み込みです。
#RTX 3060 12 GB との比較:生成は速いが、プロンプト処理は遅い
一般的な比較では、CUDAのおかげでRTX 3060 12 GBが優位に立つとされています。ただし、Vulkanで公開された測定結果を見ると、そう単純には言い切れません。生成では、RX 6700 XTが両方のモードでRTX 3060を上回ります。一方、プロンプトの読み込みでは、RTX 3060がほぼ2倍の性能を示します。この2系列の測定結果は同じディスカッションに掲載されていますが、llama.cppのバージョンが異なります。そのため、この差はおおよその規模を示す目安として捉え、確定した順位とは考えないでください。
| 測定 | RX 6700 XT | RTX 3060 (12 GB) |
|---|---|---|
| プロンプト処理(pp512)、Flash Attentionなし | 1 051,20 t/s | 1 815,70 t/s |
| 生成(tg128)、フラッシュアテンションなし | 83,88 t/s | 75,94 t/s |
| Flash Attention 使用時のプロンプト処理(pp512) | 1 010,90 t/s | 2 012,88 t/s |
| 生成(tg128)、Flash Attention使用 | 81,86 t/s | 80,59 t/s |
実際の使い勝手としては、モデルと会話する場合、両カードは同等です。一方、長い文書について質問する場合は、RTX 3060のほうが最初の語が出力されるまでの時間が短くなります。CUDAにはエコシステム面でも引き続き優位性があり、覚えておくべき回避策が少なくて済みます。中古価格が同程度なら、RTX 3060 12 GBが引き続き無難な選択です。6700 XTがお得といえるのは、すでにPCに搭載されているか、大幅に安い場合に限られます。
#ステップバイステップの起動手順
- 01Vulkanドライバーの状態を確認するWindowsではRadeonドライバーにVulkanが含まれており、Ollamaは追加手順を必要としません。LinuxではOllamaのドキュメントに従い、Mesa(RADV)のVulkanコンポーネントまたはAMDドライバーをインストールしてください。
- 02Ollamaをインストールするか、llama.cppをコンパイルするOllamaはバックエンドがインストールされた後、デフォルトでVulkanを有効にします。llama.cppでは、-DGGML_VULKAN=on をコンパイルオプションとして指定してください。
- 03LinuxでGPUへのアクセスを許可するカードが検出されない場合は、ollamaユーザーをrenderグループに追加してください。OllamaがVRAMの空き容量を読み取れるようにするには、rootとして実行するか、以下のコマンドで指定されているケイパビリティを付与してください。
- 04最初のモデルを起動8BモデルまたはGemma 4 12BをQ4_K_Mでダウンロードし、`ollama run`コマンドで起動してください。その後、`ollama ps`で、モデルがCPUではなくGPUに読み込まれていることを確認してください。
- 05お使いの環境で測定動作が遅い原因を探す前に、公開ディスカッションで使われたものと同じGGUFでllama-benchを実行し、自分のカードの結果をそこで公開されている結果と比較してください。
RADVで生成速度が低いと感じる場合、llama.cppのディスカッションでは、環境変数RADV_PERFTEST=nogttspillを設定して実行することを推奨しています。これにより、複数のパフォーマンス上の問題が解消されます。その他のVulkan設定については、専用のコンパイルガイドを参照してください。
#制限と、他の選択肢に移行するタイミング
三つの制約が浮かび上がります。まずメモリです。12 GB では、コードアシスタントや推論の品質を左右する、200 億〜320 億パラメータのモデルは使えません。次にプロンプトの処理で、長い文書を扱うセッションがつらくなります。最後にサポートです。公式の対応リストにないカードへの対応は、Vulkan や llama.cpp の更新で開発側がどこまで配慮してくれるかに左右され、長期的な保証はありません。
| あなたのニーズ | RX 6700 XTを使い続ける? | 買い替え候補 |
|---|---|---|
| 8B から 12B のモデルとの日常的なチャット | はい | なし |
| 14Bのローカルコードアシスタント | はい、短いコンテキスト | コンテキストが長くなる場合は16 GBのグラフィックスカード |
| 20B〜30Bのモデル(gpt-oss 20B、Devstral 24B) | いいえ、メモリが不足しています | 16~20GB のカード。専用ページは以下にあります |
| 大規模ドキュメントに対するRAG | 可能ですが、最初の単語が出るまで時間がかかります | プロンプトの読み込み性能がより高いカード |
| 公式サポートが保証されています | いいえ | Radeon RX 7000または9000、RTX |
#2026年の結論
- 使う価値があります
- すでにマシンに搭載している場合:2021年のカードの中では、今でも14BモデルをQ4で実行でき、生成時の効率が理論上限の80%を超える数少ないカードの一つです。
- 代わりにRTX 3060 12 GBを購入してください
- 一から構成を揃え、同じ予算を想定している場合:プロンプトの処理速度は2倍で、ソフトウェア上の回避策も不要です。
- GPUを変更する
- 200億から300億パラメータのモデルを必要とする場合。価格は毎週変動しており、/prix-gpu-iaのページではVRAMのGBあたりのコストを確認できます。
- ローカル AI 向けグラフィックカードの価格、週 2 回更新
- Ollamaドキュメント:対応GPU、ROCm、Vulkan
- llama.cpp リポジトリの Vulkan スコアボード (Llama 2 7B Q4_0)
- ROCm の GPU 互換性、AMD ドキュメント
#よくある質問
RX 6700 XT LLM:どのようなモデルを実行できるか?+
6700 XTはOllamaで動作しますか?+
ROCm は RX 6700 XT で実用的に使えますか?+
RX 6700 XT では 1 秒あたり何トークンですか?+
LLMを動かすなら、RX 6700 XTとRTX 3060 12 GBのどちらを選ぶべきですか?+
ローカルAI向けにRX 6700 XTを使うのをやめるべきなのは、どのような場合ですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。