AMD Radeon 6700XTで動作するLLMはどれか?
「6700xt llm」は、RDNA 2世代のグラフィックスカードを持ち、GPUを買い替えずにローカルモデルを使いたい方がよく検索するキーワードです。6700xtとLLMの組み合わせには朗報があります。このカードの12 GBのGDDR6メモリは、4ビット量子化した70億〜140億パラメータのモデルに十分で、チャット、コーディング、文書の要約に快適なスループットを提供します。主な制約は計算能力ではなくビデオメモリで、もう一つの障壁はソフトウェアです。RX 6700 XTはROCmで公式にサポートされていないため、設定の調整かVulkanバックエンドの使用が必要です。本記事では、重要な仕様、量子化形式ごとのVRAM使用量、現実的なスループット、ライセンスを詳しく解説します。その後、よくある質問に答え、構成ツールをご案内します。
RX 6700 XTでのローカル推論
仕様上、Radeon RX 6700 XTは2021年のゲーミング用グラフィックカードです。LLMを実行するうえで実際に重要なのは、3つの数値です。
- VRAM : 12 GBのGDDR6、バス幅192ビットです
- メモリ帯域 : 384 GB/s。これはトークン/秒の生成速度を制限する主要な要因です。生成される各トークンは、現在アクティブな重み全体を再読み込みます。
- アーキテクチャ : RDNA 2、識別子
gfx1031、40計算ユニット、専用マトリクスコアなし。
比較の観点から、16GBのカード(記載されたもの)のように Radeon RX 6800 XT向けLLMガイド ならQ4の24Bモデルを実行でき、24 GBのカードである RX 7900 XTX 32Bに達しています。6700 XTは12GBクラスに属し、RTX 3060 12GBと同じクラスです。NVIDIA。 RX 6700 XT向けに特化したガイド と、おすすめモデル一覧 Radeon RX 6700 XT向けで最も優れたLLM は、カタログに掲載されているモデルのうち、このメモリ容量に収まるものを一覧で紹介しています。
量子化形式別のVRAM使用量:Q4、Q5、Q8、FP16
計算方法は単純です。パラメータ数にパラメータあたりのバイト数を掛け、コンテキスト長に応じて増えるKVキャッシュを加えます。以下の概算値は、コンテキスト長8,192トークン、8ビットのKVキャッシュを前提として、一般的なGGUFファイルから推定したものです。
- 7〜8Bモデル :Q4 ≈ 5 GB、Q5 ≈ 6 GB、Q8 ≈ 9 GB、FP16 ≈ 16 GB。Q8まではすべて12 GBに収まりますが、FP16は収まりません。
- 12〜14B のモデル :Q4は約8~9 GB、Q5は約10 GB、Q8は約15 GB。Q4とQ5はVRAMに収まりますが、Q8は一部がシステムRAMにオフロードされます。
- 24〜27Bモデル :Q4では約15〜17GB。全体は収まりません。12GBのQ3なら可能ですが、品質が低下します。
- 30BのMoEモデルで3Bがアクティブ :Q4ではモデルの重みが約18 GBありますが、各トークンの処理で読み込まれるのはアクティブなエキスパートだけです。エキスパートをCPU側にオフロードしても、実用的な生成速度を維持できます。
転換点は明確です。12GBを超えると、llama.cppおよびOllamaは残りのレイヤーをプロセッサに転送し、帯域幅が5から10倍低下します。 「12GBのVRAMで使えるLLMのガイド」 は、サイズ × 量子化 × コンテキストの組み合わせのうち、100%GPU上で実行できるものを詳しく説明しています。
カタログの上位モデルが実行できないこと
quelllm.frのカタログにあるモデルの一部は6700 XTでは動かせません。ソフトウェアで奇跡が起きると期待させるより、その限界をはっきり伝えるほうがよいでしょう。
- DeepSeek R1 671B : ~400 GB(Q4)、MITライセンス。一般ユーザー向けのPC上でローカル実行は不可能です。どのGPUを用いても同様です。
- Qwen 3 235B-A22B :Q4で約142 GB、Apache 2.0。RAMが128 GBあっても実行できません。
- DeepSeek V4 Flash 284B :Q4で約170 GB、MITライセンス。マルチGPUサーバー、またはユニファイドメモリを搭載したハイエンドMac向けです。
- GLM 5.3 Flash 320B-A18B : ~186GB (Q4)、MIT。同じ評価です。
興味深い境界事例は、総パラメータ数が約120Bで、アクティブなパラメータ数が少ないMoEモデルです。 Qwen 3.5 122B-A10B Apache 2.0 ライセンスで Q4 では約73 GBです Qwen3.8 Flash Next 125B-A6B ~72 GBで6Bのアクティブパラメータのみを使用し、 Mistral Small 4 ~72GB(Apache 2.0ライセンス)。システムRAMが64GBで、GPUに12GBを割り当てることで、llama.cppはこれらのモデルをCPUに移行してロードできます。得られる速度はトークンごとで数トークン/秒程度で、RAMおよびCPUに応じて3〜8トークン/秒と推定されます。実際の環境で確認が必要です。これは夜間の大量処理に適していますが、インタラクティブなチャットには不向きです。重みは Hugging Face における Alibaba のページ et Hugging Face の Mistral ページ.
実際の生成速度(トークン/秒)とソフトウェアの選択
RDNA 2では、スループットはモデルと同じくらいバックエンドにも左右されます。利用できる方法は2つあります。
- OllamaとROCmの組み合わせ :6700 XTは公式リストに含まれていませんが、変数
HSA_OVERRIDE_GFX_VERSION=10.3.0により、同じファミリーのカードとして認識されます。詳しい手順は AMD ROCm対応のOllama GPUガイド ; デプロイ GitHub上のOllama 環境変数について説明しています。 - Vulkanを使用するllama.cpp : 特別なドライバーは不要で、WindowsでもLinuxでも動作します。バックエンドは llama.cppリポジトリ。生成速度はROCmとほぼ同等で、プロンプト処理はやや遅くなります。
- vLLM :RDNA 2 では現実的な選択肢ではありません。 vLLMドキュメント は、データセンター向けカードと比較的新しいRDNA 3カードを対象としています。
コミュニティが6700 XTで測定したおおよその値です。お使いのマシンで確認してください:
- Q4_K_Mの8Bモデル : 生成速度35〜45トークン/秒。
- Q4_K_Mの14Bモデル : 18〜25トークン/秒。
- エキスパートをCPU上で実行するMoE 30B-A3B :推定12〜20トークン/秒。
- Q4の24Bモデルを一部オフロード : 4から8トークン/秒、推定値。
Ollamaと組み合わせて使うチャットインターフェースとしては、 Open WebUI 単一のコンテナでデプロイでき、履歴、ドキュメント、複数のモデルを管理します。
ライセンスおよび実際の利用事例
ライセンスは、出力の利用可能範囲やモデルが製品に使用できるかどうかを決定します。カタログでは各アイテムのライセンスが表示されています。12GBのサイズに対応する主要なファミリーには、Apache 2.0、MIT、Llama Community およびいくつかの自社ライセンスが含まれます。ライセンスフィルターによる カタログ 商業利用に関する制限を含むライセンスを事前に除外できます
6700 XTが日常の利用で得意とすること:
- コードアシスタント :Q4で量子化した7〜14Bのモデルなら、エディタでのコード補完やレビューに十分な速さで応答します。各モデルの紹介ページにあるHumanEvalとLiveCodeBenchのスコアが、候補を比較する際に役立ちます。
- 非公開文書の要約とRAG :Q5で量子化した8Bモデルなら、8k〜16kのコンテキストがVRAMに収まります。それを超える場合は、KVキャッシュの量子化ビット数を下げてください。
- フランス語チャット :英語のMMLUスコアだけで判断するのではなく、モデルの紹介ページに多言語MMLUスコアやフランス語での評価が記載されているものを優先する。
- オフラインでのバッチ処理 :分類、フィールド抽出、言い換えなど、スループットよりも機密性が重視される処理。
モデル間のスコアを比較する場合、 Open LLM Leaderboard は引き続き公開の参照基準です。ただし、いつもの注意点があります。ベンチマークが測定するのは特定のタスクであり、ご自身の用途ではありません。
GPUを交換すべきですか?
12 GBの制限に直面している場合、AMD側には3つの段階があります。
- 16 GB :中古のRX 6800 XT、RX 7800 XT、または新品のRX 9060 XT。 9060 XT 16GBのベンチマーク は、24Bモデルでメモリ容量が4 GB増えることとRDNA 4がもたらす効果を示しています。
- 20 GB :RX 7900 XTなら、27BモデルをQ5でメモリに収められます。
- 24 GB :RX 7900 XTXは、実用的なコンテキスト長を確保しながら32BモデルをQ4で読み込める、AMD唯一の一般消費者向けグラフィックスカードです。
Le 比較ツール 2つの詳細ページを並べて表示し、VRAMの増加によって特定のモデルで実際に何が可能になるかを確認できます。
FAQ
Q:RX 6700 XT は ROCm と互換性がありますか?
公式にはありません。AMDは以下の内容をリストアップしていません。 gfx1031 ROCmをサポートするターゲットの中から。実際には、Ollama および ROCm 用にコンパイルされた llama.cpp は、強制的に動作します。 HSA_OVERRIDE_GFX_VERSION=10.3.0, カードを以下のように表現します gfx1030。この設定で問題が生じる場合、llama.cppのVulkanバックエンドなら、ROCmに依存せずに同程度のスループットを得られます。
Q:12GBのメモリで最大どのサイズのモデルが利用可能ですか?
14BモデルはQ4またはQ5なら、8kのコンテキストでも全体がVRAMに収まります。24Bまたは27Bモデルには、圧縮率の高いQ3量子化かCPUへの部分的なオフロードが必要で、スループットが大幅に低下します。総パラメータ数30B、アクティブパラメータ数3BのMoEモデルは、エキスパートをCPUにオフロードすることを条件に、14Bを超えるモデルの中で最もバランスの良い選択肢となります。
Q:DeepSeek R1 671B または Qwen 3 235B を 6700 XT で実行可能でしょうか?
いいえ。 DeepSeek R1 671B はQ4で約400 GBを必要とし、Qwen 3 235B-A22Bは約142 GBを必要とします。デスクトップPCでは、RAMと12 GBのVRAMをどのように組み合わせても足りません。約120Bでアクティブパラメータが6〜10BのMoEモデルが絶対的な限界で、RAM 64 GBを使い、生成速度は毎秒数トークン程度です。
Q:6700 XTでLLMを実行する場合、WindowsかLinuxが適していますか?
両方とも動作します。Windowsでは、llama.cppのVulkanバックエンドおよびOllamaの最新ビルドによりROCmのインストールが不要になります。Linuxでは、override変数を用いたROCmによりプロンプト処理が若干速くなるものの、生成速度の差は約10%と推定され、単独でシステムの変更を正当化するには不十分です。
Q:追加でどのくらいのシステムRAMを用意すべきですか?
VRAMに収まるモデルや、エキスパートをCPU側に配置する30B-A3BのMoEモデルには、32 GBで十分です。64 GBに増やす意味があるのは、Qwen3.8 Flash Next 125B-A6Bのような約120BのMoEモデルを、全面的にCPU側へオフロードして試したい場合だけです。ただし、生成速度は低下します。
Q:12 GBで長いコンテキストを扱えますか?
はい、ただしトレードオフがあります。8BモデルのKVキャッシュは、16ビットでは8kトークンごとに約1 GBを使用します。このキャッシュを8ビットに量子化すると、Q4の8Bモデルで12 GB以内に32kのコンテキストを収められます。同じ条件では、14Bモデルのコンテキストは16kまでです。カタログのモデル詳細には、各モデルが対応する最大コンテキスト長が記載されています。
結論
「6700xt llm」という検索への答えは、一文でまとめられます。70億〜140億パラメータのモデルをQ4またはQ5で、ROCmオーバーライドを設定したOllama、またはVulkanを使うllama.cpp経由で読み込めば、すべてをVRAMに収めて快適な生成速度で動作させられます。エキスパートをオフロードするMoEなら対応範囲が広がりますが、カタログ上位のモデルには依然として手が届きません。12 GBのVRAM、搭載RAM、希望するライセンスに適合するモデルの正確な一覧を得るには、次のツールをご利用ください: quelllm.frのモデル選定ツール.
LLMをローカルで実行するためのハードウェア
これらのモデルを快適にローカルで実行するには、 RTX 5070 Ti は優れたコストパフォーマンスを備えています。価格を比較してください:
アフィリエイトリンク — ローカルLLMナビは、あなたに追加費用をかけずに購入から手数料を受け取る場合があります。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。