AMD Radeon 9070XT GPUでのLLM性能
「9070xt llm」という検索語は、NVIDIAのカードを使わずにローカルでモデルを動かしたいRadeon RX 9070 XTユーザーによく検索されています。朗報です。16 GBのGDDR6とRDNA 4アーキテクチャのROCmサポートにより、メモリの制約を理解していれば、9070xt llm構成はほとんどの個人用途で実用になります。このページでは、推論に役立つカードの仕様、量子化方式(Q4、Q5、Q8、FP16)ごとのVRAM使用量、期待できるトークン/秒の処理速度、CPUへのオフロードを利用して動かせるquelllm.frのカタログ掲載モデル、ベンチマークの読み方、そして用途とAMD上で実際に動作するツール(llama.cpp、Ollama、vLLM)を詳しく説明します。
RX 9070 XTの推論用仕様書
LLMで重要なのは、単純な演算能力ではなく、メモリ帯域幅とVRAM容量です。この2点について、このカードは次のように位置づけられます:
- アーキテクチャ : RDNA 4、ROCm 識別子 gfx1201
- VRAM : 16GB GDDR6、バス256ビット
- 帯域幅 : 約 640 GB/s (メーカー指定値)
- 計算ユニット :64 CU、4,096基のストリームプロセッサ
- 通常の消費電力 : 負荷時304W
- ソフトウェアサポート :ROCm 6.4以降。代替としてllama.cppのVulkanバックエンドも利用可能
比較の目安として、帯域幅はRX 7900 XTに近いものの、VRAMは前世代の20GBまたは24GBに対して16GBにとどまります。購入前に押さえておきたいトレードオフです。 RX 9070 XT のページ モデルを適合性に従って並べており、および 専用インストールガイド では、導入手順を一つずつ説明しています。
VRAM:量子化方式ごとに16GBに収まるモデル
密モデルのメモリを推定するための実用的なルール:Q4 ではパラメータ 10 億あたり約 0.55〜0.6 GB、Q5 では 0.7 GB、Q8 では 1.05 GB、FP16 では 2 GB、さらにコンテキストに応じて増加する KV キャッシュが必要です。16 GB の環境では、システムと KV キャッシュ用に 1〜1.5 GB を確保すると:
- Q4 (Q4_K_M) :約200億〜240億パラメータまでのデンスモデル、コンテキスト8k〜16k
- Q5 :パラメータ数は約 160 億から 180 億まで
- Q8 : 最大で約120億から130億パラメータ
- FP16 :最大約70億パラメータまで。ローカル推論で役立つことはほとんどありません
このページで言及されている参照カタログのモデルは、すべてこれよりもはるかに大きいです。1,180億から1,280億パラメータのクラスから3つの例を取り上げましょう。ここでは、各トークンごとにアクティブなエキスパートのみが動作します:
- Qwen 3.5 122B-A10B :Q4は約73 GB、Q5は約88 GB(推定)、Q8は約130 GB(推定)、FP16は約245 GB(推定)。モデル情報: Qwen 3.5 122B-A10B
- Mistral Small 4 (119B):Q4で約72 GB、Q8で約128 GB(推定)。モデル紹介: Mistral Small 4
- Qwen3.8 Flash Next 125B-A6B :Q4で約72GB、アクティブなパラメータは60億のみ。モデル情報: Qwen3.8 Flash Next
これらのモデルはいずれも16GBのVRAMには収まりません。それでも、エキスパートをシステムRAMにオフロードできるため、9070 XTで使う候補として魅力があります。この仕組みは後ほど説明します。
生成速度(トークン/秒):おおよその推定値
生成において、完全にVRAMに収まるモデルの処理速度は帯域幅によって制限されます:各トークンはすべての重みを読み込む必要があります。8GBモデルでQ4の場合、理論的な帯域幅640 GB/sでは約80トークン/秒の上限が設定され、実際には55〜70%程度の値が観察されます。概算として、すべて 推定 であり、ご自身の構成で確認する必要があります:
- 70億〜90億パラメータのデンスモデル、Q4、VRAM 100% :45〜60トークン/秒
- 120億〜140億パラメータのDenseモデル、Q4 : 28から38トークン/秒
- 220億から240億パラメータのデンスモデル、Q4、短いコンテキスト : 15から22トークン/秒
- 300億パラメータ以上のデンスモデル、Q4 :CPUへの部分的なオフロードとなり、多くの場合3〜6トークン/秒で、日常的な利用にはつらい速度です
カタログ内のエキスパートモデルでは、スループットは主にシステムRAMに依存します。DDR5デュアルチャネルの64〜96 GBを使用し、アテンション層をVRAMに、エキスパートをRAMに配置することで、Qwen 3.5 122B-A10Bのようなアクティブパラメータ100億のモデルでは8〜15トークン/秒(推定)、Qwen3.8 Flash Next 125B-A6Bでは12〜20トークン/秒(推定)を目標とできます。プロンプトの処理は、すべてVRAMに収める場合よりも明らかに遅くなります。この手法は次の場所で文書化されています: llama.cppのGitHubリポジトリ テンソルの配置オプションを用いてCPU上に配置します。 ローカルベンチマーク比較ツール 期待する性能の目安となる、ほかのカードでの実測値を掲載しています。
CPUオフロードで利用できるMoEモデルとそのライセンス
十分なRAMを備えた9070 XT環境で本格的に使う場合の候補として、quelllm.frのカタログから、パラメータ数が1180億〜1420億のモデルを紹介します。商用利用の前には、必ずライセンスを確認してください:
- Qwen 3.5 122B-A10B (Alibaba):Apache 2.0、コンテキスト262k、Q4でのVRAM使用量は約73GB。重みの公開先: アリババのHugging Faceページ
- Qwen3.8 Flash Next 125B-A6B (Qwen):ライセンスは「その他、オープンウェイト」。内容をよく確認してください
- Mistral Small 4 (Mistral):Apache 2.0、コンテキスト256k。重さは Mistral の Hugging Face ページ
- Mistral Medium 3.5 128B :Modified MIT、VRAM Q4 約74 GB。モデル情報: Mistral Medium 3.5
- Nemotron 3 Super 120B (NVIDIA):NVIDIA Open Model License、Q4でのVRAM使用量は約72 GB。モデルの重みの入手先: NVIDIAのHugging Faceページ
- Laguna S 2.1 (Poolside) : OpenMDW 1.1、コード向け、Q4でのVRAM使用量は約68 GB、この中で最も軽量
- dots.llm1 Instruct (Rednote):MIT、Q4でのVRAM使用量は約85 GB、コンテキストは32kに制限
- Mixtral 8x22B Instruct (Mistral) : Apache 2.0、VRAM Q4 ~82 GB、アーキテクチャが古め
Apache 2.0とMITは、特別な条項なしに商用利用を認めています。「Modified MIT」「NVIDIA Open Model License」「OpenMDW」には追加の条件があり、そのモデルを使って製品を開発する前に、モデルのリポジトリで条件を読む必要があります。複数の候補で迷っている場合は、 比較ツール 2 つのモデル情報を並べて表示します。
ベンチマーク:このGPUのスコアの読み方
公開されているスコア(一般知識を測るMMLU、コードを評価するHumanEvalとLiveCodeBench、科学的推論を評価するGPQA)は、フル精度でのモデルの性能を測ったものであり、お使いの構成での性能を示すものではありません。9070 XTでは、次の3点に注意する必要があります:
- 量子化によりスコアがわずかに低下します。 :Q4_K_Mでは、120億パラメータを超えるモデルにおいて、MMLUでの劣化は通常2ポイント未満ですが、小規模モデルではより大きくなります。数値はモデルごとに確認が必要です。
- カタログ上のスコアは確認が必要です とOpen LLM Leaderboardを実行し、均一な条件下でオープンウェイトを評価してください。
- コンテキストのトリミングによって結果が変化します :コンテキスト長256kをうたうモデルでも、16 GBのVRAM上でコンテキスト長8kに設定して実行すると、長いコンテキストを使ったテストと同じ挙動にはなりません。
集計されたランキングに頼るよりも、ご自身のタスクとプロンプトで2つのモデルを比較する習慣をつけるのがよいでしょう。
実際の使用例とAMD互換のツール
9070 XTで日常的にうまく機能する用途には、エディタ内のコードアシスタント、文書の要約や言い換え、翻訳、ローカルRAGによる非公開ファイルの分析、短いタスクでのツールを使うエージェントの利用があります。数百ページに及ぶ契約書の分析など、非常に長いコンテキストを扱う用途では、量子化したKVキャッシュを使う小型モデルか、2枚目のGPUが必要です。
ソフトウェア側では:
- Ollama は2025年のバージョン以降、RDNA 4でのROCmに対応しています。手順は次のガイドに記載されています: AMD GPUでOllamaを使うためのガイド, およびプロジェクトは次の通りで追跡されています OllamaのGitHub
- llama.cpp は2つのバックエンドを提供しています。生成速度を重視するならROCm(HIP)、インストールの手軽さを重視するならVulkanです。Vulkanは、ROCmがカードを認識しない場合にも役立ちます
- vLLM は主に複数ユーザーへのサービス提供を対象としています。ROCmのサポートについては、次のサイトに記載されています: vLLMのサイト ただし、主にプロ向けGPUを対象としているため、このサポートを当てにする前に動作を試す必要があります
読み込み時にエラーが発生した場合、GPUが検出されない場合、または通知なしにCPUへ切り替わる場合、 Ollama GPUのトラブルシューティングガイド は、よくある原因をまとめています。16 GBを超える容量を確保するために2枚目のカードの追加を検討している場合は、 マルチGPU用のllama.cppガイド 層の配分について説明します。
FAQ
Q:RX 9070 XTは、ローカルLLMの初回セットアップに適していますか?
Q4量子化の240億パラメータまでのモデルに対応し、快適なスループットと、同等のVRAMを持つNVIDIAカードより低い価格を実現しています。弱点は16 GBのメモリです。より大きなモデルをターゲットにする場合は、24 GBのRX 7900 XTXの中古品と比較してください。Le GPU選定ガイド では、こうしたトレードオフを詳しく説明しています。
Q:LLM用途では、RX 9060 XT 16 GBとどのような違いがありますか?
VRAM容量が同じなので読み込めるモデルも同じですが、9060 XTは128ビットバスを備え、帯域幅は約半分です。トークン/秒で表す生成速度も、おおむねこの比率に従います。 9060 XT 16GBのベンチマーク は、このページの推定値と比較できる具体的な測定値を示しています。
Q:Qwen 3.5 122B-A10B を 9070 XT で実行することは可能ですか?
VRAMだけでは不可能です。Q4版のサイズは約73 GBです。システムRAMが96 GB以上あれば、llama.cppで共有層をGPUに残し、エキスパートをRAMにオフロードできます。その場合、処理速度は約8〜15トークン/秒(推定)に低下します。会話用途では許容できますが、長いプロンプトでは遅くなります。
Q:このカードではROCmとVulkanのどちらを使うべきですか?
ROCmでは一般に、スループットが10〜25%向上すると推定され、プロンプト処理も改善されます。VulkanはAMD固有の依存ソフトウェアなしでインストールでき、ほぼすべてのLinuxディストリビューションとWindowsで動作します。まずVulkanでハードウェアの動作を確認し、その速度向上に魅力を感じ、かつインストール済みのROCmのバージョンがgfx1201を認識する場合は、ROCmに切り替えてください。
Q:追加でどのくらいのシステムRAMを用意すべきですか?
VRAMに収まるモデルだけを使うなら、32 GBで十分です。カタログ掲載のエキスパート型モデルをシステムRAMへのオフロードで使うなら、最低64 GB、理想的にはデュアルチャネルDDR5で96~128 GBを目安にしてください。このモードでは、RAMの速度がトークン/秒に直接影響し、その影響はプロセッサ自体よりも大きくなります。
Q:GPUがほかの処理で使用中の場合、GPUなしで実行できるモデルはどれですか?
アクティブなパラメータ数が少ないモデルは、処理速度は低くなるものの、CPUだけでも引き続き利用できます。 GPUなし推論用の専用ページ スレッドおよび量子化設定について説明し、破損や順位の影響を解説します CPUのみ に候補モデルが掲載されています。
結論
9070xt llmのセットアップは、70億から240億パラメータのモデルで高速なローカルLLMを求める方にとって理にかなっており、カタログ内のエキスパートモデルでも、システムRAMへの投資があれば利用可能です。ここで示すスループットの数値は、お使いの機器で確認すべき推定値です。16 GBのVRAM、RAM、および用途に合ったモデルを見つけるには、を使用してください。 構成ツール または、以下を閲覧する 全モデルのカタログ VRAMによってフィルタリングされます
LLMをローカルで実行するためのハードウェア
これらのモデルを快適にローカルで実行するには、 RTX 5070 Ti は優れたコストパフォーマンスを備えています。価格を比較してください:
アフィリエイトリンク — ローカルLLMナビは、追加費用なしで購入に対する手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。