AMD Radeon 9070XT GPUでのLLM性能

「9070xt llm」という検索語は、NVIDIAのカードを使わずにローカルでモデルを動かしたいRadeon RX 9070 XTユーザーによく検索されています。朗報です。16 GBのGDDR6とRDNA 4アーキテクチャのROCmサポートにより、メモリの制約を理解していれば、9070xt llm構成はほとんどの個人用途で実用になります。このページでは、推論に役立つカードの仕様、量子化方式(Q4、Q5、Q8、FP16)ごとのVRAM使用量、期待できるトークン/秒の処理速度、CPUへのオフロードを利用して動かせるquelllm.frのカタログ掲載モデル、ベンチマークの読み方、そして用途とAMD上で実際に動作するツール(llama.cpp、Ollama、vLLM)を詳しく説明します。

RX 9070 XTの推論用仕様書

LLMで重要なのは、単純な演算能力ではなく、メモリ帯域幅とVRAM容量です。この2点について、このカードは次のように位置づけられます:

比較の目安として、帯域幅はRX 7900 XTに近いものの、VRAMは前世代の20GBまたは24GBに対して16GBにとどまります。購入前に押さえておきたいトレードオフです。 RX 9070 XT のページ モデルを適合性に従って並べており、および 専用インストールガイド では、導入手順を一つずつ説明しています。

VRAM:量子化方式ごとに16GBに収まるモデル

密モデルのメモリを推定するための実用的なルール:Q4 ではパラメータ 10 億あたり約 0.55〜0.6 GB、Q5 では 0.7 GB、Q8 では 1.05 GB、FP16 では 2 GB、さらにコンテキストに応じて増加する KV キャッシュが必要です。16 GB の環境では、システムと KV キャッシュ用に 1〜1.5 GB を確保すると:

このページで言及されている参照カタログのモデルは、すべてこれよりもはるかに大きいです。1,180億から1,280億パラメータのクラスから3つの例を取り上げましょう。ここでは、各トークンごとにアクティブなエキスパートのみが動作します:

これらのモデルはいずれも16GBのVRAMには収まりません。それでも、エキスパートをシステムRAMにオフロードできるため、9070 XTで使う候補として魅力があります。この仕組みは後ほど説明します。

生成速度(トークン/秒):おおよその推定値

生成において、完全にVRAMに収まるモデルの処理速度は帯域幅によって制限されます:各トークンはすべての重みを読み込む必要があります。8GBモデルでQ4の場合、理論的な帯域幅640 GB/sでは約80トークン/秒の上限が設定され、実際には55〜70%程度の値が観察されます。概算として、すべて 推定 であり、ご自身の構成で確認する必要があります:

カタログ内のエキスパートモデルでは、スループットは主にシステムRAMに依存します。DDR5デュアルチャネルの64〜96 GBを使用し、アテンション層をVRAMに、エキスパートをRAMに配置することで、Qwen 3.5 122B-A10Bのようなアクティブパラメータ100億のモデルでは8〜15トークン/秒(推定)、Qwen3.8 Flash Next 125B-A6Bでは12〜20トークン/秒(推定)を目標とできます。プロンプトの処理は、すべてVRAMに収める場合よりも明らかに遅くなります。この手法は次の場所で文書化されています: llama.cppのGitHubリポジトリ テンソルの配置オプションを用いてCPU上に配置します。 ローカルベンチマーク比較ツール 期待する性能の目安となる、ほかのカードでの実測値を掲載しています。

CPUオフロードで利用できるMoEモデルとそのライセンス

十分なRAMを備えた9070 XT環境で本格的に使う場合の候補として、quelllm.frのカタログから、パラメータ数が1180億〜1420億のモデルを紹介します。商用利用の前には、必ずライセンスを確認してください:

Apache 2.0とMITは、特別な条項なしに商用利用を認めています。「Modified MIT」「NVIDIA Open Model License」「OpenMDW」には追加の条件があり、そのモデルを使って製品を開発する前に、モデルのリポジトリで条件を読む必要があります。複数の候補で迷っている場合は、 比較ツール 2 つのモデル情報を並べて表示します。

ベンチマーク:このGPUのスコアの読み方

公開されているスコア(一般知識を測るMMLU、コードを評価するHumanEvalとLiveCodeBench、科学的推論を評価するGPQA)は、フル精度でのモデルの性能を測ったものであり、お使いの構成での性能を示すものではありません。9070 XTでは、次の3点に注意する必要があります:

集計されたランキングに頼るよりも、ご自身のタスクとプロンプトで2つのモデルを比較する習慣をつけるのがよいでしょう。

実際の使用例とAMD互換のツール

9070 XTで日常的にうまく機能する用途には、エディタ内のコードアシスタント、文書の要約や言い換え、翻訳、ローカルRAGによる非公開ファイルの分析、短いタスクでのツールを使うエージェントの利用があります。数百ページに及ぶ契約書の分析など、非常に長いコンテキストを扱う用途では、量子化したKVキャッシュを使う小型モデルか、2枚目のGPUが必要です。

ソフトウェア側では:

読み込み時にエラーが発生した場合、GPUが検出されない場合、または通知なしにCPUへ切り替わる場合、 Ollama GPUのトラブルシューティングガイド は、よくある原因をまとめています。16 GBを超える容量を確保するために2枚目のカードの追加を検討している場合は、 マルチGPU用のllama.cppガイド 層の配分について説明します。

FAQ

Q:RX 9070 XTは、ローカルLLMの初回セットアップに適していますか?

Q4量子化の240億パラメータまでのモデルに対応し、快適なスループットと、同等のVRAMを持つNVIDIAカードより低い価格を実現しています。弱点は16 GBのメモリです。より大きなモデルをターゲットにする場合は、24 GBのRX 7900 XTXの中古品と比較してください。Le GPU選定ガイド では、こうしたトレードオフを詳しく説明しています。

Q:LLM用途では、RX 9060 XT 16 GBとどのような違いがありますか?

VRAM容量が同じなので読み込めるモデルも同じですが、9060 XTは128ビットバスを備え、帯域幅は約半分です。トークン/秒で表す生成速度も、おおむねこの比率に従います。 9060 XT 16GBのベンチマーク は、このページの推定値と比較できる具体的な測定値を示しています。

Q:Qwen 3.5 122B-A10B を 9070 XT で実行することは可能ですか?

VRAMだけでは不可能です。Q4版のサイズは約73 GBです。システムRAMが96 GB以上あれば、llama.cppで共有層をGPUに残し、エキスパートをRAMにオフロードできます。その場合、処理速度は約8〜15トークン/秒(推定)に低下します。会話用途では許容できますが、長いプロンプトでは遅くなります。

Q:このカードではROCmとVulkanのどちらを使うべきですか?

ROCmでは一般に、スループットが10〜25%向上すると推定され、プロンプト処理も改善されます。VulkanはAMD固有の依存ソフトウェアなしでインストールでき、ほぼすべてのLinuxディストリビューションとWindowsで動作します。まずVulkanでハードウェアの動作を確認し、その速度向上に魅力を感じ、かつインストール済みのROCmのバージョンがgfx1201を認識する場合は、ROCmに切り替えてください。

Q:追加でどのくらいのシステムRAMを用意すべきですか?

VRAMに収まるモデルだけを使うなら、32 GBで十分です。カタログ掲載のエキスパート型モデルをシステムRAMへのオフロードで使うなら、最低64 GB、理想的にはデュアルチャネルDDR5で96~128 GBを目安にしてください。このモードでは、RAMの速度がトークン/秒に直接影響し、その影響はプロセッサ自体よりも大きくなります。

Q:GPUがほかの処理で使用中の場合、GPUなしで実行できるモデルはどれですか?

アクティブなパラメータ数が少ないモデルは、処理速度は低くなるものの、CPUだけでも引き続き利用できます。 GPUなし推論用の専用ページ スレッドおよび量子化設定について説明し、破損や順位の影響を解説します CPUのみ に候補モデルが掲載されています。

結論

9070xt llmのセットアップは、70億から240億パラメータのモデルで高速なローカルLLMを求める方にとって理にかなっており、カタログ内のエキスパートモデルでも、システムRAMへの投資があれば利用可能です。ここで示すスループットの数値は、お使いの機器で確認すべき推定値です。16 GBのVRAM、RAM、および用途に合ったモデルを見つけるには、を使用してください。 構成ツール または、以下を閲覧する 全モデルのカタログ VRAMによってフィルタリングされます

LLMをローカルで実行するためのハードウェア

これらのモデルを快適にローカルで実行するには、 RTX 5070 Ti は優れたコストパフォーマンスを備えています。価格を比較してください:

Amazon GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

アフィリエイトリンク — ローカルLLMナビは、追加費用なしで購入に対する手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。

記事の公開および更新日 著者: Mohamed Meguedmi · データソース: /api/models.json · コンテンツのライセンス: CC BY 4.0.

報告したい誤りや更新情報はありますか? 参加する.