2026年におけるRadeon RX 9070 XT(16 GB)で最も優れたLLM
特定する RX 9070 XTに最適なLLM 16GBのGDDR6 VRAMおよびAMDのROCmエコシステムを理解する必要があります。現在、RDNA4アーキテクチャ上で正常に動作しています。 RX 9070 XT は、2026年時点で、LinuxまたはWindowsの一般消費者向けGPU上でQ4量子化の270億パラメータモデルを実行するための、最も手軽な選択肢です。このガイドでは、ハードウェア仕様を検討し、quelllm.frのカタログからこのカードに適したモデルを選び、ライセンスを比較し、速度の目安と用途別の推奨事項を示します。
RX 9070 XTおよびROCm:モデルを選択する前に知っておくべきこと
Radeon RX 9070 XT は、256ビットバスを備えた16GBのGDDR6メモリを搭載しており、理論的な帯域幅は約576GB/sです。RDNA4アーキテクチャはこのバージョンからサポートされています ROCm 6.x、そのため、HIPバックエンドでコンパイルしたllama.cpp、Ollama ≥ 0.3.x、またはLM Studioを利用できます。ただし、Linuxでは最近のamdgpuドライバー、WindowsではROCm for Windowsがインストールされている必要があります。
モデルを起動する前に確認すべきポイント:
- 使用可能なVRAM :システムとドライバーのオーバーヘッドを差し引くと、実際に使えるのは約15.5 GB
- 帯域幅 : 約576 GB/s(推定)で、RTX 4090の約1,008 GB/sと比べると、推論速度もそれに比例して低下します
- 最も安定したバックエンド : llama.cpp と
-DGGML_HIPBLAS=ONLinux上で - 互換性 :確認する AMDの互換性マトリクス で、お使いのカーネルとドライバーの正確なバージョンに対応しているか確認する
- ネイティブ精度 : RDNA4の計算ユニットでFP16がサポートされています
朗報です。27B前後のモデルはQ4量子化なら16 GBにぴったりで、24Bクラスのモデルなら長いコンテキストにも十分な余裕があります。
16GBのVRAMに収まるモデルはどれですか?
Q4の概算ルールは、パラメータ10億あたり約0.55 GBです。したがって、27BモデルはQ4で約15〜16 GB、24Bは約13〜14 GB、32Bは約18〜19 GBとなり、上限を超えます。
26-27BサイズのQ4ネイティブ対応モデル(≤16GB)
- Gemma 2 27B — VRAM Q4 : 約16GB、 ctx : 8 192
- Gemma 3 27B — VRAM Q4 : 約16GB、 ctx : 128 000
- Qwen 3.5 27B — VRAM Q4 : 約16GB、 ctx : 262 000
- Qwen 3.6 27B — VRAM Q4 : 約16GB、 ctx : 262 144
- Qwen 3.8 27B — VRAM Q4 : 約16GB、 ctx : 262 144
- Gemma 4 26B-A4B MoE — VRAM Q4 : 約16GB、 ctx :128,000、エキスパート混合(MoE)アーキテクチャ
- Trinity Mini 26B-A3B — VRAM Q4 : ~15 GB, ctx : 131 072
24Bモデル(十分な余裕、空きメモリ2~3 GB)
- Mistral Small 3.2 24B — VRAM Q4 : 約14GB
- Magistral Small 24B — VRAM Q4 : 約14GB
- Devstral Small 2 24B — VRAM Q4 : 約14 GB、 ctx : 256 000
20-22Bモデル(大きな余裕、約3~5 GBの空き)
- Codestral 22B v0.1 — VRAM Q4 : ~13 GB, ctx : 32 000
- EuroLLM 22B Instruct 2512 — VRAM Q4 : ~13 GB、ヨーロッパ言語対応
- gpt-oss 20B — VRAM Q4 : ~13 GB, ctx : 128 000
32Bに関する注意点 : Q4(約19 GB)では、16 GBの可用VRAMを超過します。Q3(約13-14 GB、約0.42 GB/B)では技術的には可能ですが、測定可能な精度の損失が生じます。9070 XTでは、Q4で27Bを維持する選択が最も合理的です。
RX 9070 XT向けに推奨されるトップ5のモデル
1. Qwen 3.8 27B — 汎用性と長いコンテキスト
Qwen 3.8 27B は、27BクラスのQwen 3.xシリーズで最も先進的なバージョンで、AlibabaがApache 2.0ライセンスで公開しています。262,144トークンのコンテキスト長は、この規模のモデルで利用できるものの中でも最大級です。Q4では16 GBをすべて使用しますが、システムRAMへのオフロードは発生しません。
- ライセンス : Apache 2.0(商用利用が許可されています)
- VRAM Q4 : ~16 GB
- コンテキスト : 262,144トークン
- 長所 : 一般的な推論、コード、長距離の質問
- 推定速度 : RX 9070 XTで20〜30トークン/秒(コミュニティベンチマークに基づく推定、帯域幅に比例)
2. Gemma 3 27B — パフォーマンスが検証済み、コンテキスト128k
Gemma 3 27B のGoogle製は128,000トークンのコンテキストとよくドキュメント化されたアーキテクチャを提供しています。その Hugging FaceのOpen LLM Leaderboard により、理解力と指示への追従能力において、27Bクラスを代表するモデルの一つとされています。
- ライセンス : Gemma(一部商業用途に対する制限あり — Googleの利用規約を参照)
- VRAM Q4 : ~16 GB
- コンテキスト : 128,000トークン
- 長所 :離れた箇所の情報を理解する能力、指示に正確に従う能力
3. Magistral Small 24B — 構造化された推論
Magistral Small 24B はMistral AIのモデルで、多段階の推論タスクと構造化された分析向けに設計されています。Q4では約14GBを使用するため、9070 XTには2GBの余裕が残ります。これは、本番環境で長いシステムコンテキストを維持するのに役立ちます。
- ライセンス : Apache 2.0
- VRAM Q4 : 約14GB
- コンテキスト : 128,000トークン
- 長所 :分析、構造化された要約、複数のステップで動作するエージェント、連鎖的な推論
4. Devstral Small 2 24B — ソフトウェア開発エージェント
Devstral Small 2 24B (Apache 2.0、Mistral AI)は、開発用エージェントを明確に対象としており、256,000トークンという非常に大きなコンテキスト長を備えています。コードベース全体を一度に取り込めるため、自動レビュー、テスト生成、ドキュメント作成に適しています。
- ライセンス : Apache 2.0
- VRAM Q4 : 約14GB
- コンテキスト : 256,000トークン
- 長所 :コード生成、リファクタリング、大規模なコードベースの読解
5. Codestral 22B v0.1 — コードに特化した、軽量モデル
Codestral 22B v0.1 はMistral AIのモデルで、23B未満のコード向けモデルの代表格の一つです。fill-in-the-middle(FIM)に対応し、同規模の汎用モデルを上回るHumanEvalスコアを達成しています(GGUF Q4での正確なスコアは要確認)。Q4でのサイズはわずか約13 GBです。
- ライセンス : Mistral Non-Production License(非商用利用のみ)
- VRAM Q4 : 約13GB
- コンテキスト : 32,000トークン
- 長所 : コード補完、FIM、IDE統合
ライセンス:Apache 2.0、MIT、Gemma — 用途によって何が変わるか
ライセンスの選択によって、企業や製品での利用条件が決まります。
商用利用が可能な自由なライセンス(Apache 2.0またはMIT)
- Qwen 3.5 27B, Qwen 3.6 27B, Qwen 3.8 27B — Apache 2.0
- Trinity Mini 26B-A3B — Apache 2.0
- Magistral Small 24B, Devstral Small 2 24B, Mistral Small 3.2 24B — Apache 2.0
- EuroLLM 22B Instruct 2512, gpt-oss 20B — Apache 2.0
- Phi-4 14B — MIT
ライセンス制限あり
- Gemma ライセンス (Gemma 2 27B、Gemma 3 27B、Gemma 4 26B-A4B MoE):以下への同意が必要です: Google Gemmaの利用規約 ; 一部の商業利用には制限が適用されます
- Mistral Non-Production License : Codestral 22B は非商業的および研究用途に限定されています
利用可能なライセンスの一覧を概観するには、以下のページをご覧ください オープンウェイトLLMのライセンスガイド.
RX 9070 XTのベンチマークと予想性能
以下のスコアは公式発表またはコミュニティベンチマークから得られています。RX 9070 XT上で得られる推論速度は 推定値 他のGPUでの測定値を、それぞれのメモリ帯域幅に応じて重み付けした結果に基づいて。
MMLU — 一般評価
- シリーズ Qwen 3.x 27B:MMLU性能は5ショットで75%以上と報告されています。これは、 HuggingFaceのQwenページ このサイズのバリエーションについては(Q4の確認を待つ)、確認が必要です
- Gemma 3 27B:Googleによる結果の公開先: Gemmaの公式ドキュメント — Q4での量子化レベルに応じた劣化を確認する
- Magistral Small 24B:Mistral AIがリリースノートで公開した推論能力の評価指標
HumanEval — コード生成
- Devstral Small 2 24B:コーディングエージェント向けに設計されており、同規模の汎用モデルよりHumanEvalスコアが高い(GGUF Q4での確認が必要)
- Codestral 22B:コミュニティが報告したベンチマークによると、23B未満のコードカテゴリの基準モデルとして位置づけられています r/LocalLLaMA
推論速度(推定値)
- 27Bモデル Q4: 20〜35トークン/秒 RX 9070 XT で
- 24B モデル Q4 : 35〜50トークン/秒
- 14〜22Bモデル(Q4): 50〜80トークン/秒
これらの範囲は、バックエンド(llama.cpp HIPかROCmネイティブか)、並列度、使用中のコンテキストの長さによって異なります。コンテキストが最大値(262 kトークン)に近い場合、速度は大幅に低下します。
具体的なユースケース
ソフトウェア開発およびコードレビュー Devstral Small 2 24B 複数ファイルを扱うエージェントや大規模プロジェクト向け; Codestral 22B IDEでのコード補完とFIMに使用します。どちらのモデルも9070 XT上で余裕を持って実行できます。
長いドキュメントの分析 Qwen 3.8 27B 262,144トークンのコンテキストにより、膨大な契約書やレポートを1回のリクエストで分析できます。 Gemma 3 27B (128,000トークン)は、Gemmaライセンスの下で提供される有力な代替モデルです。
多言語対応とフランス語 EuroLLM 22B Instruct 2512 は、フランス語、ドイツ語、スペイン語などのヨーロッパの言語に特化して学習されています。9070 XTでは、約3 GBのメモリの余裕を残して実行できます。
高速で軽量のモデル Phi-4 14B (MIT、Microsoft)はQ4で約9 GBを使用し、残りの7 GBを非常に長いコンテキストや同時セッションに使えます。モデルのサイズより速度を優先する場合に適しています。
論理的推論およびエージェント Magistral Small 24B 構造化された推論チェーンやシンプルなエージェントに適しています。 Trinity Mini 26B-A3B (Apache 2.0、Arcee AI)はQ4で約15 GBとなり、推論性能とサイズのバランスが良好です。
2 つのモデルを直接比較するには、を使用してください quelllm.frの比較ツール.
FAQ
Q:RX 9070 XTはROCmで十分にサポートされていますか?
ROCm 6.xではRDNA4(navi48)アーキテクチャのサポートが含まれます。Linuxで最新のamdgpu-dkmsドライバーを使用すると、llama.cpp HIPが安定して動作します。WindowsではROCm for Windowsは成熟段階にあり、詳細はを参照してください。 AMDの互換性マトリクス 設定を行う前に。現在では、Linux環境でのパフォーマンスはWindows環境よりも一般的に優れています。
Q:RX 9070 XT 16GBで32Bモデルを実行することは可能ですか?
Q4(32Bで約19 GB)では使えません。VRAMの容量を超えるためです。Q3(約13〜14 GB)なら可能ですが、精度が大きく低下します。実際には、このカードでは27BモデルのQ4のほうが品質とサイズのバランスに優れています。推論性能は同等で、Q4の精度を十分に保ち、VRAM容量を超えるリスクもありません。
Q:Q4、Q5、Q8 のいずれの量子化レベルを選ぶべきですか?
Q4_K_Mは最初に試す量子化形式として最適です。品質低下が小さく、サイズはFP16の半分になります。Q5_K_MはVRAM使用量が約25%増える代わりに、精度が向上します。Q8_0はFP16に近いものの、ほとんどの27Bモデルでは16 GBを超えます。9070 XTでは、27BモデルのQ4_K_Mか24BモデルのQ5_K_Mが合理的な選択です。27Bモデルを完全なFP16で実行すること(約30 GB)は、このカードでは無理です。
Q:OllamaはLinux上でRX 9070 XTで動作しますか?
はい。Ollama ≥ 0.3.xは、Linuxでamdgpu-dkmsドライバーが正しくインストールされていれば、ROCm対応のAMD GPUを自動検出します。ほとんどの場合、手動設定は不要です。Windowsでの対応は、インストール時点で利用可能なROCm for Windowsのバージョンによって異なります。
Q:日常フランス語の用途に適したモデルはどれですか?
EuroLLM 22B Instruct 2512 は、ヨーロッパの言語に最も重点を置いたモデルです。 Mistral Small 3.2 24B はMistral AI製(Apache 2.0)で、一般的なタスクや文章作成支援においてフランス語で優れた性能を発揮し、9070 XTでも余裕を持って動作します。
Q : Qwen 3.8 27B または Gemma 3 27B :どちらを選べばよいですか?
両者は Q4 でそれぞれ約 16 GB を消費します。Qwen 3.8 27B は Apache 2.0 ライセンス(商業利用が自由)に基づいており、より長いコンテキストをサポートしています(262,144 トークン対 128,000 トークン)。Gemma 3 27B は Gemma ライセンスに従い、商業利用に対してより制限があります。ライセンスが中立である場合、SWE-bench Verified でのスコアは、 Open LLM Leaderboard あなたの特定のタスクに応じて、判断を下すことができます。
結論
Le RX 9070 XTに最適なLLM 2026 年時点では 24-27B パラメータの範囲に位置します:汎用性には Qwen 3.8 27B と Gemma 3 27B、ソフトウェア開発には Devstral Small 2 24B と Codestral 22B、欧州の多言語対応には EuroLLM 22B、構造化推論には Magistral Small 24B。RDNA4 対応の 16 GB VRAM と ROCm を備えたこのカードにより、セルフホスティングにおいて真面目なパフォーマンスレベルにアクセスできます。詳しくは ローカルLLMナビ の完全なカタログ または、以下の方法を使用してください 構成ツール GPU、ターゲットライセンス、および使用ケースに応じて選択を絞ることができます。
LLMをローカルで実行するためのハードウェア
これらのモデルを快適にローカルで実行するには、 Radeon RX 9070 XT は優れたコストパフォーマンスを備えています。価格を比較してください:
アフィリエイトリンク — ローカルLLMナビは、追加費用なしで購入に対する手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。