RTX 5070 Ti(16 GB)で動かすなら、どのLLM? ?
RTX 5070 Ti(2025年2月)は、一般ユーザー向けのローカルAI用途では、おそらく2025年の最良のグラフィックカードです。16 GBのGDDR7 VRAM、896 GB/sの帯域幅、8,960基のCUDAコアを備え、Granite 4.2 8Bを約50トークン/秒で、Mistral Small 24B Q4も快適に動かせます。2026年9月末の価格は約1,400ユーロで、5080より約450ユーロ安くなっています。本ガイドでは、なぜ2026年に性能と価格のバランスが最もよい選択肢なのか、そしてどのモデルをインストールすべきかを詳しく解説します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。
#RTX 5070 Ti:バランスのよい16 GBモデル
- アーキテクチャ
- Blackwell GB203(5080と同じダイですが、無効化されているCUの数がより多くなっています)。
- VRAM
- 16GB GDDR7、28Gbps、256ビットバス。帯域幅は896GB/sです。
- CUDAコア
- 8,960。第5世代の Tensor Cores、FP4 にネイティブ対応。
- TDP
- 300W。750Wの電源が推奨されます。
- MSRP価格
- 発売時は884€。2026年9月末時点で約1,400€(カスタムモデル)。
#1. 対応するLLMモデル
| モデル | Quant | モデルの VRAM | Tokens/sec | 用途 |
|---|---|---|---|---|
| Granite 4.2 8B | Q4_K_M | 4.6 GB | 45-55 | 即座に応答するチャット |
| Gemma 4 12B | Q4_K_M | 7 GB | 25-31 | 日常的なチャット/RAG利用 |
| Qwen 3.5 9B | Q4_K_M | 6 GB | 25-31 | VS Code用コードアシスタント |
| gpt-oss 20B | Q4_K_M | 13 GB | 50-61 | チャット + RAG + FR |
| Qwen 3.5 9B | Q8_0 | 11 GB | 18-22 | 最高品質/論理的推論 |
| Devstral Small 2 24B | Q4_K_M | 14 GB | 14-17 | 質の高いチャット |
| Mistral Small 24B | Q4_K_M | 14 GB | 28-35 | 高品質な汎用用途 |
| Qwen 3.6 35B-A3B | Q3_K_M | ~15GB | 22-28 | 高度なRAG、高速なMoE(少量のオフロード) |
#2. インストール(Ollama + CUDA)
- 01NVIDIAドライバー570以上Blackwellには必須です。WindowsではGeForce Experienceを、Ubuntuではapt install nvidia-driver-570を使用します。
- 02Ollamaollama.comから入手する標準インストーラーにはCUDAが同梱されています。ollama run granite4.2:8bですぐにテストできます。
- 03確認nvidia-smiではRTX 5070 Ti、16376 MiBと表示されるはずです。チャット中にollama psを実行し、PROCESSOR 100% GPUと表示されることを確認してください。
#3. 量子化方式別の速度(目安)
| モデル | Q4_K_M | Q5_K_M | Q6_K | Q8_0 |
|---|---|---|---|---|
| Granite 4.2 8B | 50 t/s | 46 t/s | 42 t/s | 34 t/s |
| Qwen 3.5 9B | 30 t/s | 28 t/s | 26 t/s | 22 t/s |
| Gemma 4 12B | 28 t/s | 26 t/s | 24 t/s | 20 t/s |
| Mistral Small 24B | 32 t/s | 28 t/s | — | — |
| Devstral 24B | 16 t/s | 14 t/s | — | — |
#4. Blackwell最適化
- Flash Attention 3
- デフォルトで有効、4k+コンテキストでは10~14%のパフォーマンス向上。llama.cppのログで確認可能です。
- KVキャッシュ Q8
- OLLAMA_KV_CACHE_TYPE=q8_0。Granite 4.2 8Bで32kのコンテキストを実現し、約5〜6GBで済み、8GBに比べて節約できます。
- 将来を見据えたNVFP4対応
- ハードウェアは備わっていますが、2026年時点ではあまり活用されていません。12〜18か月後にはOllamaがFP4に対応し、40%の速度向上が期待されます。
- Undervolt
- MSI Afterburnerで電圧を80mV下げると、消費電力は300Wから250Wに。LLM性能は1%低下、温度は5°C低下し、PCケースからの騒音も減ります。
#5. 5070 Ti と 4070 Ti Super と 5080 の比較
| 基準 | 5070 Ti | 4070 Ti Super | 5080 |
|---|---|---|---|
| VRAM | 16 GB GDDR7 | 16 GB GDDR6X | 16 GB GDDR7 |
| 帯域幅 | 896 GB/s | 672 GB/s | 960 GB/s |
| Granite 4.2 8B Q4 | 50 t/s | 42 t/s | 56 t/s |
| Gemma 4 12B Q4 | 28 t/s | 23 t/s | 32 t/s |
| 2026年の価格 | 2026年9月末時点で約1,400ユーロ | 中古品、価格は変動します | 2026年9月末時点での価格は約1,850€です。 |
| LLMのパフォーマンス/€ | ★★★★★ | ★★★★ | ★★★ |
#2026年の購入判断
- 2026年の一般ユーザー向けLLM用途で最適な選択
- 2026年9月末時点でGPU予算が約1,400 €あり、5090に踏み切らずに本格的なLLMを求める方に向いています。5080に対して、パフォーマンス/€の面で圧倒的な優位性があります。
- 4070 Ti Super からアップグレードすべき?
- LLMの処理速度が20%向上し、帯域幅が33%増加します。今の環境で動いているなら必須ではありませんが、4070 Ti Superを中古で売るなら、買い替えを検討する理由にはなります。中古の売却価格は変動します。
- 中古 RTX 4090 との比較
- 中古の4090(中古価格は変動)は70Bモデル(24GB VRAM)に有利です。必要がない場合は、5070 Tiが14B LLMのパフォーマンスをほぼ同等に提供し、はるかに安い価格で利用可能です。
#よくある質問
LLM用にはRTX 5070 TiとRTX 5080、どちらを選ぶべきですか?+
RTX 5070 Ti 16GBでMistral Small 24Bを実行可能ですか?+
RTX 4070 Ti SuperとRTX 5070 Tiの違いは何ですか?+
RTX 5070 Ti 16GBでQLoRAは可能ですか?+
RTX 5070 Tiには650 Wの電源で十分ですか?+
RTX 5070 TiはFP4 / NVFP4をサポートしていますか?+
RTX 3080 10GBからアップグレードする価値はありますか?+
価格は変動が激しいため、当サイトでは毎週月曜日と木曜日に、ローカルAI向けグラフィックカードの最低価格とVRAM 1 GBあたりの価格を確認しています。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。