中級 11 分RTX 50

RTX 5070 Ti(16 GB)で動かすなら、どのLLM? ?

RTX 5070 Ti(2025年2月)は、一般ユーザー向けのローカルAI用途では、おそらく2025年の最良のグラフィックカードです。16 GBのGDDR7 VRAM、896 GB/sの帯域幅、8,960基のCUDAコアを備え、Granite 4.2 8Bを約50トークン/秒で、Mistral Small 24B Q4も快適に動かせます。2026年9月末の価格は約1,400ユーロで、5080より約450ユーロ安くなっています。本ガイドでは、なぜ2026年に性能と価格のバランスが最もよい選択肢なのか、そしてどのモデルをインストールすべきかを詳しく解説します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-08-27·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。

#RTX 5070 Ti:バランスのよい16 GBモデル

アーキテクチャ
Blackwell GB203(5080と同じダイですが、無効化されているCUの数がより多くなっています)。
VRAM
16GB GDDR7、28Gbps、256ビットバス。帯域幅は896GB/sです。
CUDAコア
8,960。第5世代の Tensor Cores、FP4 にネイティブ対応。
TDP
300W。750Wの電源が推奨されます。
MSRP価格
発売時は884€。2026年9月末時点で約1,400€(カスタムモデル)。
→
なぜこれが最適なバランスなのか
16GB GDDR7であっても5080と同等の帯域幅を93%まで実現し、約450€安いです。ローカルAIにおいてVRAMおよびメモリ帯域が主な要因となる場合、CUの差による速度の低下は8〜12%にとどまり、価格の30%の低下にはなりません。

#1. 対応するLLMモデル

推奨モデル — RTX 5070 Ti 16 GB
モデルQuantモデルの VRAMTokens/sec用途
Granite 4.2 8BQ4_K_M4.6 GB45-55即座に応答するチャット
Gemma 4 12BQ4_K_M7 GB25-31日常的なチャット/RAG利用
Qwen 3.5 9BQ4_K_M6 GB25-31VS Code用コードアシスタント
gpt-oss 20BQ4_K_M13 GB50-61チャット + RAG + FR
Qwen 3.5 9BQ8_011 GB18-22最高品質/論理的推論
Devstral Small 2 24BQ4_K_M14 GB14-17質の高いチャット
Mistral Small 24BQ4_K_M14 GB28-35高品質な汎用用途
Qwen 3.6 35B-A3BQ3_K_M~15GB22-28高度なRAG、高速なMoE(少量のオフロード)

#2. インストール(Ollama + CUDA)

  1. 01
    NVIDIAドライバー570以上
    Blackwellには必須です。WindowsではGeForce Experienceを、Ubuntuではapt install nvidia-driver-570を使用します。
  2. 02
    Ollama
    ollama.comから入手する標準インストーラーにはCUDAが同梱されています。ollama run granite4.2:8bですぐにテストできます。
  3. 03
    確認
    nvidia-smiではRTX 5070 Ti、16376 MiBと表示されるはずです。チャット中にollama psを実行し、PROCESSOR 100% GPUと表示されることを確認してください。
完全なLinuxのセットアップ
sudo apt update
sudo apt install nvidia-driver-570
sudo reboot

curl -fsSL https://ollama.com/install.sh | sh
ollama run mistral-small

#3. 量子化方式別の速度(目安)

RTX 5070 Ti — トークン/秒(おおよその目安)、最近のバージョンのOllama、バッチサイズ1、Ryzen 9 7900X
モデルQ4_K_MQ5_K_MQ6_KQ8_0
Granite 4.2 8B50 t/s46 t/s42 t/s34 t/s
Qwen 3.5 9B30 t/s28 t/s26 t/s22 t/s
Gemma 4 12B28 t/s26 t/s24 t/s20 t/s
Mistral Small 24B32 t/s28 t/s——
Devstral 24B16 t/s14 t/s——

#4. Blackwell最適化

Flash Attention 3
デフォルトで有効、4k+コンテキストでは10~14%のパフォーマンス向上。llama.cppのログで確認可能です。
KVキャッシュ Q8
OLLAMA_KV_CACHE_TYPE=q8_0。Granite 4.2 8Bで32kのコンテキストを実現し、約5〜6GBで済み、8GBに比べて節約できます。
将来を見据えたNVFP4対応
ハードウェアは備わっていますが、2026年時点ではあまり活用されていません。12〜18か月後にはOllamaがFP4に対応し、40%の速度向上が期待されます。
Undervolt
MSI Afterburnerで電圧を80mV下げると、消費電力は300Wから250Wに。LLM性能は1%低下、温度は5°C低下し、PCケースからの騒音も減ります。

#5. 5070 Ti と 4070 Ti Super と 5080 の比較

16 GB搭載の高級グラフィックカード3種
基準5070 Ti4070 Ti Super5080
VRAM16 GB GDDR716 GB GDDR6X16 GB GDDR7
帯域幅896 GB/s672 GB/s960 GB/s
Granite 4.2 8B Q450 t/s42 t/s56 t/s
Gemma 4 12B Q428 t/s23 t/s32 t/s
2026年の価格2026年9月末時点で約1,400ユーロ中古品、価格は変動します2026年9月末時点での価格は約1,850€です。
LLMのパフォーマンス/€★★★★★★★★★★★★

#2026年の購入判断

2026年の一般ユーザー向けLLM用途で最適な選択
2026年9月末時点でGPU予算が約1,400 €あり、5090に踏み切らずに本格的なLLMを求める方に向いています。5080に対して、パフォーマンス/€の面で圧倒的な優位性があります。
4070 Ti Super からアップグレードすべき?
LLMの処理速度が20%向上し、帯域幅が33%増加します。今の環境で動いているなら必須ではありませんが、4070 Ti Superを中古で売るなら、買い替えを検討する理由にはなります。中古の売却価格は変動します。
中古 RTX 4090 との比較
中古の4090(中古価格は変動)は70Bモデル(24GB VRAM)に有利です。必要がない場合は、5070 Tiが14B LLMのパフォーマンスをほぼ同等に提供し、はるかに安い価格で利用可能です。

#よくある質問

LLM用にはRTX 5070 TiとRTX 5080、どちらを選ぶべきですか?+
予算が 1,700 € 未満なら、迷わず 5070 Ti を選びましょう。Granite 4.2 8B では速度が約 10 % 低下しますが(50 対 56 tok/s)、約 450 € 節約できます。VRAM は同じ 16 GB で、世代も GDDR7 も同じです。4K ゲームと LLM の両方で最高の性能を求めるなら、5080 を選ぶ理由があります。
RTX 5070 Ti 16GBでMistral Small 24Bを実行可能ですか?+
はい。Q4_K_M(14 GB)なら28〜35トークン/秒で動作します。16 GBを最も有効に活用できる汎用モデルです。Q5_K_M(17 GB)では一部のオフロードが発生しますが、それでも20〜25トークン/秒で使用できます。
RTX 4070 Ti SuperとRTX 5070 Tiの違いは何ですか?+
VRAM容量は同じ16 GBですが、GDDR6Xの代わりにGDDR7を採用しているため、メモリ帯域幅は33%増加しています。その結果、LLMの毎秒の生成トークン数は20〜25%向上しています。発売時の価格は同程度ですが、4070 Ti Superは中古ならより安く入手できます(約750ユーロ、新品は950ユーロ)。
RTX 5070 Ti 16GBでQLoRAは可能ですか?+
はい、7B〜8Bでは余裕を持って実行できます(バッチサイズ4、コンテキスト長2048で10〜12GBが必要)。14BのQLoRAは余裕が少ないものの、unslothを使えば実行可能です。24BのQLoRAは不可能で、20GB以上が必要です。
RTX 5070 Tiには650 Wの電源で十分ですか?+
はい、CPUが150 W以下(Ryzen 7600/7700、Core i5)なら十分です。GPUのTDP 300 W+CPU 150 W+システム50 W=公称500 Wなので、650 Wなら余裕があります。CPUが180 W以上(9950X、14900K)の場合は、750 Wを目安にしてください。
RTX 5070 TiはFP4 / NVFP4をサポートしていますか?+
はい、Blackwellの第5世代Tensor CoreはFP4をネイティブに処理します。2026年時点では、Ollamaとllama.cppはまだこの機能を活用していませんが、今後対応する予定です。TensorRT-LLM 0.18以降またはvLLM 0.7以降では、NVFP4で量子化したモデルで、Q4_K_Mと比べてすでに30〜40%の改善が観測されています。
RTX 3080 10GBからアップグレードする価値はありますか?+
はい、世代のジャンプが非常に大きく、+60%のVRAM(10GB → 16GB — 14B~24Bモデルの利用が可能)、+3倍の帯域幅(GDDR7のインフレーション後は760GB/s → 896GB/s)、+2倍の処理速度です。LLMを日常的に使用する場合、2026年の最もコスト効率の高いアップグレードとなります。

価格は変動が激しいため、当サイトでは毎週月曜日と木曜日に、ローカルAI向けグラフィックカードの最低価格とVRAM 1 GBあたりの価格を確認しています。

このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。