RTX 5070(12 GB)ではどのLLMを使う? ?
RTX 5070は12GBのGDDR7を搭載し、メモリ帯域幅は672GB/sです。約10GBまでのすべてのモデルをVRAMに読み込めます。Qwen 3.5 9B(6.6GB)やGemma 4 12B(7.7〜8GB)もその範囲に入り、コンテキスト用のメモリにも十分な余裕があります。一方、14GBあるMistral Small 24Bとgpt-oss 20BはVRAMに収まりません。5.3GBのモデルでは理論上の上限が約127トークン/秒に達しますが、購入前に押さえておくべき容量の限界は12GBです。
RTX 5070は、Blackwell世代の12 GBカードの中で最も高速で、メモリ帯域幅は672 GB/sです。課題は速度ではなく容量です。12 GBで4Bから12Bまでのモデルには足りますが、それを超えるモデルには足りません。このガイドでは、何がメモリに収まり、何が容量を超えるのかを数値で示し、コンテキストに合わせたOllamaの設定方法と、5070 Ti 16 GBを購入するのが適切になるタイミングを解説します。
マシンを選んでいるところですか? 予算別のおすすめ →
このセットアップの場合: RTX 5070 12GB (ASUS Prime OC).
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。
#ローカルLLM向けのRTX 5070:12 GBのGDDR7でできること
RTX 5070なら、4B〜12BのモデルをQ4で問題なく読み込めます。Ollamaのモデルライブラリによると、Qwen 3.5 9Bは6.6 GB、Gemma 4 12Bは7.7〜8 GBです。どちらも12 GBに収まり、コンテキスト用に4〜5 GBの余裕が残るため、K/Vキャッシュを量子化すれば16,000トークン以上を扱えます。一方、14 GBのモデルはどれも読み込めません。Mistral Small 24Bとgpt-oss 20Bは12 GBを超えます。192ビットのバスで672 GB/sの帯域幅があり、対話的な用途では非常に高速です。そのため、5070は一般的な用途に適していますが、より高品質なモデルを目指すと、明確な上限に突き当たります。
- アーキテクチャ
- NVIDIAによると、Blackwellアーキテクチャ、6,144基のCUDAコア、第5世代のTensorコアを搭載しています。
- メモリ
- 12GBのGDDR7を192ビットバスで搭載し、ウィキペディアによると672GB/sの帯域幅を実現しています。
- 消費電力
- 総グラフィックス消費電力は250 W。NVIDIAによると、PC全体には最低650 Wの容量を持つ電源が必要です。
- 発売価格
- 549ドル。Wikipediaによると、発売日は2025年3月5日です。
#12GBに収まるモデルはどれですか?
| モデル | サイズ | 12 GB中の空き容量 | 判定 |
|---|---|---|---|
| Granite 4.2 8B | 5.3 GB | 6.7 GB | 非常に広いコンテキスト長 |
| Qwen 3.5 9B | 6.6 GB | 5.4 GB | 快適 |
| Gemma 4 12B | 7.7~8.0 GB | 4〜4.3 GB | 快適で、16,000トークンのコンテキストが可能 |
| Mistral Small 24B | 14 GB | 否定 | VRAMに収まらない |
| Qwen 3.5 27B | 17 GB | 否定 | VRAMに収まらない |
当サイトの目安は、Q4で重みのみの場合、パラメータ10億あたり約0.6 GBです。12 GBの環境では、コンテキストが短い場合の実用的な上限は140億〜160億パラメータ、長文書で作業したい場合は120億パラメータ程度になります。8B〜9Bのモデルであれば、通常のコンテキストに必要な量に対して、はるかに大きな余裕があります。
#Ollamaをインストールし、カードを確認する
- 01NVIDIAドライバーOllamaには、バージョン550以降のNVIDIAドライバーが必要です。RTX 50の場合は、NVIDIAが提供する最新のドライバーをインストールし、nvidia-smiで確認してください。
- 02Ollama のインストールお使いのシステムに対応したインストーラーをダウンロードしてください。CUDA は同梱されています。
- 03モデルの起動ollama run gemma4:12b を使用してカードの限界をテストしてください。もしくは、より軽量なモデルを ollama run qwen3.5:9b で試してください。
- 04確認するollama ps を実行してください:PROCESSOR 列が 100 % GPU であることを確認してください。
#期待できる速度:測定値ではなく上限
ここで示す生成速度は、いずれも当サイト独自の実測値ではありません。生成速度の上限は、メモリ帯域幅をモデルの重みのサイズで割った値です。公開されている第三者の測定結果(2024年5月、llama.cppでQ4_K_M版のLLaMA 3 8Bを使用)では、上限が156トークン/秒のRTX 4080で106トークン/秒、つまり約68%を記録しています。概算として70%を採用すると、短いコンテキストでの推定値は次のとおりです。
| モデル (Q4) | モデル容量 | 上限 | 70 % での推定 |
|---|---|---|---|
| Granite 4.2 8B | 5.3 GB | 127トークン/秒 | 約89トークン/秒 |
| Qwen 3.5 9B | 6.6 GB | 102トークン/秒 | 約71トークン/秒 |
| Gemma 4 12B | 7.7 GB | 87トークン/秒 | 約61トークン/秒 |
これらの上限は、人間が文章を読む速度を大きく上回っています。5070がこれらのモデルで遅くなることはありません。制約となるのは速度ではなく容量です。コンテキストが長くなるほど推定値は下がり、プロンプトの読み込みはメモリよりも計算処理に大きな負荷をかけます。
#12 GBのメモリでコンテキストを管理する
Gemma 4 12Bで残る4 GBの余裕は、長いコンテキストを使うとすぐになくなります。OllamaではK/Vキャッシュをq8_0で量子化することで、デフォルトのf16の約半分のメモリ使用量に抑えられます。ドキュメントによれば、精度の低下はごくわずかですが、Flash Attentionが必要です。この設定により、12Bモデルで長いドキュメントを扱えるようになります。
複数のユーザーにサービスを提供する場合の落とし穴です。OllamaのFAQによると、並列リクエストが増えると、予約されるコンテキストも同様に増加します。1人のユーザーで収まるモデルが、3人ではオーバーフローする可能性があります。
#12GBで実際に実行できる内容
12 GBは8 GBと比較して、利用の性質を変えます。9Bのモデルは16,000トークンのコンテキストと小さな埋め込みモデルに十分なスペースを残します:これは快適な個人用RAGの構成です。12Bのモデルは、より限られたコンテキストという代償で、執筆や要約においてより高品質な回答を生成します。コードアシスタントは8Bから12Bのモデルとターゲットを絞った抜粋で十分ですが、リポジトリ全体を一度に読み込むことはできません。
| 用途 | 現実的? | 推奨される設定 |
|---|---|---|
| 日常のチャット | はい、非常に快適です | Qwen 3.5 9B または Gemma 4 12B |
| 長い文書の要約 | はい、コンテキストが16,000トークンの場合 | Gemma 4 12B, q8_0でのK/Vキャッシュ |
| ご自身のファイルを使ったRAG | はい | Qwen 3.5 9B および軽量エンベディング |
| コードアシスタント | はい、8Bから12Bのモデルで利用可能です | 必要な箇所を抜き出したテキスト、8,192トークンのコンテキスト |
| 14GB以上のモデル | いいえ | 16GBのVRAMを用意する |
9Bと12Bの選択はタスクによって異なります。9Bは余裕があり、長いコンテキストに適しています。一方、12Bはより高性能ですが、コンテキストの1GBが重要になります。まずは必要を満たす最小のモデルから始め、品質が要求される場合のみ12Bに切り替えてください。
#5070では足りなくなったら
メモリ追加が必要なことを示す三つのシグナルがあります。14〜24Bのモデル、例えばMistral Small 24Bやgpt-oss 20Bを使用したい場合。12Bモデルで16,000トークンを超えるコンテキストが必要な場合。生成、埋め込み、リランカーなど複数のモデルを同時に読み込む場合。これらのケースでは、5070の速度が問題ではなく、次のステップとして5070 Ti、5080、または24 GBのカードを検討してください。
#12 GBでは読み込めないもの
| モデル | サイズ | 結果 |
|---|---|---|
| Mistral Small 24B | 14 GB | 収まりきらない2 GB分をRAMにオフロード |
| Qwen 3.5 27B | 17 GB | 大幅に超過 |
| Qwen 3.5 35B | 24 GB | 実行は困難:最低24 GBのVRAMが必要 |
| 70BモデルのQ4量子化版 | 約40GB | 12 GBの一般消費者向けGPUでは扱えません |
モデルがVRAM容量を超えてもクラッシュするわけではありません。重みの一部がシステムRAMから読み出されますが、PCIe接続はGDDR7よりはるかに遅いため、生成速度が大幅に低下します。そのため、14 GBのモデルを12 GBのVRAMで動かすことはテストには使えても、日常的な利用には向きません。このようなモデルには、16 GB以上のVRAMを目安にしてください。
#同じGPUでゲームとLLMの実行を行う
RTX 5070は、両方の用途に使われることが多いです。読み込まれたモデルはメモリ内にある間ずっとVRAMを占有し、最近のゲームも数GBを必要とします。12GBでは、両方を合わせるとすぐに容量を超えてしまいます。ルールは簡単です。ゲームを起動する前にモデルをメモリから解放し、ゲームを終えたら再び読み込んでください。Ollamaは一定時間使われないとメモリを解放し、ollama psでまだ読み込まれているモデルを確認できます。ゲーム中もアシスタントを使いたい場合は、4Bの小さなモデルを選んでください。
#代わりに中古の4070 Ti Superは?
よく比較されるのが、16 GBの中古RTX 4070 Ti Superと、12 GBの新品RTX 5070です。LLM用途ではメモリ容量が優先されます。16 GBなら、5070には収まらない14 GBのモデルを読み込めます。5070には、保証、より低い消費電力(250 W)、GDDR7メモリという利点があります。使用するモデルが12 GBに収まるなら、新品の5070は妥当な選択です。そうでなければ、容量を優先すべきです。4070 Ti Superについては専用ガイドで詳しく説明しています。
#5070または5070 Ti:12GBまたは16GB
| 基準 | RTX 5070 | RTX 5070 Ti |
|---|---|---|
| メモリ | 12GB GDDR7、192ビット | 16 GB GDDR7、256ビット |
| 帯域幅 | 672 GB/s | 896 GB/s |
| CUDAコア | 6 144 | 8 960 |
| グラフィック性能 | 250 W | 300 W |
| 電源の最低要件 | 650 W | 750 W |
| 14GBモデル | いいえ | はい、2GBの余裕があります |
5070 Tiには2つの利点があります。メモリが4 GB増えることでMistral Small 24Bとgpt-oss 20Bを利用でき、帯域幅も33 %増えます。発売時の推奨価格は5070が549ドル、5070 Tiが749ドルで、差額は200ドルでした。使うモデルが12 GBに収まるなら5070で十分です。14 GBのモデルを使いたいなら、その差額を払う価値があります。購入時には、価格動向をまとめたページでその時点の価格を比較してください。
#2026年の結論
- 5070の購入がおすすめな場合
- ご使用のモデルは4Bから12Bで、Blackwellの生成速度が求められています。この機能はこの用途に非常に適しています。
- 次の場合は5070 Tiを選んでください
- 14B~24B のモデルを試したい場合は、16 GB のメモリが大きな違いをもたらします。
- ゲームとLLMの組み合わせに注意
- 最近のゲームと読み込み済みのモデルは、同じ12GBのメモリを共有します。一方を起動する前に、もう一方を終了してください。
まとめると、5070は高速なグラフィックカードで、唯一の欠点はメモリ容量が12 GBに限られることです。この上限が今は問題にならないなら、4B〜12Bのモデルを使い続ける限り、今後数か月も問題にはならないでしょう。問題になるなら、今のうちに容量の大きいカードにお金をかける方がよいでしょう。
- 出典:NVIDIAの公式仕様(RTX 5070および5070 Ti)
- 出典:Ollamaの公式FAQ(Flash Attention、K/Vキャッシュ、並列処理)
- 出典:OllamaのライブラリにおけるGemma 4のサイズ
#よくある質問
RTX 5070 12GBで70Bモデルを実行できますか?+
RTX 5070では1秒あたり何トークン生成できますか?+
2026年の業務利用には12 GBで十分ですか?+
RTX 5070 は DLSS 4 と LLM を同時にサポートしていますか?+
RTX 5070に必要な電源はどれですか?+
モデルがVRAMに収まるかを確認する方法は?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。