中級 11 分RTX 50

RTX 5070(12 GB)ではどのLLMを使う? ?

端的な回答

RTX 5070は12GBのGDDR7を搭載し、メモリ帯域幅は672GB/sです。約10GBまでのすべてのモデルをVRAMに読み込めます。Qwen 3.5 9B(6.6GB)やGemma 4 12B(7.7〜8GB)もその範囲に入り、コンテキスト用のメモリにも十分な余裕があります。一方、14GBあるMistral Small 24Bとgpt-oss 20BはVRAMに収まりません。5.3GBのモデルでは理論上の上限が約127トークン/秒に達しますが、購入前に押さえておくべき容量の限界は12GBです。

RTX 5070は、Blackwell世代の12 GBカードの中で最も高速で、メモリ帯域幅は672 GB/sです。課題は速度ではなく容量です。12 GBで4Bから12Bまでのモデルには足りますが、それを超えるモデルには足りません。このガイドでは、何がメモリに収まり、何が容量を超えるのかを数値で示し、コンテキストに合わせたOllamaの設定方法と、5070 Ti 16 GBを購入するのが適切になるタイミングを解説します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このセットアップの場合: RTX 5070 12GB (ASUS Prime OC).

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。

#ローカルLLM向けのRTX 5070:12 GBのGDDR7でできること

RTX 5070なら、4B〜12BのモデルをQ4で問題なく読み込めます。Ollamaのモデルライブラリによると、Qwen 3.5 9Bは6.6 GB、Gemma 4 12Bは7.7〜8 GBです。どちらも12 GBに収まり、コンテキスト用に4〜5 GBの余裕が残るため、K/Vキャッシュを量子化すれば16,000トークン以上を扱えます。一方、14 GBのモデルはどれも読み込めません。Mistral Small 24Bとgpt-oss 20Bは12 GBを超えます。192ビットのバスで672 GB/sの帯域幅があり、対話的な用途では非常に高速です。そのため、5070は一般的な用途に適していますが、より高品質なモデルを目指すと、明確な上限に突き当たります。

アーキテクチャ
NVIDIAによると、Blackwellアーキテクチャ、6,144基のCUDAコア、第5世代のTensorコアを搭載しています。
メモリ
12GBのGDDR7を192ビットバスで搭載し、ウィキペディアによると672GB/sの帯域幅を実現しています。
消費電力
総グラフィックス消費電力は250 W。NVIDIAによると、PC全体には最低650 Wの容量を持つ電源が必要です。
発売価格
549ドル。Wikipediaによると、発売日は2025年3月5日です。

#12GBに収まるモデルはどれですか?

RTX 5070 で動かすモデル(Ollama でのサイズ、重みのみ)
モデルサイズ12 GB中の空き容量判定
Granite 4.2 8B5.3 GB6.7 GB非常に広いコンテキスト長
Qwen 3.5 9B6.6 GB5.4 GB快適
Gemma 4 12B7.7~8.0 GB4〜4.3 GB快適で、16,000トークンのコンテキストが可能
Mistral Small 24B14 GB否定VRAMに収まらない
Qwen 3.5 27B17 GB否定VRAMに収まらない

当サイトの目安は、Q4で重みのみの場合、パラメータ10億あたり約0.6 GBです。12 GBの環境では、コンテキストが短い場合の実用的な上限は140億〜160億パラメータ、長文書で作業したい場合は120億パラメータ程度になります。8B〜9Bのモデルであれば、通常のコンテキストに必要な量に対して、はるかに大きな余裕があります。

#Ollamaをインストールし、カードを確認する

  1. 01
    NVIDIAドライバー
    Ollamaには、バージョン550以降のNVIDIAドライバーが必要です。RTX 50の場合は、NVIDIAが提供する最新のドライバーをインストールし、nvidia-smiで確認してください。
  2. 02
    Ollama のインストール
    お使いのシステムに対応したインストーラーをダウンロードしてください。CUDA は同梱されています。
  3. 03
    モデルの起動
    ollama run gemma4:12b を使用してカードの限界をテストしてください。もしくは、より軽量なモデルを ollama run qwen3.5:9b で試してください。
  4. 04
    確認する
    ollama ps を実行してください:PROCESSOR 列が 100 % GPU であることを確認してください。

#期待できる速度:測定値ではなく上限

ここで示す生成速度は、いずれも当サイト独自の実測値ではありません。生成速度の上限は、メモリ帯域幅をモデルの重みのサイズで割った値です。公開されている第三者の測定結果(2024年5月、llama.cppでQ4_K_M版のLLaMA 3 8Bを使用)では、上限が156トークン/秒のRTX 4080で106トークン/秒、つまり約68%を記録しています。概算として70%を採用すると、短いコンテキストでの推定値は次のとおりです。

RTX 5070での理論上限(672 GB/s)
モデル (Q4)モデル容量上限70 % での推定
Granite 4.2 8B5.3 GB127トークン/秒約89トークン/秒
Qwen 3.5 9B6.6 GB102トークン/秒約71トークン/秒
Gemma 4 12B7.7 GB87トークン/秒約61トークン/秒

これらの上限は、人間が文章を読む速度を大きく上回っています。5070がこれらのモデルで遅くなることはありません。制約となるのは速度ではなく容量です。コンテキストが長くなるほど推定値は下がり、プロンプトの読み込みはメモリよりも計算処理に大きな負荷をかけます。

#12 GBのメモリでコンテキストを管理する

Gemma 4 12Bで残る4 GBの余裕は、長いコンテキストを使うとすぐになくなります。OllamaではK/Vキャッシュをq8_0で量子化することで、デフォルトのf16の約半分のメモリ使用量に抑えられます。ドキュメントによれば、精度の低下はごくわずかですが、Flash Attentionが必要です。この設定により、12Bモデルで長いドキュメントを扱えるようになります。

Ollama サーバーの設定(Linux、macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=16384
ollama serve

複数のユーザーにサービスを提供する場合の落とし穴です。OllamaのFAQによると、並列リクエストが増えると、予約されるコンテキストも同様に増加します。1人のユーザーで収まるモデルが、3人ではオーバーフローする可能性があります。

#12GBで実際に実行できる内容

12 GBは8 GBと比較して、利用の性質を変えます。9Bのモデルは16,000トークンのコンテキストと小さな埋め込みモデルに十分なスペースを残します:これは快適な個人用RAGの構成です。12Bのモデルは、より限られたコンテキストという代償で、執筆や要約においてより高品質な回答を生成します。コードアシスタントは8Bから12Bのモデルとターゲットを絞った抜粋で十分ですが、リポジトリ全体を一度に読み込むことはできません。

RTX 5070(12GB)での使用例
用途現実的?推奨される設定
日常のチャットはい、非常に快適ですQwen 3.5 9B または Gemma 4 12B
長い文書の要約はい、コンテキストが16,000トークンの場合Gemma 4 12B, q8_0でのK/Vキャッシュ
ご自身のファイルを使ったRAGはいQwen 3.5 9B および軽量エンベディング
コードアシスタントはい、8Bから12Bのモデルで利用可能です必要な箇所を抜き出したテキスト、8,192トークンのコンテキスト
14GB以上のモデルいいえ16GBのVRAMを用意する

9Bと12Bの選択はタスクによって異なります。9Bは余裕があり、長いコンテキストに適しています。一方、12Bはより高性能ですが、コンテキストの1GBが重要になります。まずは必要を満たす最小のモデルから始め、品質が要求される場合のみ12Bに切り替えてください。

#5070では足りなくなったら

メモリ追加が必要なことを示す三つのシグナルがあります。14〜24Bのモデル、例えばMistral Small 24Bやgpt-oss 20Bを使用したい場合。12Bモデルで16,000トークンを超えるコンテキストが必要な場合。生成、埋め込み、リランカーなど複数のモデルを同時に読み込む場合。これらのケースでは、5070の速度が問題ではなく、次のステップとして5070 Ti、5080、または24 GBのカードを検討してください。

#12 GBでは読み込めないもの

12GBの上限を超えるモデル(Ollamaでのサイズ)
モデルサイズ結果
Mistral Small 24B14 GB収まりきらない2 GB分をRAMにオフロード
Qwen 3.5 27B17 GB大幅に超過
Qwen 3.5 35B24 GB実行は困難:最低24 GBのVRAMが必要
70BモデルのQ4量子化版約40GB12 GBの一般消費者向けGPUでは扱えません

モデルがVRAM容量を超えてもクラッシュするわけではありません。重みの一部がシステムRAMから読み出されますが、PCIe接続はGDDR7よりはるかに遅いため、生成速度が大幅に低下します。そのため、14 GBのモデルを12 GBのVRAMで動かすことはテストには使えても、日常的な利用には向きません。このようなモデルには、16 GB以上のVRAMを目安にしてください。

#同じGPUでゲームとLLMの実行を行う

RTX 5070は、両方の用途に使われることが多いです。読み込まれたモデルはメモリ内にある間ずっとVRAMを占有し、最近のゲームも数GBを必要とします。12GBでは、両方を合わせるとすぐに容量を超えてしまいます。ルールは簡単です。ゲームを起動する前にモデルをメモリから解放し、ゲームを終えたら再び読み込んでください。Ollamaは一定時間使われないとメモリを解放し、ollama psでまだ読み込まれているモデルを確認できます。ゲーム中もアシスタントを使いたい場合は、4Bの小さなモデルを選んでください。

#代わりに中古の4070 Ti Superは?

よく比較されるのが、16 GBの中古RTX 4070 Ti Superと、12 GBの新品RTX 5070です。LLM用途ではメモリ容量が優先されます。16 GBなら、5070には収まらない14 GBのモデルを読み込めます。5070には、保証、より低い消費電力(250 W)、GDDR7メモリという利点があります。使用するモデルが12 GBに収まるなら、新品の5070は妥当な選択です。そうでなければ、容量を優先すべきです。4070 Ti Superについては専用ガイドで詳しく説明しています。

#5070または5070 Ti:12GBまたは16GB

RTX 5070とRTX 5070 Ti:LLM利用時の違い
基準RTX 5070RTX 5070 Ti
メモリ12GB GDDR7、192ビット16 GB GDDR7、256ビット
帯域幅672 GB/s896 GB/s
CUDAコア6 1448 960
グラフィック性能250 W300 W
電源の最低要件650 W750 W
14GBモデルいいえはい、2GBの余裕があります

5070 Tiには2つの利点があります。メモリが4 GB増えることでMistral Small 24Bとgpt-oss 20Bを利用でき、帯域幅も33 %増えます。発売時の推奨価格は5070が549ドル、5070 Tiが749ドルで、差額は200ドルでした。使うモデルが12 GBに収まるなら5070で十分です。14 GBのモデルを使いたいなら、その差額を払う価値があります。購入時には、価格動向をまとめたページでその時点の価格を比較してください。

#2026年の結論

5070の購入がおすすめな場合
ご使用のモデルは4Bから12Bで、Blackwellの生成速度が求められています。この機能はこの用途に非常に適しています。
次の場合は5070 Tiを選んでください
14B~24B のモデルを試したい場合は、16 GB のメモリが大きな違いをもたらします。
ゲームとLLMの組み合わせに注意
最近のゲームと読み込み済みのモデルは、同じ12GBのメモリを共有します。一方を起動する前に、もう一方を終了してください。

まとめると、5070は高速なグラフィックカードで、唯一の欠点はメモリ容量が12 GBに限られることです。この上限が今は問題にならないなら、4B〜12Bのモデルを使い続ける限り、今後数か月も問題にはならないでしょう。問題になるなら、今のうちに容量の大きいカードにお金をかける方がよいでしょう。

#よくある質問

FAQ
RTX 5070 12GBで70Bモデルを実行できますか?+
いいえ。Q4 の 70B は重みだけで約 40 GB あり、カードの 12 GB の 3 倍以上です。システム RAM へのオフロードを行っても、生成は極めて遅くなります。12 GB では 4B〜12B のモデルに留まり、70B には少なくとも 48 GB のメモリを確保してください。
RTX 5070では1秒あたり何トークン生成できますか?+
ここでは信頼できる測定値は公開されていません。帯域幅672GB/sをモデルのサイズで割って求める理論上の上限は、Granite 4.2 8B(5.3GB)の場合、約127トークン/秒です。その上限の70%では、約89トークン/秒となります。これは推定値であり、コンテキストが長くなると低下します。
2026年の業務利用には12 GBで十分ですか?+
4B~12Bのモデルを使うチャット、要約、RAG、抽出であれば、はい。高品質な文章作成や大規模なリポジトリでのコードアシスタントには、140億~240億パラメータでサイズが14GB以上のモデルが必要となり、カードの容量を超えます。16GBを用意してください。
RTX 5070 は DLSS 4 と LLM を同時にサポートしていますか?+
どちらもこのカードで動作しますが、12GBのVRAMを共有します。最近のゲームはメモリの大部分を使用するため、ゲームを起動する前にモデルを読み込むか、ゲームをプレイしている間はモデルを終了してください。12GBのVRAMでは、LLMとゲームを同時に動かしてはいけません。
RTX 5070に必要な電源はどれですか?+
NVIDIAは、グラフィックスの総消費電力を250W、PC全体に必要な電源容量の最低値を650Wとしています。品質の良い650Wの電源なら適していますが、550Wは推奨値を下回ります。お使いのカードのモデルに必要なコネクターも確認してください。
モデルがVRAMに収まるかを確認する方法は?+
読み込み後、ollama psを実行してください。PROCESSOR列には100 % GPUと表示される必要があります。CPUとGPUの両方に処理が分かれている場合は、モデルの一部がシステムRAMに置かれていることを意味し、生成速度が大幅に低下します。その場合は、コンテキストを短くするか、K/Vキャッシュをq8_0で有効にするか、より小さなモデルを選んでください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。