RTX 4070 / 4070 Super / 4070 Ti(12GB)で使うLLMはどれか ?
1枚の RTX 4070、4070 Super、または 4070 Ti は 12 GB の VRAM と 504 GB/s の帯域幅を提供します。これは Q4 量子化で最大 14B パラメータのモデル(Qwen 3.5 9B、Gemma 4 12B、Qwen3 14B)を動作させるには十分ですが、24B から 27B のモデルには不十分です。3つのカードはメモリが同一であるため、生成速度はほぼ同等ですが、長いプロンプトの読み取り速度だけが異なります。
ファミリー RTX 4070 の3枚のカードは同じメモリを共有しますが、計算性能は同じではありません。LLMにとって、この差は思われているほど重要ではありません。本ガイドでは、12 GBに実際に収まるモデルとその正確な重さ、確保すべきコンテキスト予算、第三者による測定済みスループット、および大きすぎるモデルへの対処法を説明します。また、中古で狙うべきバリアントや、16 GBにアップグレードすべきタイミングもわかります。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: RTX 5070 Ti 16 GB.
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#RTX 4070とローカルLLM:12 GBでできること
ローカルLLM用途でRTX 4070の価値をまず決めるのは、12GBのメモリと504GB/sのメモリ帯域幅です。この2つの数値によって、どのモデルが収まり、どの程度の速度で動作するかが決まります。Q4に量子化された70億〜140億パラメータのモデルは、全体がVRAMに収まります。Ollamaライブラリによると、Qwen 3.5 9Bは6.6GB、Gemma 4 12Bは7.6GB、Qwen3 14Bは9.3GBです。Hardware Cornerは、RTX 4070でコンテキストを4,000トークンに設定した場合、Qwen3 8Bで毎秒71トークン、Qwen3 14Bで毎秒42トークンを測定しています。Mistral Small 24B(14GB)やQwen 3.8 27B(18GB)のような240億〜270億パラメータのモデルはVRAMに収まらず、一部がシステムRAMに移るため、速度が大きく低下します。Super版とTi版でもメモリ帯域幅は増えません。
- 発売日
- Wikipediaによると、4070 Tiは2023年1月5日、4070は2023年4月13日、4070 Superは2024年1月17日に発売されました。
- メモリ
- 12 GBのGDDR6X、192ビットのバス、21 Gbit/s:192 × 21 ÷ 8 = 504 GB/s。これはPuget Systemsが3枚のカードについて記載している値です。
- CUDAコア
- NVIDIAによると、4070は5,888、Superは7,168、Tiは7,680です。
- 消費電力
- NVIDIAによると、グラフィックス消費電力は200 W、220 W、285 Wで、必要な電源容量はそれぞれ650 W、650 W、700 Wです。
#4070、Super、Ti:メモリ容量は同じ、演算性能は異なる
| カード | CUDAコア | 帯域幅 | FP16(TFLOPS) | グラフィック性能 | 必要な電源 |
|---|---|---|---|---|---|
| RTX 4070 | 5 888 | 504GB/秒 | 29,15 | 200 W | 650 W |
| RTX 4070 Super | 7 168 | 504GB/秒 | 35,48 | 220 W | 650 W |
| RTX 4070 Ti | 7 680 | 504GB/秒 | 40,09 | 285 W | 700 W |
トークンを生成するために、GPUはモデルのすべてのアクティブな重みを再読み込みします。生成速度はメモリ帯域幅によって制限され、コア数によって制限されるわけではありません。しかし、3つのカードはすべて同じ帯域幅、504.2 GB/sを持っています。Pugetはllama.cppでGGUF 4ビットのPhi-3-miniを測定しました:プロンプト読み取り時の4070と4070 Tiの25%の差は、生成時にはほぼ同一のスコアになります。Hardware Cornerは他のモデルで、Superを4070の114%、Tiを116%と評価しています。したがって、実際の差はほぼゼロから約15%までですが、CUDAコア数は22%から30%増加しています。
計算能力が役立つのは、最初の単語が出る前の段階であるプロンプトの読み取りです。Pugetによると、FP16では4070と比べてSuperのTFLOPSは22%、Tiは38%高くなります。RAGや長い文書、大きなプロンプトを送るコーディングエージェントでは、この差が応答開始までの待ち時間を短くします。短いチャットでは、ほとんど恩恵がありません。
#12GBに収まるモデル
ファイルサイズは、2026年9月29日に確認した Ollama ライブラリのファイルに基づいています。余裕容量とは、12 GB からモデルのファイルサイズを差し引いた残りで、コンテキスト、キャッシュ、エンジンのバッファに必要なメモリはまだ含めていません。
| モデル | Ollama ファイル | 粗利益 | 用途 |
|---|---|---|---|
| Granite 4.2 8B | 5.3 GB | 6.7 GB | RAG およびツール呼び出し、128K コンテキスト、Apache 2.0 |
| Qwen 3.5 9B (Q4_K_M) | 6.6 GB | 5.4 GB | 汎用性が高く、テキストと画像に対応。Apache 2.0ライセンス |
| Gemma 4 12B (Q4_K_M) | 7.6 GB | 4.4 GB | テキスト、画像、音声;7.2GBのQATバージョン |
| Qwen3 14B | 9.3 GB | 2.7 GB | 余裕を持って動かせる最大のデンスモデル |
| Qwen 3.5 9B (Q8_0) | 11 GB | 1 GB | 非推奨:コンテキストとバッファ用の余裕が少なすぎます。 |
Qwen 3.5 9Bが最も安全な出発点です。Googleによると、Gemma 4 12Bは119.5億パラメータで、音声や画像も扱いたい場合に適しています。Granite 4.2 8Bは文書検索に向いており、IBMはRAGとツール呼び出しを強調しています。Qwen3 14Bは上限で、2.7 GBの余裕があれば数千トークンのコンテキストを確保できます。Qwen 3.5 9BのQ8_0では余裕が1 GBしかありません。コンテキスト、バッファ、Windowsが使うメモリによって、モデルがあふれる可能性があります。
ローカルRAGは埋め込みモデルを追加します。bge-m3はOllamaで1.2GBであり、Granite 4.2 8Bと組み合わせると合計6.5GB、Gemma 4 12Bと組み合わせると8.8GBになります。
#コンテキスト:モデルを読み込んだ後に残るメモリ
Ollamaはビデオメモリの容量に応じてコンテキスト長を設定します。ドキュメントによると、VRAMが24 GiB未満の場合、デフォルトは4kトークンで、エージェント、コーディングツール、ウェブ検索には少なくとも64,000トークンが推奨されています。RTX 4070は4kの区分に該当するため、デフォルト設定で起動したエージェントは、カードのメモリがいっぱいになるよりもずっと前に履歴を失います。コンテキスト長を増やすと、読み取り済みの各トークンのアテンションのキーと値を保存するKVキャッシュの分だけ、VRAMを消費します。
サイズは以下の式で計算されます:2(キーと値)× 全注意層 × KVヘッド数 × ヘッドの次元 × 値あたりのバイト × ターゲットトークン数。Hugging Faceのドキュメントによると、Qwen 3.5 9B は32層のうち8層のみが全注意層であり、KVヘッドは4つで各ヘッドの次元は256です。Gemma 4 12B は1024トークンのスライディングウィンドウ層と、統合されたキー・値のグローバル層を組み合わせています。そのキャッシュは、従来のトランスフォーマーと比べてはるかに軽量です。
| モデル | 8,000トークン | 32,000トークン | 128 000 トークン |
|---|---|---|---|
| Qwen 3.5 9B | 0,25 | 1,0 | 4,0 |
| Gemma 4 12B | 0,4 | 0,6 à 0,8 | 1,3 à 2,3 |
| 従来型のTransformer(例:32層、各ヘッドの次元が128のKVヘッド8個) | 1,0 | 4,0 | 16,0 |
これらは理論上の推定値であり、実測値ではありません。計算バッファ、DeltaNet層の状態、画像エンコーダーは考慮されていません。また、Gemmaの推定値に幅があるのは、キーと値の共有について不確実な点があるためです。Qwen 3.5 9B(6.6 GB)では、32,000トークンで約4.4 GBの余裕が残ります。128,000トークンでは、キャッシュだけで4 GiBに達し、全体で12 GB近くになります。実際の結果はollama psで確認してください。
次の改善策はキャッシュの量子化です。OllamaのFAQによると、q8_0はf16の約半分のメモリを使用し、精度の低下はごくわずかです。Flash Attentionが必要で、カードとモデルが対応していれば、Ollamaが自動的に有効にします。コンテキストが長くなると、生成も遅くなります。Hardware Cornerの測定では、Qwen3 8Bのコンテキスト長が4k、16k、32kと増えるにつれて、生成速度は71、52、38トークン/秒と低下しています。
#Ollamaをインストールし、モデルがメモリに収まることを確認する
ドキュメントによると、WindowsではOllamaにNVIDIAドライバー551.61以降が必要で、4070シリーズは対応カードに含まれています。この手順ではモデルをインストールし、その処理が100%カード上で実行されていることを確認します。
- 01ドライバを確認NVIDIAアプリケーションを開くか、ターミナルでnvidia-smiを実行してください。ドライバーのバージョンは551.61以降である必要があります。
- 02Ollama のインストールOllamaのサイトからWindows用のプログラムをダウンロードしてください。その後、ローカルAPIは http://localhost:11434 でリクエストを待ち受けます。
- 03モデルの起動ターミナルを開き、ollama run qwen3.5:9b を実行してください。6.6 GBのダウンロードは一度だけ行われます。
- 04メモリの割り当てを確認別のターミナルで ollama ps を実行してください。「プロセッサ」列に 100 % GPU と表示される必要があります。CPU/GPU の割合が 48 % / 52 % のようになっている場合は、モデルの一部がシステムRAMに退避していることを意味します。
- 05コンテキストとキャッシュを設定するOllamaアプリの設定、またはOLLAMA_CONTEXT_LENGTHでコンテキスト長を増やし、その後ollama psを再実行してください。メモリの余裕が足りない場合は、サーバー起動時にOLLAMA_FLASH_ATTENTIONを1、OLLAMA_KV_CACHE_TYPEをq8_0に設定してください。
#第三者が測定した処理速度と理論上限
QuelLLMはここに自社測定を公開していません。すべてのデータは第三者のソースから来ており、それぞれのモデルとコンテキストに基づいています。Hardware Cornerは2026年3月にRTX 4070を測定しました。XDAは2026年6月にRTX 4070 Tiについてのテストを公開しました。
| 出典 | カード | モデル | コンテキスト | 生成 | プロンプトの読み取り |
|---|---|---|---|---|---|
| Hardware Corner | RTX 4070 | Qwen3 8B Q4_K | 4k | 71,2 | 3 564 |
| Hardware Corner | RTX 4070 | Qwen3 8B Q4_K | 16k | 52,1 | 2 064 |
| Hardware Corner | RTX 4070 | Qwen3 8B Q4_K | 32k | 38,1 | 1 117 |
| Hardware Corner | RTX 4070 | Qwen3 14B Q4_K | 4k | 42,5 | 2 100 |
| Hardware Corner | RTX 4070 | Qwen3 14B Q4_K | 16k | 32,7 | 1 356 |
| XDA | RTX 4070 Ti | Qwen 3.5 9B (Ollama) | 記載なし | 65 à 67 | 記載なし |
理論上の上限は、これらの数値を判断する目安になります。生成速度は、帯域幅をモデルの重みのサイズで割った値を超えることはできません。Qwen3 8B(Ollamaでは5.2 GB)の場合、504 ÷ 5.2は約97トークン/秒となり、4kでの実測値71.2はその73%に達します。Qwen3 14B(9.3 GB)は上限が54、実測値が42.5で、上限の78%です。XDAはQwen 3.5 9B(上限76)で65〜67を記録しており、上限の85〜88%に相当します。Gemma 4 12B(7.6 GB、上限66)にこの73〜88%という範囲を当てはめると、48〜58トークン/秒になります。これは推定値であり、実測値ではありません。
| カード | 帯域幅 | 生成速度 (t/s) |
|---|---|---|
| RTX 4060 Ti 8 GB | 288 GB/s | 64,03 |
| RTX 5070 12 GB | 672 GB/s | 128,21 |
| RTX 4070 Ti Super 16 GB | 672 GB/s | 132,85 |
| RTX 3080 10 GB | 760 GB/s | 139,95 |
これらの数値はllama.cppのコミュニティランキングに由来し、そこにRTX 4070は表示されていません。生成速度は帯域幅に追従します:672 GB/sの2つのカード(1つは12 GB、もう1つは16 GB)はほぼ同じ速度で動作し、288 GB/sの4060 Tiはその半分の速度です。比例計算により、504 GB/sの4070は、この3.56 GiBのモデルで約99トークン/秒になると推定されます。これは推定値であり、実測値ではありません。
#12GBを超える場合:Qwen 3.8、Mistral Small、gpt-oss
Qwen 3.8 は Ollama ライブラリにおいて 270 億パラメータ版のみが存在し、Q4_K_M では 18 GB です。これは RTX 4070 のメモリを 6 GB 超過しており、GPU と RAM に分散して配置されます。また、これは Dense モデルであるため、各トークンがすべての重みを再読み込みします。GPU に 11 GB(504 GB/s)、RAM に 7 GB(DDR5 デュアルチャネルの仮定で 60 GB/s)を割り当てた場合、1 トークンあたりの処理時間は GPU 側で 22 ms、RAM 側で 117 ms となり、上限は約 7 トークン/秒に低下します。一方、Qwen 3.5 9B では 76 トークン/秒です。
| モデル | Ollama ファイル | 超過 | 性質 | 考えられる方法 |
|---|---|---|---|---|
| Mistral Small 24B | 14 GB | 2 GB | Dense | 非推奨:密なモデル |
| gpt-oss 20B | 14 GB | 2 GB | MoE、アクティブパラメータ数36億 | オフロードされたエキスパート(llama.cpp) |
| Gemma 4 26B | 19 GB | 7 GB | MoE (A4B) | 同様に、自分で測定してください |
| Qwen 3.8 27B | 18 GB | 6 GB | Dense | 不可:遅すぎる |
エキスパート型モデルは、メモリオーバーフロー(CPUへのオフロード)に適しています。gpt-oss 20B は、仕様書によると、総パラメータ数が210億で、1トークンあたりアクティブなパラメータ数は36億です。llama.cpp の --n-cpu-moe オプションは、最初のN層のエキスパートをメインメモリ(RAM)に保持し、アテンションとキャッシュはGPUカード上に保持します。llama.cpp の gpt-oss 向け公式ガイドでは、RTX 2060 8 GB の例として、コンテキスト長32,000トークンに対して、エキスパート層16層をCPUに配置する設定が示されています。12 GB の場合、Nを段階的に下げ、メモリエラーが発生する直前まで下げてから、1段階戻します。
この方法に関する RTX 4070 での出典のある測定値は見つかりませんでした。スループットは RAM と N に依存するため、ご自身で測定する必要があります。あるユーザーは 2025 年 8 月に、Ollama 上で RTX 4070 を使用し gpt-oss 20B を実行した際、CPU 47% と GPU 53% の自動分割で約 10 トークン/秒であったと報告しています。以降、バージョンや設定が変更された可能性があります。
#結論:どの4070を使えばよいか、そして16GBにアップグレードする時期はいつか
| 状況 | 決定 | 数値による根拠 |
|---|---|---|
| すでに4070を持っている場合、SuperまたはTiモデルです | 70億〜140億パラメータのモデル用として使い続ける | 同じ帯域幅でも、生成速度の差が0%から16% |
| チャット、アシスタント、簡単なコーディング | 4070ベースモデルで十分です | 帯域幅に依存した生成 |
| RAG、大規模ドキュメント、エージェント | SuperがなければTi | FP16のTFLOPSがそれぞれ22%、38%増加 |
| 24BモデルをすべてVRAMに収めて使いたい(14 GB) | 16GBにアップグレード(4070 Ti Super) | 16 GB および 672 GB/s |
| 12GBの環境でさらに高速化したい | RTX 5070 | 504 GB/sに対して672 GB/sで、33%多い |
RTX 5070は速度を改善しますが、容量は増えません。NVIDIAは192ビットバスのGDDR7を12GB搭載しており、28 Gbit/sでのメモリ帯域幅は672 GB/sです。4070の504 GB/sを上回ります。より大きなモデルをメモリに収めるには、16GBの容量が重要です。5070と4070 Ti Superのガイドでは、それぞれのケースを詳しく説明しています。
価格は変動が激しいため、当サイトでは毎週月曜日と木曜日に、ローカルAI向けグラフィックカードの最低価格とVRAM 1 GBあたりの価格を確認しています。
- 出典:NVIDIA、RTX 4070シリーズ仕様
- 出典:Puget Systems、一般消費者向け GPU の LLM 性能
- 出典:Ollama ドキュメント、コンテキスト長
- ソース:OllamaのFAQ、Flash AttentionおよびKVキャッシュ
- 出典:gpt-ossを実行するためのllama.cppガイド
#よくある質問
RTX 4070 にどのモデルをインストールすべきですか?+
Qwen 3.8はRTX 4070で動作しますか?+
RTX 4070、4070 Super、4070 Ti:ローカルLLMにはどれが適していますか?+
2026年でも、LLMには12 GBで十分ですか?+
RTX 4070 Superに必要な電源は?+
LLMにはRTX 4070とRTX 3080 10 GBのどちらを選ぶべきですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。