中級 14 分RTX 40

RTX 4070 / 4070 Super / 4070 Ti(12GB)で使うLLMはどれか ?

端的な回答

1枚の RTX 4070、4070 Super、または 4070 Ti は 12 GB の VRAM と 504 GB/s の帯域幅を提供します。これは Q4 量子化で最大 14B パラメータのモデル(Qwen 3.5 9B、Gemma 4 12B、Qwen3 14B)を動作させるには十分ですが、24B から 27B のモデルには不十分です。3つのカードはメモリが同一であるため、生成速度はほぼ同等ですが、長いプロンプトの読み取り速度だけが異なります。

ファミリー RTX 4070 の3枚のカードは同じメモリを共有しますが、計算性能は同じではありません。LLMにとって、この差は思われているほど重要ではありません。本ガイドでは、12 GBに実際に収まるモデルとその正確な重さ、確保すべきコンテキスト予算、第三者による測定済みスループット、および大きすぎるモデルへの対処法を説明します。また、中古で狙うべきバリアントや、16 GBにアップグレードすべきタイミングもわかります。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: RTX 5070 Ti 16 GB.

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#RTX 4070とローカルLLM:12 GBでできること

ローカルLLM用途でRTX 4070の価値をまず決めるのは、12GBのメモリと504GB/sのメモリ帯域幅です。この2つの数値によって、どのモデルが収まり、どの程度の速度で動作するかが決まります。Q4に量子化された70億〜140億パラメータのモデルは、全体がVRAMに収まります。Ollamaライブラリによると、Qwen 3.5 9Bは6.6GB、Gemma 4 12Bは7.6GB、Qwen3 14Bは9.3GBです。Hardware Cornerは、RTX 4070でコンテキストを4,000トークンに設定した場合、Qwen3 8Bで毎秒71トークン、Qwen3 14Bで毎秒42トークンを測定しています。Mistral Small 24B(14GB)やQwen 3.8 27B(18GB)のような240億〜270億パラメータのモデルはVRAMに収まらず、一部がシステムRAMに移るため、速度が大きく低下します。Super版とTi版でもメモリ帯域幅は増えません。

発売日
Wikipediaによると、4070 Tiは2023年1月5日、4070は2023年4月13日、4070 Superは2024年1月17日に発売されました。
メモリ
12 GBのGDDR6X、192ビットのバス、21 Gbit/s:192 × 21 ÷ 8 = 504 GB/s。これはPuget Systemsが3枚のカードについて記載している値です。
CUDAコア
NVIDIAによると、4070は5,888、Superは7,168、Tiは7,680です。
消費電力
NVIDIAによると、グラフィックス消費電力は200 W、220 W、285 Wで、必要な電源容量はそれぞれ650 W、650 W、700 Wです。
!
中古の4070はメモリの種類を確認してください
Wikipediaによると、2024年8月以降、RTX 4070にはGDDR6Xの代わりに20 Gbit/sのGDDR6を搭載したモデルもあります。同じ192ビットのバスでも、帯域幅は504 GB/sではなく480 GB/sとなり、5%低くなります。正確な型番を問い合わせてください。

#4070、Super、Ti:メモリ容量は同じ、演算性能は異なる

12 GB搭載のRTX 4070シリーズ3モデルの比較(NVIDIA、Puget Systems)
カードCUDAコア帯域幅FP16(TFLOPS)グラフィック性能必要な電源
RTX 40705 888504GB/秒29,15200 W650 W
RTX 4070 Super7 168504GB/秒35,48220 W650 W
RTX 4070 Ti7 680504GB/秒40,09285 W700 W

トークンを生成するために、GPUはモデルのすべてのアクティブな重みを再読み込みします。生成速度はメモリ帯域幅によって制限され、コア数によって制限されるわけではありません。しかし、3つのカードはすべて同じ帯域幅、504.2 GB/sを持っています。Pugetはllama.cppでGGUF 4ビットのPhi-3-miniを測定しました:プロンプト読み取り時の4070と4070 Tiの25%の差は、生成時にはほぼ同一のスコアになります。Hardware Cornerは他のモデルで、Superを4070の114%、Tiを116%と評価しています。したがって、実際の差はほぼゼロから約15%までですが、CUDAコア数は22%から30%増加しています。

計算能力が役立つのは、最初の単語が出る前の段階であるプロンプトの読み取りです。Pugetによると、FP16では4070と比べてSuperのTFLOPSは22%、Tiは38%高くなります。RAGや長い文書、大きなプロンプトを送るコーディングエージェントでは、この差が応答開始までの待ち時間を短くします。短いチャットでは、ほとんど恩恵がありません。

→
Ti を選ぶ理由はほとんどありません
消費電力はSuperの220 Wに対して285 Wで、30%多い一方、Hardware Cornerによると生成のスコアは2ポイント高いだけです。また、3機種の中で最も古いモデルです。価格が近ければ、このシリーズではSuperが最もおすすめの購入候補です。

#12GBに収まるモデル

ファイルサイズは、2026年9月29日に確認した Ollama ライブラリのファイルに基づいています。余裕容量とは、12 GB からモデルのファイルサイズを差し引いた残りで、コンテキスト、キャッシュ、エンジンのバッファに必要なメモリはまだ含めていません。

RTX 4070、SuperまたはTiでテスト可能なモデル(ファイル Ollama)
モデルOllama ファイル粗利益用途
Granite 4.2 8B5.3 GB6.7 GBRAG およびツール呼び出し、128K コンテキスト、Apache 2.0
Qwen 3.5 9B (Q4_K_M)6.6 GB5.4 GB汎用性が高く、テキストと画像に対応。Apache 2.0ライセンス
Gemma 4 12B (Q4_K_M)7.6 GB4.4 GBテキスト、画像、音声;7.2GBのQATバージョン
Qwen3 14B9.3 GB2.7 GB余裕を持って動かせる最大のデンスモデル
Qwen 3.5 9B (Q8_0)11 GB1 GB非推奨:コンテキストとバッファ用の余裕が少なすぎます。

Qwen 3.5 9Bが最も安全な出発点です。Googleによると、Gemma 4 12Bは119.5億パラメータで、音声や画像も扱いたい場合に適しています。Granite 4.2 8Bは文書検索に向いており、IBMはRAGとツール呼び出しを強調しています。Qwen3 14Bは上限で、2.7 GBの余裕があれば数千トークンのコンテキストを確保できます。Qwen 3.5 9BのQ8_0では余裕が1 GBしかありません。コンテキスト、バッファ、Windowsが使うメモリによって、モデルがあふれる可能性があります。

ローカルRAGは埋め込みモデルを追加します。bge-m3はOllamaで1.2GBであり、Granite 4.2 8Bと組み合わせると合計6.5GB、Gemma 4 12Bと組み合わせると8.8GBになります。

#コンテキスト:モデルを読み込んだ後に残るメモリ

Ollamaはビデオメモリの容量に応じてコンテキスト長を設定します。ドキュメントによると、VRAMが24 GiB未満の場合、デフォルトは4kトークンで、エージェント、コーディングツール、ウェブ検索には少なくとも64,000トークンが推奨されています。RTX 4070は4kの区分に該当するため、デフォルト設定で起動したエージェントは、カードのメモリがいっぱいになるよりもずっと前に履歴を失います。コンテキスト長を増やすと、読み取り済みの各トークンのアテンションのキーと値を保存するKVキャッシュの分だけ、VRAMを消費します。

サイズは以下の式で計算されます:2(キーと値)× 全注意層 × KVヘッド数 × ヘッドの次元 × 値あたりのバイト × ターゲットトークン数。Hugging Faceのドキュメントによると、Qwen 3.5 9B は32層のうち8層のみが全注意層であり、KVヘッドは4つで各ヘッドの次元は256です。Gemma 4 12B は1024トークンのスライディングウィンドウ層と、統合されたキー・値のグローバル層を組み合わせています。そのキャッシュは、従来のトランスフォーマーと比べてはるかに軽量です。

公開された設定から算出した、f16のKVキャッシュの推定サイズ(GiB)
モデル8,000トークン32,000トークン128 000 トークン
Qwen 3.5 9B0,251,04,0
Gemma 4 12B0,40,6 à 0,81,3 à 2,3
従来型のTransformer(例:32層、各ヘッドの次元が128のKVヘッド8個)1,04,016,0

これらは理論上の推定値であり、実測値ではありません。計算バッファ、DeltaNet層の状態、画像エンコーダーは考慮されていません。また、Gemmaの推定値に幅があるのは、キーと値の共有について不確実な点があるためです。Qwen 3.5 9B(6.6 GB)では、32,000トークンで約4.4 GBの余裕が残ります。128,000トークンでは、キャッシュだけで4 GiBに達し、全体で12 GB近くになります。実際の結果はollama psで確認してください。

次の改善策はキャッシュの量子化です。OllamaのFAQによると、q8_0はf16の約半分のメモリを使用し、精度の低下はごくわずかです。Flash Attentionが必要で、カードとモデルが対応していれば、Ollamaが自動的に有効にします。コンテキストが長くなると、生成も遅くなります。Hardware Cornerの測定では、Qwen3 8Bのコンテキスト長が4k、16k、32kと増えるにつれて、生成速度は71、52、38トークン/秒と低下しています。

#Ollamaをインストールし、モデルがメモリに収まることを確認する

ドキュメントによると、WindowsではOllamaにNVIDIAドライバー551.61以降が必要で、4070シリーズは対応カードに含まれています。この手順ではモデルをインストールし、その処理が100%カード上で実行されていることを確認します。

  1. 01
    ドライバを確認
    NVIDIAアプリケーションを開くか、ターミナルでnvidia-smiを実行してください。ドライバーのバージョンは551.61以降である必要があります。
  2. 02
    Ollama のインストール
    OllamaのサイトからWindows用のプログラムをダウンロードしてください。その後、ローカルAPIは http://localhost:11434 でリクエストを待ち受けます。
  3. 03
    モデルの起動
    ターミナルを開き、ollama run qwen3.5:9b を実行してください。6.6 GBのダウンロードは一度だけ行われます。
  4. 04
    メモリの割り当てを確認
    別のターミナルで ollama ps を実行してください。「プロセッサ」列に 100 % GPU と表示される必要があります。CPU/GPU の割合が 48 % / 52 % のようになっている場合は、モデルの一部がシステムRAMに退避していることを意味します。
  5. 05
    コンテキストとキャッシュを設定する
    Ollamaアプリの設定、またはOLLAMA_CONTEXT_LENGTHでコンテキスト長を増やし、その後ollama psを再実行してください。メモリの余裕が足りない場合は、サーバー起動時にOLLAMA_FLASH_ATTENTIONを1、OLLAMA_KV_CACHE_TYPEをq8_0に設定してください。
基本コマンド
ollama run qwen3.5:9b
ollama run gemma4:12b
ollama ps

# Exemple de la documentation Ollama pour fixer le contexte à 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#第三者が測定した処理速度と理論上限

QuelLLMはここに自社測定を公開していません。すべてのデータは第三者のソースから来ており、それぞれのモデルとコンテキストに基づいています。Hardware Cornerは2026年3月にRTX 4070を測定しました。XDAは2026年6月にRTX 4070 Tiについてのテストを公開しました。

RTX 4070および4070 Tiでの公開スループット値(トークン/秒)
出典カードモデルコンテキスト生成プロンプトの読み取り
Hardware CornerRTX 4070Qwen3 8B Q4_K4k71,23 564
Hardware CornerRTX 4070Qwen3 8B Q4_K16k52,12 064
Hardware CornerRTX 4070Qwen3 8B Q4_K32k38,11 117
Hardware CornerRTX 4070Qwen3 14B Q4_K4k42,52 100
Hardware CornerRTX 4070Qwen3 14B Q4_K16k32,71 356
XDARTX 4070 TiQwen 3.5 9B (Ollama)記載なし65 à 67記載なし

理論上の上限は、これらの数値を判断する目安になります。生成速度は、帯域幅をモデルの重みのサイズで割った値を超えることはできません。Qwen3 8B(Ollamaでは5.2 GB)の場合、504 ÷ 5.2は約97トークン/秒となり、4kでの実測値71.2はその73%に達します。Qwen3 14B(9.3 GB)は上限が54、実測値が42.5で、上限の78%です。XDAはQwen 3.5 9B(上限76)で65〜67を記録しており、上限の85〜88%に相当します。Gemma 4 12B(7.6 GB、上限66)にこの73〜88%という範囲を当てはめると、48〜58トークン/秒になります。これは推定値であり、実測値ではありません。

llama.cpp による帯域幅に基づく生成(Llama 2 7B Q4_0、tg128 テスト、Flash Attention 有効)
カード帯域幅生成速度 (t/s)
RTX 4060 Ti 8 GB288 GB/s64,03
RTX 5070 12 GB672 GB/s128,21
RTX 4070 Ti Super 16 GB672 GB/s132,85
RTX 3080 10 GB760 GB/s139,95

これらの数値はllama.cppのコミュニティランキングに由来し、そこにRTX 4070は表示されていません。生成速度は帯域幅に追従します:672 GB/sの2つのカード(1つは12 GB、もう1つは16 GB)はほぼ同じ速度で動作し、288 GB/sの4060 Tiはその半分の速度です。比例計算により、504 GB/sの4070は、この3.56 GiBのモデルで約99トークン/秒になると推定されます。これは推定値であり、実測値ではありません。

#12GBを超える場合:Qwen 3.8、Mistral Small、gpt-oss

Qwen 3.8 は Ollama ライブラリにおいて 270 億パラメータ版のみが存在し、Q4_K_M では 18 GB です。これは RTX 4070 のメモリを 6 GB 超過しており、GPU と RAM に分散して配置されます。また、これは Dense モデルであるため、各トークンがすべての重みを再読み込みします。GPU に 11 GB(504 GB/s)、RAM に 7 GB(DDR5 デュアルチャネルの仮定で 60 GB/s)を割り当てた場合、1 トークンあたりの処理時間は GPU 側で 22 ms、RAM 側で 117 ms となり、上限は約 7 トークン/秒に低下します。一方、Qwen 3.5 9B では 76 トークン/秒です。

12 GBを超えるモデル(Ollamaファイル)
モデルOllama ファイル超過性質考えられる方法
Mistral Small 24B14 GB2 GBDense非推奨:密なモデル
gpt-oss 20B14 GB2 GBMoE、アクティブパラメータ数36億オフロードされたエキスパート(llama.cpp)
Gemma 4 26B19 GB7 GBMoE (A4B)同様に、自分で測定してください
Qwen 3.8 27B18 GB6 GBDense不可:遅すぎる

エキスパート型モデルは、メモリオーバーフロー(CPUへのオフロード)に適しています。gpt-oss 20B は、仕様書によると、総パラメータ数が210億で、1トークンあたりアクティブなパラメータ数は36億です。llama.cpp の --n-cpu-moe オプションは、最初のN層のエキスパートをメインメモリ(RAM)に保持し、アテンションとキャッシュはGPUカード上に保持します。llama.cpp の gpt-oss 向け公式ガイドでは、RTX 2060 8 GB の例として、コンテキスト長32,000トークンに対して、エキスパート層16層をCPUに配置する設定が示されています。12 GB の場合、Nを段階的に下げ、メモリエラーが発生する直前まで下げてから、1段階戻します。

llama.cppガイドの例(8GBカード):--n-cpu-moeを調整してください
llama-server -hf ggml-org/gpt-oss-20b-GGUF --ctx-size 32768 --jinja -ub 2048 -b 2048 --n-cpu-moe 16

この方法に関する RTX 4070 での出典のある測定値は見つかりませんでした。スループットは RAM と N に依存するため、ご自身で測定する必要があります。あるユーザーは 2025 年 8 月に、Ollama 上で RTX 4070 を使用し gpt-oss 20B を実行した際、CPU 47% と GPU 53% の自動分割で約 10 トークン/秒であったと報告しています。以降、バージョンや設定が変更された可能性があります。

i
QLoRAのファインチューニングは12GBで収まる
Unslothによると、4ビットQLoRAで最低限必要なVRAMは、80億パラメータで6GB、140億パラメータで8.5GBです。バッチサイズ1と短いコンテキストなら、4070でも14Bモデルの利用を検討できます。

#結論:どの4070を使えばよいか、そして16GBにアップグレードする時期はいつか

状況別の判断
状況決定数値による根拠
すでに4070を持っている場合、SuperまたはTiモデルです70億〜140億パラメータのモデル用として使い続ける同じ帯域幅でも、生成速度の差が0%から16%
チャット、アシスタント、簡単なコーディング4070ベースモデルで十分です帯域幅に依存した生成
RAG、大規模ドキュメント、エージェントSuperがなければTiFP16のTFLOPSがそれぞれ22%、38%増加
24BモデルをすべてVRAMに収めて使いたい(14 GB)16GBにアップグレード(4070 Ti Super)16 GB および 672 GB/s
12GBの環境でさらに高速化したいRTX 5070504 GB/sに対して672 GB/sで、33%多い

RTX 5070は速度を改善しますが、容量は増えません。NVIDIAは192ビットバスのGDDR7を12GB搭載しており、28 Gbit/sでのメモリ帯域幅は672 GB/sです。4070の504 GB/sを上回ります。より大きなモデルをメモリに収めるには、16GBの容量が重要です。5070と4070 Ti Superのガイドでは、それぞれのケースを詳しく説明しています。

価格は変動が激しいため、当サイトでは毎週月曜日と木曜日に、ローカルAI向けグラフィックカードの最低価格とVRAM 1 GBあたりの価格を確認しています。

#よくある質問

RTX 4070 にどのモデルをインストールすべきですか?+
まずはQwen 3.5 9Bから始めてください。Ollamaのファイルは6.6GBで、コンテキスト用に5GBを超える余裕を残し、テキストと画像を扱えます。7.6GBのGemma 4 12Bでは、さらに音声も扱えます。9.3GBのQwen3 14Bは、快適に使える範囲で最大のモデルです。Q4で140億パラメータを超えると、モデルの一部がシステムRAMにオフロードされます。
Qwen 3.8はRTX 4070で動作しますか?+
快適には動作しません。Qwen 3.8は270億パラメータのモデルしかなく、OllamaのQ4_K_Mでは18GBを使用するため、カードのVRAM容量を6GB上回ります。VRAMとRAMに分散して配置すると、理論上の上限は約7トークン/秒です。12GBの環境では、Qwen 3.5 9BまたはGemma 4 12Bを選んでください。
RTX 4070、4070 Super、4070 Ti:ローカルLLMにはどれが適していますか?+
テキスト生成では、ほぼ同等です。メモリはどれも12GB、帯域幅も504GB/sで、引用されている測定結果による差は0~16%です。長いプロンプトを送る場合は、Superのほうが速く読み取れるため、追加費用に見合う価値があります。Tiは285Wを消費する割に、性能向上はわずかです。
2026年でも、LLMには12 GBで十分ですか?+
70億〜140億パラメータのモデルなら十分です。チャット、軽いコーディング、RAGに対応できます。一方、Q4で量子化した240億〜270億パラメータのモデルには足りません。これらの容量は14〜18GBで、24BモデルをすべてVRAMに収めるには16GBが必要です。エキスパートをオフロードするモデルも、引き続き選択肢になります。
RTX 4070 Superに必要な電源は?+
NVIDIAは、4070と4070 Superに必要な電源容量を650 W、4070 Tiには700 Wとし、Superのグラフィックス消費電力を220 Wとしています。これらはPC全体に対するメーカーの値です。550 Wの電源はこの推奨から外れますが、消費電力の少ないPCなら足りる可能性があります。
LLMにはRTX 4070とRTX 3080 10 GBのどちらを選ぶべきですか?+
3080 10GB は 320ビットのバスと 760GB/s の帯域幅を持ち、4070 の 504GB/s に対してはより高速に処理が可能であり、モデルが10GB以内に収まる場合にその効果が現れます。4070 は2GB多く、これは Gemma 4 12B または Qwen3 14B に該当します。対象モデルのサイズによって異なります。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。