RTX 3070 / 3070 Ti (8 GB)で利用可能なLLMは? ?
RTX 3070 または 3070 Ti は 8 GB の VRAM を備えています。Q4(Granite 4.2 8B は 5.3 GB、Qwen 3.5 9B は 6.6 GB)で、80 億から 90 億パラメータまでのモデルを VRAM に保持できますが、120 億パラメータ以上のモデルは保持できません。3070 Ti は 448 GB/s に対して 608 GB/s の帯域幅を誇り、同じ容量でより高速に生成します。公開された測定値はありません。スループットは推定値です。
8GBのVRAMを搭載するRTX 3070と3070 Tiは、80億パラメータのモデルを動かすには十分なカードですが、メモリ容量が制約になります。このガイドでは、実際にメモリに収まるモデルとその正確なサイズ、メモリ帯域幅から推定した生成速度、コンテキストの限界、近いクラスのカードとの違いを紹介します。12GBや16GBに移行すべきタイミングも分かります。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: RTX 5060 Ti 16GB (ASUS Prime).
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。
#RTX 3070および3070 TiでローカルLLMを実行:8GBでできること
ローカル LLM 用途では、RTX 3070 や 3070 Ti の価値は 8 GB の VRAM にあり、この容量がすべてを決めます。Q4 量子化では、パラメータ数が80億~90億までのモデルは収まりますが、120億以上のモデルは収まりません。Ollama のモデルライブラリによると、Granite 4.2 8B は 5.3 GB、Qwen3 8B は 5.2 GB、Qwen 3.5 9B は 6.6 GB です。Qwen3 14B(9.3 GB)と gpt-oss 20B(14 GB)はカードの容量を超えます。3070 Ti のメモリ帯域幅は 608 GB/s で、3070 の 448 GB/s より生成が速いものの、容量は同じです。
- メモリ
- 256ビットバスで8 GBのメモリを搭載。Wikipediaの表とNVIDIAによると、3070はGDDR6で448 GB/s、3070 TiはGDDR6Xで608 GB/sです。
- 計算
- ウィキペディアによると、3070 は 5,888 個の CUDA コアを持ち、3070 Ti は 6,144 個の CUDA コアを持ちます。
- 消費電力
- NVIDIAによると、3070のグラフィックス消費電力は220 Wで、必要な電源容量は650 Wです。3070 Tiでは、それぞれ290 Wと750 Wです。必要な電源容量は、ときどき見かける550 Wという記載よりも大きくなります。
#8GBのメモリに収まるモデル
重みの容量は、2026 年 9 月 29 日に確認した Ollama ライブラリのファイルに基づいています。余裕とは、8 GB のうち、コンテキスト、キャッシュ、エンジンのバッファ用の容量を差し引く前に残っている容量です。GPU が画面出力も担っている場合は、この余裕で画面表示に必要な容量もまかなう必要があります。
| モデル | Ollama ファイル | 粗利益 | 判定 |
|---|---|---|---|
| Qwen 3.5 4B | 3.4 GB | 4.6 GB | 非常に快適で、長いコンテキストが可能 |
| Qwen3 8B | 5.2 GB | 2.8 GB | 快適 |
| Granite 4.2 8B | 5.3 GB | 2.7 GB | 快適 |
| Qwen 3.5 9B | 6.6 GB | 1.4 GB | メモリに収まりますが、コンテキスト長を制限する必要があります |
| Gemma 4 12B | 7.6 GB | 0.4 GB | マージンなし:有用なコンテキストがありません。 |
| Qwen3 14B | 9.3 GB | 1.3GB不足 | 収まりません |
| gpt-oss 20B | 14 GB | 6GB不足 | 収まりません |
最も無難な出発点は、80億パラメータのモデルです。Granite 4.2 8BまたはQwen3 8Bなら、コンテキスト用に約3 GBを残せます。Qwen 3.5 9Bは実用上の上限です。1.4 GBの余裕は短い会話には十分ですが、長い文書には足りません。ローカルRAGでは埋め込みモデルも追加します。bge-m3はOllamaで1.2 GBを占めるため、Granite 4.2 8Bと合わせて合計6.5 GBとなり、その他の用途に1.5 GBが残ります。
#RTX 3070 を搭載した環境に Ollama をインストールする
- 01ドライバを確認ターミナルでnvidia-smiを実行してください。ドライバーのバージョンは550以上(Windowsでは551.61)である必要があり、メモリの総容量は約8GBと表示される必要があります。
- 02Ollama のインストールOllamaは公式サイトからインストールしてください。ローカルAPIは http://localhost:11434 でリッスンします。
- 03モデルの起動ollama run granite4.2:8b を実行してください。5.3GBのダウンロードは一度だけ行われます。
- 04処理の配分を確認するもう1つのターミナルでollama psを実行してください。プロセッサ列には100 % GPUと表示される必要があります。CPU/GPUの両方に分散している場合は、モデルまたはコンテキストがGPUメモリに収まらず、システムRAMにも読み込まれていることを意味します。
- 05コンテキストを調整OLLAMA_CONTEXT_LENGTHでコンテキスト長を設定し、その後ollama psを再実行してください。VRAMを節約するため、サーバーの起動時にOLLAMA_FLASH_ATTENTIONを1に、OLLAMA_KV_CACHE_TYPEをq8_0に設定してください。
#処理速度:帯域幅から期待できること
主要なベンチマークサイトでは、RTX 3070の測定値は公開されていません。したがって、以下の数値は測定値ではなく推定値です。この手法は、生成速度が帯域幅によって制限されるという事実に基づいています。理論上の上限は、おおよそ帯域幅をモデルのサイズで割った値です。Granite 4.2 8B(5.3 GB)の場合、3070では448 ÷ 5.3で毎秒85トークン、3070 Tiでは608 ÷ 5.3で毎秒115トークンとなります。Qwen 3.5 9B(6.6 GB)の場合、上限はそれぞれ68と92です。
llama.cppのコミュニティランキングを使うと、これらの上限からおおよその生成速度を見積もれます。Llama 2 7B Q4_0では、3070に近い256ビットバスのカードであるRTX 3060 Ti 8 GBが、Flash Attentionなしで92.23トークン/秒、ありで96.50トークン/秒を生成します。帯域幅360 GB/sのRTX 3060 12 GBでは、それぞれ75.57トークン/秒と76.92トークン/秒です。この速度比(1.22)は、帯域幅の比(448 ÷ 360 = 1.24)に近い値です。したがって、3070の生成速度は3060 Tiに近く、7Bモデルで約90〜95トークン/秒、3070 Tiでは約35%速い120〜130トークン/秒になると考えられます。これらは推定値です。
| モデル | Ollama ファイル | 3070の上限(448 GB/s) | 3070 Tiの上限(608 GB/s) |
|---|---|---|---|
| Qwen 3.5 4B | 3.4 GB | 132 | 179 |
| Granite 4.2 8B | 5.3 GB | 85 | 115 |
| Qwen 3.5 9B | 6.6 GB | 68 | 92 |
| Gemma 4 12B | 7.6 GB | 59 | 80 |
他の場所で測定されたカードにおける実際のスループットは、これらの上限の 70% から 80% 程度です。したがって、3070 での Granite 4.2 8B については、毎秒 55 から 65 トークンを想定してください。正確な値に関わらず、これらの速度は人間の読み取り速度を超えています。3070 の制限は速度ではなく、容量です。
#8GBの制限:コンテキスト、RAG、大規模モデル
Ollamaはビデオメモリの容量に応じてデフォルトのコンテキスト長を設定します。ドキュメントでは、VRAMが24 GiB未満の場合は4kトークンとされ、エージェント、Web検索、コード関連ツールには少なくとも64,000トークンが推奨されています。8 GBの環境で、80億パラメータのモデルに64,000トークンのコンテキストを確保するのは現実的ではありません。各トークンのアテンションのキーと値を保存するKVキャッシュが、残りのメモリを消費するためです。OllamaのFAQによると、キャッシュをq8_0で量子化すると、精度の低下を非常に小さく抑えながら、メモリ使用量をf16の約半分に減らせます。まず有効にすべき設定です。
- 120 億から 240 億パラメータのモデル
- Gemma 4 12B(7.6 GB)ではコンテキスト用の空き容量が残りません。Qwen3 14B(9.3 GB)とgpt-oss 20B(14 GB)はVRAMに収まりません。これらはシステムRAMにオフロードされ、速度が低下します。
- 長いコンテキスト
- Qwen 3.5 9B を使用すると、1.4GBの余裕はすぐに尽きてしまいます。数千トークン程度のコンテキストを維持し、ollama ps を確認してください。
- マルチステップRAG
- Granite 4.2 8B と bge-m3 は合計6.5 GBを使用するため、リランカーや2つ目のモデルを追加すると容量を超えます。
- Fine-tuning
- Unslothによると、4ビットQLoRAで必要なメモリの絶対的な最小量は、30億パラメータのモデルで3.5GB、80億パラメータのモデルで6GBです。8Bモデルは、バッチサイズ1と短いコンテキストで、かろうじて収まる程度です。
メモリ使用量を8 GB未満に抑える簡単な方法は、三つの設定で実現できます。まず、モデルファイルを読み込んだ後も少なくとも2 GBの余裕が残るモデル、Granite 4.2 8BまたはQwen3 8Bを選びます。次に、q8_0で量子化したキャッシュとFlash Attentionを有効にします。Flash Attentionの公式リポジトリでは、3070のようなAmpere GPUとの互換性が示されています。最後に、コンテキスト長を4,000トークンから8,000トークン、さらに16,000トークンへと段階的に増やし、その都度ollama psを再実行します。CPUに割り当てられた部分が表示されたら、すぐに前の段階に戻してください。こうすることで、会話の途中で初めて限界に気づく事態を避けられます。
#3070と、メモリ8~16 GBの他のカードとの比較
| カード | メモリ | 帯域幅 | そのカードで何が変わるか |
|---|---|---|---|
| RTX 3070 | 8 GB GDDR6 | 448 GB/s | 80億から90億パラメータのモデル |
| RTX 3070 Ti | 8 GB GDDR6X | 608 GB/s | 同じ容量でも、生成速度が速い |
| RTX 3060 12 GB | 12 GB GDDR6 | 360 GB/s | 120億〜140億パラメータのモデルも利用可能に |
| RTX 4060 Ti 16GB | 16 GB | 288 GB/s | gpt-oss 20Bも選択肢に加わりますが、速度はより遅くなります |
この表はトレードオフを示しています。3060 12GBは3070より帯域幅が20%低いものの、VRAMは4GB多く、3070では動かせないQwen3 14B(9.3GB)を動かせます。4060 Ti 16GBでは、200億パラメータ級のモデルも選択肢に入りますが、帯域幅が288GB/sのため、小規模なモデルでは速度が劣ります。LLMでは、対象モデルが7.5GBを超えると、速度より容量が優先されます。
#結論:使い続けるか、買い替えるか、購入を見送るか
| 状況 | 決定 | 数値による根拠 |
|---|---|---|
| すでに3070を所有しており、8Bモデルを狙っています | 手元に残す | Granite 4.2 8B:5.3 GB、推定約60トークン/秒 |
| 12B から 14B のモデルをご希望です | 12GBまたは16GBに変更 | Qwen3 14Bは9.3GBであり、3070は8GBです |
| 20Bモデルまたは長いコンテキストを使いたい | 16 GB以上のカード | gpt-oss 20B のサイズは 14 GB |
| 3070と3070 Tiのどちらを選ぶか迷っています | 最も安価なものを選ぶ | 容量は同じ、帯域幅は608 GB/s 対448 GB/s |
| まず始めるためのグラフィックカードを探している | 3060 12GBと比較 | 帯域幅はほぼ同じで、メモリ容量はより大きい |
3070は80億パラメータのモデルにはまずまずのカードですが、それ以上ではありません。入門用のカードとしては今でも役立ちます。Ollamaが対応しており、80億パラメータのモデルは、人が読むよりも速く応答します。コードエージェントや長い文書を使う予定なら、適していません。これらには、8 GBでは確保できないコンテキスト容量が必要だからです。すでに持っているなら、ローカルLLMを試してみるには十分です。この用途だけのためにカードを選ぶなら、まず容量を基準にしてください。小さなモデルがより速く動くことよりも、大きなモデルがメモリに収まることの方が価値があります。今日の価格は、当サイトの価格追跡をご覧ください。各カードの最安値を週2回記録しています。
- 出典:NVIDIA、RTX 3070および3070 Tiの仕様
- 出典:CUDAでのllama.cppのコミュニティランキング
- 出典:Ollama ドキュメント、コンテキスト長
- ソース:OllamaのFAQ、Flash AttentionおよびKVキャッシュ
- 出典:Unsloth、ファインチューニングに必要な VRAM
#よくある質問
RTX 3070上でどのようなLLMを実行すべきですか?+
RTX 3070で140億または240億パラメータのモデルを実行できるか?+
LLM用にはRTX 3070とRTX 3060 12GBのどちらを選ぶべきですか?+
LLMを動かす場合、3070と3070 Tiにはどのような違いがありますか?+
RTX 3070 Ti にはどのような電源が必要ですか?+
RTX 3070でモデルをファインチューニングすることは可能ですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。