初心者 11 分RTX 30

RTX 3070 / 3070 Ti (8 GB)で利用可能なLLMは? ?

端的な回答

RTX 3070 または 3070 Ti は 8 GB の VRAM を備えています。Q4(Granite 4.2 8B は 5.3 GB、Qwen 3.5 9B は 6.6 GB)で、80 億から 90 億パラメータまでのモデルを VRAM に保持できますが、120 億パラメータ以上のモデルは保持できません。3070 Ti は 448 GB/s に対して 608 GB/s の帯域幅を誇り、同じ容量でより高速に生成します。公開された測定値はありません。スループットは推定値です。

8GBのVRAMを搭載するRTX 3070と3070 Tiは、80億パラメータのモデルを動かすには十分なカードですが、メモリ容量が制約になります。このガイドでは、実際にメモリに収まるモデルとその正確なサイズ、メモリ帯域幅から推定した生成速度、コンテキストの限界、近いクラスのカードとの違いを紹介します。12GBや16GBに移行すべきタイミングも分かります。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: RTX 5060 Ti 16GB (ASUS Prime).

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。

#RTX 3070および3070 TiでローカルLLMを実行:8GBでできること

ローカル LLM 用途では、RTX 3070 や 3070 Ti の価値は 8 GB の VRAM にあり、この容量がすべてを決めます。Q4 量子化では、パラメータ数が80億~90億までのモデルは収まりますが、120億以上のモデルは収まりません。Ollama のモデルライブラリによると、Granite 4.2 8B は 5.3 GB、Qwen3 8B は 5.2 GB、Qwen 3.5 9B は 6.6 GB です。Qwen3 14B(9.3 GB)と gpt-oss 20B(14 GB)はカードの容量を超えます。3070 Ti のメモリ帯域幅は 608 GB/s で、3070 の 448 GB/s より生成が速いものの、容量は同じです。

メモリ
256ビットバスで8 GBのメモリを搭載。Wikipediaの表とNVIDIAによると、3070はGDDR6で448 GB/s、3070 TiはGDDR6Xで608 GB/sです。
計算
ウィキペディアによると、3070 は 5,888 個の CUDA コアを持ち、3070 Ti は 6,144 個の CUDA コアを持ちます。
消費電力
NVIDIAによると、3070のグラフィックス消費電力は220 Wで、必要な電源容量は650 Wです。3070 Tiでは、それぞれ290 Wと750 Wです。必要な電源容量は、ときどき見かける550 Wという記載よりも大きくなります。

#8GBのメモリに収まるモデル

重みの容量は、2026 年 9 月 29 日に確認した Ollama ライブラリのファイルに基づいています。余裕とは、8 GB のうち、コンテキスト、キャッシュ、エンジンのバッファ用の容量を差し引く前に残っている容量です。GPU が画面出力も担っている場合は、この余裕で画面表示に必要な容量もまかなう必要があります。

RTX 3070 / 3070 Ti 向けモデル(Ollama ファイル、特記がない限り Q4)
モデルOllama ファイル粗利益判定
Qwen 3.5 4B3.4 GB4.6 GB非常に快適で、長いコンテキストが可能
Qwen3 8B5.2 GB2.8 GB快適
Granite 4.2 8B5.3 GB2.7 GB快適
Qwen 3.5 9B6.6 GB1.4 GBメモリに収まりますが、コンテキスト長を制限する必要があります
Gemma 4 12B7.6 GB0.4 GBマージンなし:有用なコンテキストがありません。
Qwen3 14B9.3 GB1.3GB不足収まりません
gpt-oss 20B14 GB6GB不足収まりません

最も無難な出発点は、80億パラメータのモデルです。Granite 4.2 8BまたはQwen3 8Bなら、コンテキスト用に約3 GBを残せます。Qwen 3.5 9Bは実用上の上限です。1.4 GBの余裕は短い会話には十分ですが、長い文書には足りません。ローカルRAGでは埋め込みモデルも追加します。bge-m3はOllamaで1.2 GBを占めるため、Granite 4.2 8Bと合わせて合計6.5 GBとなり、その他の用途に1.5 GBが残ります。

#RTX 3070 を搭載した環境に Ollama をインストールする

  1. 01
    ドライバを確認
    ターミナルでnvidia-smiを実行してください。ドライバーのバージョンは550以上(Windowsでは551.61)である必要があり、メモリの総容量は約8GBと表示される必要があります。
  2. 02
    Ollama のインストール
    Ollamaは公式サイトからインストールしてください。ローカルAPIは http://localhost:11434 でリッスンします。
  3. 03
    モデルの起動
    ollama run granite4.2:8b を実行してください。5.3GBのダウンロードは一度だけ行われます。
  4. 04
    処理の配分を確認する
    もう1つのターミナルでollama psを実行してください。プロセッサ列には100 % GPUと表示される必要があります。CPU/GPUの両方に分散している場合は、モデルまたはコンテキストがGPUメモリに収まらず、システムRAMにも読み込まれていることを意味します。
  5. 05
    コンテキストを調整
    OLLAMA_CONTEXT_LENGTHでコンテキスト長を設定し、その後ollama psを再実行してください。VRAMを節約するため、サーバーの起動時にOLLAMA_FLASH_ATTENTIONを1に、OLLAMA_KV_CACHE_TYPEをq8_0に設定してください。
基本コマンド
ollama run granite4.2:8b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#処理速度:帯域幅から期待できること

主要なベンチマークサイトでは、RTX 3070の測定値は公開されていません。したがって、以下の数値は測定値ではなく推定値です。この手法は、生成速度が帯域幅によって制限されるという事実に基づいています。理論上の上限は、おおよそ帯域幅をモデルのサイズで割った値です。Granite 4.2 8B(5.3 GB)の場合、3070では448 ÷ 5.3で毎秒85トークン、3070 Tiでは608 ÷ 5.3で毎秒115トークンとなります。Qwen 3.5 9B(6.6 GB)の場合、上限はそれぞれ68と92です。

llama.cppのコミュニティランキングを使うと、これらの上限からおおよその生成速度を見積もれます。Llama 2 7B Q4_0では、3070に近い256ビットバスのカードであるRTX 3060 Ti 8 GBが、Flash Attentionなしで92.23トークン/秒、ありで96.50トークン/秒を生成します。帯域幅360 GB/sのRTX 3060 12 GBでは、それぞれ75.57トークン/秒と76.92トークン/秒です。この速度比(1.22)は、帯域幅の比(448 ÷ 360 = 1.24)に近い値です。したがって、3070の生成速度は3060 Tiに近く、7Bモデルで約90〜95トークン/秒、3070 Tiでは約35%速い120〜130トークン/秒になると考えられます。これらは推定値です。

生成速度の推定値(トークン/秒、理論上限、RTX 3070 / 3070 Ti)
モデルOllama ファイル3070の上限(448 GB/s)3070 Tiの上限(608 GB/s)
Qwen 3.5 4B3.4 GB132179
Granite 4.2 8B5.3 GB85115
Qwen 3.5 9B6.6 GB6892
Gemma 4 12B7.6 GB5980

他の場所で測定されたカードにおける実際のスループットは、これらの上限の 70% から 80% 程度です。したがって、3070 での Granite 4.2 8B については、毎秒 55 から 65 トークンを想定してください。正確な値に関わらず、これらの速度は人間の読み取り速度を超えています。3070 の制限は速度ではなく、容量です。

#8GBの制限:コンテキスト、RAG、大規模モデル

Ollamaはビデオメモリの容量に応じてデフォルトのコンテキスト長を設定します。ドキュメントでは、VRAMが24 GiB未満の場合は4kトークンとされ、エージェント、Web検索、コード関連ツールには少なくとも64,000トークンが推奨されています。8 GBの環境で、80億パラメータのモデルに64,000トークンのコンテキストを確保するのは現実的ではありません。各トークンのアテンションのキーと値を保存するKVキャッシュが、残りのメモリを消費するためです。OllamaのFAQによると、キャッシュをq8_0で量子化すると、精度の低下を非常に小さく抑えながら、メモリ使用量をf16の約半分に減らせます。まず有効にすべき設定です。

120 億から 240 億パラメータのモデル
Gemma 4 12B(7.6 GB)ではコンテキスト用の空き容量が残りません。Qwen3 14B(9.3 GB)とgpt-oss 20B(14 GB)はVRAMに収まりません。これらはシステムRAMにオフロードされ、速度が低下します。
長いコンテキスト
Qwen 3.5 9B を使用すると、1.4GBの余裕はすぐに尽きてしまいます。数千トークン程度のコンテキストを維持し、ollama ps を確認してください。
マルチステップRAG
Granite 4.2 8B と bge-m3 は合計6.5 GBを使用するため、リランカーや2つ目のモデルを追加すると容量を超えます。
Fine-tuning
Unslothによると、4ビットQLoRAで必要なメモリの絶対的な最小量は、30億パラメータのモデルで3.5GB、80億パラメータのモデルで6GBです。8Bモデルは、バッチサイズ1と短いコンテキストで、かろうじて収まる程度です。

メモリ使用量を8 GB未満に抑える簡単な方法は、三つの設定で実現できます。まず、モデルファイルを読み込んだ後も少なくとも2 GBの余裕が残るモデル、Granite 4.2 8BまたはQwen3 8Bを選びます。次に、q8_0で量子化したキャッシュとFlash Attentionを有効にします。Flash Attentionの公式リポジトリでは、3070のようなAmpere GPUとの互換性が示されています。最後に、コンテキスト長を4,000トークンから8,000トークン、さらに16,000トークンへと段階的に増やし、その都度ollama psを再実行します。CPUに割り当てられた部分が表示されたら、すぐに前の段階に戻してください。こうすることで、会話の途中で初めて限界に気づく事態を避けられます。

#3070と、メモリ8~16 GBの他のカードとの比較

ローカルLLM向けの近いクラスのGPUカード(NVIDIA、Hardware Corner)
カードメモリ帯域幅そのカードで何が変わるか
RTX 30708 GB GDDR6448 GB/s80億から90億パラメータのモデル
RTX 3070 Ti8 GB GDDR6X608 GB/s同じ容量でも、生成速度が速い
RTX 3060 12 GB12 GB GDDR6360 GB/s120億〜140億パラメータのモデルも利用可能に
RTX 4060 Ti 16GB16 GB288 GB/sgpt-oss 20Bも選択肢に加わりますが、速度はより遅くなります

この表はトレードオフを示しています。3060 12GBは3070より帯域幅が20%低いものの、VRAMは4GB多く、3070では動かせないQwen3 14B(9.3GB)を動かせます。4060 Ti 16GBでは、200億パラメータ級のモデルも選択肢に入りますが、帯域幅が288GB/sのため、小規模なモデルでは速度が劣ります。LLMでは、対象モデルが7.5GBを超えると、速度より容量が優先されます。

#結論:使い続けるか、買い替えるか、購入を見送るか

状況別の判断
状況決定数値による根拠
すでに3070を所有しており、8Bモデルを狙っています手元に残すGranite 4.2 8B:5.3 GB、推定約60トークン/秒
12B から 14B のモデルをご希望です12GBまたは16GBに変更Qwen3 14Bは9.3GBであり、3070は8GBです
20Bモデルまたは長いコンテキストを使いたい16 GB以上のカードgpt-oss 20B のサイズは 14 GB
3070と3070 Tiのどちらを選ぶか迷っています最も安価なものを選ぶ容量は同じ、帯域幅は608 GB/s 対448 GB/s
まず始めるためのグラフィックカードを探している3060 12GBと比較帯域幅はほぼ同じで、メモリ容量はより大きい

3070は80億パラメータのモデルにはまずまずのカードですが、それ以上ではありません。入門用のカードとしては今でも役立ちます。Ollamaが対応しており、80億パラメータのモデルは、人が読むよりも速く応答します。コードエージェントや長い文書を使う予定なら、適していません。これらには、8 GBでは確保できないコンテキスト容量が必要だからです。すでに持っているなら、ローカルLLMを試してみるには十分です。この用途だけのためにカードを選ぶなら、まず容量を基準にしてください。小さなモデルがより速く動くことよりも、大きなモデルがメモリに収まることの方が価値があります。今日の価格は、当サイトの価格追跡をご覧ください。各カードの最安値を週2回記録しています。

#よくある質問

FAQ
RTX 3070上でどのようなLLMを実行すべきですか?+
まずは Granite 4.2 8B(5.3 GB)または Qwen3 8B(5.2 GB)から始めてください。コンテキスト用に約3 GBの余裕が残ります。Qwen 3.5 9B(6.6 GB)が上限で、余裕は1.4 GBです。Q4でパラメータ数が90億を超えると、モデルはVRAMに収まらず、一部がシステムRAMに置かれます。
RTX 3070で140億または240億パラメータのモデルを実行できるか?+
いいえ。Qwen3 14BはOllamaで9.3 GBを占め、GPUの容量を1.3 GB超過しています。24Bモデル(15 GB)やgpt-oss 20B(14 GB)では、GPU容量のほぼ2倍が必要です。これらはRAMにあふれ出し、速度が低下します。14Bモデルには少なくとも12 GBが必要です。
LLM用にはRTX 3070とRTX 3060 12GBのどちらを選ぶべきですか?+
LLMを使うなら、3060 12 GBがより良い選択になることが多いです。メモリが4 GB多いため、Qwen3 14B(9.3 GB)を実行できます。3070のメモリ帯域幅は448 GB/sで、3060の360 GB/sに対し、理論上の生成速度は約25%速くなります。ただし、メモリが8 GBなので、実行できるのは80億〜90億パラメータのモデルまでです。
LLMを動かす場合、3070と3070 Tiにはどのような違いがありますか?+
メモリ容量は同じ8 GBですが、3070 TiはGDDR6の448 GB/sに対してGDDR6Xの608 GB/sというメモリ帯域幅を持ち、36%の帯域幅向上を実現しています。帯域幅に制約される生成処理は、理論上同じ割合で高速化されます。消費電力は、NVIDIAによると220 Wに対して290 Wです。
RTX 3070 Ti にはどのような電源が必要ですか?+
NVIDIAが示す必要なシステム電源容量は、3070 Tiが750W(グラフィックス消費電力290W)、3070が650W(同220W)です。これらはPC全体についてメーカーが示す値です。550Wの電源はこの推奨値を下回りますが、消費電力の少ないPCなら足りる場合もあります。
RTX 3070でモデルをファインチューニングすることは可能ですか?+
はい、小規模モデルならQLoRAでファインチューニングできます。Unslothによると、最低限必要なメモリは3Bモデルで3.5 GB、8Bモデルで6 GBです。8 GBでは、バッチサイズ1、短いコンテキストで8Bモデルがかろうじて収まります。14Bモデルには8.5 GBが必要で、収まりません。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。