初心者 11 分RTX 20

RTX 2070 / 2070 Super (8 GB) で利用可能なLLMは? ?

端的な回答

RTX 2070 または 2070 Super(GDDR6 メモリ 8 GB)なら、Q4 の70億〜90億パラメータのモデルを快適に動かせます。Granite 4.2 8B(重み 4.6 GB)や Qwen 3.5 9B(6 GB)は、全体がカードのメモリに収まります。llama.cpp の基準テストでは、2070 Super の生成速度は88トークン/秒です。9B を超えると、モデルの一部をシステム RAM にオフロードする必要があり、スループットが急落します。

RTX 2070(2018年10月)とRTX 2070 Super(2019年7月)は、8GBのメモリを搭載したTuringアーキテクチャのグラフィックカードです。2026年時点では、Q4の8Bモデルを使うアシスタントには適した性能ですが、それ以外の用途には余裕がありません。このガイドでは、両カードの仕様を公開されている速度テストと結び付け、8GBのメモリが何に使われるのか、どのような場合にカードを交換する価値があるのかを説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: RTX 5060 Ti 16 GB.

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#RTX 2070および2070 Super:8GBでできること

RTX 2070 または 2070 Super では、70 億から 90 億パラメータのモデルを Q4 量子化した場合、完全にビデオメモリに収まります。これはこれらのカードの快適な使用範囲です。QuelLLM のカタログによると、Granite 4.2 8B は Q4 で重みの容量が 4.6 GB、Qwen 3.5 9B は約 6 GB です。コンテキストの長さを適度に抑えれば、コンテキスト用に空き領域が残ります。Gemma 4 12B のような 120 億パラメータのモデル(Q4 で 7 GB)では、キャッシュとシステム用に 1 GB しか残らず、理論上は動作しますが、実際には厳しい状況です。速度面では、2070 Super は llama.cpp のリファレンステストで、Q4_0 の 70 億パラメータモデルに対して 1 秒あたり 88 トークンを記録しており、これは人間の読み取り速度をはるかに上回ります。したがって、これらのカードの本当の上限は速度ではなく、メモリ容量です。

RTX 2070
2018年10月、CUDAコア2,304基、256ビットバスのGDDR6メモリ8 GB、帯域幅448 GB/s(256ビット、14 Gbit/s)。
RTX 2070 Super
2019年7月、CUDAコア2,560基、メモリは同じ8 GB、メモリ帯域幅も同じ448 GB/s、消費電力215 W。
LLM の利用における両者の違い
ほとんど違いはありません。帯域幅と容量は同じです。Superはコア数が多く、その効果は主にプロンプトの処理に現れ、生成には現れません。

最後の点は直感に反します: テキスト生成において、グラフィックスプロセッサは各トークンごとにモデルの全重みを再読み込みするため、メモリ帯域幅がコア数よりも重要になります。448 GB/sの2枚のカードは、ゲームでは1枚が明らかに高速であっても、生成時のスループットはほぼ同等になります。

#8 GB に収まるモデルはどれか

モデルの重みが占めるのは、必要なメモリの一部にすぎません。会話が長くなるにつれて増えるコンテキストキャッシュ(KVキャッシュ)に加え、ドライバーや画面表示のための余裕も必要です。8 GBのグラフィックカードで数千トークンのコンテキストを使いたい場合、重みのサイズを最大6 GBに抑えるのが実用上の目安です。参考までに、llama.cppのテストツールでは、8 GBのRTX 3060 Tiの空きメモリは7,838 MiBと表示されます。理論上の8,192 MiBより少し少なく、モデルを読み込む前から数百メガバイトが使われています。

RTX 2070 / 2070 Super向けモデル(モデルのサイズはQuelLLMのカタログに基づく)
モデルQ4 での重み8GBでの評価
Qwen 3.5 4B2.3 GB(Q8:4.3 GB)Q8 でも、長いコンテキストを使っても、十分な余裕がある
Granite 4.2 8B4.6GB(Q8:9GB)Q4なら余裕を持って動作し、数千トークンのコンテキストを使用できます
Qwen 3.5 9B6 GB(Q8:10 GB)適度な長さのコンテキストならQ4で動作します。それより長いコンテキストでは、量子化したK/Vキャッシュを使用してください。
Gemma 4 12B7GB(Q8:13GB)制約:コンテキスト用の余裕がなく、モデルの一部がRAMにオフロードされる可能性が高い

8BモデルのQ8(9GB)は通過しません。8GBではQ4が標準であり、Q5は小型モデルにおいてのみ可能です。各量子化レベルの品質損失を比較するためには、Q4、Q5、Q8の選択ガイドを参照してください。特定のプロジェクトにおいては、サイトのVRAM計算ツールを用いて、モデルとコンテキストに応じた正確なメモリ消費量を確認できます。

#速度:基準となるベンチマークが測定するもの

利用できる唯一の公開参考データは、llama.cppのリポジトリにある共同編集の表です。ユーザーが同じコマンドの実行結果を投稿しています。条件は、Llama 2 7BのQ4_0量子化モデル(ファイルサイズ3.56 GiB)を使い、すべてのレイヤーをGPUに配置してllama-benchを実行することです。この表には、同じチップでもドライバー、OS、カードのメーカーによって結果が変わると明記されています。これらは当サイトで測定した値ではありません。以下の数値はこの表に基づいており、「読み取り」列はプロンプト処理のスループット(pp512)、「生成」列は回答生成のスループット(tg128)を示しています。

llama.cpp のテスト、Llama 2 7B Q4_0、Flash Attention なし
カードメモリ生成速度 (tok/s)プロンプトの読み込み速度(tok/s)
RTX 2060 Super8 GB60,01 420
RTX 2070 Super8 GB88,12 088
RTX 3060 12 GB12 GB75,62 138
RTX 2080 Ti11 GB107,52 891

二つの教訓。まず、2070 Super は RTX 3060 12 GB より高速に生成します(毎秒 88.1 トークン対 75.6 トークン、約 17% の差):速度は交換を正当化する理由ではありません。次に、RTX 2060 Super は 2070 Super と同じ 448 GB/s の帯域幅を示しますが、結果は毎秒 60 トークンで、32% 低いです。したがって、帯域幅の上限は予測ではありません:ドライバの状態、周波数、カードの仕様も重要です。これらの値は桁の目安として扱ってください。

#テストモデルから現在のモデルへ:比例計算

テスト用モデルのサイズは3.82 GB(3.56 GiB)です。生成速度は重みの読み取りに制約されるため、他の条件が同じなら、モデルのサイズが大きくなるのに比例して遅くなります。Granite 4.2 8BのQ4形式(4.6 GB)では、最大でも88 × 3.82 ÷ 4.6、つまり約73トークン/秒です。Qwen 3.5 9BのQ4形式(6 GB)では、約56トークン/秒です。これらは理論上の上限であり、実測値ではありません。最近のアーキテクチャ(ハイブリッドモデルや混合エキスパートモデル)やコンテキストの長さによって、結果は上にも下にも変わります。

この目安は実際の確認にも役立ちます。お使いの構成について示された数値がこれらの目安を大幅に下回る場合、たとえばQ4の8Bモデルで毎秒15トークン未満なら、モデルの一部がシステムRAMにオフロードされている兆候です。グラフィックカードが原因だと判断する前に、VRAMの使用状況を確認してください。Ollamaのトラブルシューティングガイドで手順を説明しています。

#コンテキストとKVキャッシュ:8GBで足りるかを左右する要素

会話が長くなると生成速度が低下します。モデルがトークンを生成するたびにキャッシュも読み直すためです。8 GBのカードでは、類似したカードについて公開されている測定結果を見る限り、低下は数パーセント程度と小幅です。もう一つの影響はメモリ使用量です。K/Vキャッシュはコンテキスト長に比例してVRAMを占有します。Ollamaの二つの設定で、8 GBのカードの負担を軽減できます。Flash Attentionはコンテキストが長くなった際のメモリ消費を減らします。また、Ollamaのドキュメントには、Flash Attentionを有効にするとK/Vキャッシュを量子化できると明記されています。q8_0形式のメモリ使用量は、デフォルトのf16形式の約半分で、ドキュメントによると精度の低下は非常に小さいとされています。

  1. 01
    Flash Attentionを有効にする
    環境変数OLLAMA_FLASH_ATTENTION=1を設定してサーバーを起動してください。GPUとモデルが対応している場合、OllamaはすでにFlash Attentionを自動的に有効にします。この変数は、その有効化を強制するためのものです。
  2. 02
    K/V キャッシュの量子化
    OLLAMA_KV_CACHE_TYPE=q8_0 を追加してください。q4_0に下げるのは最後の手段にしてください。ドキュメントでは、大きなコンテキストで劣化が生じる可能性が指摘されています。
  3. 03
    使用状況の確認
    長いプロンプトを実行し、nvidia-smiでカードのメモリ使用量を確認してください。VRAMが上限に達する場合は、Ollamaがモデルの一部をRAMにオフロードするままにせず、コンテキストを短くしてください。
Linux:2つの設定でOllamaを実行する
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

2070 Superでのllama.cppのテストでは、Flash Attentionを有効にした場合の生成速度は87.7トークン/秒で、無効の場合は88.1トークン/秒です。ここでは生成の高速化は期待できません。一方、プロンプトの読み取り速度は2,088トークン/秒から2,293トークン/秒に上がり、長い文書やRAGではこの差が重要になります。このテーマをさらに詳しく知りたい方には、キャッシュの量子化に特化したガイドがあります。

#2026年のTuring:ドライバー、サポート、制約

Turing世代のカードは引き続きサポートされています。Ollamaのドキュメントでは、Compute Capability 5.0以上とバージョン550以降のドライバーが必要とされており、RTX 2070、2080、2080 TiはCompute Capability 7.5のカードとして一覧に掲載されています。Turingは最低限の対応世代にもなっています。CUDA 13のリリースノートには、Turing以前のアーキテクチャ(Maxwell、Volta、Pascal)のサポートが廃止されたと記載されています。Turingのサポート終了時期を判断できる根拠はなく、その時期を示すのは軽率です。慎重に対応するには、CUDAの大型アップデートのたびにリリースノートを確認することです。

実用上の制約が残っています。最近のモデルは、より新しいハードウェア向けに設計された形式でまず公開されることが多く、その後、コミュニティが Q4 の GGUF 形式へのコンバージョンを、お使いのカードのような環境向けに提案します。これは Ollama や llama.cpp の動作を妨げるものではありませんが、読み取り可能な形式でのモデルの提供が 1〜2 日遅れる可能性があります。

#2070 Super、3060 12GBまたは3060 Ti:どの選択が適切か

LLM用途向けの8〜12 GBのグラフィックカード3種
カードメモリ生成速度 (tok/s)これによって得られるもの
RTX 2070 Super8 GB88,1まずまずの速度。Q4 では 9B が上限
RTX 3060 Ti8 GB92,2やや高速です。容量の上限は同じです。
RTX 3060 12 GB12 GB75,6速度は遅いものの、メモリが4 GB多く、Q4量子化したGemma 4 12Bを余裕を持って実行できます

速度が同程度なら、決め手はメモリ容量です。2070 Superから3060 Tiに替えても、9Bという上限は変わりません。3060 12 GBに替えると、処理速度は少し下がりますが、120億パラメータのモデルや長いコンテキストを利用できるようになります。中古価格は毎週変動するため、決める前に当サイトの価格推移を確認してください。

#2026年の結論:使い続けるか、購入するか、別の選択肢に移るか

使い続けるのがおすすめの場合
Q4の7〜9Bモデルをアシスタントとして使い、短いコードの作成、要約、あるいは中程度のRAGを行っている場合です。処理速度は十分に快適で、買い替えを必要とする理由はありません。
次の条件に当てはまる場合は別の選択肢を検討してください
十分なコンテキストを使える12Bモデル、14B以上のモデル、または非常に長い文書を扱いたい場合です。その場合、最低でも12 GBが必要で、余裕を持って使うには16 GBが必要です。
中古購入
2070 Superが魅力的な選択肢になるのは、12 GBのカードより価格が明確に安い場合だけです。これらのカードはすでに数年間使われているため、保証とファンの状態を確認してください。

#よくある質問

よくある質問
RTX 2070は2026年にLLMを実行できますか?+
はい、8 GBの範囲内であれば可能です。Q4量子化の70億から90億パラメータのモデル(Granite 4.2 8BやQwen 3.5 9Bなど)は、カードに完全に収まります。llama.cppの基準テストでは、2070 Superは1秒あたり88トークンを生成し、チャットやコード支援には十分です。
LLM用ならRTX 2070とRTX 2070 Superのどちらを選ぶべきですか?+
どちらも8GBのGDDR6を搭載し、メモリ帯域幅は同じ448GB/sです。そして、生成性能は主に帯域幅に依存します。コア数が多いSuperは、主に長いプロンプトの処理で有利です。価格差が大きい場合は、通常の2070でも非常に近い生成体験が得られます。
RTX 2070 で Gemma 4 12B を実行することは可能ですか?+
容量の限界に近いです。カタログではQ4の重みが7GBとされているため、8GBではコンテキストキャッシュやシステム用の領域がほとんど残りません。モデルは読み込めますが、会話が長くなるとすぐにVRAMに収まらなくなり、一部がシステムRAMに移されます。Granite 4.2 8BかQwen 3.5 9Bを選ぶか、VRAMが12GBのカードに変更してください。
RTX 2070 Superでのトークン/秒はどれくらいですか?+
llama.cpp の公開ベンチマークでは、Llama 2 7B の Q4_0 で 1 秒あたり 88 トークンとされています。より重いモデルはサイズにほぼ比例して遅くなります。理論的な推定値として、Q4 の 8B から 9B では 1 秒あたり 55 から 75 トークン程度を見込んでください。長いコンテキストでは、この数値は低下します。
現在のドライバーは RTX 2070 をまだサポートしていますか?+
はい。Ollama は RTX 2070、2080、2080 Ti をコンピュートケイパビリティ 7.5 のカードとして挙げており、必要なのはバージョン 550 以降のドライバーだけです。CUDA 13 では、それ以前のアーキテクチャのサポートを廃止し、Turing をサポート対象の最も古いアーキテクチャとしています。参照した情報源では、サポート終了は発表されていません。
RTX 2070 で Flash Attention を有効にするべきですか?+
Ollamaは、ハードウェアが対応していれば自動的に有効にします。OLLAMA_FLASH_ATTENTION=1 を設定して、強制的に有効にすることもできます。2070 Superでは生成速度は変わりませんが、プロンプトの読み込みが約10%速くなり、長いコンテキストでのメモリ使用量が減ります。これは8 GBのメモリでは重要です。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。