RTX 2070 / 2070 Super (8 GB) で利用可能なLLMは? ?
RTX 2070 または 2070 Super(GDDR6 メモリ 8 GB)なら、Q4 の70億〜90億パラメータのモデルを快適に動かせます。Granite 4.2 8B(重み 4.6 GB)や Qwen 3.5 9B(6 GB)は、全体がカードのメモリに収まります。llama.cpp の基準テストでは、2070 Super の生成速度は88トークン/秒です。9B を超えると、モデルの一部をシステム RAM にオフロードする必要があり、スループットが急落します。
RTX 2070(2018年10月)とRTX 2070 Super(2019年7月)は、8GBのメモリを搭載したTuringアーキテクチャのグラフィックカードです。2026年時点では、Q4の8Bモデルを使うアシスタントには適した性能ですが、それ以外の用途には余裕がありません。このガイドでは、両カードの仕様を公開されている速度テストと結び付け、8GBのメモリが何に使われるのか、どのような場合にカードを交換する価値があるのかを説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: RTX 5060 Ti 16 GB.
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#RTX 2070および2070 Super:8GBでできること
RTX 2070 または 2070 Super では、70 億から 90 億パラメータのモデルを Q4 量子化した場合、完全にビデオメモリに収まります。これはこれらのカードの快適な使用範囲です。QuelLLM のカタログによると、Granite 4.2 8B は Q4 で重みの容量が 4.6 GB、Qwen 3.5 9B は約 6 GB です。コンテキストの長さを適度に抑えれば、コンテキスト用に空き領域が残ります。Gemma 4 12B のような 120 億パラメータのモデル(Q4 で 7 GB)では、キャッシュとシステム用に 1 GB しか残らず、理論上は動作しますが、実際には厳しい状況です。速度面では、2070 Super は llama.cpp のリファレンステストで、Q4_0 の 70 億パラメータモデルに対して 1 秒あたり 88 トークンを記録しており、これは人間の読み取り速度をはるかに上回ります。したがって、これらのカードの本当の上限は速度ではなく、メモリ容量です。
- RTX 2070
- 2018年10月、CUDAコア2,304基、256ビットバスのGDDR6メモリ8 GB、帯域幅448 GB/s(256ビット、14 Gbit/s)。
- RTX 2070 Super
- 2019年7月、CUDAコア2,560基、メモリは同じ8 GB、メモリ帯域幅も同じ448 GB/s、消費電力215 W。
- LLM の利用における両者の違い
- ほとんど違いはありません。帯域幅と容量は同じです。Superはコア数が多く、その効果は主にプロンプトの処理に現れ、生成には現れません。
最後の点は直感に反します: テキスト生成において、グラフィックスプロセッサは各トークンごとにモデルの全重みを再読み込みするため、メモリ帯域幅がコア数よりも重要になります。448 GB/sの2枚のカードは、ゲームでは1枚が明らかに高速であっても、生成時のスループットはほぼ同等になります。
#8 GB に収まるモデルはどれか
モデルの重みが占めるのは、必要なメモリの一部にすぎません。会話が長くなるにつれて増えるコンテキストキャッシュ(KVキャッシュ)に加え、ドライバーや画面表示のための余裕も必要です。8 GBのグラフィックカードで数千トークンのコンテキストを使いたい場合、重みのサイズを最大6 GBに抑えるのが実用上の目安です。参考までに、llama.cppのテストツールでは、8 GBのRTX 3060 Tiの空きメモリは7,838 MiBと表示されます。理論上の8,192 MiBより少し少なく、モデルを読み込む前から数百メガバイトが使われています。
| モデル | Q4 での重み | 8GBでの評価 |
|---|---|---|
| Qwen 3.5 4B | 2.3 GB(Q8:4.3 GB) | Q8 でも、長いコンテキストを使っても、十分な余裕がある |
| Granite 4.2 8B | 4.6GB(Q8:9GB) | Q4なら余裕を持って動作し、数千トークンのコンテキストを使用できます |
| Qwen 3.5 9B | 6 GB(Q8:10 GB) | 適度な長さのコンテキストならQ4で動作します。それより長いコンテキストでは、量子化したK/Vキャッシュを使用してください。 |
| Gemma 4 12B | 7GB(Q8:13GB) | 制約:コンテキスト用の余裕がなく、モデルの一部がRAMにオフロードされる可能性が高い |
8BモデルのQ8(9GB)は通過しません。8GBではQ4が標準であり、Q5は小型モデルにおいてのみ可能です。各量子化レベルの品質損失を比較するためには、Q4、Q5、Q8の選択ガイドを参照してください。特定のプロジェクトにおいては、サイトのVRAM計算ツールを用いて、モデルとコンテキストに応じた正確なメモリ消費量を確認できます。
#速度:基準となるベンチマークが測定するもの
利用できる唯一の公開参考データは、llama.cppのリポジトリにある共同編集の表です。ユーザーが同じコマンドの実行結果を投稿しています。条件は、Llama 2 7BのQ4_0量子化モデル(ファイルサイズ3.56 GiB)を使い、すべてのレイヤーをGPUに配置してllama-benchを実行することです。この表には、同じチップでもドライバー、OS、カードのメーカーによって結果が変わると明記されています。これらは当サイトで測定した値ではありません。以下の数値はこの表に基づいており、「読み取り」列はプロンプト処理のスループット(pp512)、「生成」列は回答生成のスループット(tg128)を示しています。
| カード | メモリ | 生成速度 (tok/s) | プロンプトの読み込み速度(tok/s) |
|---|---|---|---|
| RTX 2060 Super | 8 GB | 60,0 | 1 420 |
| RTX 2070 Super | 8 GB | 88,1 | 2 088 |
| RTX 3060 12 GB | 12 GB | 75,6 | 2 138 |
| RTX 2080 Ti | 11 GB | 107,5 | 2 891 |
二つの教訓。まず、2070 Super は RTX 3060 12 GB より高速に生成します(毎秒 88.1 トークン対 75.6 トークン、約 17% の差):速度は交換を正当化する理由ではありません。次に、RTX 2060 Super は 2070 Super と同じ 448 GB/s の帯域幅を示しますが、結果は毎秒 60 トークンで、32% 低いです。したがって、帯域幅の上限は予測ではありません:ドライバの状態、周波数、カードの仕様も重要です。これらの値は桁の目安として扱ってください。
#テストモデルから現在のモデルへ:比例計算
テスト用モデルのサイズは3.82 GB(3.56 GiB)です。生成速度は重みの読み取りに制約されるため、他の条件が同じなら、モデルのサイズが大きくなるのに比例して遅くなります。Granite 4.2 8BのQ4形式(4.6 GB)では、最大でも88 × 3.82 ÷ 4.6、つまり約73トークン/秒です。Qwen 3.5 9BのQ4形式(6 GB)では、約56トークン/秒です。これらは理論上の上限であり、実測値ではありません。最近のアーキテクチャ(ハイブリッドモデルや混合エキスパートモデル)やコンテキストの長さによって、結果は上にも下にも変わります。
この目安は実際の確認にも役立ちます。お使いの構成について示された数値がこれらの目安を大幅に下回る場合、たとえばQ4の8Bモデルで毎秒15トークン未満なら、モデルの一部がシステムRAMにオフロードされている兆候です。グラフィックカードが原因だと判断する前に、VRAMの使用状況を確認してください。Ollamaのトラブルシューティングガイドで手順を説明しています。
#コンテキストとKVキャッシュ:8GBで足りるかを左右する要素
会話が長くなると生成速度が低下します。モデルがトークンを生成するたびにキャッシュも読み直すためです。8 GBのカードでは、類似したカードについて公開されている測定結果を見る限り、低下は数パーセント程度と小幅です。もう一つの影響はメモリ使用量です。K/Vキャッシュはコンテキスト長に比例してVRAMを占有します。Ollamaの二つの設定で、8 GBのカードの負担を軽減できます。Flash Attentionはコンテキストが長くなった際のメモリ消費を減らします。また、Ollamaのドキュメントには、Flash Attentionを有効にするとK/Vキャッシュを量子化できると明記されています。q8_0形式のメモリ使用量は、デフォルトのf16形式の約半分で、ドキュメントによると精度の低下は非常に小さいとされています。
- 01Flash Attentionを有効にする環境変数OLLAMA_FLASH_ATTENTION=1を設定してサーバーを起動してください。GPUとモデルが対応している場合、OllamaはすでにFlash Attentionを自動的に有効にします。この変数は、その有効化を強制するためのものです。
- 02K/V キャッシュの量子化OLLAMA_KV_CACHE_TYPE=q8_0 を追加してください。q4_0に下げるのは最後の手段にしてください。ドキュメントでは、大きなコンテキストで劣化が生じる可能性が指摘されています。
- 03使用状況の確認長いプロンプトを実行し、nvidia-smiでカードのメモリ使用量を確認してください。VRAMが上限に達する場合は、Ollamaがモデルの一部をRAMにオフロードするままにせず、コンテキストを短くしてください。
2070 Superでのllama.cppのテストでは、Flash Attentionを有効にした場合の生成速度は87.7トークン/秒で、無効の場合は88.1トークン/秒です。ここでは生成の高速化は期待できません。一方、プロンプトの読み取り速度は2,088トークン/秒から2,293トークン/秒に上がり、長い文書やRAGではこの差が重要になります。このテーマをさらに詳しく知りたい方には、キャッシュの量子化に特化したガイドがあります。
#2026年のTuring:ドライバー、サポート、制約
Turing世代のカードは引き続きサポートされています。Ollamaのドキュメントでは、Compute Capability 5.0以上とバージョン550以降のドライバーが必要とされており、RTX 2070、2080、2080 TiはCompute Capability 7.5のカードとして一覧に掲載されています。Turingは最低限の対応世代にもなっています。CUDA 13のリリースノートには、Turing以前のアーキテクチャ(Maxwell、Volta、Pascal)のサポートが廃止されたと記載されています。Turingのサポート終了時期を判断できる根拠はなく、その時期を示すのは軽率です。慎重に対応するには、CUDAの大型アップデートのたびにリリースノートを確認することです。
実用上の制約が残っています。最近のモデルは、より新しいハードウェア向けに設計された形式でまず公開されることが多く、その後、コミュニティが Q4 の GGUF 形式へのコンバージョンを、お使いのカードのような環境向けに提案します。これは Ollama や llama.cpp の動作を妨げるものではありませんが、読み取り可能な形式でのモデルの提供が 1〜2 日遅れる可能性があります。
#2070 Super、3060 12GBまたは3060 Ti:どの選択が適切か
| カード | メモリ | 生成速度 (tok/s) | これによって得られるもの |
|---|---|---|---|
| RTX 2070 Super | 8 GB | 88,1 | まずまずの速度。Q4 では 9B が上限 |
| RTX 3060 Ti | 8 GB | 92,2 | やや高速です。容量の上限は同じです。 |
| RTX 3060 12 GB | 12 GB | 75,6 | 速度は遅いものの、メモリが4 GB多く、Q4量子化したGemma 4 12Bを余裕を持って実行できます |
速度が同程度なら、決め手はメモリ容量です。2070 Superから3060 Tiに替えても、9Bという上限は変わりません。3060 12 GBに替えると、処理速度は少し下がりますが、120億パラメータのモデルや長いコンテキストを利用できるようになります。中古価格は毎週変動するため、決める前に当サイトの価格推移を確認してください。
#2026年の結論:使い続けるか、購入するか、別の選択肢に移るか
- 使い続けるのがおすすめの場合
- Q4の7〜9Bモデルをアシスタントとして使い、短いコードの作成、要約、あるいは中程度のRAGを行っている場合です。処理速度は十分に快適で、買い替えを必要とする理由はありません。
- 次の条件に当てはまる場合は別の選択肢を検討してください
- 十分なコンテキストを使える12Bモデル、14B以上のモデル、または非常に長い文書を扱いたい場合です。その場合、最低でも12 GBが必要で、余裕を持って使うには16 GBが必要です。
- 中古購入
- 2070 Superが魅力的な選択肢になるのは、12 GBのカードより価格が明確に安い場合だけです。これらのカードはすでに数年間使われているため、保証とファンの状態を確認してください。
#よくある質問
RTX 2070は2026年にLLMを実行できますか?+
LLM用ならRTX 2070とRTX 2070 Superのどちらを選ぶべきですか?+
RTX 2070 で Gemma 4 12B を実行することは可能ですか?+
RTX 2070 Superでのトークン/秒はどれくらいですか?+
現在のドライバーは RTX 2070 をまだサポートしていますか?+
RTX 2070 で Flash Attention を有効にするべきですか?+
- 出典:CUDA での llama.cpp の性能表
- 出典:Ollama がサポートする NVIDIA カード
- 出典:OllamaのFAQ(Flash Attention、K/Vキャッシュ)
- 出典:GeForce 20シリーズの仕様
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。