GTX 1070 / 1080(8 GB)で使えるLLMは? ?
はい:GTX 1070、8 GBの1070 Tiまたは1080であれば、Q4形式の70億から90億パラメータのモデルを、適度なコンテキストで問題なく動作させます。llama.cppのパブリックベンチマークでは、GTX 1070 Tiの7B Q4_0で37.82 tokens/sを記録しています。より高速なメモリを搭載した1080は、直接の測定値はありませんが、より良い結果を出すはずです。90億パラメータを超えると8 GBでは限界に達し、Pascalアーキテクチャにはソフトウェア的な将来性はありません。
GTX 1070(2016年6月)、1070 Ti(2017年11月)、1080(2016年5月)は、同じGP104チップと8GBのメモリを備えています。これらは、お金をかけずにローカルLLMを試したい人にとって、最も魅力的な中古グラフィックカードになっています。このガイドでは、そのメモリ容量で何ができるかを数値で示し、速度について公開測定から何が分かるか、そしてPascalのサポート終了日が価格よりも重要な理由を説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#GTX 1070、1070 Ti、1080:LLM 用途での違い
LLMにとって、これら3枚のカードは容量がいずれも8 GBで、生成速度を決めるメモリ帯域幅が異なります。1070と1070 Tiは256ビットバスのGDDR5を使用し、帯域幅は256 GB/sです。1080はGDDR5Xを使用し、320 GB/sに達します。LLMはトークンごとにすべての重みを読み直すため、この25%の差はほぼそのまま速度差に反映されます。その影響は、1080の2,560コアと1070の1,920コアというコア数の違いよりもはるかに大きくなります。いずれもTensor Coresを搭載しておらず、Pascalでは従来のCUDAによる計算を使います。
| カード | CUDAコア | メモリ | 帯域幅 | 実測スループット(7B Q4_0) |
|---|---|---|---|---|
| GTX 1070 | 1 920 | 8 GB GDDR5 | 256 GB/s | ベンチマークで測定されていません |
| GTX 1070 Ti | 2 432 | 8 GB GDDR5 | 256 GB/s | 37.82トークン/秒 |
| GTX 1080 | 2 560 | 8 GB GDDR5X | 320 GB/s | ベンチマークで測定されていません |
11 GB のメモリと 484 GB/s の帯域幅を持つ GTX 1080 Ti は、別のカテゴリーに属するため、専用のページを用意しています。お使いのカードが 1080 Ti なら、そちらのガイドをお読みください。
#8GBで実際にできること
重要なのは、重みと利用可能なメモリの比率です。KVキャッシュもこれに追加されるためです。サイトの目安では、Q4の7〜8Bモデルの重みは約5 GBです。8 GBのメモリでは、コンテキストとシステムに約3 GBが残り、実用的な余裕があります。Q4の9Bモデルは6 GBで、2 GBが残り、短いコンテキストであれば可能です。120億パラメータでは、重みが7 GBに達し、ほとんど何も残りません。
| モデル (Q4) | モデル容量 | 8 GBでの余裕 | 帯域幅256 GB/sでの上限 | 帯域幅320 GB/sでの上限 |
|---|---|---|---|---|
| Granite 4.1 3B | 2 GB | 6 GB | 128トークン/秒 | 160トークン/秒 |
| Granite 4.2 8B | 4.6 GB | 3.4 GB | 55トークン/秒 | 70トークン/秒 |
| Qwen3.5 9B | 6 GB | 2 GB | 43 tokens/s | 53トークン/秒 |
| Gemma 4 12B | 7 GB | 1 GB | 推奨されません | 推奨されません |
| Phi-4 14B | 9 GB | ネガティブ | GPUのメモリに収まりきらない | GPUのメモリに収まりきらない |
理論上の上限に達することはありません。公開ベンチマークでは、GTX 1070 Tiが3.56GiBのモデルで37.82トークン/秒に達しており、帯域幅の上限256GB/秒に対して約56%の効率に相当します。同じ効率を上記のモデルに適用すると、Granite 4.2 8Bは1070 Tiで約30トークン/秒で動作する計算になります。これは比例関係による外挿であり、実測値ではありません。
#公開ベンチマークの結果
QuelLLM はこれらのグラフィックカードをテストしていません。数値は、llama.cpp リポジトリの「Performance of llama.cpp on Nvidia CUDA」というディスカッションに掲載されたものです。そこでは、各投稿者が Llama 2 7B を Q4_0 で、すべてのレイヤーを GPU に載せて llama-bench を実行しています。GTX 1070 Ti は、プロンプト処理で 714.44 トークン/秒、生成で 37.82 トークン/秒を記録しています。
同じページに掲載されているカードのうち、測定値があるものを比較すると参考になります。8 GBのメモリと256ビットのメモリバスを備えたTuring世代のRTX 2060 Superは、同じテストで60.04トークン/秒を生成し、1070 Tiの37.82トークン/秒を上回っています。メモリ帯域幅が近いにもかかわらず、生成速度は59%向上しています。したがって、このベンチマーク結果は、コア数や価格よりも性能差をよく説明しています。Turingはメモリをより効率的に活用しているのです。
| カード | メモリ | プロンプト (pp512) | 生成(tg128) |
|---|---|---|---|
| GTX 1070 Ti | 8 GB GDDR5、256ビット | 714.44トークン/秒 | 37.82トークン/秒 |
| RTX 2060 Super | 8 GB GDDR6、256ビット | 1,420.24トークン/秒 | 60.04トークン/秒 |
| GTX 1080 Ti | 11GB GDDR5X、352ビット | 1,084.41 tokens/s | 62.49 tokens/s |
これらの数値を読む際には、三つの注意点があります。ベンチマークの各行は、それぞれの参加者が提供した測定結果です。ドライバー、システム、冷却方式、カードのメーカーは参加者ごとに異なるため、同じチップでも数ポイントの差が生じます。テストモデルのLlama 2 7Bは、現在のモデルよりも古く、小規模です。特定のモデルの性能を予測するものではなく、共通の比較基準として使われています。最後に、生成は主にメモリに依存する一方、プロンプトの処理は計算能力に依存します。二つの列は、それぞれ異なる側面を示しています。
#測定なしでGTX 1080の性能を推定する方法とその限界
1080はこのベンチマークの対象に含まれていません。性能の目安を得るには、メモリ帯域幅の比率を適用できます。320 ÷ 256 = 1.25なので、1070 Tiと同じ効率を維持できるなら、約47トークン/秒(37.82 × 1.25)となります。これは妥当と考えられる仮説であり、実測結果ではありません。ドライバー、llama.cppのバージョン、温度、カードの冷却状態によって、生成速度は大きく変わります。
この用途で中古のグラフィックカードを購入する場合は、販売者に実際のテスト結果のスクリーンショットを依頼するか、届いたらすぐにベンチマークで使われているモデルで自分でもllama-benchを実行してください。結果は公開されている表と直接比較できます。
#コンテキスト:3GBのマージンがどこに使われるか
8 GB では、Q4 の Granite 4.2 8B は約 3.4 GB を残します。この余剰容量は、会話のトークンごとに増加する KV キャッシュ、計算バッファ、そして GPU がディスプレイも駆動している場合のドライバと表示に使用される領域で共有されます。Ollama はデフォルトで 4,096 トークンのウィンドウで起動し、環境変数 OLLAMA_CONTEXT_LENGTH で変更できます。ウィンドウを倍にすると、KV キャッシュも倍になります。
シンプルな判断基準です。長い文書(16,000トークン以上)を扱いたい場合は、30億〜40億パラメータのモデル、または量子化したKVキャッシュを使う8Bモデルを選んでください。短いメッセージで対話するなら、Q4の8Bモデルが適切です。どちらの場合も、ollama psでモデルが100% GPUに読み込まれていることを確認してください。CPUにも一部が割り当てられている場合は、メモリの余裕が尽きていることを示します。
#Pascal上でFlash Attentionは有用か否か?
Flash AttentionはTensor Core搭載カードに限定されるという誤解があります。llama.cppのベンチマークはこれを否定しています。同ツールは各カードをFlash Attentionの有無の両方で実行し、Pascal世代のGTX 1080 Tiも両方のテーブルにリストされています。Flash Attentionを使用すると、プロンプト処理は1,084.41 tokens/sから1,138.14 tokens/sへ、約5%向上し、生成は62.49 tokens/sから61.38 tokens/sへ、2%低下します。Flash Attentionの主な利点は速度ではなくメモリです。コンテキストのフットプリントを削減し、8 GBの環境ではこれが重要になります。
Ollama は、エンジンと GPU が対応している場合、Flash Attention を自動的に有効にします。環境変数 OLLAMA_FLASH_ATTENTION=1 で強制的に有効にでき、値を0にすると無効になります。コンテキストに必要なメモリをさらに削減する KV キャッシュの量子化には、Flash Attention が有効になっている必要があります。
#8 GBのPascal GPUはどのような用途に使えるか?
| 用途 | 適切性 | 推奨設定 |
|---|---|---|
| チャット、言い換え、翻訳 | 良好 | Granite 4.2 8BをQ4で使用、コンテキスト長は4,096トークン |
| エディタ内でのコーディング支援 | 十分使える | 7〜8Bモデル、中程度のコンテキスト、読み込むモデルは1つだけ |
| 長い文書の要約 | 限定的 | 3〜4B のモデル、または量子化した KV キャッシュ |
| 自分の文書を検索する(RAG) | 十分使える | 3〜8Bモデルを使い、抜粋は短くする。12Bモデルは使わない |
| ツール呼び出しを連鎖させるエージェント | 弱い | 8 GB ではコンテキスト量も呼び出し回数も多すぎる |
#Pascal:ソフトウェアサポートが本当の制約
主なリスクは速度ではなく、ソフトウェアにあります。Ollamaでは、compute capabilityが5.0~6.2のカードにNVIDIAのバージョン570以降のドライバーが必要で、GTX 1070~1080もこの範囲に含まれます。ただし、CUDA 13のリリースノートではPascalのサポートが削除されたとされています。また、Wikipediaによると、NVIDIAはこの世代のGame Readyサポートを2025年12月に終了し、セキュリティ更新は2028年10月まで提供します。
- Aujourd'hui
- Ollamaとllama.cppは、570以降のドライバーとCUDA 12のビルドで動作します。
- 明日
- 新しい機能やエンジンはCUDA 13を対象とするため、更新のたびにPascalのサポートが削除される可能性があります。
- セキュリティ
- ドライバーのセキュリティパッチは2028年10月まで提供されますが、新たな最適化は提供されません。
#1070 Ti と他の選択肢では、どちらがよいでしょうか?
同じ中古予算の場合、比較は3つの基準で行われます:メモリ(最低8 GB)、アーキテクチャ世代(CUDA 13の恩恵を受けるにはTuring以降)、そして帯域幅。価格は毎週変動するためここでは触れませんが、選択肢の位置づけは以下の通りです。
| オプション | 長所 | 弱点 |
|---|---|---|
| GTX 1070 / 1070 Ti / 1080(既に所有) | 無料;7〜9Bモデルを余裕を持って動かせる | Pascalはサポート終了が近く、同じ帯域幅でも速度が遅い |
| RTX 2060 Super (8 GB) | ベンチマークで60.04トークン/秒、Turing、Tensor Cores | 依然として8 GB |
| RTX 3050 (6または8 GB) | Ampere、長期のソフトウェアサポート | バージョンにより帯域幅が制限されます |
| 12GBのカード(RTX 3060 12GB) | 12〜14Bモデルや長いコンテキストにも対応できる余裕 | より多くの予算が必要 |
#結論:試してみるのはおすすめですが、投資はおすすめしません
すでにGTX 1070、1070 Ti、または1080をお持ちなら、ローカルLLMを始めるのに最適な選択肢です。8GBあればQ4の8Bモデルを動かせ、生成速度もチャットに十分な快適さを保ちます。購入を検討しているなら、Turingアーキテクチャ以降の8GBのグラフィックカードを優先してください。メモリ容量が同じでも、生成速度は明らかに速く、ソフトウェアのサポート期間も長くなります。
最後に、実用面での判断基準として消費電力があります。これらのカードはゲーム時に150〜180 Wを消費するモデルです。推論時の発熱はゲーム時より少ないものの、ケースの通気が悪いと生成速度が低下することがあります。カードが遅いと結論づける前に、長時間の生成中の温度を確認してください。
- 出典:CUDA での llama.cpp 公開ベンチマーク
- 出典:Ollamaドキュメント、対応NVIDIAハードウェア
- 出典:GeForce 10シリーズ、仕様
- ソース:CUDA Toolkit リリースノート
GTX 1070または1080で8Bモデルを実行することは可能ですか?+
ローカルLLM用にはGTX 1070とGTX 1080のどちらを選ぶべきですか?+
GTX 1080 での秒間トークン数はどれくらいですか?+
GTX 1070 で Qwen3.5 9B を実行することは可能ですか?+
2026年にGTX 1080の中古を購入すべきでしょうか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。