初心者 11 分GTX 10

GTX 1070 / 1080(8 GB)で使えるLLMは? ?

端的な回答

はい:GTX 1070、8 GBの1070 Tiまたは1080であれば、Q4形式の70億から90億パラメータのモデルを、適度なコンテキストで問題なく動作させます。llama.cppのパブリックベンチマークでは、GTX 1070 Tiの7B Q4_0で37.82 tokens/sを記録しています。より高速なメモリを搭載した1080は、直接の測定値はありませんが、より良い結果を出すはずです。90億パラメータを超えると8 GBでは限界に達し、Pascalアーキテクチャにはソフトウェア的な将来性はありません。

GTX 1070(2016年6月)、1070 Ti(2017年11月)、1080(2016年5月)は、同じGP104チップと8GBのメモリを備えています。これらは、お金をかけずにローカルLLMを試したい人にとって、最も魅力的な中古グラフィックカードになっています。このガイドでは、そのメモリ容量で何ができるかを数値で示し、速度について公開測定から何が分かるか、そしてPascalのサポート終了日が価格よりも重要な理由を説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#GTX 1070、1070 Ti、1080:LLM 用途での違い

LLMにとって、これら3枚のカードは容量がいずれも8 GBで、生成速度を決めるメモリ帯域幅が異なります。1070と1070 Tiは256ビットバスのGDDR5を使用し、帯域幅は256 GB/sです。1080はGDDR5Xを使用し、320 GB/sに達します。LLMはトークンごとにすべての重みを読み直すため、この25%の差はほぼそのまま速度差に反映されます。その影響は、1080の2,560コアと1070の1,920コアというコア数の違いよりもはるかに大きくなります。いずれもTensor Coresを搭載しておらず、Pascalでは従来のCUDAによる計算を使います。

3枚のグラフィックスカードの比較一覧(出典:Wikipedia「GeForce 10 series」;測定:llama.cppのテスト環境)
カードCUDAコアメモリ帯域幅実測スループット(7B Q4_0)
GTX 10701 9208 GB GDDR5256 GB/sベンチマークで測定されていません
GTX 1070 Ti2 4328 GB GDDR5256 GB/s37.82トークン/秒
GTX 10802 5608 GB GDDR5X320 GB/sベンチマークで測定されていません

11 GB のメモリと 484 GB/s の帯域幅を持つ GTX 1080 Ti は、別のカテゴリーに属するため、専用のページを用意しています。お使いのカードが 1080 Ti なら、そちらのガイドをお読みください。

#8GBで実際にできること

重要なのは、重みと利用可能なメモリの比率です。KVキャッシュもこれに追加されるためです。サイトの目安では、Q4の7〜8Bモデルの重みは約5 GBです。8 GBのメモリでは、コンテキストとシステムに約3 GBが残り、実用的な余裕があります。Q4の9Bモデルは6 GBで、2 GBが残り、短いコンテキストであれば可能です。120億パラメータでは、重みが7 GBに達し、ほとんど何も残りません。

8 GBのメモリで動かすモデルと理論上の上限(帯域幅 ÷ モデルの重みの容量;実測値ではありません)
モデル (Q4)モデル容量8 GBでの余裕帯域幅256 GB/sでの上限帯域幅320 GB/sでの上限
Granite 4.1 3B2 GB6 GB128トークン/秒160トークン/秒
Granite 4.2 8B4.6 GB3.4 GB55トークン/秒70トークン/秒
Qwen3.5 9B6 GB2 GB43 tokens/s53トークン/秒
Gemma 4 12B7 GB1 GB推奨されません推奨されません
Phi-4 14B9 GBネガティブGPUのメモリに収まりきらないGPUのメモリに収まりきらない

理論上の上限に達することはありません。公開ベンチマークでは、GTX 1070 Tiが3.56GiBのモデルで37.82トークン/秒に達しており、帯域幅の上限256GB/秒に対して約56%の効率に相当します。同じ効率を上記のモデルに適用すると、Granite 4.2 8Bは1070 Tiで約30トークン/秒で動作する計算になります。これは比例関係による外挿であり、実測値ではありません。

#公開ベンチマークの結果

QuelLLM はこれらのグラフィックカードをテストしていません。数値は、llama.cpp リポジトリの「Performance of llama.cpp on Nvidia CUDA」というディスカッションに掲載されたものです。そこでは、各投稿者が Llama 2 7B を Q4_0 で、すべてのレイヤーを GPU に載せて llama-bench を実行しています。GTX 1070 Ti は、プロンプト処理で 714.44 トークン/秒、生成で 37.82 トークン/秒を記録しています。

同じページに掲載されているカードのうち、測定値があるものを比較すると参考になります。8 GBのメモリと256ビットのメモリバスを備えたTuring世代のRTX 2060 Superは、同じテストで60.04トークン/秒を生成し、1070 Tiの37.82トークン/秒を上回っています。メモリ帯域幅が近いにもかかわらず、生成速度は59%向上しています。したがって、このベンチマーク結果は、コア数や価格よりも性能差をよく説明しています。Turingはメモリをより効率的に活用しているのです。

llama.cpp CUDAでのベンチマーク、Llama 2 7B Q4_0、Flash Attentionなし
カードメモリプロンプト (pp512)生成(tg128)
GTX 1070 Ti8 GB GDDR5、256ビット714.44トークン/秒37.82トークン/秒
RTX 2060 Super8 GB GDDR6、256ビット1,420.24トークン/秒60.04トークン/秒
GTX 1080 Ti11GB GDDR5X、352ビット1,084.41 tokens/s62.49 tokens/s

これらの数値を読む際には、三つの注意点があります。ベンチマークの各行は、それぞれの参加者が提供した測定結果です。ドライバー、システム、冷却方式、カードのメーカーは参加者ごとに異なるため、同じチップでも数ポイントの差が生じます。テストモデルのLlama 2 7Bは、現在のモデルよりも古く、小規模です。特定のモデルの性能を予測するものではなく、共通の比較基準として使われています。最後に、生成は主にメモリに依存する一方、プロンプトの処理は計算能力に依存します。二つの列は、それぞれ異なる側面を示しています。

i
処理速度の差はプロンプトにも左右されます
プロンプトの読み込みには、1070 Tiでは2060 Superのおよそ2倍の時間がかかります。そのため、長い文書を会話に貼り付けた場合、Pascalでは最初の応答までの待ち時間が大幅に長くなります。

#測定なしでGTX 1080の性能を推定する方法とその限界

1080はこのベンチマークの対象に含まれていません。性能の目安を得るには、メモリ帯域幅の比率を適用できます。320 ÷ 256 = 1.25なので、1070 Tiと同じ効率を維持できるなら、約47トークン/秒(37.82 × 1.25)となります。これは妥当と考えられる仮説であり、実測結果ではありません。ドライバー、llama.cppのバージョン、温度、カードの冷却状態によって、生成速度は大きく変わります。

この用途で中古のグラフィックカードを購入する場合は、販売者に実際のテスト結果のスクリーンショットを依頼するか、届いたらすぐにベンチマークで使われているモデルで自分でもllama-benchを実行してください。結果は公開されている表と直接比較できます。

#コンテキスト:3GBのマージンがどこに使われるか

8 GB では、Q4 の Granite 4.2 8B は約 3.4 GB を残します。この余剰容量は、会話のトークンごとに増加する KV キャッシュ、計算バッファ、そして GPU がディスプレイも駆動している場合のドライバと表示に使用される領域で共有されます。Ollama はデフォルトで 4,096 トークンのウィンドウで起動し、環境変数 OLLAMA_CONTEXT_LENGTH で変更できます。ウィンドウを倍にすると、KV キャッシュも倍になります。

シンプルな判断基準です。長い文書(16,000トークン以上)を扱いたい場合は、30億〜40億パラメータのモデル、または量子化したKVキャッシュを使う8Bモデルを選んでください。短いメッセージで対話するなら、Q4の8Bモデルが適切です。どちらの場合も、ollama psでモデルが100% GPUに読み込まれていることを確認してください。CPUにも一部が割り当てられている場合は、メモリの余裕が尽きていることを示します。

#Pascal上でFlash Attentionは有用か否か?

Flash AttentionはTensor Core搭載カードに限定されるという誤解があります。llama.cppのベンチマークはこれを否定しています。同ツールは各カードをFlash Attentionの有無の両方で実行し、Pascal世代のGTX 1080 Tiも両方のテーブルにリストされています。Flash Attentionを使用すると、プロンプト処理は1,084.41 tokens/sから1,138.14 tokens/sへ、約5%向上し、生成は62.49 tokens/sから61.38 tokens/sへ、2%低下します。Flash Attentionの主な利点は速度ではなくメモリです。コンテキストのフットプリントを削減し、8 GBの環境ではこれが重要になります。

Ollama は、エンジンと GPU が対応している場合、Flash Attention を自動的に有効にします。環境変数 OLLAMA_FLASH_ATTENTION=1 で強制的に有効にでき、値を0にすると無効になります。コンテキストに必要なメモリをさらに削減する KV キャッシュの量子化には、Flash Attention が有効になっている必要があります。

サーバー起動時にFlash Attentionを強制的に有効にする
OLLAMA_FLASH_ATTENTION=1 ollama serve

#8 GBのPascal GPUはどのような用途に使えるか?

一般的なタスクと適合性
用途適切性推奨設定
チャット、言い換え、翻訳良好Granite 4.2 8BをQ4で使用、コンテキスト長は4,096トークン
エディタ内でのコーディング支援十分使える7〜8Bモデル、中程度のコンテキスト、読み込むモデルは1つだけ
長い文書の要約限定的3〜4B のモデル、または量子化した KV キャッシュ
自分の文書を検索する(RAG)十分使える3〜8Bモデルを使い、抜粋は短くする。12Bモデルは使わない
ツール呼び出しを連鎖させるエージェント弱い8 GB ではコンテキスト量も呼び出し回数も多すぎる

#Pascal:ソフトウェアサポートが本当の制約

主なリスクは速度ではなく、ソフトウェアにあります。Ollamaでは、compute capabilityが5.0~6.2のカードにNVIDIAのバージョン570以降のドライバーが必要で、GTX 1070~1080もこの範囲に含まれます。ただし、CUDA 13のリリースノートではPascalのサポートが削除されたとされています。また、Wikipediaによると、NVIDIAはこの世代のGame Readyサポートを2025年12月に終了し、セキュリティ更新は2028年10月まで提供します。

Aujourd'hui
Ollamaとllama.cppは、570以降のドライバーとCUDA 12のビルドで動作します。
明日
新しい機能やエンジンはCUDA 13を対象とするため、更新のたびにPascalのサポートが削除される可能性があります。
セキュリティ
ドライバーのセキュリティパッチは2028年10月まで提供されますが、新たな最適化は提供されません。
!
2028年という日付を当てにしないでください
この日付はドライバーのセキュリティに関するもので、AIツールの互換性に関するものではありません。推論エンジンは、その日付よりずっと前にPascalのサポートを終了する可能性があります。交換用のカードを用意する計画を立ててください。

#1070 Ti と他の選択肢では、どちらがよいでしょうか?

同じ中古予算の場合、比較は3つの基準で行われます:メモリ(最低8 GB)、アーキテクチャ世代(CUDA 13の恩恵を受けるにはTuring以降)、そして帯域幅。価格は毎週変動するためここでは触れませんが、選択肢の位置づけは以下の通りです。

ローカルLLM向けのエントリーレベルの選択肢
オプション長所弱点
GTX 1070 / 1070 Ti / 1080(既に所有)無料;7〜9Bモデルを余裕を持って動かせるPascalはサポート終了が近く、同じ帯域幅でも速度が遅い
RTX 2060 Super (8 GB)ベンチマークで60.04トークン/秒、Turing、Tensor Cores依然として8 GB
RTX 3050 (6または8 GB)Ampere、長期のソフトウェアサポートバージョンにより帯域幅が制限されます
12GBのカード(RTX 3060 12GB)12〜14Bモデルや長いコンテキストにも対応できる余裕より多くの予算が必要

#結論:試してみるのはおすすめですが、投資はおすすめしません

すでにGTX 1070、1070 Ti、または1080をお持ちなら、ローカルLLMを始めるのに最適な選択肢です。8GBあればQ4の8Bモデルを動かせ、生成速度もチャットに十分な快適さを保ちます。購入を検討しているなら、Turingアーキテクチャ以降の8GBのグラフィックカードを優先してください。メモリ容量が同じでも、生成速度は明らかに速く、ソフトウェアのサポート期間も長くなります。

最後に、実用面での判断基準として消費電力があります。これらのカードはゲーム時に150〜180 Wを消費するモデルです。推論時の発熱はゲーム時より少ないものの、ケースの通気が悪いと生成速度が低下することがあります。カードが遅いと結論づける前に、長時間の生成中の温度を確認してください。

FAQ
GTX 1070または1080で8Bモデルを実行することは可能ですか?+
はい。Granite 4.2 8B(Q4)のサイズは約4.6GBで、8GBのうち3GB以上をコンテキストやシステム用に残せます。llama.cppのベンチマークでは、1070 Tiで7Bモデル(Q4_0)を実行した場合に37.82トークン/秒を記録しており、チャットには快適な処理速度です。
ローカルLLM用にはGTX 1070とGTX 1080のどちらを選ぶべきですか?+
1080。GDDR5Xメモリの320GB/s(1070の256GB/sに比べて)は、同じモデルにおいて生成速度を約25%向上させます。これはメモリの速度が制限されるためです。容量は同じで、8GBです。中古カードの状態と冷却状態を確認してください。
GTX 1080 での秒間トークン数はどれくらいですか?+
llama.cppの公開ベンチマークには、GTX 1080の測定結果はありません。メモリ帯域幅256 GB/sのGTX 1070 Tiは、7B Q4_0で37.82トークン/秒を達成しています。帯域幅の比率から推定すると、1080は45トークン/秒を超えるはずですが、これはllama-benchで検証する必要がある推定値です。
GTX 1070 で Qwen3.5 9B を実行することは可能ですか?+
はい、ただし余裕は少ないです。Q4 での重みは 8GB 中約 6GB を占め、残りの 2GB は KV キャッシュとシステムに割り当てられます。短いコンテキストを維持し、ollama ps でモデルが GPU 上に残っているかを確認してください。
2026年にGTX 1080の中古を購入すべきでしょうか?+
購入するなら、非常に安く、試してみるための場合に限ります。PascalはCUDA 13の対象から外れており、Game Readyのサポートは2025年12月に終了しました。ベンチマークでは、8GBのRTX 2060 Superが60.04トークン/秒を生成するのに対し、1070 Tiは37.82トークン/秒です。予算が同程度なら、Turingのカードを買うほうがおすすめです。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。