初心者 11 分GTX 10

GTX 1080 Ti(11GB)で使用可能なLLMは? ?

端的な回答

はい。GTX 1080 Ti(11 GB、484 GB/s)は、今もローカルLLM向けのPascalカードの中で最も優れたものの一つです。llama.cppの公開ベンチマークでは、Llama 2 7BのQ4_0で生成速度62.49 tokens/sが測定されており、RTX 2060 Superと同等の水準で、メモリは3 GB多く搭載されています。Q4の8Bまたは9Bモデルを余裕を持って読み込め、コンテキストを控えめにすれば12Bモデルも読み込めます。ただし、今後のソフトウェア対応には限界があります。PascalはCUDA 13でサポート対象から外れています。

GTX 1080 Ti は 2017 年 3 月に発売され、352 ビットバスと 11 GB の GDDR5X を搭載していました。この容量は長らく珍しく、今も 8 GB のカードに対する強みとなっています。このガイドでは、このメモリで現在どこまでできるのか、公開されている測定結果が何を示しているのかを数値で説明し、広く見られる誤解を訂正します。Pascal の FP16 は「2 倍遅い」のではなく、ほぼ使い物にならないほど遅いのですが、量子化モデルではその影響は小さいのです。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。

#2026年のGTX 1080 Ti:備えているもの、備えていないもの

GTX 1080 TiはPascal世代のカード(チップはGP102)で、3,584基のCUDAコア、11 GBのGDDR5X、484 GB/sのメモリ帯域幅を備え、電力枠は250 Wです。llama.cppの公開ベンチマークでは、Q4_0のLlama 2 7Bで、生成時に62.49トークン/秒、プロンプト処理時に1,084.41トークン/秒を記録しています。この結果から、生成性能はRTX 2060 Superと同程度でありながら、メモリ容量は3 GB多いことが分かります。今でもこのカードを検討する価値があるのは、速度以上に、この容量のおかげです。

仕様(ウィキペディア、GeForce 10シリーズ)
項目値
チップGP102-350、Pascal
CUDAコア3 584
メモリ11 GB GDDR5X、バス 352ビット
帯域幅484 GB/s
FP32計算性能10 609 GFLOPS
FP16演算性能166 GFLOPS
熱設計電力(TDP)250 W

表にはすでに最も重要な情報が示されています。このカードでは、FP16の性能はFP32の約1/64です。次の段落では、なぜこれが一般に考えられているほど大きな不利にならないのかを説明します。

#パスカルの制限、何が重要で何が重要でないか

実際に三つの制約があります。一つ目は、VoltaとTuringで登場した行列演算ユニットであるTensor Coresがないことです。Tensor Coresはプロンプトの読み取りと学習を高速化しますが、メモリに依存する生成は高速化しません。二つ目は、一般消費者向けのPascalではFP16の演算性能が極端に低いことです(FP32の10,609 GFLOPSに対し、約166 GFLOPS)。llama.cppなどのエンジンは、量子化モデルを整数演算で処理することでこの問題を回避します。三つ目はソフトウェアサポートの終了で、これについては後述します。

よく繰り返される2つの主張は誤りです。FP16は単に2倍遅いわけではなく、60倍遅いです。また、Flash AttentionはTensor Core専用ではありません:llama.cppのベンチマークでは、Flash Attentionを有効化した1080 Tiが、プロンプト読み取りで1,138.14 tokens/s、生成で61.38 tokens/sを記録し、無効時はそれぞれ1,084.41と62.49でした。スループットへの効果は小さいですが、この機能は利用可能であり、コンテキストのメモリ使用量を削減します。

!
FP8やFP4はサポートされていません
最近のハードウェア量子化形式(FP8、FP4)には、より新しいグラフィックカードが必要です。1080 Tiでは、整数演算で動作する従来のGGUF量子化(Q4_K_M、Q5_K_M、Q8_0)を使ってください。

#11 GBでできること:選択のための早見表

当サイトの目安では、Q4の8Bモデルは約5 GB、14Bモデルは約9 GBで、KVキャッシュは含みません。11 GBの場合、12Bモデルでは4 GBの余裕が残り、14Bモデルでは2 GBしか残りません。この表では、テスト環境で観測された効率(理論上限484 GB/sの49%、すなわち重みの容量が3.82 GBの場合に62.49トークン/秒)を一般的なモデルに適用しています。これらは予測値であり、実測値ではありません。

11 GBで動かすモデル:理論上の上限と効率49%での推定値
モデル (Q4)モデル容量11 GB 中の空き容量帯域幅484 GB/sでの理論上限予測値
Granite 4.2 8B4.6 GB6.4 GB105トークン/秒約51トークン/秒
Qwen3.5 9B6 GB5 GB81トークン/秒約40トークン/秒
Gemma 4 12B7 GB4 GB69トークン/秒約34トークン/秒
Phi-4 14B9 GB2 GB54 tokens/s約26トークン/秒、短いコンテキスト
Gemma 4 26B-A4B (MoE)16 GBネガティブGPUのメモリに収まりきらない実現不可能

最も魅力的なのは 12B クラスです。数千トークンのコンテキストを確保しながら余裕を持って動かせる、最大のモデルです。8GB のカードでは、同じモデルを載せると残りのメモリはわずか1GB 程度で、コンテキストを大幅に減らす必要があります。それより大きいモデルでは、Q4 の 14B は収まるものの余裕はなく、300億パラメータのモデルは収まりません。

#公開ベンチマークの結果

QuelLLMはこのカードをテストしていません。「Performance of llama.cpp on Nvidia CUDA」というディスカッションのベンチマークでは、すべてのカードを同じモデルで比較しているため、1080 Tiの性能を近いクラスのカードと比較して位置づけることができます。

llama.cpp CUDAでのベンチマーク、Llama 2 7B Q4_0、Flash Attentionなし
カードメモリプロンプト (pp512)生成(tg128)
GTX 1080 Ti11GB GDDR5X、352ビット1,084.41 tokens/s62.49 tokens/s
Tesla P40 (Pascal)24 GB GDDR5, 384 bits1,007.42トークン/秒54.74トークン/秒
RTX 2060 Super8 GB GDDR6、256ビット1,420.24トークン/秒60.04トークン/秒
RTX 306012GB GDDR6、192ビット2,137.50トークン/秒75.57トークン/秒
RTX 2080 Ti11 GB GDDR6、352 ビット2,890.66トークン/秒107.51トークン/秒

3つの点が読み取れます。生成速度では、1080 TiはRTX 2060 Superと同等で、12 GBのRTX 3060より17%遅いままです。プロンプトの読み込み速度では差が広がり、RTX 3060はほぼ2倍、同じ容量のRTX 2080 Tiは2.7倍の速度です。最後に、24 GBのPascalカードであるTesla P40は54.74 tokens/sに達しています。この結果は、このアーキテクチャでも24 GBの容量を実現できる一方、速度は1080 Tiより低いことを示しています。

i
プロンプトの読み取りと生成の比較
短いメッセージでのチャットでは、生成処理が中心となり、1080 Tiも十分な性能を発揮します。長い文書の要約やRAGでは、プロンプトの読み込み速度が重要です。この処理では、TuringやAmpereのカードが2〜3倍の性能を発揮します。

#11GBを活用:量子化の度合いを抑える

11GBのVRAMならではの利点は、モデルを大きくするよりも品質を上げられることです。QuelLLMのカタログでは、Granite 4.2 8BのサイズはQ4で4.6GB、Q5で6GB、Q8で9GBとされています。8GBでは、余裕が残るのはQ4だけです。11GBではQ5(6GB)でも十分な余裕があり、Q8(9GB)もコンテキストが短ければ収まります。

11 GBのVRAMでのGranite 4.2 8B:量子化方式別の比較
量子化モデル容量余裕帯域幅484 GB/sでの理論上限
Q44.6 GB6.4 GB105トークン/秒
Q56 GB5 GB81トークン/秒
Q89 GB2 GB54 tokens/s

トレードオフは明確です。量子化の精度を一段階上げるごとにモデルの誤りは減りますが、トークンごとに読み直す重みが増えるため、生成は遅くなります。日常的なチャットには Q5 がバランスのよい選択です。生成速度をあまり重視せず、精度を求める用途(抽出、コード)なら Q8 を選ぶ理由があります。量子化ガイドでは、品質の違いを詳しく説明しています。

#カード2枚で22GB:可能ですが、確認が必要です

llama.cppのベンチマークの実施要領では、複数のGPUを持つ貢献者は、モデルが大きすぎてVRAMに収まらない場合を除き、-sm none -mgで単一のGPUの使用を強制するよう指示されています。つまり、このエンジンにはモデルを複数のカードに分散させる機能があるということです。GTX 1080 Tiを2枚使えば、重み用に22 GBを確保できる計算になり、Q4量子化した320億パラメータのモデル(当サイトの目安では19〜20 GB)を動かせますが、コンテキスト用の余裕はありません。

レイヤーの分割は速度の単純な足し算ではありません。レイヤーはGPUカード間で共有され、PCIeバスを介して転送されるため、性能向上には限界があります。この構成には、対応するケース、電源、マザーボードも必要であり、Pascalアーキテクチャのサポート終了に伴うリスクが二重になります。24 GBのプロジェクトでは、まずより新しい単一カードのコストと比較してください。

#4 ステップでインストールして確認

  1. 01
    ドライバーを確認する
    nvidia-smi を実行してください。compute capability 5.0 から 6.2 までのカード(例:GTX 1080 Ti)については、Ollama のドキュメンテーションでは 570 以上のドライバーが必要とされています。
  2. 02
    Ollama のインストール
    お使いのOS向けのインストールガイドに従ってください。OllamaはこのカードをGTX 1080 Ti(compute capability 6.1)として認識し、公式リストにも掲載しています。
  3. 03
    適切なモデルを選択する
    まずQ4の8Bモデルで一連の実行手順が機能することを確認し、その後コンテキストを4,096トークンに設定して12Bモデルをテストしてください。
  4. 04
    配置を確認する
    ollama psを実行してください:PROCESSOR列が100%GPUを示す必要があります。そうでない場合は、コンテキストまたはモデルを小さくしてください

モデルの読み込みに失敗しても、特殊な回避策用の変数を探す必要はありません。Ollamaは、エンジンとグラフィックカードが対応している場合、Flash Attentionを自動的に有効にします。ドキュメントに記載されている変数はOLLAMA_FLASH_ATTENTIONで、1で強制的に有効化し、0で無効化します。トラブルシューティングガイドでは、よくあるエラーを詳しく説明しています。

#Pascalのライフサイクル終了:計画しておくべきこと

CUDA 13のリリースノートによると、Maxwell、Pascal、Voltaはサポート対象外になっています。ウィキペディアによると、NVIDIAは2025年12月にこれらのアーキテクチャのGame Readyサポートを終了し、セキュリティ更新は2028年10月まで提供されます。現在、GTX 1080 TiはOllamaとバージョン570以降のドライバーで動作します。今後の推論エンジンがCUDA 13だけを対象にする可能性があることがリスクです。更新を行う前に、必ずドライバーとOllamaのバージョンを記録してください。

#結論:使い続けるのはあり、購入は条件付き

状況に応じた判断
あなたの状況推奨
すでに1080 Tiを持っている場合そのまま使う:8〜12Bを余裕をもって実行でき、ベンチマークでは62トークン/秒
費用をかけずに、コンテキストも確保して12Bモデルを使いたい適しています:11 GB、余裕は4 GB
長い文書やRAGを扱っているAmpereまたはTuringアーキテクチャのカードは、プロンプトを2〜3倍速く読み込みます
長く使える製品を購入したい場合Turing以降を選ぶこと:CUDA 13はすでにPascalを対象としていない
16 GB以上を希望する場合別のクラスのカードに乗り換える:1080 Tiのメモリ容量は11GBが上限

毎週変わる価格を列挙せずに現在の選択肢を比較できるよう、このサイトの各ページではメモリ容量ごとに適したモデルを紹介し、グラフィックカードの価格ページへのリンクを掲載しています。

FAQ
GTX 1080 Ti は2026年においてもLLMを実行できるでしょうか?+
はい。llama.cppの公開ベンチマークでは、Q4_0の7Bモデルで62.49トークン/秒が測定されています。11 GBのメモリには8Bまたは9Bモデルを余裕を持って読み込め、12Bモデルもコンテキストを小さめにすれば読み込めます。ツールがPascalをサポートしている限り、このカードは引き続き有用です。
LLMにはGTX 1080 TiとRTX 2060 Superのどちらを選ぶべきですか?+
生成性能はほぼ同等で、ベンチマークでは62.49対60.04トークン/秒です。1080 Tiはメモリが3 GB多く、12Bモデルではこの差が重要になります。2060 Superはプロンプトの読み取りが速く(1,420対1,084トークン/秒)、CUDA 13でも引き続きサポートされています。
GTX 1080 Ti は、LLMの処理において RTX 3060 より遅いですか?+
はい。生成速度は17%遅く(62.49対75.57トークン/秒)、プロンプトの読み込み速度はほぼ半分になります(1,084対2,137トークン/秒)。3060のメモリは12 GBで、比較対象の11 GBとの差はわずかです。3060の主な強みは、ソフトウェアサポートがより長く続くことです。
1080 TiはFlash Attentionをサポートしていますか?+
はい。llama.cppのベンチマークでは、Flash Attentionを有効にした場合、プロンプト読み取りで1,138.14 tokens/s、生成で61.38 tokens/sを記録しています。スループットへの効果は小さいですが、この機能はコンテキストのメモリ使用量を削減します。Ollama は、カードが対応している場合に自動的にこれを有効にします。
GTX 1080 TiにOllamaを使用するにはどのようなドライバーが必要ですか?+
Ollamaのドキュメントでは、GTX 1080 Tiを含むcompute capability 5.0~6.2のカードには、NVIDIAドライバー570以降が必要とされています。インストール前にnvidia-smiでバージョンを確認してください。NVIDIAは580ブランチのセキュリティ更新を2028年10月まで提供する予定ですが、新たな最適化は提供しません。
GTX 1080 Tiをいつ交換すべきですか?+
必要なツールがPascalのサポートを終了したとき、または長い文書やRAGのように、用途上11 GBを超えるメモリや高速なプロンプト処理が必要になったときです。CUDA 13ではすでにPascalのサポートが廃止されています。Ollamaやllama.cppを更新するたびに、こうしたサポート終了の兆候に注意してください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。