GTX 1080 Ti(11GB)で使用可能なLLMは? ?
はい。GTX 1080 Ti(11 GB、484 GB/s)は、今もローカルLLM向けのPascalカードの中で最も優れたものの一つです。llama.cppの公開ベンチマークでは、Llama 2 7BのQ4_0で生成速度62.49 tokens/sが測定されており、RTX 2060 Superと同等の水準で、メモリは3 GB多く搭載されています。Q4の8Bまたは9Bモデルを余裕を持って読み込め、コンテキストを控えめにすれば12Bモデルも読み込めます。ただし、今後のソフトウェア対応には限界があります。PascalはCUDA 13でサポート対象から外れています。
GTX 1080 Ti は 2017 年 3 月に発売され、352 ビットバスと 11 GB の GDDR5X を搭載していました。この容量は長らく珍しく、今も 8 GB のカードに対する強みとなっています。このガイドでは、このメモリで現在どこまでできるのか、公開されている測定結果が何を示しているのかを数値で説明し、広く見られる誤解を訂正します。Pascal の FP16 は「2 倍遅い」のではなく、ほぼ使い物にならないほど遅いのですが、量子化モデルではその影響は小さいのです。
マシンを選んでいるところですか? 予算別のおすすめ →
ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。
#2026年のGTX 1080 Ti:備えているもの、備えていないもの
GTX 1080 TiはPascal世代のカード(チップはGP102)で、3,584基のCUDAコア、11 GBのGDDR5X、484 GB/sのメモリ帯域幅を備え、電力枠は250 Wです。llama.cppの公開ベンチマークでは、Q4_0のLlama 2 7Bで、生成時に62.49トークン/秒、プロンプト処理時に1,084.41トークン/秒を記録しています。この結果から、生成性能はRTX 2060 Superと同程度でありながら、メモリ容量は3 GB多いことが分かります。今でもこのカードを検討する価値があるのは、速度以上に、この容量のおかげです。
| 項目 | 値 |
|---|---|
| チップ | GP102-350、Pascal |
| CUDAコア | 3 584 |
| メモリ | 11 GB GDDR5X、バス 352ビット |
| 帯域幅 | 484 GB/s |
| FP32計算性能 | 10 609 GFLOPS |
| FP16演算性能 | 166 GFLOPS |
| 熱設計電力(TDP) | 250 W |
表にはすでに最も重要な情報が示されています。このカードでは、FP16の性能はFP32の約1/64です。次の段落では、なぜこれが一般に考えられているほど大きな不利にならないのかを説明します。
#パスカルの制限、何が重要で何が重要でないか
実際に三つの制約があります。一つ目は、VoltaとTuringで登場した行列演算ユニットであるTensor Coresがないことです。Tensor Coresはプロンプトの読み取りと学習を高速化しますが、メモリに依存する生成は高速化しません。二つ目は、一般消費者向けのPascalではFP16の演算性能が極端に低いことです(FP32の10,609 GFLOPSに対し、約166 GFLOPS)。llama.cppなどのエンジンは、量子化モデルを整数演算で処理することでこの問題を回避します。三つ目はソフトウェアサポートの終了で、これについては後述します。
よく繰り返される2つの主張は誤りです。FP16は単に2倍遅いわけではなく、60倍遅いです。また、Flash AttentionはTensor Core専用ではありません:llama.cppのベンチマークでは、Flash Attentionを有効化した1080 Tiが、プロンプト読み取りで1,138.14 tokens/s、生成で61.38 tokens/sを記録し、無効時はそれぞれ1,084.41と62.49でした。スループットへの効果は小さいですが、この機能は利用可能であり、コンテキストのメモリ使用量を削減します。
#11 GBでできること:選択のための早見表
当サイトの目安では、Q4の8Bモデルは約5 GB、14Bモデルは約9 GBで、KVキャッシュは含みません。11 GBの場合、12Bモデルでは4 GBの余裕が残り、14Bモデルでは2 GBしか残りません。この表では、テスト環境で観測された効率(理論上限484 GB/sの49%、すなわち重みの容量が3.82 GBの場合に62.49トークン/秒)を一般的なモデルに適用しています。これらは予測値であり、実測値ではありません。
| モデル (Q4) | モデル容量 | 11 GB 中の空き容量 | 帯域幅484 GB/sでの理論上限 | 予測値 |
|---|---|---|---|---|
| Granite 4.2 8B | 4.6 GB | 6.4 GB | 105トークン/秒 | 約51トークン/秒 |
| Qwen3.5 9B | 6 GB | 5 GB | 81トークン/秒 | 約40トークン/秒 |
| Gemma 4 12B | 7 GB | 4 GB | 69トークン/秒 | 約34トークン/秒 |
| Phi-4 14B | 9 GB | 2 GB | 54 tokens/s | 約26トークン/秒、短いコンテキスト |
| Gemma 4 26B-A4B (MoE) | 16 GB | ネガティブ | GPUのメモリに収まりきらない | 実現不可能 |
最も魅力的なのは 12B クラスです。数千トークンのコンテキストを確保しながら余裕を持って動かせる、最大のモデルです。8GB のカードでは、同じモデルを載せると残りのメモリはわずか1GB 程度で、コンテキストを大幅に減らす必要があります。それより大きいモデルでは、Q4 の 14B は収まるものの余裕はなく、300億パラメータのモデルは収まりません。
#公開ベンチマークの結果
QuelLLMはこのカードをテストしていません。「Performance of llama.cpp on Nvidia CUDA」というディスカッションのベンチマークでは、すべてのカードを同じモデルで比較しているため、1080 Tiの性能を近いクラスのカードと比較して位置づけることができます。
| カード | メモリ | プロンプト (pp512) | 生成(tg128) |
|---|---|---|---|
| GTX 1080 Ti | 11GB GDDR5X、352ビット | 1,084.41 tokens/s | 62.49 tokens/s |
| Tesla P40 (Pascal) | 24 GB GDDR5, 384 bits | 1,007.42トークン/秒 | 54.74トークン/秒 |
| RTX 2060 Super | 8 GB GDDR6、256ビット | 1,420.24トークン/秒 | 60.04トークン/秒 |
| RTX 3060 | 12GB GDDR6、192ビット | 2,137.50トークン/秒 | 75.57トークン/秒 |
| RTX 2080 Ti | 11 GB GDDR6、352 ビット | 2,890.66トークン/秒 | 107.51トークン/秒 |
3つの点が読み取れます。生成速度では、1080 TiはRTX 2060 Superと同等で、12 GBのRTX 3060より17%遅いままです。プロンプトの読み込み速度では差が広がり、RTX 3060はほぼ2倍、同じ容量のRTX 2080 Tiは2.7倍の速度です。最後に、24 GBのPascalカードであるTesla P40は54.74 tokens/sに達しています。この結果は、このアーキテクチャでも24 GBの容量を実現できる一方、速度は1080 Tiより低いことを示しています。
#11GBを活用:量子化の度合いを抑える
11GBのVRAMならではの利点は、モデルを大きくするよりも品質を上げられることです。QuelLLMのカタログでは、Granite 4.2 8BのサイズはQ4で4.6GB、Q5で6GB、Q8で9GBとされています。8GBでは、余裕が残るのはQ4だけです。11GBではQ5(6GB)でも十分な余裕があり、Q8(9GB)もコンテキストが短ければ収まります。
| 量子化 | モデル容量 | 余裕 | 帯域幅484 GB/sでの理論上限 |
|---|---|---|---|
| Q4 | 4.6 GB | 6.4 GB | 105トークン/秒 |
| Q5 | 6 GB | 5 GB | 81トークン/秒 |
| Q8 | 9 GB | 2 GB | 54 tokens/s |
トレードオフは明確です。量子化の精度を一段階上げるごとにモデルの誤りは減りますが、トークンごとに読み直す重みが増えるため、生成は遅くなります。日常的なチャットには Q5 がバランスのよい選択です。生成速度をあまり重視せず、精度を求める用途(抽出、コード)なら Q8 を選ぶ理由があります。量子化ガイドでは、品質の違いを詳しく説明しています。
#カード2枚で22GB:可能ですが、確認が必要です
llama.cppのベンチマークの実施要領では、複数のGPUを持つ貢献者は、モデルが大きすぎてVRAMに収まらない場合を除き、-sm none -mgで単一のGPUの使用を強制するよう指示されています。つまり、このエンジンにはモデルを複数のカードに分散させる機能があるということです。GTX 1080 Tiを2枚使えば、重み用に22 GBを確保できる計算になり、Q4量子化した320億パラメータのモデル(当サイトの目安では19〜20 GB)を動かせますが、コンテキスト用の余裕はありません。
レイヤーの分割は速度の単純な足し算ではありません。レイヤーはGPUカード間で共有され、PCIeバスを介して転送されるため、性能向上には限界があります。この構成には、対応するケース、電源、マザーボードも必要であり、Pascalアーキテクチャのサポート終了に伴うリスクが二重になります。24 GBのプロジェクトでは、まずより新しい単一カードのコストと比較してください。
#4 ステップでインストールして確認
- 01ドライバーを確認するnvidia-smi を実行してください。compute capability 5.0 から 6.2 までのカード(例:GTX 1080 Ti)については、Ollama のドキュメンテーションでは 570 以上のドライバーが必要とされています。
- 02Ollama のインストールお使いのOS向けのインストールガイドに従ってください。OllamaはこのカードをGTX 1080 Ti(compute capability 6.1)として認識し、公式リストにも掲載しています。
- 03適切なモデルを選択するまずQ4の8Bモデルで一連の実行手順が機能することを確認し、その後コンテキストを4,096トークンに設定して12Bモデルをテストしてください。
- 04配置を確認するollama psを実行してください:PROCESSOR列が100%GPUを示す必要があります。そうでない場合は、コンテキストまたはモデルを小さくしてください
モデルの読み込みに失敗しても、特殊な回避策用の変数を探す必要はありません。Ollamaは、エンジンとグラフィックカードが対応している場合、Flash Attentionを自動的に有効にします。ドキュメントに記載されている変数はOLLAMA_FLASH_ATTENTIONで、1で強制的に有効化し、0で無効化します。トラブルシューティングガイドでは、よくあるエラーを詳しく説明しています。
#Pascalのライフサイクル終了:計画しておくべきこと
CUDA 13のリリースノートによると、Maxwell、Pascal、Voltaはサポート対象外になっています。ウィキペディアによると、NVIDIAは2025年12月にこれらのアーキテクチャのGame Readyサポートを終了し、セキュリティ更新は2028年10月まで提供されます。現在、GTX 1080 TiはOllamaとバージョン570以降のドライバーで動作します。今後の推論エンジンがCUDA 13だけを対象にする可能性があることがリスクです。更新を行う前に、必ずドライバーとOllamaのバージョンを記録してください。
#結論:使い続けるのはあり、購入は条件付き
| あなたの状況 | 推奨 |
|---|---|
| すでに1080 Tiを持っている場合 | そのまま使う:8〜12Bを余裕をもって実行でき、ベンチマークでは62トークン/秒 |
| 費用をかけずに、コンテキストも確保して12Bモデルを使いたい | 適しています:11 GB、余裕は4 GB |
| 長い文書やRAGを扱っている | AmpereまたはTuringアーキテクチャのカードは、プロンプトを2〜3倍速く読み込みます |
| 長く使える製品を購入したい場合 | Turing以降を選ぶこと:CUDA 13はすでにPascalを対象としていない |
| 16 GB以上を希望する場合 | 別のクラスのカードに乗り換える:1080 Tiのメモリ容量は11GBが上限 |
毎週変わる価格を列挙せずに現在の選択肢を比較できるよう、このサイトの各ページではメモリ容量ごとに適したモデルを紹介し、グラフィックカードの価格ページへのリンクを掲載しています。
- 出典:CUDA での llama.cpp 公開ベンチマーク
- 出典:Ollamaドキュメント、対応NVIDIAハードウェア
- 出典:GeForce 10シリーズ、仕様
- ソース:CUDA Toolkit リリースノート
GTX 1080 Ti は2026年においてもLLMを実行できるでしょうか?+
LLMにはGTX 1080 TiとRTX 2060 Superのどちらを選ぶべきですか?+
GTX 1080 Ti は、LLMの処理において RTX 3060 より遅いですか?+
1080 TiはFlash Attentionをサポートしていますか?+
GTX 1080 TiにOllamaを使用するにはどのようなドライバーが必要ですか?+
GTX 1080 Tiをいつ交換すべきですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。