初心者 11 分GTX 16

GTX 1650 / 1660 / Super / TiではどのLLMを選ぶべきか ?

端的な回答

GTX 1660(6 GB)では、70億〜80億パラメータのローカル LLM を Q4 で動かせます。llama.cpp の公開ベンチマークでは、7B Q4_0 の生成速度は 41.35 tokens/s ですが、プロンプト処理速度はわずか 148.91 tokens/s です。より高速なメモリを搭載した 1660 Super と Ti は、さらに速く動作すると予想されます。メモリが 4 GB に限られる GTX 1650 では、20億〜30億パラメータのモデルに限定されます。いずれも引き続き CUDA 13 でサポートされています。

2019年に発売されたGTX 16シリーズは、Tensor Coreもレイトレーシングコアも備えていないTuringアーキテクチャの製品です。GTX 10とは異なり、Pascalのサポート終了の対象ではありません。このガイドでは、LLMにとって重要なメモリ容量と帯域幅を基準に4枚のカードを比較し、公開されている測定結果を根拠に説明します。また、生成性能が良好でも、長いプロンプトを高速に読み込めるとは限らないという落とし穴を指摘します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#GTX 16シリーズでLLMを使う:押さえておくべきポイント

LLMに関して、GTX 16シリーズのメモリ容量は、GTX 1650が4GB、GTX 1660および1660 Super・1660 Tiが6GBです。生成速度は帯域幅に依存し、128GB/s(GDDR5搭載の1650)、192GB/s(1660)、288GB/s(1660 Ti)、336GB/s(1660 Super)と異なり、同等の6GBメモリを持つ中で1660 Superが最も速く、元の1660が最も遅いです。

GTX 16 の帯域幅とメモリ(Wikipedia、GeForce 16 series)
カードメモリ帯域幅CUDAコア
GTX 1650 (GDDR5)4 GB、GDDR5、128ビット128 GB/s896
GTX 1650 (GDDR6, 2020年4月)GDDR6192 GB/s896
GTX 16606GB、GDDR5、192ビット192 GB/s1 408
GTX 1660 Super6 GB, GDDR6336 GB/s詳細は未記載
GTX 1660 Ti6 GB, GDDR6288 GB/s1 536

このシリーズにはTensor CoresもRT Coresもありません。ウィキペディアによると、RTX 20のTuringアーキテクチャをベースに、この2種類の演算ユニットを省きつつ、整数演算専用コアは維持しています。整数形式に量子化されたモデルでは、Tensor Coresがないことによる生成への影響は小さいです。

#Tensor CoresなしのTuring:Pascalと比べて何が変化したか

このシリーズの強みはFP16です。GTX 1660の場合、Wikipediaによると、半精度では8,617 GFLOPS、単精度では4,309 GFLOPSとされています。FP16はFP32の2倍の速度で動作しますが、GTX 1080 Tiのガイドが示すように、GTX 10のような一般向けGPUではFP32よりもはるかに遅くなります。これが、1660が192 GB/sという同等の帯域幅において、GTX 1060を生成速度で大きく上回り、CUDA 13でもサポートが廃止されなかった理由です。

反例はプロンプトの読み取りにあります。llama.cpp のベンチマークでは、1660 のプロンプト処理は 148.91 トークン/秒であるのに対し、GTX 1060 は 416.85 トークン/秒です。より新しいカードが、長いテキストをほぼ3倍速く読み取れる可能性があります。ベンチマークは原因の詳細を述べておらず、結果は単一のコントリビューターによるもので、オーダーオブマグニチュードとして読むべきです。それでも、長文書への過度な期待を和らげるには十分です。

llama.cpp CUDAでのベンチマーク、Llama 2 7B Q4_0:1660と近いクラスのカードを比較
カード帯域幅プロンプト (pp512)生成(tg128)
GTX 1060 6 GB (Pascal)192 GB/s416.85トークン/秒27.79トークン/秒
GTX 1660 6GB (Turing)192 GB/s148.91トークン/秒41.35トークン/秒
Quadro T1000 4GB128 GB/s79.44トークン/秒27.82トークン/秒
!
1件の投稿、1枚のGPU
このベンチマークの各行は、各投稿者がそれぞれのドライバーとシステム環境で測定したものです。このベンチマークで1660と1060を比較して得られるのは、おおよその目安であって、普遍的な法則ではありません。プロンプトの処理速度を重視する場合は、llama-benchでお使いのグラフィックカードをテストしてください。

#4つのバリアントを一つずつ

GTX 1650 (4 GB)
このベンチマークには1650の測定結果はありませんが、同じ帯域幅を持つ4 GB・128ビットの Quadro T1000 の結果があります。最小限のコンテキストなら、7Bモデルを Q4_0 でメモリに収め、27.82トークン/秒で動かせます。これが限界です。4 GB では、20億〜30億パラメータのモデルを選ぶほうがよいでしょう。
GTX 1660 (6 GB GDDR5)
テストに使用したカード:生成速度は41.35トークン/秒。6 GBモデルの中では最も遅いものの、Q4でのチャットには十分です。
GTX 1660 Ti (6GB GDDR6)
288 GB/s:1660より帯域幅が50%広いため、処理速度も同程度向上すると見込まれますが、実測での確認が必要です。
GTX 1660 Super (6 GB GDDR6)
336 GB/s:LLM 用途ではシリーズで最も優れており、1660 よりメモリ帯域幅が 75% 広くなっています。

これらの推定は、帯域幅だけに基づいています。1660の効率(理論上限の82%)を当てはめると、同じ7B Q4_0モデルで、1660 Tiは約62トークン/秒、1660 Superは約72トークン/秒を生成すると予測されます。これらはお使いのカードでの測定によって確認すべき予測値であり、実測結果ではありません。

購入時の注意点:GTX 1650には2種類あります。2019年の初期版は128ビットのGDDR5を使用し、帯域幅は128GB/sです。2020年4月の改訂版では12Gbit/sのGDDR6に変更され、帯域幅は192GB/sになりました。LLMでは、同じモデルでも処理速度が最大で50%向上する可能性があります。中古の1650を購入する前に、出品情報のGDDR5またはGDDR6という表記を確認するか、GPU-Zで仕様を確認してください。

#4 GB・6 GB環境でのコンテキスト:本当の上限

Ollama は 4,096 トークンのウィンドウで起動し、OLLAMA_CONTEXT_LENGTH で変更できます。KV キャッシュは会話の各トークンに応じて増加します。ウィンドウを倍にすると、キャッシュも倍になります。6 GB の環境で Granite 4.2 8B を Q4 で使用する場合、約 1.4 GB の余裕はすぐに消費されます。4 GB の環境では、3B のモデルを使用すると 2 GB の余裕があり、6 GB の環境で 8B を使用する場合よりも余裕があります。

実用上の目安として、量子化をさらに強めるよりも、モデルのサイズやコンテキストの長さを減らしてください。これらのグラフィックカードでは、コンテキストの長い3Bモデルのほうが、一部の処理をCPUにオフロードする8Bモデルよりも良い結果を得られます。ollama ps で、モデルが常に100 % GPU上で動作していることを確認してください。一部がCPU側にオフロードされると、生成速度が大きく落ちます。システムメモリはグラフィックカードのメモリよりもはるかに遅いためです。

どの用途にどのカードを使うべきか?
用途GTX 1650 (4 GB)GTX 1660 / Super / Ti(6 GB)
短いチャット、翻訳、言い換え2〜3Bのモデル8B Q4、短いコンテキスト
エディタにおけるコード補完2〜3Bのモデルで、品質は限定的です7〜8Bモデルが可能です
長い文書の要約推奨されません遅い:1660でプロンプトの読み込み速度は148.91トークン/秒
自分のドキュメント内を検索(RAG)3Bモデル、短い抜粋3〜8Bのモデル、短い抜粋

#収まるモデル:4 GB と 6 GB の比較

当サイトの目安では、Q4の3Bモデルは約2 GB、7〜8Bモデルは約5 GBで、KVキャッシュの分は別途必要です。6 GBでは、Q4のGranite 4.2 8Bを読み込むと約1.4 GBが残ります。数千トークンのコンテキストには十分ですが、それ以上の余裕はありません。4 GBでは、3Bモデルが妥当な上限です。

4 GBと6 GBに収まるモデル(Q4でのモデルサイズ、QuelLLMカタログ)
モデル (Q4)モデル容量4 GBの場合6GB で
Gemma 4 2B1.2 GB余裕あり余裕あり
Granite 4.1 3B2 GB余裕あり余裕あり
Phi-4 Mini 3.8B3 GB余裕が少ない余裕あり
Granite 4.2 8B4.6 GB収まりません1.4GBの余裕
Qwen3.5 9B6 GB収まりませんコンテキストを含めるとメモリ容量を超えます

1650では、パラメータ数が20億〜40億のモデルに絞ってください。これは下書き、翻訳、分類にも適した範囲です。1660では、Q4の8Bモデルが限界です。チャットには使えますが、長いコンテキストを確保する余裕はほとんどありません。

#ソフトウェアサポート:GTX 10に比べて明確な利点

Ollamaでは、最近のカードにはNVIDIA 550以降のドライバーが必要ですが、compute capabilityが5.0~6.2のカード(Pascalを含む)には570が必要です。Ollamaの公式リストには、GTX 1650 TiとRTX 20シリーズがcompute capability 7.5として掲載されています。その他のGTX 16シリーズも同じTuringアーキテクチャを採用していますが、リストには個別に記載されていないため、インストール時に確認が必要です。

CUDA 13のリリースノートによると、サポート終了の対象はTuringより前のアーキテクチャ(Maxwell、Volta、Pascal)です。Turing、つまりGTX 16シリーズは引き続きサポートされています。中古で購入するなら、価格が近いGTX 10シリーズよりGTX 16シリーズを選ぶ主な理由はここにあります。

ソフトウェア対応の比較
ポイントGTX 16 (Turing)GTX 10 (Pascal)
Ollamaが必要とするドライバー550またはそれ以降570以降
CUDA 13サポート対象削除されました
llama.cppにおけるFlash Attention利用可能利用可能

#インストールおよび設定

  1. 01
    ドライバを確認
    nvidia-smiを実行してください。バージョンは550を超えている必要があります。
  2. 02
    Ollama のインストール
    お使いのシステムに対応するインストールガイドに従い、その後、メモリ容量に合ったモデルをダウンロードしてください。
  3. 03
    配置を確認
    ollama ps を実行してください。PROCESSOR 列には 100 % GPU と表示されるはずです。CPU にも分散している場合は、モデルが GPU メモリに収まりきっていないことを示します。
  4. 04
    コンテキストを制限する
    Ollama は4,096トークンから開始します。4GBまたは6GBの場合、メモリの余裕が確認された上でのみ値を増やすようにしてください。

Flash Attention は Tensor Cores を搭載したカード専用ではありません。llama.cpp は GTX 1660 でも Pascal 世代のカードでもこれを実行できます。ベンチマークでは、有効時にプロンプト処理が 154.45 トークン/秒、生成が 41.43 トークン/秒で、無効時はそれぞれ 148.91 トークン/秒と 41.35 トークン/秒でした。速度の向上はわずかですが、コンテキストに必要なメモリが減るため、6 GB の環境では役立ちます。Ollama は、カードが対応している場合、Flash Attention を自動的に有効にします。

#結論:どのGTX 16が適しているか、そしていつ他の選択肢に切り替えるべきか

状況に応じた判断
あなたの状況推奨
1660 Superまたは1660 Tiをお持ちの場合シリーズで最も高性能:8BをQ4で実行し、快適にチャット
1660 を持っていますチャットには十分ですが、プロンプトの読み込みが遅い
1650(4GB)をお持ちの場合20億から40億パラメータのモデルのみ
長い文書を読みたいAmpereまたはそれ以降のGPUは、プロンプトをはるかに速く読み取ります
12B以上のモデルを使いたい上位グレードへ:12 GB以上を目指す

最後の確認ポイントとして、これらのカードは重負処理には適していませんが、発熱量は比較的低い(WikipediaによるとGTX 1660は120W)です。日々数問の質問に応えるローカルアシスタント向けに、250Wのカードに比べて実質的な利点があります。

中古品を同程度の予算で選ぶなら、1660 SuperはGTX 1060や1070より良い選択肢です。メモリ容量は同じで、メモリがより高速なうえ、ソフトウェアサポートもより長く続きます。新品を購入する場合や日常的に使う場合は、RTX 3050やRTX 2060ならTensor Coresが加わり、バージョンによってはメモリ容量も増えます。価格は毎週変わるため、当サイトの価格ページを確認してください。

FAQ
GTX 1660でLLMを実行することは可能ですか?+
はい。llama.cpp の公開ベンチマークでは、GTX 1660 6GB で 7B モデル(Q4_0)の生成速度は 41.35 tokens/s とされ、チャット用途には十分です。プロンプトの読み込みは遅い(148.91 tokens/s)ため、長文の処理には時間がかかります。8B モデル(Q4)は、現実的な限界です
LLM用にGTX 16シリーズのどのモデルを選ぶべきですか?+
GTX 1660 Superは6 GBのメモリと336 GB/sの帯域幅を備え、シリーズの中で生成に最も適しています。次が1660 Ti(288 GB/s)、その次が1660(192 GB/s)です。1650を選ぶのは、20億〜30億パラメータのモデルを使う場合に限ってください。
GTX 1650 4GBで7Bモデルを実行可能ですか?+
ぎりぎり可能です。ベンチマークには、最小限のコンテキストで7BモデルをQ4_0で実行し、27.82トークン/秒を記録した4 GBのQuadro T1000が含まれています。実用上、1650には20億〜30億パラメータのモデルのほうが適しており、コンテキスト用のメモリにも余裕が残ります。
GTX 16シリーズはFlash Attentionをサポートしていますか?+
はい。llama.cppのベンチマークでは、GTX 1660でFlash Attentionを有効にした場合、プロンプト処理は154.45トークン/秒、生成は41.43トークン/秒と測定されています。無効の場合は、それぞれ148.91トークン/秒と41.35トークン/秒です。速度の向上はわずかですが、コンテキストのメモリ使用量を減らせます。したがって、Tensor CoresがなくてもFlash Attentionは動作します。
GTX 1660 Super が GTX 1060 より AI 用途で優れているのでしょうか?+
はい。6 GB のキャパシティにおいて、1660 Super は 336 GB/s に対し、192 GB/s であり、Turing はメモリをより効率的に活用します。1660 は 41.35 テキスト単位/秒で、1060 は 27.79 テキスト単位/秒です。Turing はさらに CUDA 13 でサポートされています。Pascal とは異なります。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。