GTX 1650 / 1660 / Super / TiではどのLLMを選ぶべきか ?
GTX 1660(6 GB)では、70億〜80億パラメータのローカル LLM を Q4 で動かせます。llama.cpp の公開ベンチマークでは、7B Q4_0 の生成速度は 41.35 tokens/s ですが、プロンプト処理速度はわずか 148.91 tokens/s です。より高速なメモリを搭載した 1660 Super と Ti は、さらに速く動作すると予想されます。メモリが 4 GB に限られる GTX 1650 では、20億〜30億パラメータのモデルに限定されます。いずれも引き続き CUDA 13 でサポートされています。
2019年に発売されたGTX 16シリーズは、Tensor Coreもレイトレーシングコアも備えていないTuringアーキテクチャの製品です。GTX 10とは異なり、Pascalのサポート終了の対象ではありません。このガイドでは、LLMにとって重要なメモリ容量と帯域幅を基準に4枚のカードを比較し、公開されている測定結果を根拠に説明します。また、生成性能が良好でも、長いプロンプトを高速に読み込めるとは限らないという落とし穴を指摘します。
マシンを選んでいるところですか? 予算別のおすすめ →
ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64 GB / 1 TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#GTX 16シリーズでLLMを使う:押さえておくべきポイント
LLMに関して、GTX 16シリーズのメモリ容量は、GTX 1650が4GB、GTX 1660および1660 Super・1660 Tiが6GBです。生成速度は帯域幅に依存し、128GB/s(GDDR5搭載の1650)、192GB/s(1660)、288GB/s(1660 Ti)、336GB/s(1660 Super)と異なり、同等の6GBメモリを持つ中で1660 Superが最も速く、元の1660が最も遅いです。
| カード | メモリ | 帯域幅 | CUDAコア |
|---|---|---|---|
| GTX 1650 (GDDR5) | 4 GB、GDDR5、128ビット | 128 GB/s | 896 |
| GTX 1650 (GDDR6, 2020年4月) | GDDR6 | 192 GB/s | 896 |
| GTX 1660 | 6GB、GDDR5、192ビット | 192 GB/s | 1 408 |
| GTX 1660 Super | 6 GB, GDDR6 | 336 GB/s | 詳細は未記載 |
| GTX 1660 Ti | 6 GB, GDDR6 | 288 GB/s | 1 536 |
このシリーズにはTensor CoresもRT Coresもありません。ウィキペディアによると、RTX 20のTuringアーキテクチャをベースに、この2種類の演算ユニットを省きつつ、整数演算専用コアは維持しています。整数形式に量子化されたモデルでは、Tensor Coresがないことによる生成への影響は小さいです。
#Tensor CoresなしのTuring:Pascalと比べて何が変化したか
このシリーズの強みはFP16です。GTX 1660の場合、Wikipediaによると、半精度では8,617 GFLOPS、単精度では4,309 GFLOPSとされています。FP16はFP32の2倍の速度で動作しますが、GTX 1080 Tiのガイドが示すように、GTX 10のような一般向けGPUではFP32よりもはるかに遅くなります。これが、1660が192 GB/sという同等の帯域幅において、GTX 1060を生成速度で大きく上回り、CUDA 13でもサポートが廃止されなかった理由です。
反例はプロンプトの読み取りにあります。llama.cpp のベンチマークでは、1660 のプロンプト処理は 148.91 トークン/秒であるのに対し、GTX 1060 は 416.85 トークン/秒です。より新しいカードが、長いテキストをほぼ3倍速く読み取れる可能性があります。ベンチマークは原因の詳細を述べておらず、結果は単一のコントリビューターによるもので、オーダーオブマグニチュードとして読むべきです。それでも、長文書への過度な期待を和らげるには十分です。
| カード | 帯域幅 | プロンプト (pp512) | 生成(tg128) |
|---|---|---|---|
| GTX 1060 6 GB (Pascal) | 192 GB/s | 416.85トークン/秒 | 27.79トークン/秒 |
| GTX 1660 6GB (Turing) | 192 GB/s | 148.91トークン/秒 | 41.35トークン/秒 |
| Quadro T1000 4GB | 128 GB/s | 79.44トークン/秒 | 27.82トークン/秒 |
#4つのバリアントを一つずつ
- GTX 1650 (4 GB)
- このベンチマークには1650の測定結果はありませんが、同じ帯域幅を持つ4 GB・128ビットの Quadro T1000 の結果があります。最小限のコンテキストなら、7Bモデルを Q4_0 でメモリに収め、27.82トークン/秒で動かせます。これが限界です。4 GB では、20億〜30億パラメータのモデルを選ぶほうがよいでしょう。
- GTX 1660 (6 GB GDDR5)
- テストに使用したカード:生成速度は41.35トークン/秒。6 GBモデルの中では最も遅いものの、Q4でのチャットには十分です。
- GTX 1660 Ti (6GB GDDR6)
- 288 GB/s:1660より帯域幅が50%広いため、処理速度も同程度向上すると見込まれますが、実測での確認が必要です。
- GTX 1660 Super (6 GB GDDR6)
- 336 GB/s:LLM 用途ではシリーズで最も優れており、1660 よりメモリ帯域幅が 75% 広くなっています。
これらの推定は、帯域幅だけに基づいています。1660の効率(理論上限の82%)を当てはめると、同じ7B Q4_0モデルで、1660 Tiは約62トークン/秒、1660 Superは約72トークン/秒を生成すると予測されます。これらはお使いのカードでの測定によって確認すべき予測値であり、実測結果ではありません。
購入時の注意点:GTX 1650には2種類あります。2019年の初期版は128ビットのGDDR5を使用し、帯域幅は128GB/sです。2020年4月の改訂版では12Gbit/sのGDDR6に変更され、帯域幅は192GB/sになりました。LLMでは、同じモデルでも処理速度が最大で50%向上する可能性があります。中古の1650を購入する前に、出品情報のGDDR5またはGDDR6という表記を確認するか、GPU-Zで仕様を確認してください。
#4 GB・6 GB環境でのコンテキスト:本当の上限
Ollama は 4,096 トークンのウィンドウで起動し、OLLAMA_CONTEXT_LENGTH で変更できます。KV キャッシュは会話の各トークンに応じて増加します。ウィンドウを倍にすると、キャッシュも倍になります。6 GB の環境で Granite 4.2 8B を Q4 で使用する場合、約 1.4 GB の余裕はすぐに消費されます。4 GB の環境では、3B のモデルを使用すると 2 GB の余裕があり、6 GB の環境で 8B を使用する場合よりも余裕があります。
実用上の目安として、量子化をさらに強めるよりも、モデルのサイズやコンテキストの長さを減らしてください。これらのグラフィックカードでは、コンテキストの長い3Bモデルのほうが、一部の処理をCPUにオフロードする8Bモデルよりも良い結果を得られます。ollama ps で、モデルが常に100 % GPU上で動作していることを確認してください。一部がCPU側にオフロードされると、生成速度が大きく落ちます。システムメモリはグラフィックカードのメモリよりもはるかに遅いためです。
| 用途 | GTX 1650 (4 GB) | GTX 1660 / Super / Ti(6 GB) |
|---|---|---|
| 短いチャット、翻訳、言い換え | 2〜3Bのモデル | 8B Q4、短いコンテキスト |
| エディタにおけるコード補完 | 2〜3Bのモデルで、品質は限定的です | 7〜8Bモデルが可能です |
| 長い文書の要約 | 推奨されません | 遅い:1660でプロンプトの読み込み速度は148.91トークン/秒 |
| 自分のドキュメント内を検索(RAG) | 3Bモデル、短い抜粋 | 3〜8Bのモデル、短い抜粋 |
#収まるモデル:4 GB と 6 GB の比較
当サイトの目安では、Q4の3Bモデルは約2 GB、7〜8Bモデルは約5 GBで、KVキャッシュの分は別途必要です。6 GBでは、Q4のGranite 4.2 8Bを読み込むと約1.4 GBが残ります。数千トークンのコンテキストには十分ですが、それ以上の余裕はありません。4 GBでは、3Bモデルが妥当な上限です。
| モデル (Q4) | モデル容量 | 4 GBの場合 | 6GB で |
|---|---|---|---|
| Gemma 4 2B | 1.2 GB | 余裕あり | 余裕あり |
| Granite 4.1 3B | 2 GB | 余裕あり | 余裕あり |
| Phi-4 Mini 3.8B | 3 GB | 余裕が少ない | 余裕あり |
| Granite 4.2 8B | 4.6 GB | 収まりません | 1.4GBの余裕 |
| Qwen3.5 9B | 6 GB | 収まりません | コンテキストを含めるとメモリ容量を超えます |
1650では、パラメータ数が20億〜40億のモデルに絞ってください。これは下書き、翻訳、分類にも適した範囲です。1660では、Q4の8Bモデルが限界です。チャットには使えますが、長いコンテキストを確保する余裕はほとんどありません。
#ソフトウェアサポート:GTX 10に比べて明確な利点
Ollamaでは、最近のカードにはNVIDIA 550以降のドライバーが必要ですが、compute capabilityが5.0~6.2のカード(Pascalを含む)には570が必要です。Ollamaの公式リストには、GTX 1650 TiとRTX 20シリーズがcompute capability 7.5として掲載されています。その他のGTX 16シリーズも同じTuringアーキテクチャを採用していますが、リストには個別に記載されていないため、インストール時に確認が必要です。
CUDA 13のリリースノートによると、サポート終了の対象はTuringより前のアーキテクチャ(Maxwell、Volta、Pascal)です。Turing、つまりGTX 16シリーズは引き続きサポートされています。中古で購入するなら、価格が近いGTX 10シリーズよりGTX 16シリーズを選ぶ主な理由はここにあります。
| ポイント | GTX 16 (Turing) | GTX 10 (Pascal) |
|---|---|---|
| Ollamaが必要とするドライバー | 550またはそれ以降 | 570以降 |
| CUDA 13 | サポート対象 | 削除されました |
| llama.cppにおけるFlash Attention | 利用可能 | 利用可能 |
#インストールおよび設定
- 01ドライバを確認nvidia-smiを実行してください。バージョンは550を超えている必要があります。
- 02Ollama のインストールお使いのシステムに対応するインストールガイドに従い、その後、メモリ容量に合ったモデルをダウンロードしてください。
- 03配置を確認ollama ps を実行してください。PROCESSOR 列には 100 % GPU と表示されるはずです。CPU にも分散している場合は、モデルが GPU メモリに収まりきっていないことを示します。
- 04コンテキストを制限するOllama は4,096トークンから開始します。4GBまたは6GBの場合、メモリの余裕が確認された上でのみ値を増やすようにしてください。
Flash Attention は Tensor Cores を搭載したカード専用ではありません。llama.cpp は GTX 1660 でも Pascal 世代のカードでもこれを実行できます。ベンチマークでは、有効時にプロンプト処理が 154.45 トークン/秒、生成が 41.43 トークン/秒で、無効時はそれぞれ 148.91 トークン/秒と 41.35 トークン/秒でした。速度の向上はわずかですが、コンテキストに必要なメモリが減るため、6 GB の環境では役立ちます。Ollama は、カードが対応している場合、Flash Attention を自動的に有効にします。
#結論:どのGTX 16が適しているか、そしていつ他の選択肢に切り替えるべきか
| あなたの状況 | 推奨 |
|---|---|
| 1660 Superまたは1660 Tiをお持ちの場合 | シリーズで最も高性能:8BをQ4で実行し、快適にチャット |
| 1660 を持っています | チャットには十分ですが、プロンプトの読み込みが遅い |
| 1650(4GB)をお持ちの場合 | 20億から40億パラメータのモデルのみ |
| 長い文書を読みたい | Ampereまたはそれ以降のGPUは、プロンプトをはるかに速く読み取ります |
| 12B以上のモデルを使いたい | 上位グレードへ:12 GB以上を目指す |
最後の確認ポイントとして、これらのカードは重負処理には適していませんが、発熱量は比較的低い(WikipediaによるとGTX 1660は120W)です。日々数問の質問に応えるローカルアシスタント向けに、250Wのカードに比べて実質的な利点があります。
中古品を同程度の予算で選ぶなら、1660 SuperはGTX 1060や1070より良い選択肢です。メモリ容量は同じで、メモリがより高速なうえ、ソフトウェアサポートもより長く続きます。新品を購入する場合や日常的に使う場合は、RTX 3050やRTX 2060ならTensor Coresが加わり、バージョンによってはメモリ容量も増えます。価格は毎週変わるため、当サイトの価格ページを確認してください。
- 出典:CUDA での llama.cpp 公開ベンチマーク
- 出典:Ollamaドキュメント、対応NVIDIAハードウェア
- 出典:GeForce 16シリーズ、仕様
- ソース:CUDA Toolkit リリースノート
GTX 1660でLLMを実行することは可能ですか?+
LLM用にGTX 16シリーズのどのモデルを選ぶべきですか?+
GTX 1650 4GBで7Bモデルを実行可能ですか?+
GTX 16シリーズはFlash Attentionをサポートしていますか?+
GTX 1660 Super が GTX 1060 より AI 用途で優れているのでしょうか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。