RTX 5060 Ti(8 / 16 GB)で使えるLLMは? ?
RTX 5060 Tiの16 GB版は、最大140億パラメータのモデル(Qwen3 14B、9.3 GB)やgpt-oss 20B(14 GB)をVRAMに保持でき、Hardware Cornerによると、14Bモデルで41トークン/秒の生成速度を実現します。8 GB版で使えるのは90億パラメータ以下のモデルに限られます。448 GB/sの帯域幅は両バージョンで同じであり、違いを決めるのはメモリ容量です。
RTX 5060 Tiには8 GB版と16 GB版があり、GPUも448 GB/sの帯域幅も同じです。実行できるモデルを決めるのは容量だけです。このガイドでは、各バージョンについて、実際にメモリに収まるモデル、Hardware Cornerが測定した処理速度、コンテキストの影響、近いクラスのカードとの差を紹介します。より高速なカードを選ぶべき場合も分かります。
マシンを選んでいるところですか? 予算別のおすすめ →
このセットアップの場合: RTX 5060 Ti 16 GB.
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#ローカルLLM向けのRTX 5060 Ti:16 GBのメモリと448 GB/sの帯域幅でできること
ローカルLLMにおいて、RTX 5060 Ti 16 GBは140億から200億パラメータまでのモデルを完全にVRAMに収容できますが、448 GB/sの帯域幅により、ハイエンドカードよりも2倍から3倍遅くなります。ライブラリOllama によると、Qwen3 14Bは9,3 GBで、gpt-oss 20B は14 GBです。Hardware Cornerは、コンテキスト16,000トークンでQwen3 14Bが毎秒32,9トークン、128,000トークンでgpt-oss 20B が毎秒43,8トークンと測定しています。17 GB以上の270億から320億パラメータのモデルは収容できません。8 GBバージョンは、90億パラメータ以下のモデルに限定されます。
- メモリ
- NVIDIAによると、128ビットのバスに16 GBまたは8 GBのGDDR7を搭載しています。Hardware Cornerによると、メモリ帯域幅は448 GB/sです。
- 消費電力
- NVIDIA によると、グラフィックス消費電力は 180 W、システムに必要な電源容量は 600 W です。この電源容量は、よく出回っている 550 W という数値を上回ります。
- ソフトウェア
- Compute Capability は 12.0 で、ドライバー 550 以降であれば Ollama が対応しています。
#8 GBか16 GBか:本当に重要なのはこの選択だけ
両バージョンはGPUとメモリ帯域幅が同じで、異なるのはメモリ容量だけです。その容量によって、実行できるモデルが決まります。NVIDIAは5060 Tiを16 GB版と8 GB版で提供しています。以下の比較には、2026年9月29日に参照したOllamaライブラリのファイルを使用しています。
| モデル | Ollama ファイル | 8GBバージョン | 16GBバージョン |
|---|---|---|---|
| Granite 4.2 8B | 5.3 GB | 収まります。余裕容量は2.7 GB | 非常に快適 |
| Qwen 3.5 9B | 6.6 GB | 収まります。1.4 GB の余裕があります | 非常に快適 |
| Gemma 4 12B | 7.6 GB | 0.4GBの余裕:コンテキストなし | 快適 |
| Qwen3 14B | 9.3 GB | 収まりません | 6.7GBの余裕 |
| gpt-oss 20B | 14 GB | 収まりません | 収まり、2 GBの余裕があります |
| Devstral Small 2 24B | 15 GB | 収まりません | わずか1GBの余裕があります |
| Qwen 3.5 27B | 17 GB | 収まりません | 収まりません |
8 GBでは、9Bモデルの場合、コンテキストとシステムに割り当てられるのは1.4 GBのみです。これは不足しており、より低速なRAMへのオーバーフローがすぐに発生します。16 GB版では対応モデルのラインナップが2倍になり、12Bから20Bのモデルも利用可能になります。LLMの定期的な利用を想定する場合、16 GB版は24 GBのカードには遠く及びませんが、唯一の余裕を確保できるバージョンです。
#モデルをダウンロードする前にメモリの余裕を計算する
計算は単純です。GPUのメモリ容量からファイルサイズを引くと、おおよその空き容量が分かります。この空き容量で、KVキャッシュ、推論エンジンのバッファ、OSが画面表示に使う分をまかなう必要があります。Qwen3 14Bでは、16 - 9.3で6.7 GBが残ります。8 GB版でQwen 3.5 9Bを使う場合は、8 - 6.6で1.4 GBが残ります。余裕が小さいほど、コンテキストを短くし、キャッシュを量子化する必要があります。ollama psでCPUとGPUに分かれていることが表示される場合、モデルまたはそのコンテキストがGPUメモリに収まらず、システムRAMにあふれています。その結果、生成速度はシステムRAMの速度に左右される水準まで落ちます。
8 GB 版では、三つの習慣でメモリ容量超過の大半を防げます。ファイルサイズが 7 GB 未満で、パラメータ数が 90 億以下のモデルを選んでください。ollama ps に 100 % GPU と表示されている間は、コンテキスト長を控えめに保ってください。また、モデルを起動する前に、ブラウザやゲームなど、ビデオメモリを消費するアプリケーションを閉じてください。
#16GBで推奨されるモデル
正しい判断は、Qwen3 14B または gpt-oss 20B から始めることです。Qwen3 14B はコンテキストに約 7 GB の余裕を残します。gpt-oss 20B は 14 GB に収まります。これは Ollama によると、そのエキスパートの重みがパラメータあたり 4.25 ビットで MXFP4 に量子化されているため、16 GB のメモリで動作可能だからです。Devstral Small 2 (15 GB) のような Q4 の 240 億パラメータモデルは、わずか 1 GB のみ残します。短いやり取りには対応できますが、エージェントには対応できません。ローカル RAG は埋め込みモデルを追加します:bge-m3 は Ollama で 1.2 GB を占め、Qwen 3.5 9B と合わせて合計 7.8 GB になります。
#RTX 5060 Ti搭載のパソコンにOllamaをインストールする
- 01ドライバを確認ターミナルでnvidia-smiを実行してください。ドライバーのバージョンは550以上(Windowsでは551.61)である必要があり、総メモリ容量は16GB、もう一方のモデルでは8GBと表示されるはずです。
- 02Ollama のインストールOllamaは公式サイトからインストールしてください。ローカルAPIは http://localhost:11434 でリッスンします。
- 03モデルの起動16 GB で ollama run qwen3:14b を実行するか、8 GB で ollama run qwen3.5:9b を実行してください。ダウンロードは一度だけです。
- 04処理の配分を確認する別のターミナルで ollama ps を実行してください。Processor列には「100 % GPU」と表示されるはずです。8 GB版で処理がCPUとGPUに分かれている場合は、モデルまたはコンテキストがVRAMに収まっていないことを意味します。より軽量なモデルを選んでください。
- 05コンテキストを調整OLLAMA_CONTEXT_LENGTHでコンテキスト長を設定し、その後ollama psを再実行してください。余裕が足りない場合は、起動時にOLLAMA_FLASH_ATTENTIONを1に、OLLAMA_KV_CACHE_TYPEをq8_0に設定してください。
#実測の処理速度:帯域幅が速度を決める
これらの数値は、llama.cppで16GB版を4k〜128kのコンテキストでテストしているHardware Cornerによるものです。QuelLLMが測定した数値ではありません。
| モデル(Q4_K、またはgpt-oss用のMXFP4) | 4kコンテキスト | コンテキスト 32k | 128kコンテキスト | プロンプト読み込み 4k |
|---|---|---|---|---|
| Qwen3 8B | 69,2 | 38,9 | 未測定 | 2 965,1 |
| Qwen3 14B | 41,1 | 25,9 | 未測定 | 1 743,0 |
| gpt-oss 20B (MXFP4) | 92,1 | 73,2 | 43,8 | 3 585,2 |
生成速度は帯域幅に制約されます。理論上の上限は、帯域幅をモデルの重みで割った値にほぼ等しくなります。Qwen3 14B(9.3 GB)の場合、448 ÷ 9.3 で毎秒 48 トークンとなり、4k での測定値 41.1 はその 85 % を達成しています。コンテキストは速度に影響します。Qwen3 14B は 4k から 32k にかけて 37 % 低下します(41.1 から 25.9)。gpt-oss 20B はエキスパート型モデルであり、1 トークンごとに重みの一部のみを読み込むため、見かけの上限(448 ÷ 14 = 32)を超えて毎秒 92.1 トークンに達します。
Ollama は、VRAM 容量に応じてデフォルトのコンテキスト長を設定します。ドキュメントでは、VRAM が 24 GiB 未満の場合は 4k トークンとされ、エージェントやウェブ検索には少なくとも 64,000 トークンが推奨されています。5060 Ti は、この 4k の区分に入ります。FAQ によると、q8_0 は KV キャッシュのメモリ使用量を f16 の約半分に抑え、精度の低下もごくわずかです。16 GB では最初に有効にすべき設定であり、8 GB では必須です。
#5060 Ti と他のカードの比較:測定された差異
| カード | メモリ | 相対生成 |
|---|---|---|
| RTX 5070 Ti | 16 GB | 176 % |
| RTX 3090 | 24 GB | 158 % |
| RTX 4070 Super | 12 GB | 113 % |
| RTX 5060 Ti | 16 GB | 100 % |
| RTX 3060 | 12 GB | 69 % |
| RTX 4060 Ti | 16 GB | 68 % |
この表は5060 Tiのトレードオフを示しています。GDDR7メモリ(448 GB/s 対 288 GB/s)のおかげで、16 GBの4060 Ti(100 ÷ 68)より約半分の速度で生成できますが、同じ容量で76%高速な5070 Tiにはまだ遠く及びません。単なるスループットだけを見れば、12 GBの4070 Superの方が速いですが、gpt-oss 20Bは収まりません。Hardware Cornerによると、その価格対メモリ比により、2026年の初心者向けには「バリューキング」とされています。現在の価格推移と比較してください。
Hardware Cornerも、16 GBのカード2枚を使えば、フラッグシップカードほどの費用をかけずに32 GBまで増やせると指摘しています。2枚のGPUへの分散には、llama.cppのtensor-splitモードを使います。詳しくはマルチGPUガイドで説明しています。この方法で増えるのは容量であり、カード1枚あたりの速度ではありません。
#結論:16GB、8GB、またはその他のカード
| 状況 | 決定 | 数値による根拠 |
|---|---|---|
| LLM を日常的に使いたいが、予算は抑えたい場合 | 5060 Ti 16GB | gpt-oss 20B 128kのコンテキスト:43.8 t/s |
| 主に80億から90億パラメータのモデルを求めている場合 | 8GB版で足りる場合もあります | Qwen 3.5 9Bでは1.4 GBの余裕 |
| 同じ容量で速度を重視したい場合 | 5070 Ti | 5060 Tiの速度の176% |
| 27Bの密なモデルを使いたい | 24GBのGPU | Qwen 3.5 27Bは17 GBです |
| 4060 Ti 16GBを既に所有しています | 速度が必要でなければ、そのまま使い続ける | 5060 Ti の 68 % の速度 |
意思決定の方法は二つの質問に集約されます。起動したい最大のモデルはどれですか?90億パラメータ未満であれば8 GB版で十分です。120億から200億パラメータの間であれば16 GB版が必要です。それ以上であれば、24 GBのカードまたは2枚のカードが必要です。許容できる速度はどれくらいですか?14Bで1秒あたり40トークンの場合、読み取りは滑らかです。5070 Tiは、長いテキストを生成する場合や複数のユーザーにサービスを提供する場合にのみ正当化されます。
ファインチューニングについて、Unslothは4ビットQLoRAで必要な最低VRAM容量を示しています。8Bモデルでは6 GB、14Bモデルでは8.5 GB、27Bモデルでは22 GBです。したがって、16 GB版では、バッチサイズ1と短いコンテキストで14Bモデルをファインチューニングできます。その日の価格については、当サイトの価格追跡ページをご覧ください。各カードの最安値を週に2回記録しています。
- 出典:NVIDIA、RTX 5060シリーズ仕様
- 出典:Hardware Corner、RTX 5060 Ti 16 GBでのLLMベンチマーク
- 出典:Ollama、モデルgpt-ossのページ
- 出典:Ollama ドキュメント、コンテキスト長
- 出典:Unsloth、ファインチューニングに必要な VRAM
#よくある質問
ローカルLLMには、RTX 5060 Tiの8 GB版と16 GB版のどちらを選ぶべきですか?+
RTX 5060 Tiでは1秒あたり何トークン生成できますか?+
RTX 5060 Ti 16 GBで240億または320億パラメータのモデルを実行できるか?+
RTX 5060 Tiにどのような電源が必要ですか?+
LLMにはRTX 5060 TiとRTX 4060 Ti 16 GBのどちらを選ぶべきですか?+
RTX 5060 Ti 16 GBでモデルをファインチューニングできますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。