初心者 11 分RTX 50

RTX 5060 Ti(8 / 16 GB)で使えるLLMは? ?

端的な回答

RTX 5060 Tiの16 GB版は、最大140億パラメータのモデル(Qwen3 14B、9.3 GB)やgpt-oss 20B(14 GB)をVRAMに保持でき、Hardware Cornerによると、14Bモデルで41トークン/秒の生成速度を実現します。8 GB版で使えるのは90億パラメータ以下のモデルに限られます。448 GB/sの帯域幅は両バージョンで同じであり、違いを決めるのはメモリ容量です。

RTX 5060 Tiには8 GB版と16 GB版があり、GPUも448 GB/sの帯域幅も同じです。実行できるモデルを決めるのは容量だけです。このガイドでは、各バージョンについて、実際にメモリに収まるモデル、Hardware Cornerが測定した処理速度、コンテキストの影響、近いクラスのカードとの差を紹介します。より高速なカードを選ぶべき場合も分かります。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-29·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このセットアップの場合: RTX 5060 Ti 16 GB.

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#ローカルLLM向けのRTX 5060 Ti:16 GBのメモリと448 GB/sの帯域幅でできること

ローカルLLMにおいて、RTX 5060 Ti 16 GBは140億から200億パラメータまでのモデルを完全にVRAMに収容できますが、448 GB/sの帯域幅により、ハイエンドカードよりも2倍から3倍遅くなります。ライブラリOllama によると、Qwen3 14Bは9,3 GBで、gpt-oss 20B は14 GBです。Hardware Cornerは、コンテキスト16,000トークンでQwen3 14Bが毎秒32,9トークン、128,000トークンでgpt-oss 20B が毎秒43,8トークンと測定しています。17 GB以上の270億から320億パラメータのモデルは収容できません。8 GBバージョンは、90億パラメータ以下のモデルに限定されます。

メモリ
NVIDIAによると、128ビットのバスに16 GBまたは8 GBのGDDR7を搭載しています。Hardware Cornerによると、メモリ帯域幅は448 GB/sです。
消費電力
NVIDIA によると、グラフィックス消費電力は 180 W、システムに必要な電源容量は 600 W です。この電源容量は、よく出回っている 550 W という数値を上回ります。
ソフトウェア
Compute Capability は 12.0 で、ドライバー 550 以降であれば Ollama が対応しています。

#8 GBか16 GBか:本当に重要なのはこの選択だけ

両バージョンはGPUとメモリ帯域幅が同じで、異なるのはメモリ容量だけです。その容量によって、実行できるモデルが決まります。NVIDIAは5060 Tiを16 GB版と8 GB版で提供しています。以下の比較には、2026年9月29日に参照したOllamaライブラリのファイルを使用しています。

バージョン別にメモリに収まるモデル(Ollamaファイル、特記がない限りQ4)
モデルOllama ファイル8GBバージョン16GBバージョン
Granite 4.2 8B5.3 GB収まります。余裕容量は2.7 GB非常に快適
Qwen 3.5 9B6.6 GB収まります。1.4 GB の余裕があります非常に快適
Gemma 4 12B7.6 GB0.4GBの余裕:コンテキストなし快適
Qwen3 14B9.3 GB収まりません6.7GBの余裕
gpt-oss 20B14 GB収まりません収まり、2 GBの余裕があります
Devstral Small 2 24B15 GB収まりませんわずか1GBの余裕があります
Qwen 3.5 27B17 GB収まりません収まりません

8 GBでは、9Bモデルの場合、コンテキストとシステムに割り当てられるのは1.4 GBのみです。これは不足しており、より低速なRAMへのオーバーフローがすぐに発生します。16 GB版では対応モデルのラインナップが2倍になり、12Bから20Bのモデルも利用可能になります。LLMの定期的な利用を想定する場合、16 GB版は24 GBのカードには遠く及びませんが、唯一の余裕を確保できるバージョンです。

#モデルをダウンロードする前にメモリの余裕を計算する

計算は単純です。GPUのメモリ容量からファイルサイズを引くと、おおよその空き容量が分かります。この空き容量で、KVキャッシュ、推論エンジンのバッファ、OSが画面表示に使う分をまかなう必要があります。Qwen3 14Bでは、16 - 9.3で6.7 GBが残ります。8 GB版でQwen 3.5 9Bを使う場合は、8 - 6.6で1.4 GBが残ります。余裕が小さいほど、コンテキストを短くし、キャッシュを量子化する必要があります。ollama psでCPUとGPUに分かれていることが表示される場合、モデルまたはそのコンテキストがGPUメモリに収まらず、システムRAMにあふれています。その結果、生成速度はシステムRAMの速度に左右される水準まで落ちます。

8 GB 版では、三つの習慣でメモリ容量超過の大半を防げます。ファイルサイズが 7 GB 未満で、パラメータ数が 90 億以下のモデルを選んでください。ollama ps に 100 % GPU と表示されている間は、コンテキスト長を控えめに保ってください。また、モデルを起動する前に、ブラウザやゲームなど、ビデオメモリを消費するアプリケーションを閉じてください。

#16GBで推奨されるモデル

正しい判断は、Qwen3 14B または gpt-oss 20B から始めることです。Qwen3 14B はコンテキストに約 7 GB の余裕を残します。gpt-oss 20B は 14 GB に収まります。これは Ollama によると、そのエキスパートの重みがパラメータあたり 4.25 ビットで MXFP4 に量子化されているため、16 GB のメモリで動作可能だからです。Devstral Small 2 (15 GB) のような Q4 の 240 億パラメータモデルは、わずか 1 GB のみ残します。短いやり取りには対応できますが、エージェントには対応できません。ローカル RAG は埋め込みモデルを追加します:bge-m3 は Ollama で 1.2 GB を占め、Qwen 3.5 9B と合わせて合計 7.8 GB になります。

#RTX 5060 Ti搭載のパソコンにOllamaをインストールする

  1. 01
    ドライバを確認
    ターミナルでnvidia-smiを実行してください。ドライバーのバージョンは550以上(Windowsでは551.61)である必要があり、総メモリ容量は16GB、もう一方のモデルでは8GBと表示されるはずです。
  2. 02
    Ollama のインストール
    Ollamaは公式サイトからインストールしてください。ローカルAPIは http://localhost:11434 でリッスンします。
  3. 03
    モデルの起動
    16 GB で ollama run qwen3:14b を実行するか、8 GB で ollama run qwen3.5:9b を実行してください。ダウンロードは一度だけです。
  4. 04
    処理の配分を確認する
    別のターミナルで ollama ps を実行してください。Processor列には「100 % GPU」と表示されるはずです。8 GB版で処理がCPUとGPUに分かれている場合は、モデルまたはコンテキストがVRAMに収まっていないことを意味します。より軽量なモデルを選んでください。
  5. 05
    コンテキストを調整
    OLLAMA_CONTEXT_LENGTHでコンテキスト長を設定し、その後ollama psを再実行してください。余裕が足りない場合は、起動時にOLLAMA_FLASH_ATTENTIONを1に、OLLAMA_KV_CACHE_TYPEをq8_0に設定してください。
基本コマンド
ollama run qwen3:14b
ollama run gpt-oss:20b
ollama ps

# Exemple de la documentation Ollama : contexte de 64 000 tokens
OLLAMA_CONTEXT_LENGTH=64000 ollama serve

#実測の処理速度:帯域幅が速度を決める

これらの数値は、llama.cppで16GB版を4k〜128kのコンテキストでテストしているHardware Cornerによるものです。QuelLLMが測定した数値ではありません。

RTX 5060 Ti 16 GBで生成する際のトークン/秒(Hardware Corner)
モデル(Q4_K、またはgpt-oss用のMXFP4)4kコンテキストコンテキスト 32k128kコンテキストプロンプト読み込み 4k
Qwen3 8B69,238,9未測定2 965,1
Qwen3 14B41,125,9未測定1 743,0
gpt-oss 20B (MXFP4)92,173,243,83 585,2

生成速度は帯域幅に制約されます。理論上の上限は、帯域幅をモデルの重みで割った値にほぼ等しくなります。Qwen3 14B(9.3 GB)の場合、448 ÷ 9.3 で毎秒 48 トークンとなり、4k での測定値 41.1 はその 85 % を達成しています。コンテキストは速度に影響します。Qwen3 14B は 4k から 32k にかけて 37 % 低下します(41.1 から 25.9)。gpt-oss 20B はエキスパート型モデルであり、1 トークンごとに重みの一部のみを読み込むため、見かけの上限(448 ÷ 14 = 32)を超えて毎秒 92.1 トークンに達します。

Ollama は、VRAM 容量に応じてデフォルトのコンテキスト長を設定します。ドキュメントでは、VRAM が 24 GiB 未満の場合は 4k トークンとされ、エージェントやウェブ検索には少なくとも 64,000 トークンが推奨されています。5060 Ti は、この 4k の区分に入ります。FAQ によると、q8_0 は KV キャッシュのメモリ使用量を f16 の約半分に抑え、精度の低下もごくわずかです。16 GB では最初に有効にすべき設定であり、8 GB では必須です。

#5060 Ti と他のカードの比較:測定された差異

グラフィックカード別の相対的な生成性能(Hardware Corner、5060 Ti 16 GB = 100 %)
カードメモリ相対生成
RTX 5070 Ti16 GB176 %
RTX 309024 GB158 %
RTX 4070 Super12 GB113 %
RTX 5060 Ti16 GB100 %
RTX 306012 GB69 %
RTX 4060 Ti16 GB68 %

この表は5060 Tiのトレードオフを示しています。GDDR7メモリ(448 GB/s 対 288 GB/s)のおかげで、16 GBの4060 Ti(100 ÷ 68)より約半分の速度で生成できますが、同じ容量で76%高速な5070 Tiにはまだ遠く及びません。単なるスループットだけを見れば、12 GBの4070 Superの方が速いですが、gpt-oss 20Bは収まりません。Hardware Cornerによると、その価格対メモリ比により、2026年の初心者向けには「バリューキング」とされています。現在の価格推移と比較してください。

Hardware Cornerも、16 GBのカード2枚を使えば、フラッグシップカードほどの費用をかけずに32 GBまで増やせると指摘しています。2枚のGPUへの分散には、llama.cppのtensor-splitモードを使います。詳しくはマルチGPUガイドで説明しています。この方法で増えるのは容量であり、カード1枚あたりの速度ではありません。

#結論:16GB、8GB、またはその他のカード

状況別の判断
状況決定数値による根拠
LLM を日常的に使いたいが、予算は抑えたい場合5060 Ti 16GBgpt-oss 20B 128kのコンテキスト:43.8 t/s
主に80億から90億パラメータのモデルを求めている場合8GB版で足りる場合もありますQwen 3.5 9Bでは1.4 GBの余裕
同じ容量で速度を重視したい場合5070 Ti5060 Tiの速度の176%
27Bの密なモデルを使いたい24GBのGPUQwen 3.5 27Bは17 GBです
4060 Ti 16GBを既に所有しています速度が必要でなければ、そのまま使い続ける5060 Ti の 68 % の速度

意思決定の方法は二つの質問に集約されます。起動したい最大のモデルはどれですか?90億パラメータ未満であれば8 GB版で十分です。120億から200億パラメータの間であれば16 GB版が必要です。それ以上であれば、24 GBのカードまたは2枚のカードが必要です。許容できる速度はどれくらいですか?14Bで1秒あたり40トークンの場合、読み取りは滑らかです。5070 Tiは、長いテキストを生成する場合や複数のユーザーにサービスを提供する場合にのみ正当化されます。

ファインチューニングについて、Unslothは4ビットQLoRAで必要な最低VRAM容量を示しています。8Bモデルでは6 GB、14Bモデルでは8.5 GB、27Bモデルでは22 GBです。したがって、16 GB版では、バッチサイズ1と短いコンテキストで14Bモデルをファインチューニングできます。その日の価格については、当サイトの価格追跡ページをご覧ください。各カードの最安値を週に2回記録しています。

#よくある質問

FAQ
ローカルLLMには、RTX 5060 Tiの8 GB版と16 GB版のどちらを選ぶべきですか?+
90億パラメータのモデル以外も実行したい場合は、16 GB版を選んでください。GPUと448 GB/sの帯域幅は同じで、違うのはメモリ容量だけです。8 GB版では、Qwen 3.5 9B(6.6 GB)を読み込むと余裕は1.4 GBしかありません。16 GB版なら、gpt-oss 20B(14 GB)とQwen3 14B(9.3 GB)はコンテキスト用のメモリも含めて収まります。
RTX 5060 Tiでは1秒あたり何トークン生成できますか?+
Hardware Cornerのデータによると、16GBバージョンではQwen3 14B(4kコンテキスト)で41.1トークン/秒、Qwen3 8Bで69.2トークン/秒、gpt-oss 20Bで92.1トークン/秒が記録されています。コンテキストが大きくなると生成速度が低下し、Qwen3 14Bは32kコンテキストでは25.9トークン/秒にまで落ちます。これらの値は第三者測定値です。
RTX 5060 Ti 16 GBで240億または320億パラメータのモデルを実行できるか?+
Q4の24Bモデル(Devstral Small 2、15GB)はぎりぎり収まりますが、余裕は1GBしかないため、実用的なコンテキスト長は確保できません。27Bや32B(17〜20GB)は収まりません。Hardware Cornerによると、30Bモデルが収まるのは3ビットの場合だけで、品質が大きく低下します。
RTX 5060 Tiにどのような電源が必要ですか?+
NVIDIAは、5060 Tiに必要なシステム電源を600W、グラフィックスカードの消費電力を180Wとしています。これらはPC全体についてメーカーが示す値です。よく挙げられる550Wの電源はこの推奨値を下回りますが、消費電力の少ないPCであれば足りる場合もあります。
LLMにはRTX 5060 TiとRTX 4060 Ti 16 GBのどちらを選ぶべきですか?+
5060 Tiは16GBのキャパシティで47%高速に動作し、4060 TiはHardware Cornerのデータによると68%の帯域を達成(288GB/s対448GB/s)します。価格差を比較して選択してください。予算が限られている場合、4060 Tiの中古モデルも依然として利用可能です。
RTX 5060 Ti 16 GBでモデルをファインチューニングできますか?+
はい、QLoRAで最大140億パラメータまで可能です。Unslothによると、バッチサイズ1、短いコンテキストの場合、最低限必要なメモリは8Bで6GB、14Bで8.5GBです。27Bには22GBが必要で、収まりません。8GB版は8Bまたは9Bに限られます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。