RTX 5060(8 GB)で使えるLLMは? ?
RTX 5060 は、8 GB の GDDR7 メモリと 448 GB/s の帯域幅を備え、RTX 4060 より帯域幅が 65% 広くなっています。Q4 に量子化した 30億〜90億パラメータのモデルを無理なく動かせます。例えば Granite 4.2 8B(5.3 GB)や Qwen 3.5 9B(6.6 GB)が該当し、8B モデルでの生成速度の理論上限は約 85 トークン/秒です。制約となるのはメモリ容量で、12B 以上のモデルは実用的なコンテキストを確保すると収まりません。
RTX 5060は、公衆市場でLLMのローカル実行に最も速い8GBメモリのGPUであり、GDDR7メモリによってその性能が実現されています。しかし8GBは8GBです。このガイドでは、実際に使える内容、期待できる速度、バウンドを回避する設定 Ollama、そしてRTX 5060 Ti 16GBがより良い選択となるタイミングについて記載しています。
マシンを選んでいるところですか? 予算別のおすすめ →
このセットアップの場合: RTX 5060 Ti 16 GB.
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。
#RTX 5060でローカルLLMを使う:8 GBのGDDR7でできること
RTX 5060は、Q4の30億~90億パラメータのモデルを難なく動かせます。Ollamaのライブラリによると、Qwen 3.5 4Bは3.4GB、Granite 4.2 8Bは5.3GB、Qwen 3.5 9Bは6.6GBです。いずれもカードの8GBに収まりますが、最後のモデルではコンテキストを短くする必要があります。Gemma 4 12B(7.7~8GB)のような12Bモデルでは、コンテキストを1トークンも追加する前にメモリを使い切ってしまいます。このカードの強みはメモリ帯域幅です。128ビットバスで448GB/sと、RTX 4060の272GB/sを65%上回ります。チャット、要約、小規模なRAGには、5060は十分な余裕があります。9Bを超えるモデルを使うには、速度ではなく、より多くのVRAMが必要です。
- アーキテクチャ
- NVIDIA によると、Blackwell アーキテクチャ、3,840基の CUDA コア、第5世代の Tensor Core を搭載しています。
- メモリ
- 8GBのGDDR7で128ビットバス、帯域幅448GB/s
- 消費電力
- 総グラフィックス消費電力は145W。NVIDIAが示すPC全体の電源容量の最低要件は550Wです。
- 発売価格
- 299ドル。Wikipediaによると、発売日は2025年5月19日です。
#なぜ5060が同じ容量の4060よりも速いのか?
生成プロセスでは、各トークンがGPUがモデルの大部分の重みを再読み込みを必要とします。したがって、最大速度は帯域幅を重みのサイズで割った値になります。5060は4060と比べてメモリを65%速く読み込みます。同じモデルの場合、理論的な上限も同様の割合で上昇します。これはLLMにとって唯一の技術的根拠です。CUDAコアはプロンプトの読み込みに役立ちますが、生成はメモリの制限によって制約されます。
| カード | メモリ | 帯域幅 | 5.3GBモデルでの上限 |
|---|---|---|---|
| RTX 4060 | 8 GB GDDR6 | 272GB/s | 51トークン/秒 |
| RTX 5060 | 8GB GDDR7 | 448 GB/s | 85トークン/秒 |
#8 GB に収まるモデルはどれか
| モデル | サイズ | 8 GBでの余裕 | 判定 |
|---|---|---|---|
| Qwen 3.5 4B | 3.4 GB | 4.6 GB | 快適に動作し、長いコンテキストも利用可能 |
| Granite 4.2 8B | 5.3 GB | 2.7 GB | 適度な長さのコンテキストなら快適 |
| Qwen 3.5 9B | 6.6 GB | 1.4 GB | 余裕が少なく、コンテキストは短め |
| Gemma 4 12B | 7.7~8.0 GB | 0 GB またはそれ以下 | 実用的なコンテキスト長ではメモリに収まらない |
Gemma 4 12B は、ファイルサイズだけで判断する落とし穴を示しています。重みは7.7〜8GBを占めますが、グラフィックカードにはコンテキストキャッシュと画面表示用のメモリも必要です。モデルは読み込めますが、扱えるコンテキストはせいぜい数千トークンで、アプリケーションが少しでもVRAMを使うと、収まりきらない分がシステムRAMに移されます。VRAMが8GBの場合、Qwen 3.5 9B または Granite 4.2 8B のほうが無理なく使える選択肢で、実用的なメモリの余裕も確保できます。
#画像、ビジョン、量子化:2つの補足事項
Ollamaのモデルライブラリによると、Qwen 3.5はテキストと画像を入力として受け付けます。そのため、4Bまたは9Bのモデルでスクリーンショットを説明したり、図を読み取ったりできます。画像はコンテキストを消費するため、8 GBではメモリの余裕が減ります。空き容量を確保したい場合は、画像処理には4B(3.4 GB)を選んでください。量子化については、8 GBではQ4_K_Mが引き続きバランスのよい選択です。より高精度の量子化に切り替えると、モデルの重みの容量が数百MB増えますが、このカードにはその分の余裕がありません。通常の用途では、目に見える違いもありません。
#Ollamaをインストールし、カードを確認する
- 01NVIDIAドライバーOllama は NVIDIA 550 以上のドライバーを必要とします。RTX 50 であれば、NVIDIA が提供する最新ドライバーをインストールしてください。nvidia-smi で確認してください。
- 02Ollama のインストールRTX 5060は対応カードの一覧に含まれています(Compute Capability 12.0)。CUDAは同梱されているため、別途インストールする必要はありません。
- 03最初のモデルollama run qwen3.5:9b(6.6 GB)を実行してください。メモリに余裕を残したい場合は、代わりにollama run granite4.2:8b(5.3 GB)を実行してください。
- 04制御ollama ps を実行してください:PROCESSOR 列が 100 % GPU であることを確認してください。
#期待できる速度:測定値ではなく上限
ここで示す生成速度は、いずれも当サイト独自の実測値ではありません。生成速度の上限は、メモリ帯域幅をモデルの重みのサイズで割った値です。公開されている第三者の測定結果(2024年5月、llama.cppでQ4_K_M版のLLaMA 3 8Bを使用)では、上限が156トークン/秒のRTX 4080で106トークン/秒、つまり約68%を記録しています。概算として70%を採用すると、短いコンテキストでの推定値は次のとおりです。
| モデル (Q4) | モデル容量 | 上限 | 70 % での推定 |
|---|---|---|---|
| Qwen 3.5 4B | 3.4 GB | 132トークン/秒 | 約92トークン/秒 |
| Granite 4.2 8B | 5.3 GB | 85トークン/秒 | 約59トークン/秒 |
| Qwen 3.5 9B | 6.6 GB | 68トークン/秒 | 約48トークン/秒 |
| Gemma 4 12B | 7.7 GB | 58 tokens/s | 約40トークン/秒、コンテキストが非常に制限されています |
これらの上限値はいずれも、快適に読める速度の目安である毎秒15〜20トークン程度を大きく上回っています。したがって、5060の制約になるのは速度ではなく、8GBというメモリ容量です。
#8GBを超えないようにOllamaを設定する
Ollamaでは、K/Vキャッシュをq8_0に量子化することで、デフォルトのf16と比べてメモリ使用量を約半分に抑えられます。ドキュメントによれば、精度の低下はごくわずかです。これにはFlash Attentionが必要です。8GBの環境では、これが最も効果的な対策です。モデルを変更せずにコンテキストを長くできます。
- 1 つのモデルのみ
- 一度に 1 つのモデルのみをロードしてください。RAG 用の埋め込みモデルは小さく保つ必要があります。
- リソースを多く消費するアプリケーション
- ハードウェアアクセラレーションを使用するブラウザ、ゲーム、動画エンコード用のアプリは VRAM を確保するため、ロードする前に終了してください。
- 適切なコンテキスト
- コンテキストの倍増はK/Vキャッシュの倍増を意味します:必要なタスクに対してのみ増やしてください。
- 監視
- 長い生成処理の実行中にnvidia-smiを確認すると、実際にどれだけ余裕があるかがわかります。
#8GBで実際に何ができるか
適切な基準は、要求されるタスクであり、モデルのサイズではありません。チャットや言い換えは、4Bでも8Bでも行えます。数十ページに及ぶ文書の要約には、8,000トークンから16,000トークンのコンテキストが必要です。q8_0のK/Vキャッシュを使用する場合、8Bモデルは8 GBでこれを実現できます。RAGは、生成モデル、埋め込みモデル、および検索された抜粋のコンテキストを組み合わせます。生成モデルは9B以下に保ってください。コードアシスタントは最も制約が厳しいケースであり、専門モデルはすぐにビデオカードの容量を超えてしまいます。
| 用途 | 現実的? | 推奨設定 |
|---|---|---|
| 日常会話、短い質問 | はい | Granite 4.2 8B, デフォルトのコンテキスト |
| 10ページから30ページまでのドキュメントの要約 | はい、8,192トークンから16,384トークンのコンテキストに対応可能です | q8_0のK/Vキャッシュ、Flash Attention |
| ご自身のファイルを使ったRAG | はい、4Bから8Bのモデルで可能です | 軽量な埋め込み、生成モデルは1つだけ |
| リポジトリでのコードアシスタント | 限定販売 | 4B〜8Bのモデル、短い抜粋 |
| 14GB以上のモデル | いいえ | 16GBのVRAMを用意する |
モデルがGPUのVRAMに収まりきらなくても、生成は停止しません。一部の重みがシステムRAMから読み込まれます。その兆候は、生成速度の急激な低下です。ollama ps コマンドはGPUとCPUへの割り当てを表示します。100 % GPUと表示される行は正常ですが、GPUとCPUに分かれている行は、モデルがVRAMに収まりきっていないことを示します。コンテキストを短くするか、モデルを変更することで解消できます。
#5060では足りなくなったとき
メモリをさらに必要とすることを示す三つのシグナルがあります。高品質な文章作成のために 12B 以上のモデルを求めている場合。長いドキュメントにより、コンテキストが定期的に 16 000 トークンを超えている場合。生成、埋め込み、リランカーの複数のモデルを同時に読み込んでいる場合。これらの場合、速度を追加しても何も変わりません。不足しているのは容量であり、次の段階は 12 GB と 16 GB のページで説明されています。
#5060か5060 Ti 16GBか:重要な選択
RTX 5060 Ti 16 GBは、128ビットのバスで同じGDDR7メモリを使用しており、Wikipediaによるとメモリ帯域幅も同じ448 GB/sです。実質的な違いは、4,608基のCUDAコアと16 GBのメモリです。そのため、両方のカードに収まるモデルなら生成速度は同じですが、5060には収まらない14 GBのモデルも読み込めます。発売時の希望小売価格は、5060が299ドル、5060 Ti 8 GBが379ドル、5060 Ti 16 GBが429ドルでした。130ドル多く払うことで、メモリ容量が2倍になります。
| 基準 | RTX 5060 | RTX 5060 Ti 16 GB |
|---|---|---|
| メモリ | 8GB GDDR7 | 16 GB GDDR7 |
| 帯域幅 | 448 GB/s | 448 GB/s |
| CUDAコア | 3 840 | 4 608 |
| グラフィック性能 | 145 W | 180 W |
| 電源の最低要件 | 550 W | 600 W |
| 14GBのモデル(gpt-oss 20B、Mistral Small 24B) | いいえ | はい、2GBの余裕があります |
#2026年の結論
- 5060 の購入を勧める条件
- 使うモデルが4B〜9Bで、予算が限られており、保証付きの新品を希望する場合です。8GBのカードでは最速です。
- 次の場合は 5060 Ti 16 GB を選ぶ
- 12B~24Bのモデルを使いたい場合は、速度よりも容量が重要で、追加費用もわずかです。
- 5060を避けたほうがよいのは、次の場合です
- Gemma 4 12B、gpt-oss 20B、またはサイズが8 GBを超えるモデルを本格的に使う予定がある。
一言でまとめると、5060は容量ではなく、速度と価格を理由に選ぶ8 GBのグラフィックカードです。用途に必要なメモリが8 GBに収まるなら、新品ではこれに勝るカードを見つけるのは難しいでしょう。収まらないなら、どんな設定でも不足する8 GBを補うことはできず、同シリーズの一段上のカードに投資するのが適切です。
- 出典:NVIDIA の公式仕様(RTX 5060 および 5060 Ti)
- 出典:OllamaがサポートするNVIDIA GPU
- 出典:Ollama公式FAQ(Flash Attention、K/Vキャッシュ)
#よくある質問
RTX 5060でLLMをローカル実行できますか?+
RTX 5060での1秒あたりのトークン数はどれくらいですか?+
LLMを動かすなら、RTX 5060とRTX 4060 Ti 16 GBのどちらを選ぶべきですか?+
RTX 5060のFP4は Ollama を加速するのでしょうか?+
RTX 5060にどのような電源が必要ですか?+
RTX 5060でRAGは可能ですか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。