初心者 11 分RTX 50

RTX 5060(8 GB)で使えるLLMは? ?

端的な回答

RTX 5060 は、8 GB の GDDR7 メモリと 448 GB/s の帯域幅を備え、RTX 4060 より帯域幅が 65% 広くなっています。Q4 に量子化した 30億〜90億パラメータのモデルを無理なく動かせます。例えば Granite 4.2 8B(5.3 GB)や Qwen 3.5 9B(6.6 GB)が該当し、8B モデルでの生成速度の理論上限は約 85 トークン/秒です。制約となるのはメモリ容量で、12B 以上のモデルは実用的なコンテキストを確保すると収まりません。

RTX 5060は、公衆市場でLLMのローカル実行に最も速い8GBメモリのGPUであり、GDDR7メモリによってその性能が実現されています。しかし8GBは8GBです。このガイドでは、実際に使える内容、期待できる速度、バウンドを回避する設定 Ollama、そしてRTX 5060 Ti 16GBがより良い選択となるタイミングについて記載しています。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このセットアップの場合: RTX 5060 Ti 16 GB.

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — お客様の追加負担なしで、当サイトが紹介料を受け取る場合があります。Amazonのパートナーとして、QuelLLMは所定の条件を満たす購入から収益を得ます。

#RTX 5060でローカルLLMを使う:8 GBのGDDR7でできること

RTX 5060は、Q4の30億~90億パラメータのモデルを難なく動かせます。Ollamaのライブラリによると、Qwen 3.5 4Bは3.4GB、Granite 4.2 8Bは5.3GB、Qwen 3.5 9Bは6.6GBです。いずれもカードの8GBに収まりますが、最後のモデルではコンテキストを短くする必要があります。Gemma 4 12B(7.7~8GB)のような12Bモデルでは、コンテキストを1トークンも追加する前にメモリを使い切ってしまいます。このカードの強みはメモリ帯域幅です。128ビットバスで448GB/sと、RTX 4060の272GB/sを65%上回ります。チャット、要約、小規模なRAGには、5060は十分な余裕があります。9Bを超えるモデルを使うには、速度ではなく、より多くのVRAMが必要です。

アーキテクチャ
NVIDIA によると、Blackwell アーキテクチャ、3,840基の CUDA コア、第5世代の Tensor Core を搭載しています。
メモリ
8GBのGDDR7で128ビットバス、帯域幅448GB/s
消費電力
総グラフィックス消費電力は145W。NVIDIAが示すPC全体の電源容量の最低要件は550Wです。
発売価格
299ドル。Wikipediaによると、発売日は2025年5月19日です。

#なぜ5060が同じ容量の4060よりも速いのか?

生成プロセスでは、各トークンがGPUがモデルの大部分の重みを再読み込みを必要とします。したがって、最大速度は帯域幅を重みのサイズで割った値になります。5060は4060と比べてメモリを65%速く読み込みます。同じモデルの場合、理論的な上限も同様の割合で上昇します。これはLLMにとって唯一の技術的根拠です。CUDAコアはプロンプトの読み込みに役立ちますが、生成はメモリの制限によって制約されます。

8GBのグラフィックカード:5.3GBのモデルでの帯域幅と上限
カードメモリ帯域幅5.3GBモデルでの上限
RTX 40608 GB GDDR6272GB/s51トークン/秒
RTX 50608GB GDDR7448 GB/s85トークン/秒

#8 GB に収まるモデルはどれか

RTX 5060で使うモデル(Ollamaでのサイズ、モデルの重みのみ)
モデルサイズ8 GBでの余裕判定
Qwen 3.5 4B3.4 GB4.6 GB快適に動作し、長いコンテキストも利用可能
Granite 4.2 8B5.3 GB2.7 GB適度な長さのコンテキストなら快適
Qwen 3.5 9B6.6 GB1.4 GB余裕が少なく、コンテキストは短め
Gemma 4 12B7.7~8.0 GB0 GB またはそれ以下実用的なコンテキスト長ではメモリに収まらない

Gemma 4 12B は、ファイルサイズだけで判断する落とし穴を示しています。重みは7.7〜8GBを占めますが、グラフィックカードにはコンテキストキャッシュと画面表示用のメモリも必要です。モデルは読み込めますが、扱えるコンテキストはせいぜい数千トークンで、アプリケーションが少しでもVRAMを使うと、収まりきらない分がシステムRAMに移されます。VRAMが8GBの場合、Qwen 3.5 9B または Granite 4.2 8B のほうが無理なく使える選択肢で、実用的なメモリの余裕も確保できます。

#画像、ビジョン、量子化:2つの補足事項

Ollamaのモデルライブラリによると、Qwen 3.5はテキストと画像を入力として受け付けます。そのため、4Bまたは9Bのモデルでスクリーンショットを説明したり、図を読み取ったりできます。画像はコンテキストを消費するため、8 GBではメモリの余裕が減ります。空き容量を確保したい場合は、画像処理には4B(3.4 GB)を選んでください。量子化については、8 GBではQ4_K_Mが引き続きバランスのよい選択です。より高精度の量子化に切り替えると、モデルの重みの容量が数百MB増えますが、このカードにはその分の余裕がありません。通常の用途では、目に見える違いもありません。

#Ollamaをインストールし、カードを確認する

  1. 01
    NVIDIAドライバー
    Ollama は NVIDIA 550 以上のドライバーを必要とします。RTX 50 であれば、NVIDIA が提供する最新ドライバーをインストールしてください。nvidia-smi で確認してください。
  2. 02
    Ollama のインストール
    RTX 5060は対応カードの一覧に含まれています(Compute Capability 12.0)。CUDAは同梱されているため、別途インストールする必要はありません。
  3. 03
    最初のモデル
    ollama run qwen3.5:9b(6.6 GB)を実行してください。メモリに余裕を残したい場合は、代わりにollama run granite4.2:8b(5.3 GB)を実行してください。
  4. 04
    制御
    ollama ps を実行してください:PROCESSOR 列が 100 % GPU であることを確認してください。

#期待できる速度:測定値ではなく上限

ここで示す生成速度は、いずれも当サイト独自の実測値ではありません。生成速度の上限は、メモリ帯域幅をモデルの重みのサイズで割った値です。公開されている第三者の測定結果(2024年5月、llama.cppでQ4_K_M版のLLaMA 3 8Bを使用)では、上限が156トークン/秒のRTX 4080で106トークン/秒、つまり約68%を記録しています。概算として70%を採用すると、短いコンテキストでの推定値は次のとおりです。

RTX 5060における理論的な上限(448 GB/s)
モデル (Q4)モデル容量上限70 % での推定
Qwen 3.5 4B3.4 GB132トークン/秒約92トークン/秒
Granite 4.2 8B5.3 GB85トークン/秒約59トークン/秒
Qwen 3.5 9B6.6 GB68トークン/秒約48トークン/秒
Gemma 4 12B7.7 GB58 tokens/s約40トークン/秒、コンテキストが非常に制限されています

これらの上限値はいずれも、快適に読める速度の目安である毎秒15〜20トークン程度を大きく上回っています。したがって、5060の制約になるのは速度ではなく、8GBというメモリ容量です。

#8GBを超えないようにOllamaを設定する

Ollamaでは、K/Vキャッシュをq8_0に量子化することで、デフォルトのf16と比べてメモリ使用量を約半分に抑えられます。ドキュメントによれば、精度の低下はごくわずかです。これにはFlash Attentionが必要です。8GBの環境では、これが最も効果的な対策です。モデルを変更せずにコンテキストを長くできます。

Ollama サーバーの設定(Linux、macOS)
export OLLAMA_FLASH_ATTENTION=1
export OLLAMA_KV_CACHE_TYPE=q8_0
export OLLAMA_CONTEXT_LENGTH=8192
ollama serve
1 つのモデルのみ
一度に 1 つのモデルのみをロードしてください。RAG 用の埋め込みモデルは小さく保つ必要があります。
リソースを多く消費するアプリケーション
ハードウェアアクセラレーションを使用するブラウザ、ゲーム、動画エンコード用のアプリは VRAM を確保するため、ロードする前に終了してください。
適切なコンテキスト
コンテキストの倍増はK/Vキャッシュの倍増を意味します:必要なタスクに対してのみ増やしてください。
監視
長い生成処理の実行中にnvidia-smiを確認すると、実際にどれだけ余裕があるかがわかります。

#8GBで実際に何ができるか

適切な基準は、要求されるタスクであり、モデルのサイズではありません。チャットや言い換えは、4Bでも8Bでも行えます。数十ページに及ぶ文書の要約には、8,000トークンから16,000トークンのコンテキストが必要です。q8_0のK/Vキャッシュを使用する場合、8Bモデルは8 GBでこれを実現できます。RAGは、生成モデル、埋め込みモデル、および検索された抜粋のコンテキストを組み合わせます。生成モデルは9B以下に保ってください。コードアシスタントは最も制約が厳しいケースであり、専門モデルはすぐにビデオカードの容量を超えてしまいます。

RTX 5060 (8 GB) での使用例
用途現実的?推奨設定
日常会話、短い質問はいGranite 4.2 8B, デフォルトのコンテキスト
10ページから30ページまでのドキュメントの要約はい、8,192トークンから16,384トークンのコンテキストに対応可能ですq8_0のK/Vキャッシュ、Flash Attention
ご自身のファイルを使ったRAGはい、4Bから8Bのモデルで可能です軽量な埋め込み、生成モデルは1つだけ
リポジトリでのコードアシスタント限定販売4B〜8Bのモデル、短い抜粋
14GB以上のモデルいいえ16GBのVRAMを用意する

モデルがGPUのVRAMに収まりきらなくても、生成は停止しません。一部の重みがシステムRAMから読み込まれます。その兆候は、生成速度の急激な低下です。ollama ps コマンドはGPUとCPUへの割り当てを表示します。100 % GPUと表示される行は正常ですが、GPUとCPUに分かれている行は、モデルがVRAMに収まりきっていないことを示します。コンテキストを短くするか、モデルを変更することで解消できます。

#5060では足りなくなったとき

メモリをさらに必要とすることを示す三つのシグナルがあります。高品質な文章作成のために 12B 以上のモデルを求めている場合。長いドキュメントにより、コンテキストが定期的に 16 000 トークンを超えている場合。生成、埋め込み、リランカーの複数のモデルを同時に読み込んでいる場合。これらの場合、速度を追加しても何も変わりません。不足しているのは容量であり、次の段階は 12 GB と 16 GB のページで説明されています。

#5060か5060 Ti 16GBか:重要な選択

RTX 5060 Ti 16 GBは、128ビットのバスで同じGDDR7メモリを使用しており、Wikipediaによるとメモリ帯域幅も同じ448 GB/sです。実質的な違いは、4,608基のCUDAコアと16 GBのメモリです。そのため、両方のカードに収まるモデルなら生成速度は同じですが、5060には収まらない14 GBのモデルも読み込めます。発売時の希望小売価格は、5060が299ドル、5060 Ti 8 GBが379ドル、5060 Ti 16 GBが429ドルでした。130ドル多く払うことで、メモリ容量が2倍になります。

RTX 5060 と RTX 5060 Ti:LLM の利用で何が違うか
基準RTX 5060RTX 5060 Ti 16 GB
メモリ8GB GDDR716 GB GDDR7
帯域幅448 GB/s448 GB/s
CUDAコア3 8404 608
グラフィック性能145 W180 W
電源の最低要件550 W600 W
14GBのモデル(gpt-oss 20B、Mistral Small 24B)いいえはい、2GBの余裕があります

#2026年の結論

5060 の購入を勧める条件
使うモデルが4B〜9Bで、予算が限られており、保証付きの新品を希望する場合です。8GBのカードでは最速です。
次の場合は 5060 Ti 16 GB を選ぶ
12B~24Bのモデルを使いたい場合は、速度よりも容量が重要で、追加費用もわずかです。
5060を避けたほうがよいのは、次の場合です
Gemma 4 12B、gpt-oss 20B、またはサイズが8 GBを超えるモデルを本格的に使う予定がある。

一言でまとめると、5060は容量ではなく、速度と価格を理由に選ぶ8 GBのグラフィックカードです。用途に必要なメモリが8 GBに収まるなら、新品ではこれに勝るカードを見つけるのは難しいでしょう。収まらないなら、どんな設定でも不足する8 GBを補うことはできず、同シリーズの一段上のカードに投資するのが適切です。

#よくある質問

FAQ
RTX 5060でLLMをローカル実行できますか?+
はい、Q4 なら約 90 億パラメータまでです。Granite 4.2 8B(5.3 GB)と Qwen 3.5 9B(6.6 GB)は、このカードの 8 GB の VRAM に収まります。それを超える Gemma 4 12B(7.7〜8 GB)などでは、コンテキスト用の空き容量がなくなり、モデルの一部がシステム RAM に回されます。
RTX 5060での1秒あたりのトークン数はどれくらいですか?+
ここでは信頼できる測定値は公開されていません。理論上の上限は、448GB/sの帯域幅をモデルサイズで割った値で、Granite 4.2 8B(5.3GB)では約85トークン/秒です。この上限の70%なら約59トークン/秒となります。これは推定値であり、コンテキストが長くなるほど低下します。
LLMを動かすなら、RTX 5060とRTX 4060 Ti 16 GBのどちらを選ぶべきですか?+
8GBに収まるモデルでは、5060の方が高速です。メモリ帯域幅は448GB/sで、比較対象は288GB/sです。gpt-oss 20Bのような14GBのモデルには、4060 Ti 16GBだけが適しています。したがって、まず使用したいモデルのサイズ、次に4060 Tiの中古価格に応じて選ぶことになります。
RTX 5060のFP4は Ollama を加速するのでしょうか?+
NVIDIAは第5世代Tensor CoresのFP4を強調しています。Ollamaの現在のモデルはQ4_K_M形式であり、FP4形式ではありません。ここではそのような利点は文書化されていません。生成を高速化する要因は448 GB/sの帯域幅です。
RTX 5060にどのような電源が必要ですか?+
NVIDIA は、全体のグラフィックスパワーが145Wで、PC全体の最小電源が550Wであることを示しています。この数値にはプロセッサや消費ピークへの余裕が含まれています。550Wクラスの高品質電源は適しています。5060 Tiは600Wが必要です。
RTX 5060でRAGは可能ですか?+
はい。4B〜8Bの生成モデルと軽量な埋め込みモデルを使えば可能です。読み込んだ状態にする生成モデルは一つだけにし、K/Vキャッシュをq8_0で有効にして、コンテキストは抜粋に必要な範囲に制限してください。それを超えると、8 GBという容量が制約要因になります。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。