RTX 3050(6 / 8 GB)で使うならどの LLM? ?
RTX 3050 は、Q4 量子化の 30 億から 40 億パラメータの小型モデルを難なく動作させます。例えば Granite 4.1 3B(2 GB)や Qwen 3.5 4B(2.3 GB)などです。Q4 の 8B(Granite 4.2 8B、4.6 GB)は 8 GB 版に収まり、6 GB 版ではぎりぎり動作します。llama.cpp の公開表では、Q4_0 の 7B モデルで 6 GB 版が 37 tokens/s を記録しています。
RTX 3050 は、非常に異なる2つのデスクトップバージョンが存在します。2022年の8 GB版と、2024年の6 GB版です。後者はコア数が少なく、バス幅が狭く、消費電力は70 Wです。このガイドでは、測定された値と推定値を区別し、各バージョンに収まるモデルを示し、6 GBのカードから最大限の性能を引き出す方法を説明します。
マシンを選んでいるところですか? 予算別のおすすめ →
このガイドで紹介する購入候補の別の選択肢: RTX 5060 Ti 16GB (ASUS Prime).
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。
#2026年のRTX 3050:実行できるモデル
RTX 3050では、Q4量子化の30億〜40億パラメータのモデルを快適に実行できます。QuelLLMのカタログによると、Granite 4.1 3Bの容量は2 GB、Qwen 3.5 4Bは2.3 GBです。どちらも6 GB版と8 GB版に収まり、コンテキスト用の余裕もあります。Granite 4.2 8Bのような80億パラメータのモデル(Q4で4.6 GB)は8 GB版に収まりますが、llama.cppで使える容量が5,804 MiBしかない6 GB版ではぎりぎりです。Qwen 3.5 9Bのような9Bモデル(重みの容量は6 GB)は、どちらの版でも一部をシステムRAMに移さなければ収まりません。速度については、公開されている唯一の結果は6 GB版のもので、Q4_0の70億パラメータのモデルで毎秒37トークンです。チャットには十分ですが、モデルが大きくなるとカードはすぐに限界に達します。
#RTX 3050 6 GB または 8 GB:2つの異なるカード
NVIDIAは同じ名称で2つの製品を販売しました。両者の測定値を混ぜて扱うことはできません。同じメモリ条件では6GB版のほうが遅くなります。これは、96ビットのバスによって帯域幅が168GB/sに制限されるためで、8GB版の224GB/sを下回ります。
| 基準 | RTX 3050 8GB | RTX 3050 6GB |
|---|---|---|
| CUDAコア | 2 560 | 2 304 |
| メモリバス / バンド幅 | 128ビット / 224 GB/s | 96ビット / 168 GB/s |
| GPUのパワーアップ | 130 W | 70 W |
| NVIDIA が推奨するシステム電源 | 550 W | 300 W |
| Llama 2 7B Q4_0での生成 | 未公表(45〜50トークン/秒と推定) | 37.4トークン/秒(公表された測定値) |
8 GBの推定値では、224 GB/sの測定値が6 GBの理論的最大帯域幅に対する比率として約85%を達成しています。これは予測であり、結果として引用すべきではありません。70 Wの消費電力により、電源が制限されている古いPC向けに6 GBは魅力的です。ただし、NVIDIAのリストにはこのバージョン用の追加電源接続端子が記載されていません。
#メモリ容量別の対応モデル
| モデル | Q4 での重み | RTX 3050 6GB | RTX 3050 8GB |
|---|---|---|---|
| Granite 4.1 3B | 2 GB | 非常に余裕あり | 非常に余裕あり |
| Qwen 3.5 4B | 2.3 GB(Q8:4.3 GB) | Q4なら余裕あり、Q8では余裕がほとんどない | 余裕があり、Q8も可能 |
| Granite 4.2 8B | 4.6 GB | 制限:コンテキストが非常に短い | まずまず。コンテキストは中程度。 |
| Qwen 3.5 9B | 6 GB | 収まりません | 余裕はごくわずか、コンテキストは短め |
守るべきルールは、コンテキストとシステムのために少なくとも1ギガバイトの空き領域を確保することです。6 GBのVRAMでは、llama.cppに実際に使用可能なメモリは5 804 MiB、つまり5.7 GBにわずかに届かない程度です。したがって、4.6 GBのモデルは使用可能ですが、コンテキストは短く保つ必要があります。8 GBのVRAMでは、同じモデルでも約3ギガバイトの余裕があります。6 GBのVRAMに関するガイドでは、快適に動作するモデルが詳しく説明されています。
#速度:測定値および推定値
llama.cppの共同編集のベンチマーク表には、2026年7月にVRAM 6 GBのRTX 3050での測定結果が追加されました。ファイルサイズ3.56 GiBのLlama 2 7BをQ4_0で動かした場合、生成速度は37.39トークン/秒です。Flash Attentionを使うと38.51トークン/秒になります。この結果には、注目すべき点が2つあります。まず、168 GB/sのメモリ帯域幅から得られる上限の約85%に達しており、効率は良好です。カードの性能を制限しているのはコアではなくメモリです。次に、生成が長くなると処理速度が下がります。2,048トークンの生成では33.52トークン/秒まで下がり、約10%の低下となります。
ファイルサイズに基づく比例計算で、他のモデルについても推定できます。これらは6 GB版の測定値から計算した理論上の上限であり、公開された結果ではありません。
| モデル | Q4 での重み | 推定生成速度 |
|---|---|---|
| Granite 4.1 3B | 2 GB | 約70トークン/秒 |
| Qwen 3.5 4B | 2.3 GB | 約60トークン/秒 |
| Granite 4.2 8B | 4.6 GB | 約30トークン/秒 |
比較すると、RTX 3060 12 GBは同じテストで毎秒75.6トークンを生成し、3050 6 GBの2倍です。80億パラメータのモデルでは、この差をはっきり実感できます。3050 6 GBは理論上の推定では毎秒約30トークンまで低下するため、読める速度ではあるものの、人が読む速度より遅くなります。
#6 GB を効率的に活用するためのヒント
- 01パラメータ数が40億以下のモデルを選ぶQwen 3.5 4B または Granite 4.1 3B を Q4 で使用すると、3〜4 GBのメモリの余裕が残るため、十分な長さのコンテキストと、はるかに高い処理速度を確保できます。
- 02ビデオメモリの解放ブラウザ、ゲーム、および GPU を使用しているすべてのアプリケーションを閉じてください。6 GB の場合、他のアプリケーションが消費する 1 GB ごとに、利用可能なコンテキストが減少します。
- 03K/V キャッシュの量子化Ollamaのドキュメントには、Flash Attentionが有効な場合にK/Vキャッシュを量子化できると記載されています。サーバーを起動する前に、まずOLLAMA_FLASH_ATTENTION=1を設定し、次にOLLAMA_KV_CACHE_TYPE=q8_0を設定してください。
- 04読み込み状態を確認する最初のプロンプトを送信した後、ollama psを実行してください。Processor列には100% GPUと表示される必要があります。そうでなければ、モデルがGPUメモリに収まらず、一部がシステムメモリに回っているため、速度が大幅に低下します。
#手元にあるバージョンを確認する
両方のカードは同じ名前をもち、セール広告では常にメモリ容量が明記されていません。PCを開ける必要なしに、いくつかのヒントから判別できます。NVIDIAの仕様表では、カードの出力パワーが明確に区別されています。8GBモデルは130W、6GBモデルは70Wで、推奨されるシステム電源はそれぞれ550Wと300Wです。外部電源接続端子が付いていないカードは、非常におそらく6GBモデルです。ただし、メーカーの一部モデルでは外部電源接続端子を追加することがあります。カードをインストールした後、nvidia-smiコマンドで総メモリ容量が表示されます。6000MiB程度の値は小型モデルを、8000MiB程度の値は大型モデルを示します。また、6GBモデルのllama.cppテストでは5804MiBの実効メモリが確認されました。これは標定容量よりもわずかに少ない値です。
この確認は、コストのかかる混乱を避けるために重要です。8 GBの製品を購入したつもりが6 GBの製品が届くと、実行できる内容が変わります。なぜなら、Granite 4.2 8Bはそこではかろうじて実行可能になるからです。購入前に必ずnvidia-smiのスクリーンショットを要求し、メモリが明記されていない広告には応じないでください。リサイクルPCにすでにインストールされているカードについても同様です。Windowsに表示される名前だけでは、2つのバージョンを区別するのに十分ではありません。
#コンテキスト:6 GBでどこまで拡張できるか
llama.cppのテーブルによると、3050 6 GBの生成スループットは、生成トークン数が128から2,048に増加するにつれて10%低下します。メモリは第二の要因です。コンテキストキャッシュは、会話の長さに比例してVRAMを消費します。6 GBのカードで4BモデルのQ4(2.3 GB)を使用する場合、キャッシュに3 GB以上残るため、数千トークンのコンテキストを容易に処理できます。一方、4.6 GBの8Bモデルでは、約1 GBしか残らず、速度よりも先にコンテキストがボトルネックになります。
二つの習慣で、予期せぬ問題を避けることができます。まず、モデルが数十万トークンのコンテキストを宣言していても、必要な分だけにコンテキストウィンドウを意図的に制限してください。次に、長い文書を扱う場合は、分割してください。2,000トークンのテキストを3つ要約する方が、6,000トークンの1つを要約するよりもメモリ消費が少なくなります。コンテキストウィンドウに関するガイドでは、これらのトレードオフについて詳しく説明しています。
#ローカルAIでRTX 3050は実際に何に使えるのか
Q4 量子化の 30 億から 40 億パラメータのモデルであれば、特定のタスクに十分対応できます。テキストの要約、言い換え、メッセージの分類、短いドキュメントに関する単純な質問への回答、コードの自動補完などが挙げられます。8B モデルでの長時間の対話、大規模ドキュメントでの RAG、または最も高性能なモデルを必要とする推論タスクには不向きです。ボトルネックは速度だけではありません。小型モデルはエラーが多く、文脈をより早く失います。そのため、重要なトピックについては回答を確認し、人間による再確認なしに重大な決定を委ねないよう注意してください。
まずは低コストでローカルAIを試してみたいのであれば、このカードはその役割を果たします。日常的に使うアシスタントが欲しい場合は、8 GBのメモリで動かす8Bモデルが最低限です。12 GBあれば余裕が生まれ、中古価格なら手が届くことも多いです。
#2026年の結論
- 用途は小型モデルに限定
- 6 GBの場合は、パラメータ数40億以下のモデルにとどめてください。8 GBの場合は、Q4の8Bモデルが適度な長さのコンテキストで動作します。
- 12GBのカードを推奨します
- 3060 12 GBは測定されたスループットを2倍にし、120億パラメータのモデルを可能にします。中古価格の差は毎週変動します:追跡情報を参照してください。
- 購入時
- 3050を選ぶのは、すでにPCに搭載されている場合か、予算が非常に限られている場合だけにしてください。6GB版か8GB版かを確認してください。販売情報では必ずしも明記されていません。
#よくある質問
RTX 3050はLLMを実行できるのでしょうか?+
ローカルAIにはRTX 3050の6GB版と8GB版のどちらを選ぶべきですか?+
RTX 3050 6GBでどのモデルを選べばよいですか?+
RTX 3050での1秒あたりのトークン数は?+
LLM用にはRTX 3050とRTX 3060 12 GBのどちらを選ぶべきですか?+
Ollama は RTX 3050 で動作しますか?+
- 出典:CUDA での llama.cpp の性能表
- 出典:NVIDIAのRTX 3050製品ページ
- 出典:Ollama がサポートする NVIDIA カード
- 出典:Ollama FAQ(ollama ps、K/Vキャッシュ)
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。