初心者 11 分RTX 30

RTX 3050(6 / 8 GB)で使うならどの LLM? ?

端的な回答

RTX 3050 は、Q4 量子化の 30 億から 40 億パラメータの小型モデルを難なく動作させます。例えば Granite 4.1 3B(2 GB)や Qwen 3.5 4B(2.3 GB)などです。Q4 の 8B(Granite 4.2 8B、4.6 GB)は 8 GB 版に収まり、6 GB 版ではぎりぎり動作します。llama.cpp の公開表では、Q4_0 の 7B モデルで 6 GB 版が 37 tokens/s を記録しています。

RTX 3050 は、非常に異なる2つのデスクトップバージョンが存在します。2022年の8 GB版と、2024年の6 GB版です。後者はコア数が少なく、バス幅が狭く、消費電力は70 Wです。このガイドでは、測定された値と推定値を区別し、各バージョンに収まるモデルを示し、6 GBのカードから最大限の性能を引き出す方法を説明します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-09-30·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

このガイドで紹介する購入候補の別の選択肢: RTX 5060 Ti 16GB (ASUS Prime).

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — あなたに追加費用はかかりません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。

#2026年のRTX 3050:実行できるモデル

RTX 3050では、Q4量子化の30億〜40億パラメータのモデルを快適に実行できます。QuelLLMのカタログによると、Granite 4.1 3Bの容量は2 GB、Qwen 3.5 4Bは2.3 GBです。どちらも6 GB版と8 GB版に収まり、コンテキスト用の余裕もあります。Granite 4.2 8Bのような80億パラメータのモデル(Q4で4.6 GB)は8 GB版に収まりますが、llama.cppで使える容量が5,804 MiBしかない6 GB版ではぎりぎりです。Qwen 3.5 9Bのような9Bモデル(重みの容量は6 GB)は、どちらの版でも一部をシステムRAMに移さなければ収まりません。速度については、公開されている唯一の結果は6 GB版のもので、Q4_0の70億パラメータのモデルで毎秒37トークンです。チャットには十分ですが、モデルが大きくなるとカードはすぐに限界に達します。

#RTX 3050 6 GB または 8 GB:2つの異なるカード

NVIDIAは同じ名称で2つの製品を販売しました。両者の測定値を混ぜて扱うことはできません。同じメモリ条件では6GB版のほうが遅くなります。これは、96ビットのバスによって帯域幅が168GB/sに制限されるためで、8GB版の224GB/sを下回ります。

RTX 3050:2つのバージョン
基準RTX 3050 8GBRTX 3050 6GB
CUDAコア2 5602 304
メモリバス / バンド幅128ビット / 224 GB/s96ビット / 168 GB/s
GPUのパワーアップ130 W70 W
NVIDIA が推奨するシステム電源550 W300 W
Llama 2 7B Q4_0での生成未公表(45〜50トークン/秒と推定)37.4トークン/秒(公表された測定値)

8 GBの推定値では、224 GB/sの測定値が6 GBの理論的最大帯域幅に対する比率として約85%を達成しています。これは予測であり、結果として引用すべきではありません。70 Wの消費電力により、電源が制限されている古いPC向けに6 GBは魅力的です。ただし、NVIDIAのリストにはこのバージョン用の追加電源接続端子が記載されていません。

#メモリ容量別の対応モデル

RTX 3050で使えるモデル(重みのサイズはQuelLLMカタログに基づく)
モデルQ4 での重みRTX 3050 6GBRTX 3050 8GB
Granite 4.1 3B2 GB非常に余裕あり非常に余裕あり
Qwen 3.5 4B2.3 GB(Q8:4.3 GB)Q4なら余裕あり、Q8では余裕がほとんどない余裕があり、Q8も可能
Granite 4.2 8B4.6 GB制限:コンテキストが非常に短いまずまず。コンテキストは中程度。
Qwen 3.5 9B6 GB収まりません余裕はごくわずか、コンテキストは短め

守るべきルールは、コンテキストとシステムのために少なくとも1ギガバイトの空き領域を確保することです。6 GBのVRAMでは、llama.cppに実際に使用可能なメモリは5 804 MiB、つまり5.7 GBにわずかに届かない程度です。したがって、4.6 GBのモデルは使用可能ですが、コンテキストは短く保つ必要があります。8 GBのVRAMでは、同じモデルでも約3ギガバイトの余裕があります。6 GBのVRAMに関するガイドでは、快適に動作するモデルが詳しく説明されています。

#速度:測定値および推定値

llama.cppの共同編集のベンチマーク表には、2026年7月にVRAM 6 GBのRTX 3050での測定結果が追加されました。ファイルサイズ3.56 GiBのLlama 2 7BをQ4_0で動かした場合、生成速度は37.39トークン/秒です。Flash Attentionを使うと38.51トークン/秒になります。この結果には、注目すべき点が2つあります。まず、168 GB/sのメモリ帯域幅から得られる上限の約85%に達しており、効率は良好です。カードの性能を制限しているのはコアではなくメモリです。次に、生成が長くなると処理速度が下がります。2,048トークンの生成では33.52トークン/秒まで下がり、約10%の低下となります。

ファイルサイズに基づく比例計算で、他のモデルについても推定できます。これらは6 GB版の測定値から計算した理論上の上限であり、公開された結果ではありません。

RTX 3050 6 GBの推定値(37.4トークン/秒の実測値を基に比例計算)
モデルQ4 での重み推定生成速度
Granite 4.1 3B2 GB約70トークン/秒
Qwen 3.5 4B2.3 GB約60トークン/秒
Granite 4.2 8B4.6 GB約30トークン/秒

比較すると、RTX 3060 12 GBは同じテストで毎秒75.6トークンを生成し、3050 6 GBの2倍です。80億パラメータのモデルでは、この差をはっきり実感できます。3050 6 GBは理論上の推定では毎秒約30トークンまで低下するため、読める速度ではあるものの、人が読む速度より遅くなります。

#6 GB を効率的に活用するためのヒント

  1. 01
    パラメータ数が40億以下のモデルを選ぶ
    Qwen 3.5 4B または Granite 4.1 3B を Q4 で使用すると、3〜4 GBのメモリの余裕が残るため、十分な長さのコンテキストと、はるかに高い処理速度を確保できます。
  2. 02
    ビデオメモリの解放
    ブラウザ、ゲーム、および GPU を使用しているすべてのアプリケーションを閉じてください。6 GB の場合、他のアプリケーションが消費する 1 GB ごとに、利用可能なコンテキストが減少します。
  3. 03
    K/V キャッシュの量子化
    Ollamaのドキュメントには、Flash Attentionが有効な場合にK/Vキャッシュを量子化できると記載されています。サーバーを起動する前に、まずOLLAMA_FLASH_ATTENTION=1を設定し、次にOLLAMA_KV_CACHE_TYPE=q8_0を設定してください。
  4. 04
    読み込み状態を確認する
    最初のプロンプトを送信した後、ollama psを実行してください。Processor列には100% GPUと表示される必要があります。そうでなければ、モデルがGPUメモリに収まらず、一部がシステムメモリに回っているため、速度が大幅に低下します。
Linux:K/Vキャッシュが量子化されています
OLLAMA_FLASH_ATTENTION=1 OLLAMA_KV_CACHE_TYPE=q8_0 ollama serve

#手元にあるバージョンを確認する

両方のカードは同じ名前をもち、セール広告では常にメモリ容量が明記されていません。PCを開ける必要なしに、いくつかのヒントから判別できます。NVIDIAの仕様表では、カードの出力パワーが明確に区別されています。8GBモデルは130W、6GBモデルは70Wで、推奨されるシステム電源はそれぞれ550Wと300Wです。外部電源接続端子が付いていないカードは、非常におそらく6GBモデルです。ただし、メーカーの一部モデルでは外部電源接続端子を追加することがあります。カードをインストールした後、nvidia-smiコマンドで総メモリ容量が表示されます。6000MiB程度の値は小型モデルを、8000MiB程度の値は大型モデルを示します。また、6GBモデルのllama.cppテストでは5804MiBの実効メモリが確認されました。これは標定容量よりもわずかに少ない値です。

カードのメモリを表示
nvidia-smi --query-gpu=name,memory.total --format=csv

この確認は、コストのかかる混乱を避けるために重要です。8 GBの製品を購入したつもりが6 GBの製品が届くと、実行できる内容が変わります。なぜなら、Granite 4.2 8Bはそこではかろうじて実行可能になるからです。購入前に必ずnvidia-smiのスクリーンショットを要求し、メモリが明記されていない広告には応じないでください。リサイクルPCにすでにインストールされているカードについても同様です。Windowsに表示される名前だけでは、2つのバージョンを区別するのに十分ではありません。

#コンテキスト:6 GBでどこまで拡張できるか

llama.cppのテーブルによると、3050 6 GBの生成スループットは、生成トークン数が128から2,048に増加するにつれて10%低下します。メモリは第二の要因です。コンテキストキャッシュは、会話の長さに比例してVRAMを消費します。6 GBのカードで4BモデルのQ4(2.3 GB)を使用する場合、キャッシュに3 GB以上残るため、数千トークンのコンテキストを容易に処理できます。一方、4.6 GBの8Bモデルでは、約1 GBしか残らず、速度よりも先にコンテキストがボトルネックになります。

二つの習慣で、予期せぬ問題を避けることができます。まず、モデルが数十万トークンのコンテキストを宣言していても、必要な分だけにコンテキストウィンドウを意図的に制限してください。次に、長い文書を扱う場合は、分割してください。2,000トークンのテキストを3つ要約する方が、6,000トークンの1つを要約するよりもメモリ消費が少なくなります。コンテキストウィンドウに関するガイドでは、これらのトレードオフについて詳しく説明しています。

#ローカルAIでRTX 3050は実際に何に使えるのか

Q4 量子化の 30 億から 40 億パラメータのモデルであれば、特定のタスクに十分対応できます。テキストの要約、言い換え、メッセージの分類、短いドキュメントに関する単純な質問への回答、コードの自動補完などが挙げられます。8B モデルでの長時間の対話、大規模ドキュメントでの RAG、または最も高性能なモデルを必要とする推論タスクには不向きです。ボトルネックは速度だけではありません。小型モデルはエラーが多く、文脈をより早く失います。そのため、重要なトピックについては回答を確認し、人間による再確認なしに重大な決定を委ねないよう注意してください。

まずは低コストでローカルAIを試してみたいのであれば、このカードはその役割を果たします。日常的に使うアシスタントが欲しい場合は、8 GBのメモリで動かす8Bモデルが最低限です。12 GBあれば余裕が生まれ、中古価格なら手が届くことも多いです。

#2026年の結論

用途は小型モデルに限定
6 GBの場合は、パラメータ数40億以下のモデルにとどめてください。8 GBの場合は、Q4の8Bモデルが適度な長さのコンテキストで動作します。
12GBのカードを推奨します
3060 12 GBは測定されたスループットを2倍にし、120億パラメータのモデルを可能にします。中古価格の差は毎週変動します:追跡情報を参照してください。
購入時
3050を選ぶのは、すでにPCに搭載されている場合か、予算が非常に限られている場合だけにしてください。6GB版か8GB版かを確認してください。販売情報では必ずしも明記されていません。

#よくある質問

よくある質問
RTX 3050はLLMを実行できるのでしょうか?+
はい、小型モデルなら動かせます。Granite 4.1 3B(2GB)やQwen 3.5 4B(2.3GB)のような、Q4の3Bまたは4Bモデルなら余裕で収まります。llama.cppの公開表では、6GB版で7BのQ4_0モデルを動かした場合、毎秒37トークンとされています。80億パラメータ以上のモデルは容量の限界に近くなります。
ローカルAIにはRTX 3050の6GB版と8GB版のどちらを選ぶべきですか?+
価格差が妥当であれば8GBを選択してください。6GBは2304コアに対し2560コア、96ビットバスに対し128ビット、帯域幅は168GB/sに対し224GB/sであり、同等のメモリ性能においてより遅いです。しかし、70Wの消費電力は電源が制限されたPCにとって利点となります。
RTX 3050 6GBでどのモデルを選べばよいですか?+
Q4で量子化した、パラメータ数が40億以下のモデルを選んでください。Qwen 3.5 4B(2.3 GB)またはGranite 4.1 3B(2 GB)なら、コンテキスト用のメモリに余裕が残ります。Granite 4.2 8B(4.6 GB)も使用できますが、カードで利用できるメモリは5,804 MiBしかないため、コンテキストは短くする必要があります。Qwen 3.5 9B(6 GB)は収まりません。
RTX 3050での1秒あたりのトークン数は?+
6 GB版については、llama.cppの公開テーブルでは、7BのQ4_0で37.4トークン/秒、2,048トークン生成時に33.5と記載されています。より軽量なモデルの方が速く、4Bについては理論的な推定で約60トークン/秒です。8 GB版については、公開された測定値は存在しません。
LLM用にはRTX 3050とRTX 3060 12 GBのどちらを選ぶべきですか?+
予算が許せば迷わず3060 12 GBです。同じテストで3050 6 GBが37.4トークン/秒であるのに対し、75.6トークン/秒を生成し、12 GBのメモリは120億パラメータのモデルを可能にします。3050は、すでにインストールされている場合や、予算が非常に限られている場合のみ価値があります。
Ollama は RTX 3050 で動作しますか?+
はい。Ollama は RTX 3050 を 8.6 の計算能力を持つカードとしてリストアップしており、550 以上のドライバーが必要とします。最初のロード後、ollama ps でモデルが GPU で 100%に達しているかを確認してください。6GBのメモリでは、モデルが大きすぎるとすぐにRAMに切り替わってしまいます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。