2026年、1000ユーロ未満で選ぶローカルAI向けの最良のGPU
検索する 1,000ユーロ未満でAIに最適なGPU は、クラウドのサブスクリプションに頼らずLLMをローカルで動かしたい人にとって、重要な課題となっています。2026年、この価格帯のグラフィックカード市場には有力な選択肢がいくつかありますが、VRAMや量子化の制約を理解せずに選ぶのは、当てずっぽうで選ぶようなものです。オープンウェイトモデルの普及と、llama.cppのような推論ツールの成熟により、適切なカードを選べば、誰でもローカル推論を利用できるようになりました。本記事では、1,000ユーロ未満で入手できるGPU、1秒あたりのトークン数で測る実際の性能、ソフトウェアとの互換性、そしてこの予算で現実的に動かせるモデルを紹介します。
VRAM:ローカル推論における決定的な基準
GPUを比較する前に、ローカルでLLMを実行する際にビデオメモリ(VRAM)が制限要因となる理由を理解する必要があります。
メモリに読み込んだLLMが占有する容量は、パラメータ数と選択した量子化形式によって決まります:
- FP16(16ビット) :パラメータ10億個あたり約2 GB
- Q8(8ビット) :パラメータ10億個あたり約1 GB
- Q5(5ビット) :パラメータ10億個あたり約0.65 GB
- Q4 (4ビット) :10億パラメータあたり約0.5 GB(測定可能な軽微な品質低下あり)
例として、 Qwen 2.5 72B Instruct, 720億パラメータを持つため、quelllm.frのカタログ仕様によるとQ4で約42GBのVRAMを必要とします。 Llama 4 Scout 109Bは、MetaのMoEモデルで、公表されているパラメータ数は109Bです。スパースなアーキテクチャによりQ4では約65 GBまで減りますが、それでも価格帯にかかわらず、一般消費者向けカード1枚の容量を超えます。
GGUFの量子化は、 llama.cpp 現在、NVIDIA (CUDA) および AMD (ROCm) 上の GPU によるローカル推論の事実上の標準です。システム RAM にモデルの一部をオフロードすることも可能ですが、毎秒トークン数の大幅な低下を伴います。Q4、Q5、Q8 形式間のトレードオフを詳しく知りたい場合は、弊社の LLMの量子化に関するガイド.
2026年の1,000ユーロ未満のGPUの概観
現時点でこの予算内で購入できるグラフィックカードは以下のとおりです(2026年半ばのフランス市場における税込推定価格):
RTX 4070 Ti Super — 16 GB VRAM - 新品の推定価格 : 680–750 € - メモリ帯域 : 672 GB/s - アーキテクチャ :Ada Lovelace、CUDA 12.x - 対象となる用途 : Q5/Q8で最大約13B、またはQ4で部分的にオフロードを適用した場合の約30Bまで対応
RTX 4080 Super — 16GB VRAM - 新品の推定価格 : 850–950 € - メモリ帯域 : 736 GB/s - アーキテクチャ : Ada Lovelace - 利点 : 同じ負荷において4070 Ti Superと比べて約10%のスループット向上
RX 7900 XTX — 24GB VRAM - 新品の推定価格 : 850–950 € - メモリ帯域 : 960 GB/s - アーキテクチャ : RDNA 3、ROCm 6.x - 主要な利点 : 24GBのVRAMにより、より大きなモデルを完全にVRAMにロードできます
RTX 3090(中古市場)— 24 GB VRAM - 予想される中古価格 : 420–580 € - メモリ帯域 : 936 GB/s - アーキテクチャ : Ampere、CUDA 11/12 - コストパフォーマンス :LLMの純粋な推論用途では、この候補の中で最もコストパフォーマンスに優れています。RX 7900 XTXと同じVRAM容量を備え、価格は多くの場合その半分です
RTX 3090 Ti(中古市場)— 24 GB VRAM - 予想される中古価格 : 550–700 € - メモリ帯域 : 1 008 GB/s - 注記 :3090よりもわずかに高速ですが、中古市場ではあまり出回っていません
LLMの負荷に対しては、 生のTFLOPS値よりもVRAMが重要. 500ユーロの中古RTX 3090は、パラメータ数が13Bを超えるモデルにおいて、新規のRTX 4070 Ti Superと実用的に比較して優位性を示し、24GBのVRAMに対し16GBを備えることからその実力が確認できる。
1秒あたりのトークン数で見る性能:現実的な推定値
以下の数字は、コミュニティが公開したベンチマークに基づく推定値です Hugging Face Open LLM Leaderboard およびllama.cppコミュニティの報告書。これらはllama.cppのバージョン、ドライバー、システム構成によって異なります。
- RTX 3090 / 24 GB — Q4の7Bモデル : 80~120トークン/秒と推定
- RTX 3090 / 24 GB — 13Bモデル Q4 : 45~70トークン/秒と推定
- RTX 3090 / 24 GB — Q4の30Bモデル :推定15〜25トークン/秒(すべてVRAM内で実行)
- RTX 4070 Ti Super / 16 GB — 7B モデル(Q4) :推定90~130トークン/秒
- RTX 4070 Ti Super / 16 GB — 13Bモデル(Q4) : 50~75トークン/秒(推定)
- RX 7900 XTX / 24 GB — 13Bモデル(Q4) :推定50~80トークン/秒(ROCmのバージョンによって10~20%の変動が生じる可能性があります)
モデルが利用可能なVRAM容量を超えてCPUへのオフロードが必要になると、システムRAMの容量やPCIeバスの速度によっては、スループットが5〜15トークン/秒まで低下することがあり、生産的な利用が難しくなります。
ソフトウェア互換性:CUDA、ROCmおよび推論エコシステム
NVIDIA (CUDA) は、ローカルLLM推論で引き続き最も充実したサポートを受けられるプラットフォームです:
- llama.cppのCUDAバックエンド :安定性、最大限の性能、すべての量子化形式への対応
- フロントエンドエコシステム : LM Studio, Open WebUI, および大半の一般向けツールは CUDA を優先的に対象としています
- Drivers :成熟しており、ドキュメントが豊富で、定期的に更新されます
AMD (ROCm) はバージョン6.0以降、大きく進歩しています:
- llama.cppのROCmバックエンド :動作しますが、一部の高度な形式(IQ3、IQ4)では、同世代のNVIDIA GPUより10〜20%遅い場合があります。バージョンによって異なるため、確認が必要です
- 実用的な利点 :RX 7900 XTXは24 GBのVRAMを備え、RTX 4080 Superよりも安いため、エコシステムの成熟度では劣るものの、合理的な選択肢です
カタログのモデルがインフラに求めるもの
一点、はっきりさせておく必要があります: quelllm.fr のカタログに掲載されているモデル(最小でも71Bパラメータ)は、どれも1,000 €未満の GPU 1基の VRAM には完全には収まりません. は Qwen 2.5 72B Instruct はQ4で約42 GBを必要とします。一方、 DeepSeek R1 671B には約400GB必要です。
予算が限られているとこれらのモデルを使えない、という意味ではありません。ただし、次の点を伴います:
- CPU/RAMへのオフロード :llama.cppで可能ですが、スループットは推定5〜15トークン/秒まで低下します。テストには役立ちますが、本番運用には向きません
- マルチGPU構成 :中古のRTX 3090を2枚使えば(合計約800〜1,000ユーロ)、VRAMは合計48GBとなり、Qwen 2.5 72B Instruct(Q4で約42GB)を完全にVRAMに読み込めます。構成の詳細については、当サイトの RTX 3090とRTX 4090の比較 設定の詳細について
カタログの大規模モデルに関するプロジェクトについては、セクションをご覧ください モデルファミリー別のおすすめLLM インフラ要件に応じて選択肢を順位付けしています。
ユーザータイプ別の結論
初心者向け/予算が限られている方向け(予算600ユーロ未満) 以下のものを選考してください 中古RTX 3090。24GBのVRAM、Ampereの堅実な性能、中古市場で他に引けを取らない価格。購入前に放熱状態(サーマルグリス、ファン)を確認し、長期間の高負荷なマイニングに使われていないことを確かめてください。
中級者向け / 新品のハードウェアを推奨(600~800ユーロ) La RTX 4070 Ti Super は最も汎用性の高い選択肢です。VRAMは16 GBで、比較的新しいアーキテクチャを採用し、長期サポートにも優れ、消費電力は控えめです(TDP 285 W)。主な制約は、大規模モデル(30B以上)を実行するには、かなりの部分をシステムRAMへオフロードする必要があることです。
上級者向け / VRAMを最大限に確保(800~1,000 €) La RX 7900 XTX (24 GB、約900 €)または RTX 4080 Super (16 GB、約900 €) に応じて、VRAMの最大値とブレット速度およびソフトウェアの互換性の優先順位を決定してください。LLMに関しては、RX 7900 XTXが24 GBを備えるため優位ですが、ROCmエコシステムはCUDAに比べてまだ発展途上です。
FAQ
Q:2026年にローカルでLLMを実行するには16GBのGPUは十分ですか?
16GBあれば、CPUへのオフロードを少し使ってQ4で約30Bまでのモデルを実行できます。また、Q5/Q8なら約13Bまでのモデルを、オフロードなしで快適な生成速度で実行できます。quelllm.frのカタログにあるモデル(71B以上)には、マルチGPU構成でなければ16GBでは足りません。ローカル推論を試すにはよい入門構成ですが、必要な性能や容量が増えると明確な限界になります。
Q:LLMの使用目的で、新品か中古か、どちらが良いですか?
LLM 推論では、中古の Ampere 世代の GPU(RTX 3090、3090 Ti)は、24 GB の VRAM により、他ではなかなか得られない優れたコストパフォーマンスを提供します。主なリスクは、集中的なマイニング利用による機械的な摩耗です。取引履歴のある販売者から購入し、GPU ストレステストツールで負荷時の安定性を試し、メーカー保証の残存期間がある場合は適用されるか確認してください。
Q:RX 7900 XTXは実際にROCmでLLMを実行可能でしょうか?
はい。ROCm 6.xと最近のバージョンのllama.cppを使えば、RX 7900 XTXはローカル推論で十分に機能します。一部の高度な量子化形式では、同世代のNVIDIA GPUより性能がわずかに劣ります(バージョンごとの確認が必要です)。ただし、パラメータ数が13Bを超えるモデルでは、24 GBのVRAMという利点がその差を十分に補います。
Q:70Bモデルを実行するには、どのくらいのVRAMが必要ですか?
約72Bパラメータのモデルは、Q4で約42 GB必要です — これは~に示されている値です Qwen 2.5 72B Instruct quelllm.frのカタログ内。Q5では約50 GB、FP16では約144 GBを想定してください。これには、少なくとも24 GBのコンシューマー向けGPU 2基、または予算外のプロフェッショナル向けGPUが必要です。
Q:1,000ユーロ未満のGPUでLoRAファインチューニングを行うことは可能ですか?
PEFT/LoRAによるファインチューニングは、参考文献に記載されています。 arXiv:2106.09685、7B から 13B パラメータのモデルに対して 16–24 GB の VRAM で利用可能です。7B モデルの FP16 によるフルファインチューニングには、勾配を含むと約 30–40 GB 必要であり、これは 1,000 ユーロ未満の単一 GPU の容量を超えます。カタログ内のより大きなモデルについては、ローカルファインチューニングは一般向けの単一 GPU 構成では依然として手が届きません。
Q:モデル全体をVRAMに収めて推論する場合と、CPUにオフロードして推論する場合では、具体的にどのような違いがありますか?
完全にVRAMにモデルを配置した場合、GPUのメモリ帯域(例:RTX 3090で936GB/s)によって速度が制限されます。モデルのサイズに応じて、通常20~120トークン/秒となります。CPUにオフロードを適用した場合、PCIeのバス(実際にはPCIe 4.0 x16で約32GB/s)によって速度が制限され、10~30倍の速度低下が起こります。オフロードは実験に有用ですが、継続的な生産的な使用には適していません。
結論
を選択 1,000ユーロ未満でAIに最適なGPU 2026年には明確な選択肢が残ります。新しいカードで新規購入の場合、16GBのVRAMで一般的なモデルを使用するか、RTX 3090の24GB(中古)を用いて品質と価格のバランスを確保するかという判断になります。オープンウェイトの大型モデルにはより多くのインフラが必要ですが、小型モデルはこの予算内で依然としてアクセス可能かつパフォーマンスを維持できます。当社の 構成ツール あなたのGPUに適したLLMを特定するためには、または直接を探索してください quelllm.fr カタログ では、必要なVRAM容量とライセンスで249のモデルを絞り込めます。
LLMをローカルで実行するためのハードウェア
これらのモデルを快適にローカルで実行するには、 RTX 5070 Ti は優れたコストパフォーマンスを備えています。価格を比較してください:
アフィリエイトリンク — QuelLLMは購入に対して紹介料を受け取る場合があります。お客様に追加費用はかかりません。Amazonアソシエイトとして、QuelLLMは適格販売により収入を得ています。