予算ガイド · 2026年更新
ローカルLLMスタックの構築 予算に応じて
2026年にQwen 3、Gemma 3、DeepSeek R1の蒸留モデルを実用的な速度で実際に動かせる、最も安価なハードウェアとモデルの組み合わせ。
予算に合うマシンは?
予算と優先事項を入力してください。このツールは、その範囲内に収まるマシン、そのマシンが実行可能な LLM、および今週の確認済み価格を提示します。
このガイドの読み方
二つの変数の値を決めてください: 予算 と 主な用途。それ以外のすべて——量子化、ランタイム、コンテキスト長——はそこから決まります。まずVRAMを基準に、8Kのコンテキストでも余裕を持ってQ4_K_Mで収まる最大のモデルを選び、その後にランタイムを選んでください。
基本ルール:GGUF Q4_K_M形式のモデルは約 (paramètres × 0,6) Go のVRAMに加え、8Kでは約1.5 GBのKVキャッシュが必要です。そのため、14Bモデルには約10 GBが必要となり、中古のRTX 3060 12 GBが依然としてコストパフォーマンスの基準となる理由もここにあります。
予算の段階を選んでください
| 段階 | 予算 | 参考構成 | VRAM / 統合メモリ | 最適モデル (Q4_K_M) |
|---|---|---|---|---|
| 入力 | 400-550 € | 中古のRyzen 7 5700UミニPC、16GB DDR4 | 0 GB GPU / 16 GB RAM | Qwen3 4B |
| コストパフォーマンス | 850-1 000 € | Ryzen 5 7600 + RTX 3060 12 GB(中古)+ 32 GB DDR5 | 12 GB | Qwen 3 14B または Qwen 2.5 Coder 14B |
| パフォーマンス | 1 400-1 600 € | Ryzen 7 7700 + 中古のRTX 3090 24 GB + 64 GB DDR5 | 24 GB | Qwen3-Coder 30B-A3B または DeepSeek-R1-Distill-Qwen-32B |
| 静音 | ≈ 2 000 € | Apple Mac mini M5 Pro 24 GB (新品) | 約16GBの使用可能なメモリ | Qwen 3 14B |
2026年半ばのフランス/EU中古市場における参考価格です。中古市場の価格は変動するため、購入前に最新の価格を確認してください。
第2段階 — 900ユーロの最有力候補
大多数の読者におすすめするのは、この段階です。中古のRTX 3060 12GBは、中古市場でおよそ200〜240€で取引されています。12GBのVRAMは、14Bクラスのモデルにちょうど適した容量です。
| モデル(Q4_K_M) | 使用されるVRAM | トークン/秒(推定値) | おすすめの用途 |
|---|---|---|---|
| Qwen 3 8B | ~6 GB | ~50 | チャット、RAG |
| Qwen 2.5 Coder 14B | ~10 GB | ~28 | コード補完、リファクタリング |
| Gemma 3 12B | ~8 GB | ~34 | 多言語対応、文書に基づく質問応答 |
| DeepSeek-R1-Distill-Qwen-14B | ~10 GB | ~28 | 段階的推論 |
これは推定値であり、QuelLLMによる実測値ではありません。理論上限(RTX 3060のメモリ帯域幅360 GB/秒をモデルサイズで割った値)の約70%です。Q4の8Bモデルの上限は約72トークン/秒、14Bモデルの上限は約40トークン/秒です。
実行環境:Ollama、llama.cppまたはvLLM?
- Ollama — 単一ユーザーのデスクトップ環境での使用に最適です。GGUFを自動的にダウンロードし、OpenAI互換APIを提供し、Open WebUIに1コマンドで統合できます。
- llama.cpp — CPUやユニファイドメモリでトークン/秒の性能を限界まで引き出したい場合に最適です。CLIの扱いにはより専門的な知識が必要ですが、移植性はより優れています。
- vLLM — PagedAttentionと連続バッチ処理により、複数のユーザーやエージェントからのリクエストを並行して処理するのに最適です。
ソロ開発者 → デフォルトで Ollama。3人以上のチーム → FastAPI の小さなプロキシ経由で vLLM。
消費電力、騒音、総コスト
| Config | アイドル時(W) | 負荷時の消費電力(W) | kWh/年(充電時間4時間/日) | 年間コスト(0.20 €/kWhの場合) |
|---|---|---|---|---|
| エントリーレベルのミニPC | 8 | 35 | 51 | 10,20 € |
| 3060の価値 | 45 | 220 | 321 | 64,20 € |
| 3090 のパフォーマンス | 50 | 360 | 526 | 105,10 € |
| Mac mini (Proチップ) | 6 | 65 | 95 | 19,00 € |
消費電力はおおよその値です。計算式:負荷時の消費電力 × 4時間 × 365日。それ以外の時間はマシンの電源を切る想定です。アイドル状態でも電源を入れたままにする場合は、アイドル時の消費電力 × 20時間 × 365日を加えてください。
最も消費電力の大きい構成でも、このペースでは年間約105ユーロの電気代がかかります。これは月額20ユーロのサブスクリプションの5か月分をわずかに超える額です。
判定
| 利用者タイプ | 推奨されるレベル | なぜ |
|---|---|---|
| 試してみたい方、チャットのみ | 入門向け:400ユーロ | CPUで動作するQwen3 4Bは、人が読む速度より速く生成します |
| 個人開発者、日常的なコーディング | 900ユーロ相当 | 約28トークン/秒で動作するコーディング向け14Bモデルが、価格と性能のバランスが取れる選択です |
| 推論、エージェント、複数モデル | パフォーマンス 1,500€ | 24 GBあれば32Bクラスのモデルが使えるようになります |
| 静音性とメンテナンス不要 | 静音型 ≈ 2,000€ | Mac miniのアイドル時の消費電力はわずか数ワットです |
よくある質問
2026年に実用的に使うには、8 GBのVRAMで十分ですか?
ぎりぎりです。RTX 3050 8GBまたはRX 6600で、Qwen3 8B Q4_K_Mを4Kのコンテキストで動かすことはできます。ただし、ローカル推論を本当に魅力的にする14Bモデルを動かすためのメモリの余裕はなくなります。可能なら12GBのVRAMを目指すこと。
NVIDIAよりAMDのグラフィックカードを買うべきでしょうか?
推論だけであれば、Radeon RDNA3およびRDNA4(7800 XT、7900 GRE、RX 9070 XT)は、llama.cppのVulkanバックエンドでもROCmでも良好に動作します。同じメモリ容量なら安価なことが多いものの、CUDAエコシステムの一部が使えなくなります。vLLMにはより多くの制約があり、flash-attnや大半のファインチューニングツールも利用できません。
これらの予算でファインチューニングはできますか?
7Bサイズのモデルに対するLoRAファインチューニングは12GBのGPUでUnslothを使用して実行可能です。14B以上のモデルは実際には24GBを必要とします。1Bを超える完全ファインチューニングは、2026年現在、一般消費者向けのハードウェアが提供できる範囲を超えます。
Mac のユニファイドメモリは、専用 VRAM と比べてどうですか?
Mac mini M5 Proの帯域幅は307 GB/sで、RTX 3090の936 GB/sを大きく下回ります。カードに収まるモデルなら、Macの生成速度は毎秒トークン数でおよそRTX 3090の2分の1から3分の1です。消費電力、メモリ容量、複数モデルの読み込みでは優位ですが、1ユーロあたりのトークン/秒では劣ります。