◆ ローカルAI — 1時間で、あなたのマシンにプライベートで無料のChatGPTを · 24 € · または全キットを49 €で →

予算ガイド · 2026年更新

ローカルLLMスタックの構築 予算に応じて

2026年にQwen 3、Gemma 3、DeepSeek R1の蒸留モデルを実用的な速度で実際に動かせる、最も安価なハードウェアとモデルの組み合わせ。

予算に合うマシンは?

予算と優先事項を入力してください。このツールは、その範囲内に収まるマシン、そのマシンが実行可能な LLM、および今週の確認済み価格を提示します。

このガイドの読み方

二つの変数の値を決めてください: 予算 と 主な用途。それ以外のすべて——量子化、ランタイム、コンテキスト長——はそこから決まります。まずVRAMを基準に、8Kのコンテキストでも余裕を持ってQ4_K_Mで収まる最大のモデルを選び、その後にランタイムを選んでください。

基本ルール:GGUF Q4_K_M形式のモデルは約 (paramètres × 0,6) Go のVRAMに加え、8Kでは約1.5 GBのKVキャッシュが必要です。そのため、14Bモデルには約10 GBが必要となり、中古のRTX 3060 12 GBが依然としてコストパフォーマンスの基準となる理由もここにあります。

予算の段階を選んでください

段階予算参考構成VRAM / 統合メモリ最適モデル (Q4_K_M)
入力400-550 €中古のRyzen 7 5700UミニPC、16GB DDR40 GB GPU / 16 GB RAMQwen3 4B
コストパフォーマンス850-1 000 €Ryzen 5 7600 + RTX 3060 12 GB(中古)+ 32 GB DDR512 GBQwen 3 14B または Qwen 2.5 Coder 14B
パフォーマンス1 400-1 600 €Ryzen 7 7700 + 中古のRTX 3090 24 GB + 64 GB DDR524 GBQwen3-Coder 30B-A3B または DeepSeek-R1-Distill-Qwen-32B
静音≈ 2 000 €Apple Mac mini M5 Pro 24 GB (新品)約16GBの使用可能なメモリQwen 3 14B

2026年半ばのフランス/EU中古市場における参考価格です。中古市場の価格は変動するため、購入前に最新の価格を確認してください。

第2段階 — 900ユーロの最有力候補

大多数の読者におすすめするのは、この段階です。中古のRTX 3060 12GBは、中古市場でおよそ200〜240€で取引されています。12GBのVRAMは、14Bクラスのモデルにちょうど適した容量です。

モデル(Q4_K_M)使用されるVRAMトークン/秒(推定値)おすすめの用途
Qwen 3 8B~6 GB~50チャット、RAG
Qwen 2.5 Coder 14B~10 GB~28コード補完、リファクタリング
Gemma 3 12B~8 GB~34多言語対応、文書に基づく質問応答
DeepSeek-R1-Distill-Qwen-14B~10 GB~28段階的推論

これは推定値であり、QuelLLMによる実測値ではありません。理論上限(RTX 3060のメモリ帯域幅360 GB/秒をモデルサイズで割った値)の約70%です。Q4の8Bモデルの上限は約72トークン/秒、14Bモデルの上限は約40トークン/秒です。

実行環境:Ollama、llama.cppまたはvLLM?

ソロ開発者 → デフォルトで Ollama。3人以上のチーム → FastAPI の小さなプロキシ経由で vLLM。

消費電力、騒音、総コスト

Configアイドル時(W)負荷時の消費電力(W)kWh/年(充電時間4時間/日)年間コスト(0.20 €/kWhの場合)
エントリーレベルのミニPC8355110,20 €
3060の価値4522032164,20 €
3090 のパフォーマンス50360526105,10 €
Mac mini (Proチップ)6659519,00 €

消費電力はおおよその値です。計算式:負荷時の消費電力 × 4時間 × 365日。それ以外の時間はマシンの電源を切る想定です。アイドル状態でも電源を入れたままにする場合は、アイドル時の消費電力 × 20時間 × 365日を加えてください。

最も消費電力の大きい構成でも、このペースでは年間約105ユーロの電気代がかかります。これは月額20ユーロのサブスクリプションの5か月分をわずかに超える額です。

判定

利用者タイプ推奨されるレベルなぜ
試してみたい方、チャットのみ入門向け:400ユーロCPUで動作するQwen3 4Bは、人が読む速度より速く生成します
個人開発者、日常的なコーディング900ユーロ相当約28トークン/秒で動作するコーディング向け14Bモデルが、価格と性能のバランスが取れる選択です
推論、エージェント、複数モデルパフォーマンス 1,500€24 GBあれば32Bクラスのモデルが使えるようになります
静音性とメンテナンス不要静音型 ≈ 2,000€Mac miniのアイドル時の消費電力はわずか数ワットです

よくある質問

2026年に実用的に使うには、8 GBのVRAMで十分ですか?

ぎりぎりです。RTX 3050 8GBまたはRX 6600で、Qwen3 8B Q4_K_Mを4Kのコンテキストで動かすことはできます。ただし、ローカル推論を本当に魅力的にする14Bモデルを動かすためのメモリの余裕はなくなります。可能なら12GBのVRAMを目指すこと。

NVIDIAよりAMDのグラフィックカードを買うべきでしょうか?

推論だけであれば、Radeon RDNA3およびRDNA4(7800 XT、7900 GRE、RX 9070 XT)は、llama.cppのVulkanバックエンドでもROCmでも良好に動作します。同じメモリ容量なら安価なことが多いものの、CUDAエコシステムの一部が使えなくなります。vLLMにはより多くの制約があり、flash-attnや大半のファインチューニングツールも利用できません。

これらの予算でファインチューニングはできますか?

7Bサイズのモデルに対するLoRAファインチューニングは12GBのGPUでUnslothを使用して実行可能です。14B以上のモデルは実際には24GBを必要とします。1Bを超える完全ファインチューニングは、2026年現在、一般消費者向けのハードウェアが提供できる範囲を超えます。

Mac のユニファイドメモリは、専用 VRAM と比べてどうですか?

Mac mini M5 Proの帯域幅は307 GB/sで、RTX 3090の936 GB/sを大きく下回ります。カードに収まるモデルなら、Macの生成速度は毎秒トークン数でおよそRTX 3090の2分の1から3分の1です。消費電力、メモリ容量、複数モデルの読み込みでは優位ですが、1ユーロあたりのトークン/秒では劣ります。

その他の無料ツール