LLM用GPUサーバーの費用はいくら?購入、レンタル、 API
LLM 用 GPU サーバーのコストは、グラフィックスカードの価格だけでは決まりません。専用マシンを購入するか、ホスティング事業者から借りるか、クラウド API を利用するかで、支出の形は大きく異なります。多額の初期投資か毎月の請求か、固定費か変動費かという違いです。このガイドでは、2026年の費用の目安、セルフホストと API 利用の損益分岐点、予算別の代表的な構成を紹介します。
マシンを選んでいるところですか? 予算別のおすすめ →
ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).
ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。
なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →
800 €から3,500 €まで、予算別にすべてのオプションを比較 →
低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.
外出先では: ローカル AI 向けのノートパソコンはどれ? →
アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。
#3つの選択肢とそのコストプロファイル
具体的な金額の話に入る前に、LLM向けGPUサーバーの費用には、互いに大きく異なる3つの経済モデルがあることを理解しておく必要があります。適切な選択は予算だけで決まるものではなく、何よりも利用量とデータの機密性に左右されます。
- 購入(CAPEX)
- マシンを所有するために、一度にまとまった金額を投資します。その後の限界費用はほぼゼロです(電気代)。頻繁に、長時間稼働させるなら費用に見合います。
- レンタル(月額OPEX)
- 専用GPUサーバーまたはホスティングプロバイダーの仮想マシン(月額または時間単位で課金)。投資は不要ですが、サーバーが稼働している間は継続的に請求が発生します。
- クラウドAPI(トークン単位のOPEX)
- マシンを管理する必要はなく、使用量(100 万トークンあたり)に応じて課金されます。固定コストはゼロですが、価格は使用量に比例して上昇します。
#専用マシンを購入する
機材の購入は、従来型のセルフホスティングの方式です。自宅や設備室にマシンを設置し、2〜4年で償却します。費用の中心はGPUで、マシン全体の予算の半分以上を占めることもよくあります。
- エントリークラスのGPU — RTX 3060 12GB
- 中古価格で約300€。7B〜14BモデルをQ4で快適に動作させられます。本格的なローカルLLMの入り口としての価値があります。
- 幅広い用途に使えるGPU — RTX 4070 / 4080 16 GB
- 700〜1,200ユーロ。14Bモデルはスムーズに動作し、32BモデルもQ4なら多少の余裕があります(4080でVRAM 19 GB……ぎりぎりの容量です)。
- 高性能GPU — RTX 4090 24 GB
- 1,600〜2,000ユーロ。32B Q4(約19 GB)を余裕で動かせ、強く量子化すれば70Bも動かせます。ワークステーションの定番です。
- 統合メモリ — Mac Studio / M4 Pro 48–128 GB
- 2,000〜6,000ユーロ。ユニファイドVRAMにより、複数のGPUを使わずに70Bモデル、場合によってはそれ以上のモデルも読み込めます。静かで消費電力も少ないです。
これに、マシンの残りの構成部品が加わります。マザーボード、CPU、32〜64 GBのRAM、十分な容量の電源(4090なら750 W以上)、通気性のよいケースです。GPU以外の基本構成をまともにそろえるには、500〜900ユーロを見込んでください。したがって、32Bモデルを動かせるGPUワークステーション一式の総額は、2,500〜3,500ユーロになります。
#ホスティング事業者からGPUサーバーを借りる
レンタルなら、初期投資と陳腐化の問題を避けられます。大きく分けて2種類あります。月額制の専用GPUサーバー(マシンを常時確保する方式)と、クラウド型の時間課金GPU(推論に使った時間分だけ支払う方式)です。
- 専用GPUの月額レンタル — フランスのホスティング事業者
- OVHcloudやScalewayでは、専用GPUを搭載したサーバーを、カード(L4、L40S、H100)に応じて月額数百ユーロから千ユーロ超でレンタルできます。データがフランス国内でホスティングされることは、データ主権やGDPRの観点で利点となります。
- 時間単位で借りるGPU — クラウドのスポット利用
- RunPod、Vast.ai、Lambdaなどのプラットフォームでは、GPUのレンタル料金はカードの種類に応じて1時間あたり0,20〜3ユーロです。スポット的なバッチ処理やファインチューニングには最適ですが、24時間365日の運用には向きません。
- 汎用クラウドのGPU仮想マシン
- AWS、GCP、AzureはGPUインスタンスを時間単位で課金します。GPU専門のクラウド事業者より高額になることが多い一方、大手クラウドのエコシステムとSLAを利用できます。
シンプルなルールとして、断続的な負荷(一日数時間、バッチ処理、実験など)の場合、時間単位のレンタルが有利です。常時応答が必要なサービスの場合、月単位の専用GPUまたは購入は、二ヶ月目または三ヶ月目から優位になります。
#クラウドAPIを経由する
APIは、自分でサーバーを用意せずに利用できる選択肢です。GPUを購入することも借りることもなく、消費したトークン数に応じて支払います。固定費がゼロなので、利用量が少ない場合や予測できない場合に、最も合理的な出発点となります。
- 課金方式
- 入力および出力のトークンあたりの価格(100万トークンあたり)。出力トークンは通常、入力トークンよりも高価です。
- 利点
- メンテナンス不要、陳腐化なし。ワークステーションでは実行できない100B以上のモデルに、すぐにアクセスできます。
- コスト面のデメリット
- 料金は使用量に比例して増えます。1日に10万件の文書を処理するパイプラインでは、「安い」APIでも月額請求額が4桁になります。
- プライバシーに関する欠点
- プロンプトは自分のインフラの外に送信されます。機密データ(医療、法務、独自のソースコード)を扱う場合、適切な契約と専用クラウドがなければ、利用の選択肢にはなりません。
#セルフホストと API の損益分岐点
これが計算の要点です。購入したGPUは固定費、APIは変動費です。そのため、従量課金で支払うよりも自分のサーバーを所有するほうが安くなるトークン量の境界があります。その境界を下回る場合はAPIが有利で、上回る場合はセルフホスティングの初期費用を回収できます。
直感的には、1,800 €のRTX 4090を3年で償却すると、月額で約50 €のハードウェアコストに加え、電気代が発生します。月間API使用量がこの額を超える場合、購入が経済的になります——通常、毎日数百万トークンの継続的な使用からです。日常的な使用で数回のリクエスト程度であれば、APIは依然として優れたパフォーマンスを維持します。
- 利用量が少なく、データに機密性がない場合
- API。1日あたり数千トークン程度では、サーバーの固定費をかけるだけのメリットはありません。
- 継続的に大量に利用
- 購入。GPUへの投資は数か月で回収でき、リクエストごとの限界費用はほぼゼロになります。
- データ量を問わず、機密性の高いデータを扱う場合
- セルフホスト(購入、またはフランス国内でのレンタル)。コストを計算する前に、機密性の要件によって選択が決まります。
- 一時的な負荷のピーク、またはファインチューニング
- 時間単位でレンタル。処理を行っている間だけ、計算リソースの利用料金を支払います。
#予算別の標準構成
以下は、3つの予算と目標レベルに対応するセルフホスト型マシンの3つのプロファイルです。価格帯は2026年の概算で、完全なハードウェア構成を含みます。
- 01GPU搭載ワークステーション — 2,500€ から 3,500€64GBのRAMを備えたPCに、RTX 4090 24GB(または価格を半分に抑えるための中古RTX 3090)を搭載する構成です。32BのQ4モデル(VRAM約19GB)を余裕を持って動かせるほか、量子化を強くかけた70Bモデルも動かせます。開発者や小規模チームにとって定番となる構成です。
- 02GPU専用サーバー — 4,000〜8,000€または月額レンタルラックシャーシにプロ用カード(L40S 48 GB、またはテンソル分割による 2× RTX 4090)を配置し、24/7 で動作し、Open WebUI を介して複数のユーザーにサービスを提供するように設計されています。ハードウェアの管理を避けたい場合は、フランスのホスティングプロバイダーで購入またはレンタルできます。
- 03統合メモリ搭載ミニPC — 700€から6,000€まで静かで省電力な推論サーバーにはMac mini M4(約700ユーロから)、複数のGPUを使わずに70B〜123Bモデルを動かすにはMac Studio M5 Ultra(96GB以上、512GBモデルは2026年10月末に登場すると発表されています)が選択肢です。消費電力はNVIDIA GPUに比べてごくわずかです。
#忘れずに考慮すべき隠れたコスト
購入価格は目に見える部分にすぎません。LLM 用 GPU サーバーの予算において、3つの継続的な費用項目は常に過小評価されています。
- 電気代
- RTX 4090 は負荷下で最大 450 W 消費します。ほぼ連続的な推論では、kWh 単価によって月額で数十ユーロに相当します。統一メモリを搭載した Mac はそのごく一部しか消費しないため、24 時間 365 日稼働させる上での大きな利点となります。
- メンテナンスと可用性
- 常に応答できる必要があるサーバーには、監視、更新、障害対応が必要です。請求書には表れませんが、実際に人の作業時間がかかります。
- 陳腐化
- GPUの価値は下がり、モデルは急速に進化します。3年間で償却するのは妥当ですが、2026年の14Bモデルが2024年の70Bモデルを上回るため、ハードウェアの性能を追い求める必要が常にあるわけではありません。より新しく、より小さいモデルで十分なこともあります。
- 冷却と騒音
- ハイエンドGPUは発熱し、騒音も発生します。業務用の部屋に設置する場合は室内の換気を確保すること。ワークステーションとして使う場合は、騒音による不快感の少なさも重要です。
#さらに詳しく
判断をより確かなものにするための関連ガイドは3つあります。GPU選びのガイドでは、VRAM・予算・性能のトレードオフをカードごとに詳しく解説しています。コスト計算ツールでは、セルフホストとAPI利用の損益分岐点を正確に算出します。32 GBのVRAMを搭載するPC構成ガイドでは、32Bモデルを動かせるマシンの具体的な構成部品を紹介しています。
- ローカルAI向けGPUの選び方
- 2026年購入ガイド:RTX 4070 と 4090 および Mac M-Max の比較、VRAMと予算のバランス。
- LLMコスト計算機
- トークン量に基づいて、セルフホストとAPIのどちらを選ぶべきか、その切り替えの境目を数値で算出してください。
- AI PC 構成:VRAM 32 GB の予算
- 32Bモデルをローカルで実行できるマシンを構成するためのコンポーネント選定。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。