初心者 9 分予算

LLM用GPUサーバーの費用はいくら?購入、レンタル、 API

LLM 用 GPU サーバーのコストは、グラフィックスカードの価格だけでは決まりません。専用マシンを購入するか、ホスティング事業者から借りるか、クラウド API を利用するかで、支出の形は大きく異なります。多額の初期投資か毎月の請求か、固定費か変動費かという違いです。このガイドでは、2026年の費用の目安、セルフホストと API 利用の損益分岐点、予算別の代表的な構成を紹介します。

マシンを選んでいるところですか? 予算別のおすすめ →

著者 Mohamed Meguedmi·更新 2026-07-13·Windows・macOS・Linuxでテスト済み
推奨ハードウェア

ローカルAI向けでコストパフォーマンスに優れた選択肢: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395).

ミニPCはコンピューター一式です。利用可能なメモリとエンジンの互換性を確認してください。macOS/MLXやCUDAの代替にはなりません。

なぜこの選択か? 完全な解説はこちら: GMKtec EVO-X2 64GB / 1TB (Ryzen AI Max+ 395) →

800 €から3,500 €まで、予算別にすべてのオプションを比較 →

低予算向け: RTX 5060 ・大規模モデル: RTX 5090 · Mac Studio.

外出先では: ローカル AI 向けのノートパソコンはどれ? →

アフィリエイトリンク — 追加費用なしで手数料を受け取る場合があります。Amazonアソシエイトとして、ローカルLLMナビは条件を満たす購入から利益を得ています。

#3つの選択肢とそのコストプロファイル

具体的な金額の話に入る前に、LLM向けGPUサーバーの費用には、互いに大きく異なる3つの経済モデルがあることを理解しておく必要があります。適切な選択は予算だけで決まるものではなく、何よりも利用量とデータの機密性に左右されます。

購入(CAPEX)
マシンを所有するために、一度にまとまった金額を投資します。その後の限界費用はほぼゼロです(電気代)。頻繁に、長時間稼働させるなら費用に見合います。
レンタル(月額OPEX)
専用GPUサーバーまたはホスティングプロバイダーの仮想マシン(月額または時間単位で課金)。投資は不要ですが、サーバーが稼働している間は継続的に請求が発生します。
クラウドAPI(トークン単位のOPEX)
マシンを管理する必要はなく、使用量(100 万トークンあたり)に応じて課金されます。固定コストはゼロですが、価格は使用量に比例して上昇します。
i
本質的な問い
「LLM用GPUサーバーはいくらかかるのか」という問いに、唯一の答えはありません。本当に役立つ問いは、自分の利用量がどの程度になれば、従量課金で支払うよりも購入するほうが合理的になるのか、ということです。これはカタログ価格の話ではなく、分岐点を計算する問題です。

#専用マシンを購入する

機材の購入は、従来型のセルフホスティングの方式です。自宅や設備室にマシンを設置し、2〜4年で償却します。費用の中心はGPUで、マシン全体の予算の半分以上を占めることもよくあります。

エントリークラスのGPU — RTX 3060 12GB
中古価格で約300€。7B〜14BモデルをQ4で快適に動作させられます。本格的なローカルLLMの入り口としての価値があります。
幅広い用途に使えるGPU — RTX 4070 / 4080 16 GB
700〜1,200ユーロ。14Bモデルはスムーズに動作し、32BモデルもQ4なら多少の余裕があります(4080でVRAM 19 GB……ぎりぎりの容量です)。
高性能GPU — RTX 4090 24 GB
1,600〜2,000ユーロ。32B Q4(約19 GB)を余裕で動かせ、強く量子化すれば70Bも動かせます。ワークステーションの定番です。
統合メモリ — Mac Studio / M4 Pro 48–128 GB
2,000〜6,000ユーロ。ユニファイドVRAMにより、複数のGPUを使わずに70Bモデル、場合によってはそれ以上のモデルも読み込めます。静かで消費電力も少ないです。

これに、マシンの残りの構成部品が加わります。マザーボード、CPU、32〜64 GBのRAM、十分な容量の電源(4090なら750 W以上)、通気性のよいケースです。GPU以外の基本構成をまともにそろえるには、500〜900ユーロを見込んでください。したがって、32Bモデルを動かせるGPUワークステーション一式の総額は、2,500〜3,500ユーロになります。

→
中古なら価格を大幅に抑えられる
GPUの中古市場(RTX 3090 24 GBは約700 €、RTX 3060 12 GBは約250 €)は、計算式を根本から変えます。中古の3090は、中古の4090の価格の3分の1で24 GBのVRAMを提供しますが、電力消費量が高くなるという代償があります。

#ホスティング事業者からGPUサーバーを借りる

レンタルなら、初期投資と陳腐化の問題を避けられます。大きく分けて2種類あります。月額制の専用GPUサーバー(マシンを常時確保する方式)と、クラウド型の時間課金GPU(推論に使った時間分だけ支払う方式)です。

専用GPUの月額レンタル — フランスのホスティング事業者
OVHcloudやScalewayでは、専用GPUを搭載したサーバーを、カード(L4、L40S、H100)に応じて月額数百ユーロから千ユーロ超でレンタルできます。データがフランス国内でホスティングされることは、データ主権やGDPRの観点で利点となります。
時間単位で借りるGPU — クラウドのスポット利用
RunPod、Vast.ai、Lambdaなどのプラットフォームでは、GPUのレンタル料金はカードの種類に応じて1時間あたり0,20〜3ユーロです。スポット的なバッチ処理やファインチューニングには最適ですが、24時間365日の運用には向きません。
汎用クラウドのGPU仮想マシン
AWS、GCP、AzureはGPUインスタンスを時間単位で課金します。GPU専門のクラウド事業者より高額になることが多い一方、大手クラウドのエコシステムとSLAを利用できます。
!
24/7レンタルの罠
常時稼働するサービスのために GPU を時間単位でレンタルするのは、最悪の選択です。1.5 €/h の GPU を常時オンにすると、月額 1,000 € 以上となり、これは 6 週間ごとに RTX 4090 を購入するのと同じ価格です。時間単位のレンタルは、断続的な負荷の場合にのみ意味があります。

シンプルなルールとして、断続的な負荷(一日数時間、バッチ処理、実験など)の場合、時間単位のレンタルが有利です。常時応答が必要なサービスの場合、月単位の専用GPUまたは購入は、二ヶ月目または三ヶ月目から優位になります。

#クラウドAPIを経由する

APIは、自分でサーバーを用意せずに利用できる選択肢です。GPUを購入することも借りることもなく、消費したトークン数に応じて支払います。固定費がゼロなので、利用量が少ない場合や予測できない場合に、最も合理的な出発点となります。

課金方式
入力および出力のトークンあたりの価格(100万トークンあたり)。出力トークンは通常、入力トークンよりも高価です。
利点
メンテナンス不要、陳腐化なし。ワークステーションでは実行できない100B以上のモデルに、すぐにアクセスできます。
コスト面のデメリット
料金は使用量に比例して増えます。1日に10万件の文書を処理するパイプラインでは、「安い」APIでも月額請求額が4桁になります。
プライバシーに関する欠点
プロンプトは自分のインフラの外に送信されます。機密データ(医療、法務、独自のソースコード)を扱う場合、適切な契約と専用クラウドがなければ、利用の選択肢にはなりません。
i
セルフホスト型APIとプロプライエタリAPIの比較
プロプライエタリーメーカーのAPI(第三者にデータを送信)と、OllamaまたはvLLM上で自ら公開するOpenAI互換APIを混同しないでください。後者はAPIの利便性を提供しつつ、トークンコストやデータの漏洩を回避できます。

#セルフホストと API の損益分岐点

これが計算の要点です。購入したGPUは固定費、APIは変動費です。そのため、従量課金で支払うよりも自分のサーバーを所有するほうが安くなるトークン量の境界があります。その境界を下回る場合はAPIが有利で、上回る場合はセルフホスティングの初期費用を回収できます。

直感的には、1,800 €のRTX 4090を3年で償却すると、月額で約50 €のハードウェアコストに加え、電気代が発生します。月間API使用量がこの額を超える場合、購入が経済的になります——通常、毎日数百万トークンの継続的な使用からです。日常的な使用で数回のリクエスト程度であれば、APIは依然として優れたパフォーマンスを維持します。

→
計算機を使用してください
大まかに見積もる代わりに、当サイトのLLMコスト計算ツールで切り替えの損益分岐点を正確に算出できます。トークン使用量、利用を想定しているAPIの料金、ハードウェア費用を入力すると、いつからセルフホスティングが採算に合うかが分かります。
利用量が少なく、データに機密性がない場合
API。1日あたり数千トークン程度では、サーバーの固定費をかけるだけのメリットはありません。
継続的に大量に利用
購入。GPUへの投資は数か月で回収でき、リクエストごとの限界費用はほぼゼロになります。
データ量を問わず、機密性の高いデータを扱う場合
セルフホスト(購入、またはフランス国内でのレンタル)。コストを計算する前に、機密性の要件によって選択が決まります。
一時的な負荷のピーク、またはファインチューニング
時間単位でレンタル。処理を行っている間だけ、計算リソースの利用料金を支払います。

#予算別の標準構成

以下は、3つの予算と目標レベルに対応するセルフホスト型マシンの3つのプロファイルです。価格帯は2026年の概算で、完全なハードウェア構成を含みます。

  1. 01
    GPU搭載ワークステーション — 2,500€ から 3,500€
    64GBのRAMを備えたPCに、RTX 4090 24GB(または価格を半分に抑えるための中古RTX 3090)を搭載する構成です。32BのQ4モデル(VRAM約19GB)を余裕を持って動かせるほか、量子化を強くかけた70Bモデルも動かせます。開発者や小規模チームにとって定番となる構成です。
  2. 02
    GPU専用サーバー — 4,000〜8,000€または月額レンタル
    ラックシャーシにプロ用カード(L40S 48 GB、またはテンソル分割による 2× RTX 4090)を配置し、24/7 で動作し、Open WebUI を介して複数のユーザーにサービスを提供するように設計されています。ハードウェアの管理を避けたい場合は、フランスのホスティングプロバイダーで購入またはレンタルできます。
  3. 03
    統合メモリ搭載ミニPC — 700€から6,000€まで
    静かで省電力な推論サーバーにはMac mini M4(約700ユーロから)、複数のGPUを使わずに70B〜123Bモデルを動かすにはMac Studio M5 Ultra(96GB以上、512GBモデルは2026年10月末に登場すると発表されています)が選択肢です。消費電力はNVIDIA GPUに比べてごくわずかです。
i
VRAM およびモデルのサイズ
Q4量子化でのメモリ容量の目安:7Bモデルは約5 GB、14Bモデルは約9 GB、32Bモデルは約19 GB、70Bモデルは約40 GBに収まります。モデルサイズの上限を決めるのはVRAM(Macではユニファイドメモリ)であり、純粋な計算性能ではありません。GPUは何よりもVRAM容量を優先して選んでください。

#忘れずに考慮すべき隠れたコスト

購入価格は目に見える部分にすぎません。LLM 用 GPU サーバーの予算において、3つの継続的な費用項目は常に過小評価されています。

電気代
RTX 4090 は負荷下で最大 450 W 消費します。ほぼ連続的な推論では、kWh 単価によって月額で数十ユーロに相当します。統一メモリを搭載した Mac はそのごく一部しか消費しないため、24 時間 365 日稼働させる上での大きな利点となります。
メンテナンスと可用性
常に応答できる必要があるサーバーには、監視、更新、障害対応が必要です。請求書には表れませんが、実際に人の作業時間がかかります。
陳腐化
GPUの価値は下がり、モデルは急速に進化します。3年間で償却するのは妥当ですが、2026年の14Bモデルが2024年の70Bモデルを上回るため、ハードウェアの性能を追い求める必要が常にあるわけではありません。より新しく、より小さいモデルで十分なこともあります。
冷却と騒音
ハイエンドGPUは発熱し、騒音も発生します。業務用の部屋に設置する場合は室内の換気を確保すること。ワークステーションとして使う場合は、騒音による不快感の少なさも重要です。
!
所有コストの総額
購入価格ではなく、償却期間における総所有コスト(TCO)で常に比較してください。購入価格は安いものの電力消費が多いGPU NVIDIA は、24時間365日、3年間使用した場合、より高価だが省電力なMacよりもコストがかかる可能性があります。計算に電力とメンテナンス費用を含めてください。

#さらに詳しく

判断をより確かなものにするための関連ガイドは3つあります。GPU選びのガイドでは、VRAM・予算・性能のトレードオフをカードごとに詳しく解説しています。コスト計算ツールでは、セルフホストとAPI利用の損益分岐点を正確に算出します。32 GBのVRAMを搭載するPC構成ガイドでは、32Bモデルを動かせるマシンの具体的な構成部品を紹介しています。

ローカルAI向けGPUの選び方
2026年購入ガイド:RTX 4070 と 4090 および Mac M-Max の比較、VRAMと予算のバランス。
LLMコスト計算機
トークン量に基づいて、セルフホストとAPIのどちらを選ぶべきか、その切り替えの境目を数値で算出してください。
AI PC 構成:VRAM 32 GB の予算
32Bモデルをローカルで実行できるマシンを構成するためのコンポーネント選定。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。