Ollama Cloud:価格、レビュー、制限 (2026)
Ollama Cloud はシンプルな機能を提供します。それは、お使いのマシンでは大きすぎるモデル(120B、480B、671B パラメータ)を Ollama のサーバー上で実行することです。ローカル版と同じ CLI を使用できます。これは便利です。ただし、根本的な点が2つ変わります。プロンプトがあなたの端末から外部に送信され、使用量に応じた課金が発生するということです。このガイドでは、その正確な内容、コスト、そしてなぜほとんどのケースでセルフホスティングが望ましいのかを説明します。
#Ollama Cloudとは何か
2025年から、OllamaはOllama Cloudという有料サービスを提供しています。OllamaのGPUインフラ上でホストされているモデルを、ローカルモデルとまったく同じコマンドで呼び出せます。うたい文句は、Mac Studio UltraやH100クラスターを用意せずに、数千億パラメータ規模の巨大なオープンウェイトモデルを動かせることです。
具体的には、通常どおり Ollama をインストールし、認証を行ってから、「cloud」と表示されたモデル(例:gpt-oss:120b-cloud)をプルします。推論は手元の GPU ではなく、Ollama のサーバー上で行われるようになります。手元のマシンはプロンプトのトークンだけを送信し、応答のトークンを受信します。
#クラウド側で動作するモデルはどのようなものがありますか?
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
クラウドのカタログは、まさにローカルでは動かしにくいモデルを対象にしています。カタログは変化していきますが、基本方針は同じです。オープンウェイトまたはオープンなモデルで、非常に大規模なものや、VRAMを多く必要とするマルチモーダルモデルを扱います。
- 100B以上のパラメータを持つモデル
- gpt-oss:120b、qwen3-coder:480b、kimi-k2などのモデルは、Q4で60〜250 GBのVRAMを必要とし、個人用のワークステーションでは手が届かない規模です。
- 最先端の MoE モデル
- DeepSeek V3/V4、Llama 4 Maverick:ローカルにインストールする7B/32Bの蒸留版ではなく、完全版です。
- 高負荷の特化型モデル
- 巨大なコード生成モデル、長いコンテキストに対応する推論モデル("thinking")、高解像度のビジョンモデル。
通常のモデル(Mistral 7B、Llama 3.1 8B、Qwen 14B、Phi-4など)はローカルで推奨されています。RTX 3060 12GBまたはMacBook Airに収まるため、これらを外部に移動するメリットは一切ありません。
#料金と制限
Ollama Cloudは、月額定額プラン(時間単位のリクエストクォータ)と、高負荷用途向けの消費型課金モデルの間を橋渡ししています。正確な料金は変動するため、契約前にollama.com/cloudを確認してください。ただし、いくつかのポイントは変わりません。
- 時間あたりのリクエスト数の上限
- 基本プランでは、時単位または日単位でクエリの数に制限があります。人間によるチャット利用には快適ですが、1万ドキュメントをループ処理するスクリプトにとってはすぐに達成されてしまいます。
- 推論時間ごとの課金
- 非常に大きなモデルでは、GPUの使用時間に応じて課金される場合があります。長いコンテキストを使うリクエスト(32kトークン、深い推論)は、単なる「こんにちは」よりも必然的にコストが高くなります。
- デフォルトではトークン単価が表示されない
- OpenAI や Anthropic と異なり、Ollama Cloud の API は必ずしもトークン単位で課金されるわけではありません。そのため、予算を精密に見積もりにくくなります。
- 一般向けのSLAは提供されていません
- まだ新しいサービスであり、執筆時点では、大手クラウドサービスに匹敵する可用性の保証はありません。
#プライバシー:実際に何が変わるのか
ここでセルフホストとの差は、些細な違いではなく構造的なものになります。Ollamaをローカルで使う場合、プロンプトはlocalhostのポート11434の外に出ません。これはファイアウォールで確認できます。クラウドでは、プロンプトはインターネットを経由し、第三者のインフラで処理されます。
- プロンプトが管理範囲の外に送信される
- 送信したデータはすべて、契約書の抜粋、プロプライエタリなソースコード、患者記録、メールなど、手元のマシンの外に出ます。法律事務所、医師、人事部門、研究開発ラボにとって、これは受け入れられません。
- データ保持ポリシー
- Ollamaは、ユーザーのプロンプトをモデルの学習に使用しないと説明しています。ただし、デバッグ、不正利用の検出、ログのためのデータ保持はプランによって異なります。機密性の高い情報を送信する前に、利用規約を確認してください。
- GDPRとホスティング
- Ollama Cloudのサーバーは主に米国にあります。欧州の個人データを扱う場合、EU域外への移転という問題が生じますが、セルフホストならこの問題を一挙に解消できます。
- インフラ側の監査は不可能
- ローカル環境では、tcpdump でポート 11434 を監視し、外部に何も送信されていないことを証明できます。クラウド環境では、信頼するしかありません。何がログに記録されているかを技術的に確認する方法はありません。
#クラウドモデルごとのセルフホスト可能な代替案
クラウドで提供されるほぼすべてのモデルには、同等のローカル代替モデル(同じファミリーのより小さなモデル)、または許容できるローカル代替モデル(比較可能な別のオープンウェイトモデル)が存在します。役立つ対応関係を以下に示します。
- gpt-oss:120b-cloud → llama3.1:8b または qwen2.5:14b(ローカル)
- 会話用途の90%では、RTX 3060 12 GBで8B〜14BのQ4モデルを動かせば十分です。違いが現れるのは、主に長い推論や百科事典的な知識を必要とするタスクです。
- qwen3-coder:480b-cloud → qwen2.5-coder:14b または 32b
- 32BモデルのQ4(約19GBのVRAM)は、RTX 4090またはMac M-Maxで動作します。IDEでのコード補完には十分です——Continue.devガイドを参照してください。
- deepseek-v3:671b-cloud → deepseek-r1:32b または 70b(蒸留済み)
- DeepSeek R1の蒸留版は、4090またはMac Studioでローカル実行でき、一般的なベンチマークでフルモデルの推論能力の80~90%を再現します。
- 巨大な画像認識モデル → qwen2.5-vl:7bまたはllama3.2-vision:11b
- OCR、画像のタグ付け、説明の生成といった用途では、この2つのモデルは8〜12 GBのVRAMで動作します。マルチモーダルLLMの画像認識をローカルで使うためのガイドをご覧ください。
- 100万トークンの長いコンテキスト → コンテキスト128kのローカルモデル+チャンク分割
- 実際の用途で、一度に100万トークンを必要とするケースはごくわずかです。チャンキングとリランカーを組み合わせた適切なRAGパイプラインなら、コンテキスト長32kのローカルモデルで大規模なコーパスを処理できます。
#デシジョンテーブル
Ollama Cloudとセルフホストのどちらを選ぶか判断するには、次の5つの質問を順番に自分に問いかけてください。最初に答えが「セルフホスト」になった時点で、選択が決まります。
- 1. データはセンシティブですか?
- 独自の非公開コード、顧客データ、医療、法務、人事、研究開発 → セルフホスティング一択です。
- 2. GDPRまたは業界固有の規制の対象ですか?
- 病院、銀行、公共部門、欧州のデータ → セルフホスティング、または専用のソブリンクラウド(Ollama Cloudは対象外)。
- 3. 利用量は予測可能で、多いですか?
- 1日あたりの呼び出しが数千回を超える場合 → 利用量によって変動するクラウド料金と比べ、1,500ユーロのGPUは数か月で元が取れます。
- 4. オフラインでの動作が必要ですか?
- 接続が安定しない拠点、現場でのデモ、エアギャップ要件への適合 → セルフホスティングが必須です。
- 5. 100B以上のモデルがどうしても必要ですか?
- 答えが「はい」の場合に限り、かつローカルの32Bモデルを試した後であれば、Ollama Cloudは検討すべき選択肢となります。
#どちらを使うべきか、それぞれの使い分け
#Ollama Cloudの適切なケースは非常に限られています
- 巨大モデルを必要なときだけ評価する
- マシンに投資する前に、480Bのコーディング用モデルに価値があるかを10分で試したい場合、クラウドを使えば衝動買いを避けられます。
- 現地に機材を用意せずに行う顧客向けデモ
- Mac Studioを持ち運ばずに、ノートパソコンでPOCを披露する営業担当者。
- 非常に負荷の高い単発タスク
- 四半期ごとに一度、長文コンテキストで要約する500ページのリポートで、機密データは一切含まれていない。
- 学習と探索
- 670Bモデルに何ができるかを知り、その後、何を目指すべきかを把握したうえでローカル環境に戻ること。
#セルフホスティングが有利なケース
- あらゆる継続的な利用
- 日常的なコーディング支援、社内チーム用チャット、企業文書を対象にしたRAGでは、請求額が安定していることが重要です。
- 機密性の高いデータを扱うあらゆる用途
- 議論の余地はありません。法律、医療、人事、金融、研究開発、独自開発のコードに関するデータは、ローカルに留めます。
- あらゆる自動化された利用
- バッチパイプライン、ループ処理を繰り返すエージェント、n8n、ETLスクリプトでは、クラウドの利用上限をたちまち超えてしまい、コストが予測できなくなります。
- あらゆるオフライン用途またはエッジ用途
- 作業場でのRaspberry Pi、移動中のノートPC、安定したインターネット接続のない現場。
- あらゆるカスタマイズのニーズ
- ファインチューニング、カスタムModelfile、チーム用のシステムプロンプト、利用しているツールとの緊密な連携――クラウドではこうしたことはできません。
#さらに詳しく
ご自身のケースにはセルフホスティングが適していると判断した場合(その可能性は高いでしょう)、以下のガイドが順調なスタートを切るために役立ちます。
- 適切なGPUを選択
- ローカルAI用GPUを選ぶガイドでは、VRAM/予算/パフォーマンスのバランスを説明し、RTX 3060 12GBからMac Studio Ultraまでをカバーしています。
- 量子化について理解する
- 量子化の選択(Q4、Q5、Q8、FP16)に関するガイドでは、16GBのGPU上で32Bモデルを収容しつつ品質を損なわない方法を説明しています。
- 運用上の機密性
- プライバシー確認リストには、手元のマシンからパケットが一切外に出ていないことを確かめるための具体的な確認項目がまとめられています。実際の挙動によって確かめるためのものです。
Ollama Cloudは無料ですか?+
Ollama をクラウドを介さずにどのように使うことができますか?+
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。