初心者 8 分Ollama

Ollama Cloud:価格、レビュー、制限 (2026)

Ollama Cloud はシンプルな機能を提供します。それは、お使いのマシンでは大きすぎるモデル(120B、480B、671B パラメータ)を Ollama のサーバー上で実行することです。ローカル版と同じ CLI を使用できます。これは便利です。ただし、根本的な点が2つ変わります。プロンプトがあなたの端末から外部に送信され、使用量に応じた課金が発生するということです。このガイドでは、その正確な内容、コスト、そしてなぜほとんどのケースでセルフホスティングが望ましいのかを説明します。

著者 Mohamed Meguedmi·更新 2026-09-05·Windows・macOS・Linuxでテスト済み
i
要約
Ollama Cloudは、手元のマシンには大きすぎるモデル(120B、480B、671B)をOllamaのサーバー上で動かし、ローカルと同じCLIで利用できます。· 料金体系は、時間単位の利用枠がある月額プランから、大量利用向けの推論時間に応じた課金まであります。料金は変わるため、ollama.com/cloudで確認してください。· ローカルとは異なり、プロンプトは手元のマシンを離れ、主に米国にあるサーバーを経由します。· 継続的に利用する場合や機密性の高いデータを扱う場合は、セルフホスティングのほうが依然としてはるかに望ましい選択です。

#Ollama Cloudとは何か

2025年から、OllamaはOllama Cloudという有料サービスを提供しています。OllamaのGPUインフラ上でホストされているモデルを、ローカルモデルとまったく同じコマンドで呼び出せます。うたい文句は、Mac Studio UltraやH100クラスターを用意せずに、数千億パラメータ規模の巨大なオープンウェイトモデルを動かせることです。

具体的には、通常どおり Ollama をインストールし、認証を行ってから、「cloud」と表示されたモデル(例:gpt-oss:120b-cloud)をプルします。推論は手元の GPU ではなく、Ollama のサーバー上で行われるようになります。手元のマシンはプロンプトのトークンだけを送信し、応答のトークンを受信します。

クラウド呼び出しの例(一般的な構文)
# Authentification (une seule fois)
ollama signin

# Lancer un modèle hébergé
ollama run gpt-oss:120b-cloud
i
これは「ローカルクラウド」ではありません
Ollama Cloudは、モデルの一部分を手元のマシンで実行するハイブリッドモードではありません。完全なリモート推論であり、OpenAIやAnthropicのAPIと同様に、プロンプトはインターネット経由で送信されます。「ローカル」なのはCLIだけです。

#クラウド側で動作するモデルはどのようなものがありますか?

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

クラウドのカタログは、まさにローカルでは動かしにくいモデルを対象にしています。カタログは変化していきますが、基本方針は同じです。オープンウェイトまたはオープンなモデルで、非常に大規模なものや、VRAMを多く必要とするマルチモーダルモデルを扱います。

100B以上のパラメータを持つモデル
gpt-oss:120b、qwen3-coder:480b、kimi-k2などのモデルは、Q4で60〜250 GBのVRAMを必要とし、個人用のワークステーションでは手が届かない規模です。
最先端の MoE モデル
DeepSeek V3/V4、Llama 4 Maverick:ローカルにインストールする7B/32Bの蒸留版ではなく、完全版です。
高負荷の特化型モデル
巨大なコード生成モデル、長いコンテキストに対応する推論モデル("thinking")、高解像度のビジョンモデル。

通常のモデル(Mistral 7B、Llama 3.1 8B、Qwen 14B、Phi-4など)はローカルで推奨されています。RTX 3060 12GBまたはMacBook Airに収まるため、これらを外部に移動するメリットは一切ありません。

#料金と制限

Ollama Cloudは、月額定額プラン(時間単位のリクエストクォータ)と、高負荷用途向けの消費型課金モデルの間を橋渡ししています。正確な料金は変動するため、契約前にollama.com/cloudを確認してください。ただし、いくつかのポイントは変わりません。

時間あたりのリクエスト数の上限
基本プランでは、時単位または日単位でクエリの数に制限があります。人間によるチャット利用には快適ですが、1万ドキュメントをループ処理するスクリプトにとってはすぐに達成されてしまいます。
推論時間ごとの課金
非常に大きなモデルでは、GPUの使用時間に応じて課金される場合があります。長いコンテキストを使うリクエスト(32kトークン、深い推論)は、単なる「こんにちは」よりも必然的にコストが高くなります。
デフォルトではトークン単価が表示されない
OpenAI や Anthropic と異なり、Ollama Cloud の API は必ずしもトークン単位で課金されるわけではありません。そのため、予算を精密に見積もりにくくなります。
一般向けのSLAは提供されていません
まだ新しいサービスであり、執筆時点では、大手クラウドサービスに匹敵する可用性の保証はありません。
!
「ほぼ無料」の落とし穴
無料枠や安価なエントリープランがあると、すべてをクラウドで処理したくなります。しかし、自動化(バッチ処理、ループを繰り返すエージェント、10万チャンクを対象とするRAG)を始めると、料金はすぐに膨らみ、呼び出しのたびにネットワーク遅延も加わります。

#プライバシー:実際に何が変わるのか

ここでセルフホストとの差は、些細な違いではなく構造的なものになります。Ollamaをローカルで使う場合、プロンプトはlocalhostのポート11434の外に出ません。これはファイアウォールで確認できます。クラウドでは、プロンプトはインターネットを経由し、第三者のインフラで処理されます。

プロンプトが管理範囲の外に送信される
送信したデータはすべて、契約書の抜粋、プロプライエタリなソースコード、患者記録、メールなど、手元のマシンの外に出ます。法律事務所、医師、人事部門、研究開発ラボにとって、これは受け入れられません。
データ保持ポリシー
Ollamaは、ユーザーのプロンプトをモデルの学習に使用しないと説明しています。ただし、デバッグ、不正利用の検出、ログのためのデータ保持はプランによって異なります。機密性の高い情報を送信する前に、利用規約を確認してください。
GDPRとホスティング
Ollama Cloudのサーバーは主に米国にあります。欧州の個人データを扱う場合、EU域外への移転という問題が生じますが、セルフホストならこの問題を一挙に解消できます。
インフラ側の監査は不可能
ローカル環境では、tcpdump でポート 11434 を監視し、外部に何も送信されていないことを証明できます。クラウド環境では、信頼するしかありません。何がログに記録されているかを技術的に確認する方法はありません。
→
tcpdumpを使ったテスト
Ollamaをセルフホストする場合は、モデルを使っている間に `sudo tcpdump -i any port 443` を実行してください。外向きのパケットは一つも表示されないはずです。Ollama Cloudでは、ollama.comのサーバーへの通信が確認できます。機密性の証明は、通信があるかないかで判別でき、観測可能です。

#クラウドモデルごとのセルフホスト可能な代替案

クラウドで提供されるほぼすべてのモデルには、同等のローカル代替モデル(同じファミリーのより小さなモデル)、または許容できるローカル代替モデル(比較可能な別のオープンウェイトモデル)が存在します。役立つ対応関係を以下に示します。

gpt-oss:120b-cloud → llama3.1:8b または qwen2.5:14b(ローカル)
会話用途の90%では、RTX 3060 12 GBで8B〜14BのQ4モデルを動かせば十分です。違いが現れるのは、主に長い推論や百科事典的な知識を必要とするタスクです。
qwen3-coder:480b-cloud → qwen2.5-coder:14b または 32b
32BモデルのQ4(約19GBのVRAM)は、RTX 4090またはMac M-Maxで動作します。IDEでのコード補完には十分です——Continue.devガイドを参照してください。
deepseek-v3:671b-cloud → deepseek-r1:32b または 70b(蒸留済み)
DeepSeek R1の蒸留版は、4090またはMac Studioでローカル実行でき、一般的なベンチマークでフルモデルの推論能力の80~90%を再現します。
巨大な画像認識モデル → qwen2.5-vl:7bまたはllama3.2-vision:11b
OCR、画像のタグ付け、説明の生成といった用途では、この2つのモデルは8〜12 GBのVRAMで動作します。マルチモーダルLLMの画像認識をローカルで使うためのガイドをご覧ください。
100万トークンの長いコンテキスト → コンテキスト128kのローカルモデル+チャンク分割
実際の用途で、一度に100万トークンを必要とするケースはごくわずかです。チャンキングとリランカーを組み合わせた適切なRAGパイプラインなら、コンテキスト長32kのローカルモデルで大規模なコーパスを処理できます。
i
品質のギャップは四半期ごとに縮まります
2026年の14Bモデルは、ほとんどのベンチマークで2024年の70Bモデルを上回ります。「400Bが必要だ」と考える理由は、ますます少なくなっています。クラウドにお金を払う前に、ローカルの14Bモデルで十分ではないか、実際に試してみてください。驚くことも多いでしょう。

#デシジョンテーブル

Ollama Cloudとセルフホストのどちらを選ぶか判断するには、次の5つの質問を順番に自分に問いかけてください。最初に答えが「セルフホスト」になった時点で、選択が決まります。

1. データはセンシティブですか?
独自の非公開コード、顧客データ、医療、法務、人事、研究開発 → セルフホスティング一択です。
2. GDPRまたは業界固有の規制の対象ですか?
病院、銀行、公共部門、欧州のデータ → セルフホスティング、または専用のソブリンクラウド(Ollama Cloudは対象外)。
3. 利用量は予測可能で、多いですか?
1日あたりの呼び出しが数千回を超える場合 → 利用量によって変動するクラウド料金と比べ、1,500ユーロのGPUは数か月で元が取れます。
4. オフラインでの動作が必要ですか?
接続が安定しない拠点、現場でのデモ、エアギャップ要件への適合 → セルフホスティングが必須です。
5. 100B以上のモデルがどうしても必要ですか?
答えが「はい」の場合に限り、かつローカルの32Bモデルを試した後であれば、Ollama Cloudは検討すべき選択肢となります。
→
実用的なルール
迷った場合は、まず14B Q4モデルをローカルで使ってみてください。そのモデルの限界が実際に用途の妨げになるかどうかは、すぐに分かります。80%の場合は妨げになりません。クラウドの利用は基本ではなく、例外と考えてください。

#どちらを使うべきか、それぞれの使い分け

#Ollama Cloudの適切なケースは非常に限られています

巨大モデルを必要なときだけ評価する
マシンに投資する前に、480Bのコーディング用モデルに価値があるかを10分で試したい場合、クラウドを使えば衝動買いを避けられます。
現地に機材を用意せずに行う顧客向けデモ
Mac Studioを持ち運ばずに、ノートパソコンでPOCを披露する営業担当者。
非常に負荷の高い単発タスク
四半期ごとに一度、長文コンテキストで要約する500ページのリポートで、機密データは一切含まれていない。
学習と探索
670Bモデルに何ができるかを知り、その後、何を目指すべきかを把握したうえでローカル環境に戻ること。

#セルフホスティングが有利なケース

あらゆる継続的な利用
日常的なコーディング支援、社内チーム用チャット、企業文書を対象にしたRAGでは、請求額が安定していることが重要です。
機密性の高いデータを扱うあらゆる用途
議論の余地はありません。法律、医療、人事、金融、研究開発、独自開発のコードに関するデータは、ローカルに留めます。
あらゆる自動化された利用
バッチパイプライン、ループ処理を繰り返すエージェント、n8n、ETLスクリプトでは、クラウドの利用上限をたちまち超えてしまい、コストが予測できなくなります。
あらゆるオフライン用途またはエッジ用途
作業場でのRaspberry Pi、移動中のノートPC、安定したインターネット接続のない現場。
あらゆるカスタマイズのニーズ
ファインチューニング、カスタムModelfile、チーム用のシステムプロンプト、利用しているツールとの緊密な連携――クラウドではこうしたことはできません。
!
ロックインの罠
チームが特定のクラウドモデルを呼び出すことに慣れると、そこから離れるのは大変です。そのモデルに合わせて調整したプロンプト、出力形式、固有の振る舞いがあるためです。最初からセルフホスティングに投資すれば、この依存を避けられ、価格が上がったときにも費用を節約できます。

#さらに詳しく

ご自身のケースにはセルフホスティングが適していると判断した場合(その可能性は高いでしょう)、以下のガイドが順調なスタートを切るために役立ちます。

適切なGPUを選択
ローカルAI用GPUを選ぶガイドでは、VRAM/予算/パフォーマンスのバランスを説明し、RTX 3060 12GBからMac Studio Ultraまでをカバーしています。
量子化について理解する
量子化の選択(Q4、Q5、Q8、FP16)に関するガイドでは、16GBのGPU上で32Bモデルを収容しつつ品質を損なわない方法を説明しています。
運用上の機密性
プライバシー確認リストには、手元のマシンからパケットが一切外に出ていないことを確かめるための具体的な確認項目がまとめられています。実際の挙動によって確かめるためのものです。
Ollama クラウドに関するよくある質問
Ollama Cloudは無料ですか?+
無料プランもありますが、利用上限は厳しく制限されています(同時に使えるモデル数が少なく、利用枠はセッションごと、週ごとに更新されます)。より頻繁に利用する場合に向けて、Ollama は月額サブスクリプションの有料プランを提供しており、同時に使えるモデル数と利用枠が増えます。正確な料金は変わるため、固定された金額を鵜呑みにせず、契約する前に必ず公式ページ ollama.com/pricing を確認してください。
Ollama をクラウドを介さずにどのように使うことができますか?+
何も変わりません。Ollamaを従来どおりローカルにインストールすれば、以前とまったく同じように動作し、アカウントもサブスクリプションも必要ありません。クラウドは任意の機能で、「cloud」と表示されたモデルを明示的に選択し、認証を行った場合にのみ有効になります。標準モデル(Llama、Mistral、Qwenなど)を使用している限り、すべてがローカルで動作し、モデルのダウンロード後はインターネット接続が不要です。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。