Ollama とは何か、どのように機能するか(ガイド (初心者向け)
Ollama とは何か? これは、ご自身のマシン上でローカルに LLM を実行するための最もシンプルなツールです。クラウドも、サブスクリプションも、OpenAI への送信も不要です。このガイドでは、Ollama が何かをゼロから説明し、モデルのダウンロードと実行方法、時間の 90 % で使用する 3、4 つのコマンド、そして開始に必要な最低限の知識を解説します。
#Ollamaとは何ですか?
Ollama は、言語モデル(LLM)をご自身のコンピュータに直接ダウンロードし、保存して実行するオープンソースのツールです。コマンドを入力するとモデルがメモリに読み込まれ、コマンドライン、または Ollama に接続したグラフィカルインターフェースから対話できます。すべてローカルで処理され、モデルのダウンロード後は、インターネットにデータが送信されることはありません。
具体的には、Ollamaは2つの役割を同時に果たします。デーモン(バックグラウンドで動作するプログラム)と、そのデーモンと通信するCLI(コマンドラインから使うコマンド)です。デーモンはお使いのマシンのポート11434で接続を待ち受け、小規模なHTTP APIを公開します。OpenAIのAPIと同じ、あるいはほぼ同じものです。そのため、対応するすべてのインターフェース(Open WebUI、クライアントモードのLM Studio、Continue.devなど)は、変更を加えずに接続できます。
なぜこれほど多くの人がOllamaに乗り換えるのでしょうか。ローカルLLMを使う際の技術的な手間をすべてなくしてくれるからです。コンパイルも、GPUの手動設定も、Pythonのバージョン管理も不要です。インストールして ollama run qwen3.5:9b と入力すれば動きます。LLMにとってのDockerに相当し、モデルとその実行環境を一つの形式にまとめます。
#内部の仕組み
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
Ollamaを起動すると、3つの層が連携して動作します。これらの層を理解すると、問題を診断する力が大きく変わります。
- デーモン(ollama serve)
- バックグラウンドで動作し、http://localhost:11434 でリクエストを待ち受け、モデルのメモリへの読み込みとメモリからの解放を管理するサービスです。WindowsとmacOSでは、インストール後に自動的に起動します。Linuxでは通常、systemdサービスとして動作します。
- 推論エンジン (llama.cpp)
- モデルを動かすのはこれです。Ollama には CUDA (NVIDIA)、Metal (Apple Silicon) および CPU をサポートする事前にコンパイル済みのバージョンが含まれています。コンパイルは不要です。
- CLI(ollama)
- ユーザーが呼び出すコマンドラインプログラムです。それ自体が行う処理は多くありません。デーモンにHTTPリクエストを送り、応答を表示します。
ollama run qwen3.5:9b を入力すると、実際に起こるのは次の通りです:CLI がデーモンにモデルの読み込みを要求し、モデルがディスクに存在しない場合は、Ollama のレジストリ(Docker Hub に似たもの)からダウンロードされます。GPUが対応している場合はVRAMに、そうでない場合はRAMに読み込みを行い、インタラクティブなチャットセッションを開始します。重い処理はすべてデーモン側で行われ、CLIはただのクライアントにすぎません。
#コマンド:run、pull、list
三つのコマンドが利用の90%をカバーします。これらを覚えれば、残りは自明に思えるでしょう。
#ollama run
まず覚えておきたいコマンドです。モデルがまだなければダウンロードし、メモリに読み込んでから、ターミナルで対話を開始します。
セッションに入ったら、質問を入力してEnterキーを押します。終了するには、/byeまたはCtrl+Dを使用します。複数行モードに切り替えるには、3つの引用符(""")で開始します。/で始まるものはすべて内部コマンドです(/show、/set、/clear、/save、/load)。
プロンプトを引数として直接渡すこともできます。スクリプト化に便利です:
#ollama pull
モデルを実行せずにダウンロードします。複数のモデルを事前に準備したい場合や、特定のバリエーション(サイズ、量子化)を取得したい場合に便利です。
名前はmodele:tagという形式です。タグを指定しない場合は、デフォルトのバージョン(通常はQ4_K_Mで量子化された8B/9B)が取得されます。タグを明示すると、サイズ(2b、4b、9b、27b、30b)と量子化形式(q4_K_M、q5_K_M、q8_0、fp16)を選択できます。
#ollama list
マシンにインストールされたモデルを表示し、そのディスク上のサイズとインストール日を示します。
#その他の有用なコマンド
- ollama ps
- 現在メモリに読み込まれているモデルと、それぞれが消費するVRAM/RAMの量を表示します。「動作が重い」という問題の診断に欠かせません。
- ollama rm <modele>
- ディスクからモデルを削除します。モデルフォルダの容量が50 GBほどになってきたときに便利です。
- ollama show <modele>
- モデルのメタデータを表示します。コンテキストサイズ、量子化、プロンプトテンプレート、対応機能(ツール、画像対応など)が含まれます。
- ollama serve
- デーモンを手動でフォアグラウンドで起動します。Linuxでの利用や診断に便利です(ログをリアルタイムで確認できます)。
- ollama create
- Modelfileからカスタムモデルを作成します。ModelfileはLLM用のDockerfileに相当します。より高度な話題です。
#モデルはどこに保存されていますか?
モデルのファイルサイズは数GBに及ぶことがあります。保存場所を把握しておくことは、不要なファイルを整理したり、モデルライブラリを別のディスクに移したり、バックアップしたりするうえで不可欠です。
- Windows
- %USERPROFILE%\.ollama\models — 通常は C:\Users\votrenom\.ollama\models
- macOS
- ~/.ollama/models
- Linux(公式スクリプトによるインストール)
- /usr/share/ollama/.ollama/models — le démon tourne sous l'utilisateur ollama
- Linux(ユーザーによる手動インストール)
- ~/.ollama/models
このフォルダ内には 2 つのサブフォルダがあります。blobs(ハッシュで識別されるモデルのバイナリファイル)と manifests(どのタグに対応する blob であるかを記述するメタデータ)。これらのファイルを直接編集しないでください — ollama rm et ollama pull pour を使用して管理してください。
#使い始めるために最低限必要な構成
「Ollamaって何ですか?自分のパソコンで動かせますか?」という質問はよく寄せられます。ここでは、宣伝上の最低要件ではなく、実際に動かすための基準を示します。
- RAM 8 GB、GPU なし
- Q4の2〜3Bモデルに限られます(Qwen 3.5 2B、Granite 4.2 3B)。最近のCPUで5〜10トークン/秒。試して学ぶ用途には使えます。
- RAM 16 GB、GPUなし
- 8BモデルはQ4なら収まります(Granite 4.2 8B、Qwen 3.5 9B)。速度の目安は4〜8トークン/秒です。継続的な対話用途には遅いですが、動作します。
- VRAM 8 GBのGPU
- 8B モデルの Q4 なら快適に動作します(Qwen 3.5 9B、Granite 4.2 8B — 30〜50 トークン/秒)。12〜14B モデルでは限界に達します。
- VRAM 12 GB の GPU(RTX 3060、4070)
- 2026年の入門向けとして、バランスのよい選択肢です。すべての8Bモデルがスムーズに動作し、Gemma 4 12BもQ4なら快適に使えます。このクラスで最高の品質を求めるなら、Qwen 3.5 9BをQ8で使う選択肢もあります。
- 16 GBのGPU(RTX 4080、5080)、または32 GBのユニファイドメモリを搭載したMac M-Pro
- Q4 の24Bクラス(Mistral Small 24B、Devstral 24B、gpt-oss 20B)へ、または品質を重視して Q8 の Qwen 3.5 9B へとステップアップできます。
- GPU 24GB(RTX 3090、4090)またはMac M-Max 48GB以上
- 27〜35Bのモデル(Qwen 3.8 27B、Qwen 3.6 35B-A3B)を快適に動かせます。少し待つ余裕があれば、Q4の大型MoEモデルも動かせます。
ディスク側では、7Bモデルに対してQ4で10GB、32Bモデルに対して30GBを予備としてください。初期から50GBから100GBの空き容量を確保することで、すぐにデータの整理を迫られません。
#おすすめの最初のモデル
Ollamaを初めて使うときは、「どんなものか見てみよう」と、動かせる中で最も大きなモデルを試したくなりがちです。これは間違いです。VRAMを使い切り、モデルの処理がシステムRAMに回されて遅くなり、結局使うのを諦めてしまいます。まずは小さなモデルから始めましょう。
- 01Qwen 3.5 9B — 標準の選択肢として妥当なモデルollama run qwen3.5:9b télécharge la version Q4_K_M de Qwen 3.5 9B (6,6 Go). Bonne qualité générale, français solide, entrée vision, fenêtre de contexte 256k. C'est le choix 8 Go de 2026 et un excellent baromètre pour évaluer ce que votre machine peut faire.
- 02Granite 4.2 8B — リソース消費を抑えた選択肢ollama run granite4.2:8b pour le modèle d'IBM (5,3 Go, Apache 2.0). Un peu plus léger, très économe en tokens, contexte 128k. Bon compromis si votre carte est juste sur la VRAM. Pour un français très naturel avec plus de VRAM, Mistral Small 24B (ollama run mistral-small) reste une valeur sûre.
- 03Qwen 3.5 4B — 注目を集める小型の万能モデルollama run qwen3.5:4b pour le nouveau petit modèle par défaut (3,4 Go, Apache 2.0). Étonnamment capable pour sa taille, correct en code léger et en extraction. Beaucoup l'adoptent comme défaut quand la VRAM est comptée.
- 04Granite 4.2 3B — マシンの性能が控えめな場合ollama run granite4.2:3b pour un modèle qui tient sur 4 Go de RAM (2,2 Go, Apache 2.0). Moins capable mais utilisable pour des tâches simples et pour apprendre la mécanique d'Ollama sans souffrir des temps de chargement.
#ヒントと落とし穴
- モデルは5分間使われないとメモリから解放されます
- これはOLLAMA_KEEP_ALIVEのデフォルト値です。モデルをVRAMにより長く保持したい場合は、OLLAMA_KEEP_ALIVE=2hに設定してください(ロード解除を一切しない場合は-1)。逆に、リクエストの終了直後にVRAMを解放したい場合は、0に設定してください。
- 回答が数文で途切れる
- num_ctx(コンテキストウィンドウ)のデフォルト値は4096トークンで、モデルが対応するコンテキスト長にかかわらず、この値が使われます。RAGや長い文書を扱う場合は、PARAMETER num_ctx 32768を指定したModelfileを作成し、ollama createを実行してください。VRAM使用量は急速に増えるので注意してください。
- シェルの自動補完なし
- すべてのコマンドを確認するにはollama help、各コマンドの詳細を確認するにはollama help <commande>と入力してください。ドキュメントはCLI内にあります。
- ネットワーク上の別のマシンから接続が拒否されました
- デフォルトでは、Ollamaは127.0.0.1でのみ接続を待ち受けます。LAN上で公開するには、デーモンを起動する前にOLLAMA_HOST=0.0.0.0:11434を設定してください。ファイアウォールの設定も忘れずに確認してください。
- 同じモデル名でも複数のバージョン
- ollama pull qwen3.5:9b et ollama pull qwen3.5:9b-q8_0 téléchargent deux variantes séparées. Surveillez votre disque avec ollama list.
#さらに詳しく
Ollamaとは何か、そして基本的にどう動くのかが理解できました。次に進むなら、以下が自然な選択肢です。
- 実際に自分のOSにインストールする
- 「WindowsにOllamaをインストールする」ガイド(macOS版、Linux版もあります)では、クリーンな環境でのインストール、GPUの確認、最初のモデルの導入を順を追って説明しています。
- 適切な量子化の選択
- 量子化(Q4、Q5、Q8、FP16)を選択する際のガイドは、実際の品質損失を視覚的に比較し、品質とVRAMのバランスを判断するのに役立ちます。
- 本格的なグラフィカルインターフェースを接続する
- 当サイトの「Open WebUI と Ollama」のガイドに沿えば、現在動作しているデーモンの上に、RAG を内蔵した複数ユーザー対応の ChatGPT のようなインターフェースを10分で導入できます。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。