初心者 7 分Ollama

Ollama とは何か、どのように機能するか(ガイド (初心者向け)

Ollama とは何か? これは、ご自身のマシン上でローカルに LLM を実行するための最もシンプルなツールです。クラウドも、サブスクリプションも、OpenAI への送信も不要です。このガイドでは、Ollama が何かをゼロから説明し、モデルのダウンロードと実行方法、時間の 90 % で使用する 3、4 つのコマンド、そして開始に必要な最低限の知識を解説します。

著者 Mohamed Meguedmi·更新 2026-08-27·Windows・macOS・Linuxでテスト済み

#Ollamaとは何ですか?

Ollama は、言語モデル(LLM)をご自身のコンピュータに直接ダウンロードし、保存して実行するオープンソースのツールです。コマンドを入力するとモデルがメモリに読み込まれ、コマンドライン、または Ollama に接続したグラフィカルインターフェースから対話できます。すべてローカルで処理され、モデルのダウンロード後は、インターネットにデータが送信されることはありません。

具体的には、Ollamaは2つの役割を同時に果たします。デーモン(バックグラウンドで動作するプログラム)と、そのデーモンと通信するCLI(コマンドラインから使うコマンド)です。デーモンはお使いのマシンのポート11434で接続を待ち受け、小規模なHTTP APIを公開します。OpenAIのAPIと同じ、あるいはほぼ同じものです。そのため、対応するすべてのインターフェース(Open WebUI、クライアントモードのLM Studio、Continue.devなど)は、変更を加えずに接続できます。

i
一言で言うと
Ollamaは、オープンウェイトのLLMをダウンロードして実行するローカルデーモンと、それとやり取りするためのCLIで構成されています。内部では、使いやすくパッケージ化されたllama.cppが動いています。コンパイルも、GGUFファイルの手動操作も必要ありません。

なぜこれほど多くの人がOllamaに乗り換えるのでしょうか。ローカルLLMを使う際の技術的な手間をすべてなくしてくれるからです。コンパイルも、GPUの手動設定も、Pythonのバージョン管理も不要です。インストールして ollama run qwen3.5:9b と入力すれば動きます。LLMにとってのDockerに相当し、モデルとその実行環境を一つの形式にまとめます。

#内部の仕組み

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

Ollamaを起動すると、3つの層が連携して動作します。これらの層を理解すると、問題を診断する力が大きく変わります。

デーモン(ollama serve)
バックグラウンドで動作し、http://localhost:11434 でリクエストを待ち受け、モデルのメモリへの読み込みとメモリからの解放を管理するサービスです。WindowsとmacOSでは、インストール後に自動的に起動します。Linuxでは通常、systemdサービスとして動作します。
推論エンジン (llama.cpp)
モデルを動かすのはこれです。Ollama には CUDA (NVIDIA)、Metal (Apple Silicon) および CPU をサポートする事前にコンパイル済みのバージョンが含まれています。コンパイルは不要です。
CLI(ollama)
ユーザーが呼び出すコマンドラインプログラムです。それ自体が行う処理は多くありません。デーモンにHTTPリクエストを送り、応答を表示します。

ollama run qwen3.5:9b を入力すると、実際に起こるのは次の通りです:CLI がデーモンにモデルの読み込みを要求し、モデルがディスクに存在しない場合は、Ollama のレジストリ(Docker Hub に似たもの)からダウンロードされます。GPUが対応している場合はVRAMに、そうでない場合はRAMに読み込みを行い、インタラクティブなチャットセッションを開始します。重い処理はすべてデーモン側で行われ、CLIはただのクライアントにすぎません。

→
ポート 11434
これは広く使われているHTTPポートです。アプリが「お使いのOllamaに接続する」と説明している場合、接続先はhttp://localhost:11434です。Ollamaが起動していれば、このURLをブラウザで開くと「Ollama is running」というメッセージが表示されます。これが最も簡単な動作確認方法です。

#コマンド:run、pull、list

三つのコマンドが利用の90%をカバーします。これらを覚えれば、残りは自明に思えるでしょう。

#ollama run

まず覚えておきたいコマンドです。モデルがまだなければダウンロードし、メモリに読み込んでから、ターミナルで対話を開始します。

ターミナル
ollama run qwen3.5:9b
# Première fois : télécharge ~6.6 Go puis lance le chat
# Fois suivantes : charge le modèle déjà présent et démarre

セッションに入ったら、質問を入力してEnterキーを押します。終了するには、/byeまたはCtrl+Dを使用します。複数行モードに切り替えるには、3つの引用符(""")で開始します。/で始まるものはすべて内部コマンドです(/show、/set、/clear、/save、/load)。

プロンプトを引数として直接渡すこともできます。スクリプト化に便利です:

ワンショットプロンプト
ollama run qwen3.5:9b "Résume ce texte en 3 points : [...]"

#ollama pull

モデルを実行せずにダウンロードします。複数のモデルを事前に準備したい場合や、特定のバリエーション(サイズ、量子化)を取得したい場合に便利です。

ターミナル
ollama pull granite4.2:3b
ollama pull qwen3.5:9b
ollama pull qwen3.5:9b-q8_0

名前はmodele:tagという形式です。タグを指定しない場合は、デフォルトのバージョン(通常はQ4_K_Mで量子化された8B/9B)が取得されます。タグを明示すると、サイズ(2b、4b、9b、27b、30b)と量子化形式(q4_K_M、q5_K_M、q8_0、fp16)を選択できます。

i
量子化を簡単に説明すると
「生」モデルは、FP16で70億パラメータの場合、14 GBの重みを持ちます。量子化はこれらの数値をより少ないビット数に圧縮します。Q4_K_M(4ビット)はサイズを約4分の1に縮小し、品質の低下は最小限です。これは開始時に推奨される最適解です。Q5_K_Mは品質がやや高く、Q8_0はほぼ完璧ですが2倍の重さがあり、FP16は高性能なGPU向けに予約されています。

#ollama list

マシンにインストールされたモデルを表示し、そのディスク上のサイズとインストール日を示します。

ターミナル
ollama list
# NAME               ID            SIZE    MODIFIED
# qwen3.5:9b         42182419e950  6.6 GB  2 days ago
# granite4.2:8b      f974a74358d6  5.3 GB  1 week ago

#その他の有用なコマンド

ollama ps
現在メモリに読み込まれているモデルと、それぞれが消費するVRAM/RAMの量を表示します。「動作が重い」という問題の診断に欠かせません。
ollama rm <modele>
ディスクからモデルを削除します。モデルフォルダの容量が50 GBほどになってきたときに便利です。
ollama show <modele>
モデルのメタデータを表示します。コンテキストサイズ、量子化、プロンプトテンプレート、対応機能(ツール、画像対応など)が含まれます。
ollama serve
デーモンを手動でフォアグラウンドで起動します。Linuxでの利用や診断に便利です(ログをリアルタイムで確認できます)。
ollama create
Modelfileからカスタムモデルを作成します。ModelfileはLLM用のDockerfileに相当します。より高度な話題です。

#モデルはどこに保存されていますか?

モデルのファイルサイズは数GBに及ぶことがあります。保存場所を把握しておくことは、不要なファイルを整理したり、モデルライブラリを別のディスクに移したり、バックアップしたりするうえで不可欠です。

Windows
%USERPROFILE%\.ollama\models — 通常は C:\Users\votrenom\.ollama\models
macOS
~/.ollama/models
Linux(公式スクリプトによるインストール)
/usr/share/ollama/.ollama/models — le démon tourne sous l'utilisateur ollama
Linux(ユーザーによる手動インストール)
~/.ollama/models

このフォルダ内には 2 つのサブフォルダがあります。blobs(ハッシュで識別されるモデルのバイナリファイル)と manifests(どのタグに対応する blob であるかを記述するメタデータ)。これらのファイルを直接編集しないでください — ollama rm et ollama pull pour を使用して管理してください。

→
モデルを別のディスクに移動
システム用SSDの容量が小さく、より大容量の別のドライブがある場合は、環境変数OLLAMA_MODELSで保存先を変更してください。例:WindowsではOLLAMA_MODELS=D:\ollama-models、Linuxではexport OLLAMA_MODELS=/mnt/data/ollama-models。変数を反映するためにデーモンを再起動してください。

#使い始めるために最低限必要な構成

「Ollamaって何ですか?自分のパソコンで動かせますか?」という質問はよく寄せられます。ここでは、宣伝上の最低要件ではなく、実際に動かすための基準を示します。

RAM 8 GB、GPU なし
Q4の2〜3Bモデルに限られます(Qwen 3.5 2B、Granite 4.2 3B)。最近のCPUで5〜10トークン/秒。試して学ぶ用途には使えます。
RAM 16 GB、GPUなし
8BモデルはQ4なら収まります(Granite 4.2 8B、Qwen 3.5 9B)。速度の目安は4〜8トークン/秒です。継続的な対話用途には遅いですが、動作します。
VRAM 8 GBのGPU
8B モデルの Q4 なら快適に動作します(Qwen 3.5 9B、Granite 4.2 8B — 30〜50 トークン/秒)。12〜14B モデルでは限界に達します。
VRAM 12 GB の GPU(RTX 3060、4070)
2026年の入門向けとして、バランスのよい選択肢です。すべての8Bモデルがスムーズに動作し、Gemma 4 12BもQ4なら快適に使えます。このクラスで最高の品質を求めるなら、Qwen 3.5 9BをQ8で使う選択肢もあります。
16 GBのGPU(RTX 4080、5080)、または32 GBのユニファイドメモリを搭載したMac M-Pro
Q4 の24Bクラス(Mistral Small 24B、Devstral 24B、gpt-oss 20B)へ、または品質を重視して Q8 の Qwen 3.5 9B へとステップアップできます。
GPU 24GB(RTX 3090、4090)またはMac M-Max 48GB以上
27〜35Bのモデル(Qwen 3.8 27B、Qwen 3.6 35B-A3B)を快適に動かせます。少し待つ余裕があれば、Q4の大型MoEモデルも動かせます。

ディスク側では、7Bモデルに対してQ4で10GB、32Bモデルに対して30GBを予備としてください。初期から50GBから100GBの空き容量を確保することで、すぐにデータの整理を迫られません。

!
「GPUが検出されたが使用されていない」という罠
WindowsとLinuxでは、OllamaがGPUを自動検出します。ただし、NVIDIAドライバーが古すぎる場合や、AMD製GPUを使っていてROCmが正しくインストールされていない場合は例外です。ollama psで確認してください。GPUを搭載しているのにPROCESSOR列に100% CPUと表示される場合、ハードウェアアクセラレーションは有効になっていません。Apple Silicon搭載MacのmacOSでは、Metalによるアクセラレーションは自動で、常に有効です。

#おすすめの最初のモデル

Ollamaを初めて使うときは、「どんなものか見てみよう」と、動かせる中で最も大きなモデルを試したくなりがちです。これは間違いです。VRAMを使い切り、モデルの処理がシステムRAMに回されて遅くなり、結局使うのを諦めてしまいます。まずは小さなモデルから始めましょう。

  1. 01
    Qwen 3.5 9B — 標準の選択肢として妥当なモデル
    ollama run qwen3.5:9b télécharge la version Q4_K_M de Qwen 3.5 9B (6,6 Go). Bonne qualité générale, français solide, entrée vision, fenêtre de contexte 256k. C'est le choix 8 Go de 2026 et un excellent baromètre pour évaluer ce que votre machine peut faire.
  2. 02
    Granite 4.2 8B — リソース消費を抑えた選択肢
    ollama run granite4.2:8b pour le modèle d'IBM (5,3 Go, Apache 2.0). Un peu plus léger, très économe en tokens, contexte 128k. Bon compromis si votre carte est juste sur la VRAM. Pour un français très naturel avec plus de VRAM, Mistral Small 24B (ollama run mistral-small) reste une valeur sûre.
  3. 03
    Qwen 3.5 4B — 注目を集める小型の万能モデル
    ollama run qwen3.5:4b pour le nouveau petit modèle par défaut (3,4 Go, Apache 2.0). Étonnamment capable pour sa taille, correct en code léger et en extraction. Beaucoup l'adoptent comme défaut quand la VRAM est comptée.
  4. 04
    Granite 4.2 3B — マシンの性能が控えめな場合
    ollama run granite4.2:3b pour un modèle qui tient sur 4 Go de RAM (2,2 Go, Apache 2.0). Moins capable mais utilisable pour des tâches simples et pour apprendre la mécanique d'Ollama sans souffrir des temps de chargement.
→
チャット中にollama psを実行してください
チャット中に、別のターミナルでollama psを実行してください。読み込まれているモデル、使用メモリ、GPU/CPUへの割り当てを確認できます。実際に何が起きているかを具体的に理解するには、これが最もよい方法です。

#ヒントと落とし穴

モデルは5分間使われないとメモリから解放されます
これはOLLAMA_KEEP_ALIVEのデフォルト値です。モデルをVRAMにより長く保持したい場合は、OLLAMA_KEEP_ALIVE=2hに設定してください(ロード解除を一切しない場合は-1)。逆に、リクエストの終了直後にVRAMを解放したい場合は、0に設定してください。
回答が数文で途切れる
num_ctx(コンテキストウィンドウ)のデフォルト値は4096トークンで、モデルが対応するコンテキスト長にかかわらず、この値が使われます。RAGや長い文書を扱う場合は、PARAMETER num_ctx 32768を指定したModelfileを作成し、ollama createを実行してください。VRAM使用量は急速に増えるので注意してください。
シェルの自動補完なし
すべてのコマンドを確認するにはollama help、各コマンドの詳細を確認するにはollama help <commande>と入力してください。ドキュメントはCLI内にあります。
ネットワーク上の別のマシンから接続が拒否されました
デフォルトでは、Ollamaは127.0.0.1でのみ接続を待ち受けます。LAN上で公開するには、デーモンを起動する前にOLLAMA_HOST=0.0.0.0:11434を設定してください。ファイアウォールの設定も忘れずに確認してください。
同じモデル名でも複数のバージョン
ollama pull qwen3.5:9b et ollama pull qwen3.5:9b-q8_0 téléchargent deux variantes séparées. Surveillez votre disque avec ollama list.
i
5分で使えるグラフィカルインターフェース
仕組みを理解するにはCLIで十分ですが、日常的に使うなら、Open WebUI(ChatGPTのようなウェブインターフェース)か、クライアントモードのLM StudioをOllamaデーモンに接続してください。これらのツールはlocalhost:11434のサーバーを自動検出し、使いやすいインターフェースですべてのモデルを表示します。

#さらに詳しく

Ollamaとは何か、そして基本的にどう動くのかが理解できました。次に進むなら、以下が自然な選択肢です。

実際に自分のOSにインストールする
「WindowsにOllamaをインストールする」ガイド(macOS版、Linux版もあります)では、クリーンな環境でのインストール、GPUの確認、最初のモデルの導入を順を追って説明しています。
適切な量子化の選択
量子化(Q4、Q5、Q8、FP16)を選択する際のガイドは、実際の品質損失を視覚的に比較し、品質とVRAMのバランスを判断するのに役立ちます。
本格的なグラフィカルインターフェースを接続する
当サイトの「Open WebUI と Ollama」のガイドに沿えば、現在動作しているデーモンの上に、RAG を内蔵した複数ユーザー対応の ChatGPT のようなインターフェースを10分で導入できます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。