初心者 3分Ollama

macOS(Apple Silicon)に Ollama をインストールするガイド 2026

Apple Silicon 搭載のMac(M1、M2、M3、M4)は、ローカルAIに適した一般向けマシンの中でも特に優れています。ユニファイドメモリにより、64GBのMacBook Proでは、2,000ユーロのゲーミングPCでは到底扱えない70Bモデルを動かせます。ここでは、3分で使い始める方法を紹介します。

著者 Mohamed Meguedmi·更新 2026-08-27·macOS 14+ でテスト済み

#なぜMacでローカルAIを実行するのか?

一般的なPCでは、GPUのVRAMとCPUのRAMは物理的に分かれています。12 GBのRTX 4070を使っている場合、システムRAMが64 GBあっても、モデルに使えるメモリは12 GBに制限されます。

Apple Silicon搭載Macはユニファイドメモリを採用しており、GPU、CPU、Neural Engineが同じRAMを共有します。64 GBのMacBook Pro M3 Maxでは、モデルに48 GBを割り当てられます。Qwen 3.6 35B-A3Bのような大規模なMoEモデルをフル精度で読み込んだり、複数のモデルを同時に動かしたりするのに十分で、無理なく実行できます。

→
経験則
macOS はシステム用に約 25%の RAM を予約します。16GB の Mac では約 12GB が使用可能と見なせます。32GB の場合:約 24GB。64GB の場合:約 48GB。

#前提条件

Macキット

Ollamaはお使いのMacで動作します。Macキットでは、自動起動、ネットワーク、ログの設定(第7章)を通じてOllamaを信頼できるサービスとして運用できるようにし、Open WebUIを接続します(第8章)。また、ユニファイドメモリによってモデル選びがどう変わるかも説明します(第2章)。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応
macOS 12 Monterey以降
Metalの最新の最適化を利用するには、Sonoma(14)またはSequoia(15)を推奨します。
Apple Silicon搭載Mac
M1、M2、M3、またはM4 — pro、max、ultra、どれも問題ありません。Intelは公式サポートされていません(遅い)。
RAMは最低16 GB必要
8 GBでも3Bモデルは動作しますが、余裕はあまりありません。16 GBなら8〜9Bモデル、32 GBなら30BのMoEモデル(Qwen 3.6 35B-A3Bなど)、64 GBなら大型モデルをフル精度で動かせます。
約20GBのディスクスペース
3〜4個のモデル用です。ダウンロードしたモデルは~/.ollama/modelsに保存されます。

#1. インストール

方法は2つあり、どちらも適切です。公式の .dmg を使う方法と Homebrew を使う方法です。開発者は Homebrew を好むでしょうし、それ以外の方はより簡単な方法を選ぶでしょう。

#オプションA — .dmgアプリケーション

公式ダウンロード
https://ollama.com/download/mac
  1. 01
    ダウンロードした.dmgファイルを開く
    ほかのMacアプリと同じように、Ollama.appをアプリケーションフォルダへドラッグしてください。
  2. 02
    Ollama.app を一度起動してください
    最初の起動時にmacOSが確認を求めます("インターネットからダウンロードされたアプリ")。『開く』をクリックしてください。
  3. 03
    コマンドラインツールの許可
    Ollamaはコマンド ollama のインストールを提案します。承認してください——管理者パスワードが求められます。
  4. 04
    メニューバーにラマのアイコンが表示されます
    これがデーモンです。最初に表示されるウィンドウを閉じても、デーモンは動作し続けます。

#オプションB — Homebrew

ターミナル
brew install --cask ollama

より短時間で更新できます。利点:新しいバージョンがリリースされたら、brew upgrade ollama で更新できます。

#確認

ターミナル
ollama --version

#2. 初めてのモデル

16GBのMacでは、まずQwen 3.5 9BまたはGranite 4.2 8Bから始めてください。32GB以上なら、最初からQwen 3.8 27Bや、Qwen 3.6 35B-A3Bのような高速なMoEモデルを選べます。

Qwen 3.5 9B(16 GB以上のすべての構成)
ollama run qwen3.5:9b
Granite 4.2 8B(16 GB以上なら快適)
ollama run granite4.2:8b
Qwen 3.8 27B (32GB以上を推奨)
ollama run qwen3.8:27b
Qwen 3.6 35B-A3B MoE(32GB以上、64GBで快適)
ollama run qwen3.6:35b
i
最初のダウンロード
モデルは Ollama の CDN 経由でダウンロードされます(容量は数 GB)。接続環境に応じて、2〜10 分を見込んでください。次回以降の起動は即座に行えます。

#3. ユニファイドメモリを理解する

macOSはアプリ間でRAMを動的に割り当てます。Ollamaがモデルを読み込むと、必要に応じてシステムがほかのデータを自動的にスワップ領域へ移します。そのため、普段より大きなモデルを読み込めますが、その代わりにシステム全体の動作が遅くなります。

モデルが実行されている間、リアルタイムで監視するためには:

メモリの監視
top -o mem
!
スワップが過剰になると遅くなる
Ollamaの実行中にアクティブなスワップが10 GBを超えて表示される場合、お使いのMacに対してモデルが大きすぎます。サイズを下げたり、よりアグレッシブな量子化(Q4ではなくQ3など)を選択してください。

#4. Metalのアクセラレーションを確認

Metal は、CUDA に相当する Apple の API で、Ollama が Mac の内蔵 GPU で計算を実行できるようにします。デフォルトで有効ですが、確認しておくとよいでしょう。

読み込まれたモデルの状態
ollama ps

PROCESSOR列には100% GPUと表示されている必要があります。CPUと表示される場合は、何か問題があります。モデルがサポートされていないか、Metalドライバーが古すぎるかのどちらかです。

GPUの消費量(リアルタイム)
sudo powermetrics --samplers gpu_power -i 500

#5. ChatGPT風のインターフェース

日常的に使うには、ターミナルでの操作はすぐに負担になります。Mac では、使いやすい選択肢が3つあります。

Enchanted (無料、App Store)
デザインが最も洗練されています。SwiftUIで作られたネイティブアプリで、設定なしでOllamaに接続できます。
Msty(無料、.dmg)
より多機能:複数モデルへの対応、タブ、保存済みプロンプト、内蔵RAG。
Dockerを用いたOpen WebUI
すでに Docker を導入しているなら、これが最も機能の豊富な版です(履歴、Markdown、拡張機能)。
Enchantedを1行で
open 'macappstore://apps.apple.com/app/enchanted-llm/id6474268307'

#6. システム起動時にOllamaを起動する

.dmgからインストールした場合、Ollamaはデフォルトでログイン時に起動します。Homebrewからインストールした場合は、手動で起動します:

brew servicesによる自動起動
brew services start ollama

無効にするには:brew services stop ollama。状態を確認するには:brew services list。

#トラブルシューティング

インストール後に「ollama : command not found」と表示される
シンボリックリンクが作成されていません。Ollama.appを一度起動し、CLIのインストールの案内を承認してください。
モデルが途中でクラッシュする
メモリが不足しています。Chrome/Electronを閉じて、もう一度起動してください。それでも解決しない場合は、量子化によってサイズをさらに小さくしたモデルを選んでください。
MacBookのファンが全速で回る
負荷の高い推論中には通常起こる現象です。抑えるには、より小さなモデルを使うか、電源につないでください(MacBookはバッテリー駆動時に性能を制限します)。
Ollamaを削除できない
デーモンを停止:ollama stop。その後、Ollama.appを削除し、~/.ollamaフォルダ(すべてのダウンロード済みモデルを含む)も削除してください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。