OllamaでGemma 4をローカル実行:インストール、VRAM、 perfs
Gemma 4 は、Googleが2026年にリリースした新世代のオープンウェイトモデルです。ネイティブでマルチモーダルに対応し、長いコンテキストを扱え、ライセンスはApache 2.0です。Ollamaライブラリには、実用的な3つのサイズ、E2B(コンパクト)、12B、26B-A4B(MoE)が用意されています。このガイドでは、OllamaでGemma 4を実行する方法、VRAMに応じた量子化の選び方、RTXとApple Siliconでの生成速度の目安(トークン/秒)、Gemma 3と比べて具体的に何が変わるかを解説します。
#なぜGemma 4をローカルで使うのか
Gemma 4は、同規模のオープンウェイトモデルの中でも、フランス語に特に優れたモデルの一つです。12B Q4は8〜12 GBのVRAMに余裕を持って収まるため、RTX 3060や4070、ミドルレンジのMac Mシリーズで利用できます。26B-A4Bは40億のパラメータだけを有効にするMoEモデルで、24 GBのGPU(3090、4090、7900 XTX)やユニファイドメモリを十分に備えたMacを活用しながら、高速に動作します。フランス語のアシスタント、RAG、汎用的なコーディング用途では、まず選ぶモデルとして非常に優秀です。
ローカルで実行するもう一つの理由は、Gemma 4 が2026年4月から Apache 2.0 ライセンスで公開されていることです。これにより、従来の Gemma Terms of Use による制約がなくなり、商用利用、再配布、ファインチューニングが自由に行えます。また、Ollama がモデルの取得、量子化、推論を管理するため、利用者が Python、CUDA、llama.cpp を直接操作する必要はありません。
#Gemma 3と比べて何が変化したか
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
Gemma 3(2025年3月)はマルチモーダル機能と128kのコンテキストを導入しました。Gemma 4はこれらを引き継ぎ、3つの面で進化しています。品質では、推論とコードのベンチマークで大幅な向上が測定されています。効率では、12Bが多くのタスクでGemma 3の27Bより優れた代替となり、MoEの26B-A4Bは小さなモデルの速度で大きなモデル相当の性能を発揮します。トークナイザーでは、語彙がより高密度になり、同等の内容を生成するのに必要なトークン数が減るため、1秒当たりの有用なトークン数が増えます。
- サイズ
- Gemma 3:1B、4B、12B、27B(デンスモデル)。Gemma 4:E2B(コンパクト)、12B(デンスモデル)、26B-A4B(MoE、アクティブパラメータ数4B)。このシリーズは、単純にモデルを大型化するのではなく、効率を高める方向に進化しています。
- マルチモーダル
- 12Bと26B-A4Bは画像理解にネイティブ対応しています(テキスト+画像)。E2Bは引き続き、テキスト向けのコンパクトなバリエーションです。
- コンテキスト
- 全ラインアップで128kトークン対応。以前と同じメモリ制限が適用されます:KVキャッシュのサイズがすぐに大きくなります。
- Tokenizer
- SentencePieceを採用し、フランス語、コード、非ラテン文字を使う言語をよりよく扱えるように語彙を見直しています。同等のプロンプトで、トークン消費量が約5〜15%少なくなります。
- ライセンス
- 2026年4月からApache 2.0。商用利用、再配布、ファインチューニングは自由で、許容される利用に関する独自の条項はありません。Gemma 3の「Gemma Terms of Use」と比べると、大きな変更です。
#前提条件
- Ollama インストール済み
- 比較的新しいバージョン(≥ 0.5)。まだインストールしていない場合は、Windows、macOS、Linuxのインストールガイドを参照してください。
- ディスク容量
- E2Bでは4.3 GB、12B Q4では7.6 GB、26B-A4B Q4では19 GBを見込んでください。12Bと26BのQ5・Q8版は、サイズが1.3〜2倍になります。
- VRAMまたは統合メモリ
- 実用上の最低容量は、E2Bで6GB、Q4の12Bで8~12GB、Q4の26B-A4Bで24GBです。これを下回ると、モデルの一部の処理がCPUに回り、速度が大幅に低下します。
- 最新のGPUドライバー
- NVIDIAにはCUDA 12.x、AMDにはROCm 6.x、Apple SiliconにはネイティブのMetalを使用します。Ollamaはバックエンドを自動検出します。
#1. 1つのコマンドでプルと起動
Gemma 4 の Ollama タグは、通常の命名規則に従います。gemma4(latest はデフォルトで 12B Q4 を指します)、gemma4:e2b-it-qat、gemma4:12b、gemma4:26b です。量子化方式を明示する場合は、gemma4:12b-instruct-q4_K_M のように接尾辞を付けます。
最初の実行時に、Ollamaはモデルをダウンロード(12B Q4の場合約7.6 GB)し、直ちにインタラクティブなプロンプトを表示します。以降の実行では、モデルがメモリキャッシュに残っている限り、起動が即時になります。
VRAMに何が読み込まれているかをリアルタイムで確認するには:
PROCESSOR列には100% GPUと表示される必要があります。70%/30% GPU/CPUと表示される場合、モデルがVRAMに収まっていません。より強く圧縮する量子化、または一段小さいサイズのモデルに切り替えてください。
#2. モデルサイズと量子化方式別のVRAM
以下の数値には、モデルの重みに加えて、8kトークンのコンテキストウィンドウ(Ollamaのデフォルト設定)用のKVキャッシュが含まれています。32kまたは128kに拡張する場合は、モデルのサイズに応じてさらに2〜8 GBを見込んでください。
- Gemma 4 E2B — QAT int4
- VRAMは約4.5GB。コンパクトな派生版です(QAT、MatFormer方式で約20億のアクティブパラメータ)。GTX 1660(6GB)やRTX 3050(8GB)のどのモデルでも、または8GBのユニファイドメモリを搭載したMacで動作します。
- Gemma 4 12B — Q4_K_M
- ≈ 8 GB の VRAM。対象となるのは RTX 3060 12 GB、4070 12 GB、5070 12 GB、Mac 16 GB 以上です。
- Gemma 4 12B — Q5_K_M
- VRAM使用量は約9.5GB。コンテキスト長を控えめにすれば12GBに収まり、16GBならより余裕があります(4070 Ti Super、5080)。
- Gemma 4 12B — Q8_0
- VRAMは約13 GB。VRAMが16 GB以上のグラフィックカード、またはメモリ容量に余裕のあるApple Silicon搭載機向けです。
- Gemma 4 26B-A4B — Q4_K_M
- VRAM:約19 GB。適した構成:RTX 3090、4090、5090、RX 7900 XTX、Mac Studio。MoE:アクティブな4B分だけを読み込むため、メモリ使用量が大きくても高速です。
- Gemma 4 26B-A4B — Q5_K_M
- VRAMは約23 GB。24 GB環境では上限に近いため、それ以外の選択肢として、48 GB以上のユニファイドメモリを搭載したMacか、マルチGPU構成を検討してください。
- Gemma 4 26B-A4B — Q8_0
- VRAM は約 30 GB。VRAM 32 GB 以上の GPU(RTX 5090)や、ユニファイドメモリ 48 GB 以上の Mac 向けです。
#3. トークン/秒:RTXとApple Silicon
新しいバージョンのOllamaで、コンテキスト8k、短いプロンプト、200トークンの生成という条件で観測したおおよその値です。数値は生成内容とOllamaのバージョンによって±15%変動します。26B-A4BはMoE(アクティブパラメータ4B)なので、メモリに収まれば、密な26Bモデルよりもはるかに高速に動作します。
- RTX 3060 12 GB
- Gemma 4 E2B:約90 tok/s。Gemma 4 12B Q4:約28 tok/s。26B-A4B:19 GB 必要で容量に収まらないため、避けてください。
- RTX 4070 12 GB
- E2B:約130 tok/s。12B Q4:約46 tok/s。26B-A4B:VRAMに収まりません。
- RTX 4080 Super 16 GB
- 12B Q4:約 66 tok/s。12B Q8:約 40 tok/s。26B-A4B は 16 GB 以内には収まらない。
- RTX 4090 24 GB
- 12B Q4:約100トークン/秒。26B-A4B Q4:約58トークン/秒。26B-A4B Q5:約50トークン/秒。
- RTX 5090 32GB
- 12B Q4:~150 tok/s。26B-A4B Q4:~88 tok/s。26B-A4B Q8:~48 tok/s。
- Mac M3 Max 64 GB
- 12B Q4:~38 tok/s。26B-A4B Q4:~30 tok/s。統合メモリのおかげで安定したパフォーマンスを実現。
- Mac M4 Pro 48 GB
- 12B Q4:約34トークン/秒。26B-A4B Q4:約24トークン/秒。MoEは問題なく収まり、サイズの割に軽快に動作します。
- Mac M4 Max 128 GB
- 26B-A4B Q4:~36 tok/s。26B-A4B Q8:~20 tok/s。26Bを日常的に使用する上で最も適したMac
#4. 最初のプロンプトと有用な設定
Gemma 4は特別なシステムプロンプトがなくてもフランス語で良好に応答しますが、用途に応じて調整したほうがよいパラメータもいくつかあります。
インタラクティブなプロンプトからパラメータを即座に調整する方法は以下の通りです:
- temperature
- デフォルトは 0.7 です。事実に基づく内容、コード、RAG では 0.2〜0.4 に下げてください。ブレインストーミングでは 0.9〜1.1 に上げてください。
- num_ctx
- コンテキストウィンドウ。デフォルトはビルドによって4096または8192です。用途と利用可能なVRAMに応じて増やしてください。
- num_predict
- 生成するトークン数の上限。-1 は無制限(生成が停止するまで)。応答の長さを制限するのに役立ちます。
- repeat_penalty
- デフォルトは1.1です。Gemma 4が同じ内容を繰り返す場合は、1.15〜1.2に上げてください。回答が書き言葉に寄りすぎていると感じる場合は、1.05に下げてください。
#5. APIおよびコードからの統合
Ollamaは、http://localhost:11434/v1 にOpenAI互換のエンドポイントを提供しています。OpenAI APIに対応するSDKなら、base_urlをこのローカルエンドポイントに設定するだけで動作します。
マルチモーダルバージョン(12Bおよび26B-A4B)では、メッセージ内に画像をbase64形式またはローカルURLで指定します。これはGPT-4oと同じプロトコルです。
#トラブルシューティング
- "Error: model gemma4 not found"
- お使いのOllamaのバージョンにはそのタグがまだ存在しないか、入力ミスがあります。ollama listでインストール済みのモデルを確認し、Ollamaライブラリのドキュメントで公式タグを確認してください。
- CPU側にオフロードされるモデル
- ollama ps affiche 60% GPU / 40% CPU. Passez à une quantization plus agressive (Q4 → Q3_K_S), réduisez num_ctx, ou descendez d'une taille (12B → E2B).
- 数時間後に速度が3分の1に低下
- 一部のドライバーではKVキャッシュが断片化します。Ollamaサービスを再起動してください(Linuxではsudo systemctl restart ollamaを実行し、Mac/Windowsではアプリを再起動します)。
- 約400語で応答が途中で切れる
- num_predict の値が低すぎます。2048、または無制限にするなら -1 に設定し、それに応じて num_ctx を増やしてください。
- E2Bのフランス語が不自然
- これは想定内です。E2B はサイズの割に高性能ですが、あくまでコンパクトなモデルです。フランス語の品質に高い水準を求める場合は、12B を選んでください。
- RTX 4060 8 GBで12Bモデルを実行するとOOMが発生
- Q4 に量子化した 12B モデルは 8 GB にぎりぎり収まりますが、コンテキスト用の余裕はありません。gemma4:e2b-it-qat を選ぶか、CPU へのオフロード(約 3〜5 トークン/秒)を受け入れるか、グラフィックカードを交換してください。
#さらに詳しく
Gemma 4が動くようになりました。用途に応じて、さらに活用するためのヒントをいくつか紹介します。
- Ollama とは何か、どのように動作するか
- Ollamaを初めて使う方には、この初心者向けガイドで基本的なコマンドと仕組みの全体像を説明しています。
- 量子化の選択(Q4、Q5、Q8、FP16)
- Q8からQ4に切り替えると具体的に何を犠牲にするのか、そしてそれがどのような場合に本当に重要になるのかを理解するために。
- Ollamaと組み合わせたOpen WebUI
- Gemma 4を使えるChatGPT風のインターフェースに:会話履歴、組み込みRAG、複数ユーザー間での共有。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。