中級 10 分Gemma

OllamaでGemma 4をローカル実行:インストール、VRAM、 perfs

Gemma 4 は、Googleが2026年にリリースした新世代のオープンウェイトモデルです。ネイティブでマルチモーダルに対応し、長いコンテキストを扱え、ライセンスはApache 2.0です。Ollamaライブラリには、実用的な3つのサイズ、E2B(コンパクト)、12B、26B-A4B(MoE)が用意されています。このガイドでは、OllamaでGemma 4を実行する方法、VRAMに応じた量子化の選び方、RTXとApple Siliconでの生成速度の目安(トークン/秒)、Gemma 3と比べて具体的に何が変わるかを解説します。

著者 Mohamed Meguedmi·更新 2026-08-27·Windows・macOS・Linuxでテスト済み

#なぜGemma 4をローカルで使うのか

Gemma 4は、同規模のオープンウェイトモデルの中でも、フランス語に特に優れたモデルの一つです。12B Q4は8〜12 GBのVRAMに余裕を持って収まるため、RTX 3060や4070、ミドルレンジのMac Mシリーズで利用できます。26B-A4Bは40億のパラメータだけを有効にするMoEモデルで、24 GBのGPU(3090、4090、7900 XTX)やユニファイドメモリを十分に備えたMacを活用しながら、高速に動作します。フランス語のアシスタント、RAG、汎用的なコーディング用途では、まず選ぶモデルとして非常に優秀です。

ローカルで実行するもう一つの理由は、Gemma 4 が2026年4月から Apache 2.0 ライセンスで公開されていることです。これにより、従来の Gemma Terms of Use による制約がなくなり、商用利用、再配布、ファインチューニングが自由に行えます。また、Ollama がモデルの取得、量子化、推論を管理するため、利用者が Python、CUDA、llama.cpp を直接操作する必要はありません。

i
一言で
Gemma 4 + Ollamaなら、モデルをダウンロードするコマンドが1つ、会話するためのコマンドが1つ、そしてlocalhost:11434にOpenAI互換のエンドポイントがあります。あとは設定を調整するだけです。

#Gemma 3と比べて何が変化したか

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

Gemma 3(2025年3月)はマルチモーダル機能と128kのコンテキストを導入しました。Gemma 4はこれらを引き継ぎ、3つの面で進化しています。品質では、推論とコードのベンチマークで大幅な向上が測定されています。効率では、12Bが多くのタスクでGemma 3の27Bより優れた代替となり、MoEの26B-A4Bは小さなモデルの速度で大きなモデル相当の性能を発揮します。トークナイザーでは、語彙がより高密度になり、同等の内容を生成するのに必要なトークン数が減るため、1秒当たりの有用なトークン数が増えます。

サイズ
Gemma 3:1B、4B、12B、27B(デンスモデル)。Gemma 4:E2B(コンパクト)、12B(デンスモデル)、26B-A4B(MoE、アクティブパラメータ数4B)。このシリーズは、単純にモデルを大型化するのではなく、効率を高める方向に進化しています。
マルチモーダル
12Bと26B-A4Bは画像理解にネイティブ対応しています(テキスト+画像)。E2Bは引き続き、テキスト向けのコンパクトなバリエーションです。
コンテキスト
全ラインアップで128kトークン対応。以前と同じメモリ制限が適用されます:KVキャッシュのサイズがすぐに大きくなります。
Tokenizer
SentencePieceを採用し、フランス語、コード、非ラテン文字を使う言語をよりよく扱えるように語彙を見直しています。同等のプロンプトで、トークン消費量が約5〜15%少なくなります。
ライセンス
2026年4月からApache 2.0。商用利用、再配布、ファインチューニングは自由で、許容される利用に関する独自の条項はありません。Gemma 3の「Gemma Terms of Use」と比べると、大きな変更です。
→
Gemma 3を使い続けるべき場合
すでにGemma 3 12Bで安定して動作するRAGパイプラインがあり、その品質で十分なら、移行すること自体を目的に移行しないでください。Gemma 4 12Bのほうが優れていますが、VRAM使用量のわずかな増加(Q4で約8 GB対約7 GB)とプロンプトの再調整が見合うのは、Gemma 3の12Bモデルの限界に直面している場合だけです。

#前提条件

Ollama インストール済み
比較的新しいバージョン(≥ 0.5)。まだインストールしていない場合は、Windows、macOS、Linuxのインストールガイドを参照してください。
ディスク容量
E2Bでは4.3 GB、12B Q4では7.6 GB、26B-A4B Q4では19 GBを見込んでください。12Bと26BのQ5・Q8版は、サイズが1.3〜2倍になります。
VRAMまたは統合メモリ
実用上の最低容量は、E2Bで6GB、Q4の12Bで8~12GB、Q4の26B-A4Bで24GBです。これを下回ると、モデルの一部の処理がCPUに回り、速度が大幅に低下します。
最新のGPUドライバー
NVIDIAにはCUDA 12.x、AMDにはROCm 6.x、Apple SiliconにはネイティブのMetalを使用します。Ollamaはバックエンドを自動検出します。

#1. 1つのコマンドでプルと起動

Gemma 4 の Ollama タグは、通常の命名規則に従います。gemma4(latest はデフォルトで 12B Q4 を指します)、gemma4:e2b-it-qat、gemma4:12b、gemma4:26b です。量子化方式を明示する場合は、gemma4:12b-instruct-q4_K_M のように接尾辞を付けます。

プルおよび直接起動
ollama run gemma4:12b

最初の実行時に、Ollamaはモデルをダウンロード(12B Q4の場合約7.6 GB)し、直ちにインタラクティブなプロンプトを表示します。以降の実行では、モデルがメモリキャッシュに残っている限り、起動が即時になります。

プルのみ(実行しない)
ollama pull gemma4:e2b-it-qat
ollama pull gemma4:12b
ollama pull gemma4:26b
i
明示的に量子化を選択
OllamaはデフォルトでQ4_K_Mを使用します。95%のケースで、これが品質とメモリ使用量の最適なバランスです。さらに品質を求めるなら、gemma4:12b-instruct-q5_K_M(品質がわずかに向上、VRAM使用量は25%増)やgemma4:12b-instruct-q8_0(FP16に近い品質、VRAM使用量は100%増)が選択肢になります。一方、E2BはQAT int4(gemma4:e2b-it-qat)で直接配布されており、よりメモリ使用量の多い有用なバリアントはありません。量子化していないFP16に意味があるのは、ファインチューニングの場合だけです。

VRAMに何が読み込まれているかをリアルタイムで確認するには:

読み込まれたモデルの状態
ollama ps

PROCESSOR列には100% GPUと表示される必要があります。70%/30% GPU/CPUと表示される場合、モデルがVRAMに収まっていません。より強く圧縮する量子化、または一段小さいサイズのモデルに切り替えてください。

#2. モデルサイズと量子化方式別のVRAM

以下の数値には、モデルの重みに加えて、8kトークンのコンテキストウィンドウ(Ollamaのデフォルト設定)用のKVキャッシュが含まれています。32kまたは128kに拡張する場合は、モデルのサイズに応じてさらに2〜8 GBを見込んでください。

Gemma 4 E2B — QAT int4
VRAMは約4.5GB。コンパクトな派生版です(QAT、MatFormer方式で約20億のアクティブパラメータ)。GTX 1660(6GB)やRTX 3050(8GB)のどのモデルでも、または8GBのユニファイドメモリを搭載したMacで動作します。
Gemma 4 12B — Q4_K_M
≈ 8 GB の VRAM。対象となるのは RTX 3060 12 GB、4070 12 GB、5070 12 GB、Mac 16 GB 以上です。
Gemma 4 12B — Q5_K_M
VRAM使用量は約9.5GB。コンテキスト長を控えめにすれば12GBに収まり、16GBならより余裕があります(4070 Ti Super、5080)。
Gemma 4 12B — Q8_0
VRAMは約13 GB。VRAMが16 GB以上のグラフィックカード、またはメモリ容量に余裕のあるApple Silicon搭載機向けです。
Gemma 4 26B-A4B — Q4_K_M
VRAM:約19 GB。適した構成:RTX 3090、4090、5090、RX 7900 XTX、Mac Studio。MoE:アクティブな4B分だけを読み込むため、メモリ使用量が大きくても高速です。
Gemma 4 26B-A4B — Q5_K_M
VRAMは約23 GB。24 GB環境では上限に近いため、それ以外の選択肢として、48 GB以上のユニファイドメモリを搭載したMacか、マルチGPU構成を検討してください。
Gemma 4 26B-A4B — Q8_0
VRAM は約 30 GB。VRAM 32 GB 以上の GPU(RTX 5090)や、ユニファイドメモリ 48 GB 以上の Mac 向けです。
!
128kコンテキストの罠
12Bモデルで最大コンテキストウィンドウ(num_ctx=131072)を有効にすると、KVキャッシュが4〜6GB増えることがあります。Q4で8kのコンテキストがぎりぎり収まる状態なら、32kではメモリ容量を超えます。コンテキストを段階的に増やし、ollama psで状況を確認してください。

#3. トークン/秒:RTXとApple Silicon

新しいバージョンのOllamaで、コンテキスト8k、短いプロンプト、200トークンの生成という条件で観測したおおよその値です。数値は生成内容とOllamaのバージョンによって±15%変動します。26B-A4BはMoE(アクティブパラメータ4B)なので、メモリに収まれば、密な26Bモデルよりもはるかに高速に動作します。

RTX 3060 12 GB
Gemma 4 E2B:約90 tok/s。Gemma 4 12B Q4:約28 tok/s。26B-A4B:19 GB 必要で容量に収まらないため、避けてください。
RTX 4070 12 GB
E2B:約130 tok/s。12B Q4:約46 tok/s。26B-A4B:VRAMに収まりません。
RTX 4080 Super 16 GB
12B Q4:約 66 tok/s。12B Q8:約 40 tok/s。26B-A4B は 16 GB 以内には収まらない。
RTX 4090 24 GB
12B Q4:約100トークン/秒。26B-A4B Q4:約58トークン/秒。26B-A4B Q5:約50トークン/秒。
RTX 5090 32GB
12B Q4:~150 tok/s。26B-A4B Q4:~88 tok/s。26B-A4B Q8:~48 tok/s。
Mac M3 Max 64 GB
12B Q4:~38 tok/s。26B-A4B Q4:~30 tok/s。統合メモリのおかげで安定したパフォーマンスを実現。
Mac M4 Pro 48 GB
12B Q4:約34トークン/秒。26B-A4B Q4:約24トークン/秒。MoEは問題なく収まり、サイズの割に軽快に動作します。
Mac M4 Max 128 GB
26B-A4B Q4:~36 tok/s。26B-A4B Q8:~20 tok/s。26Bを日常的に使用する上で最も適したMac
→
実用的な目安
30トークン/秒を超えると、対話的な利用はスムーズです。15~30トークン/秒でもチャットには十分ですが、長い出力ではもたつきを感じます。10トークン/秒未満の場合は、バッチ処理や、いずれにしても完了まで待つタスクに用途を絞ってください。

#4. 最初のプロンプトと有用な設定

Gemma 4は特別なシステムプロンプトがなくてもフランス語で良好に応答しますが、用途に応じて調整したほうがよいパラメータもいくつかあります。

簡単なテスト
ollama run gemma4:12b
>>> Explique la différence entre un index B-tree et un index hash en SQL, en 5 lignes.

インタラクティブなプロンプトからパラメータを即座に調整する方法は以下の通りです:

セッション設定
/set parameter temperature 0.3
/set parameter num_ctx 16384
/set parameter num_predict 800
temperature
デフォルトは 0.7 です。事実に基づく内容、コード、RAG では 0.2〜0.4 に下げてください。ブレインストーミングでは 0.9〜1.1 に上げてください。
num_ctx
コンテキストウィンドウ。デフォルトはビルドによって4096または8192です。用途と利用可能なVRAMに応じて増やしてください。
num_predict
生成するトークン数の上限。-1 は無制限(生成が停止するまで)。応答の長さを制限するのに役立ちます。
repeat_penalty
デフォルトは1.1です。Gemma 4が同じ内容を繰り返す場合は、1.15〜1.2に上げてください。回答が書き言葉に寄りすぎていると感じる場合は、1.05に下げてください。
i
設定を永続化する
システムプロンプトとパラメータを固定するには、Modelfileを作成してください。FROM gemma4:12bに続けて、SYSTEM "..."、PARAMETER temperature 0.3などを記述します。ollama create monassistant -f Modelfileを実行すると、その後はmonassistantを通常のモデルと同じように呼び出せます。

#5. APIおよびコードからの統合

Ollamaは、http://localhost:11434/v1 にOpenAI互換のエンドポイントを提供しています。OpenAI APIに対応するSDKなら、base_urlをこのローカルエンドポイントに設定するだけで動作します。

Python — OpenAI SDK
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama",  # valeur ignorée, mais le SDK l'exige
)

resp = client.chat.completions.create(
    model="gemma4:12b",
    messages=[
        {"role": "system", "content": "Tu réponds en français, de manière concise."},
        {"role": "user", "content": "Résume la photosynthèse en 3 lignes."},
    ],
    temperature=0.3,
)
print(resp.choices[0].message.content)

マルチモーダルバージョン(12Bおよび26B-A4B)では、メッセージ内に画像をbase64形式またはローカルURLで指定します。これはGPT-4oと同じプロトコルです。

curl を使用した視覚処理
curl http://localhost:11434/api/generate -d '{
  "model": "gemma4:12b",
  "prompt": "Décris cette image en français.",
  "images": ["'"$(base64 -w0 photo.jpg)"'"],
  "stream": false
}'

#トラブルシューティング

"Error: model gemma4 not found"
お使いのOllamaのバージョンにはそのタグがまだ存在しないか、入力ミスがあります。ollama listでインストール済みのモデルを確認し、Ollamaライブラリのドキュメントで公式タグを確認してください。
CPU側にオフロードされるモデル
ollama ps affiche 60% GPU / 40% CPU. Passez à une quantization plus agressive (Q4 → Q3_K_S), réduisez num_ctx, ou descendez d'une taille (12B → E2B).
数時間後に速度が3分の1に低下
一部のドライバーではKVキャッシュが断片化します。Ollamaサービスを再起動してください(Linuxではsudo systemctl restart ollamaを実行し、Mac/Windowsではアプリを再起動します)。
約400語で応答が途中で切れる
num_predict の値が低すぎます。2048、または無制限にするなら -1 に設定し、それに応じて num_ctx を増やしてください。
E2Bのフランス語が不自然
これは想定内です。E2B はサイズの割に高性能ですが、あくまでコンパクトなモデルです。フランス語の品質に高い水準を求める場合は、12B を選んでください。
RTX 4060 8 GBで12Bモデルを実行するとOOMが発生
Q4 に量子化した 12B モデルは 8 GB にぎりぎり収まりますが、コンテキスト用の余裕はありません。gemma4:e2b-it-qat を選ぶか、CPU へのオフロード(約 3〜5 トークン/秒)を受け入れるか、グラフィックカードを交換してください。

#さらに詳しく

Gemma 4が動くようになりました。用途に応じて、さらに活用するためのヒントをいくつか紹介します。

Ollama とは何か、どのように動作するか
Ollamaを初めて使う方には、この初心者向けガイドで基本的なコマンドと仕組みの全体像を説明しています。
量子化の選択(Q4、Q5、Q8、FP16)
Q8からQ4に切り替えると具体的に何を犠牲にするのか、そしてそれがどのような場合に本当に重要になるのかを理解するために。
Ollamaと組み合わせたOpen WebUI
Gemma 4を使えるChatGPT風のインターフェースに:会話履歴、組み込みRAG、複数ユーザー間での共有。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。