🇺🇸 Gemma 4 E4B
実効パラメータ数40億のマルチモーダルモデル(テキスト+画像+音声)。140言語。ノートPCとエッジ向け。
ollama run gemma4:e4b
ランキング更新日:2026年9月22日
GPUがありませんか?最近の1〜7BのLLMは、llama.cppとQ4量子化によりCPUでも十分に動作します。8〜16 GBのRAMが必要で、5〜15トークン/秒の処理速度を受け入れる必要があります。以下がおすすめの選択肢です。
実効パラメータ数40億のマルチモーダルモデル(テキスト+画像+音声)。140言語。ノートPCとエッジ向け。
ollama run gemma4:e4b
30億パラメータのDenseモデル、Apache 2.0。フランス語を含む12言語、131kコンテキスト、GQA 40Q/8KV。ツール呼び出しとFIMによるコード補完に対応。2026年4月29日公開。
ollama run granite4.1:3b
Gemma 4 E2B:有効パラメータ2B(合計5.1B)、Q4でVRAM約3 GB(Ollamaの重みはQATで4.3 GB、デフォルトで7.2 GB)。テキストと画像に対応するマルチモーダル、128kコンテキスト、Apache 2.0。
ollama run gemma4:e2b
Granite 4.1(3B、Apache 2.0):Ollama の汎用タグで、IBM Granite 4.1 ファミリーのモデルです。コンテキスト長128k、ツール呼び出しとコードに対応。2026年5月リリース。
ollama run granite4.1
OLMo 3 7BをSFTで「thinking」向けにファインチューニングしたモデル:段階的な推論、16kのコンテキスト、Q4で約4.2 GBのVRAM。100%オープン、Apache 2.0ライセンス。
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
GLM 5.3 (Zhipu):コードと推論に特化した Dense 7B モデル、128k コンテキスト、Q4 で VRAM 約 4.1 GB。軽量で、6~8 GB の GPU で動作、MIT ライセンス。
ollama pull glm-5.3
企業文書からの情報抽出に特化した3BのVLM。OCR、表、フォーム。
# HuggingFace : ibm-granite/granite-4.0-3b-vision
| 順位 | モデル | Params | VRAM Q4 | コンテキスト | ライセンス | 内蔵GPU使用時/GPUなし |
|---|---|---|---|---|---|---|
| #1 | Gemma 4 E4B | 4B | 10 GB | 128 000 | Apache 2.0 | ✗ |
| #2 | Granite 4.1 3B Instruct | 3B | 2 GB | 131 072 | Apache 2.0 | ✗ |
| #3 | Gemma 4 E2B | 2B | 3 GB | 128 000 | Apache 2.0 | ✗ |
| #4 | Granite 4.1 | 3B | 1.7 GB | 128 000 | Apache 2.0 | ✗ |
| #5 | OLMo 3 7B Think (SFT) | 7B | 4.2 GB | 16 000 | Apache 2.0 | ✗ |
| #6 | GLM 5.3 7B | 7B | 4.1 GB | 128 000 | MIT | ✗ |
| #7 | Granite 4.0 3B Vision | 3B | 2.2GB | 16 384 | Apache 2.0 | ✗ |
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
対象は8B以下のモデルのみです。それを超えると、CPUの処理速度が低すぎます。3B以下のモデル(現代のCPUでは非常に高速)と、制約の少ないライセンスには大きく加点します。
考慮した基準:
スコアリングの仕組みはすべて公開しています。 私たちの方法論 でVRAMやtokens/secの計算の詳細をご確認ください。
本当にGPUなしでLLMを実行できるのでしょうか?
はい — これにより、 llama.cpp + Q4_K_M量子化により、7BモデルはRyzen 7またはApple M1のCPUで毎秒5〜10トークンの速度で動作します。対話用途では、1〜3Bモデル(毎秒30〜50トークン)を目安にしてください。
RAMはどれくらい必要ですか?
7BモデルでQ4の場合:最小8GBのRAM、推奨16GB(モデルは約5GBを消費し、残りはOSおよびコンテキスト用)。3Bモデルなら6〜8GB、1Bモデルなら4GBが十分です。
LLM に適した CPU は?
コア数が多く、AVX2/AVX-512 をより活用できるほど有利です。最近の Ryzen 7/9、最近の Intel Core i7/i9、Apple M1/M2/M3 は、いずれも優れた選択肢です。高速なメモリ(DDR5 > DDR4)を優先してください。コア数よりも RAM の帯域幅が制限要因になることがよくあります。
iGPU(Intel/AMD)は役立つでしょうか?
効果は限定的です。iGPUでVulkanを使うと、CPUだけの場合に比べて性能が20〜40%向上します。劇的ではありませんが、活用する価値はあります。Apple Silicon搭載Macでは、Metal経由で内蔵GPUを利用でき、大きな違いが出ます(これが「unified memory」モードです)。