ホーム › カタログ › 2026年、GPUなし(CPUのみ)での利用に最適なLLM

2026年、GPUなし(CPUのみ)での利用に最適なLLM

◆ ローカルAI — 1時間で、あなたのマシンにプライベートで無料のChatGPTを · 24 € · または全キットを49 €で →

ランキング更新日:2026年9月22日

GPUがありませんか?最近の1〜7BのLLMは、llama.cppとQ4量子化によりCPUでも十分に動作します。8〜16 GBのRAMが必要で、5〜15トークン/秒の処理速度を受け入れる必要があります。以下がおすすめの選択肢です。

ランキング

1

🇺🇸 Gemma 4 E4B

Google · 4B パラメータ · Apache 2.0 · 128 000 トークン ctx

実効パラメータ数40億のマルチモーダルモデル(テキスト+画像+音声)。140言語。ノートPCとエッジ向け。

このランクの理由 4Bパラメータ — モダンなCPUで正常に動作(Q4で5〜10トークン/秒)。
ollama run gemma4:e4b
VRAM Q4
10 GB
Q8で12GB
2

🇺🇸 Granite 4.1 3B Instruct

IBM · 3B パラメータ · Apache 2.0 · 131 072 トークン ctx

30億パラメータのDenseモデル、Apache 2.0。フランス語を含む12言語、131kコンテキスト、GQA 40Q/8KV。ツール呼び出しとFIMによるコード補完に対応。2026年4月29日公開。

このランクの理由 3Bパラメータ — モダンなCPUで正常に動作し、Q4の条件下で30〜50トークン/秒で処理可能です。
ollama run granite4.1:3b
VRAM Q4
2 GB
Q8で3 GB
3

🇺🇸 Gemma 4 E2B

Google · 2B パラメータ · Apache 2.0 · 128 000 トークン ctx

Gemma 4 E2B:有効パラメータ2B(合計5.1B)、Q4でVRAM約3 GB(Ollamaの重みはQATで4.3 GB、デフォルトで7.2 GB)。テキストと画像に対応するマルチモーダル、128kコンテキスト、Apache 2.0。

このランクの理由 20億パラメータ — 最近のCPUで問題なく動作します(Q4で30〜50トークン/秒)。
ollama run gemma4:e2b
VRAM Q4
3 GB
Q8で5 GB
4

🇺🇸 Granite 4.1

IBM · 3B パラメータ · Apache 2.0 · 128 000 トークン ctx

Granite 4.1(3B、Apache 2.0):Ollama の汎用タグで、IBM Granite 4.1 ファミリーのモデルです。コンテキスト長128k、ツール呼び出しとコードに対応。2026年5月リリース。

このランクの理由 3Bパラメータ — モダンなCPUで正常に動作し、Q4の条件下で30〜50トークン/秒で処理可能です。
ollama run granite4.1
VRAM Q4
1.7 GB
3.2 GB (Q8)
5

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B パラメータ · Apache 2.0 · コンテキスト:16,000トークン

OLMo 3 7BをSFTで「thinking」向けにファインチューニングしたモデル:段階的な推論、16kのコンテキスト、Q4で約4.2 GBのVRAM。100%オープン、Apache 2.0ライセンス。

このランクの理由 7Bパラメータ — モダンなCPU上で正常に動作し、Q4で5〜10トークン/秒で実行可能です。
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
VRAM Q4
4.2 GB
Q8で8 GB
6

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B パラメータ · MIT · 128 000 トークン ctx

GLM 5.3 (Zhipu):コードと推論に特化した Dense 7B モデル、128k コンテキスト、Q4 で VRAM 約 4.1 GB。軽量で、6~8 GB の GPU で動作、MIT ライセンス。

このランクの理由 7Bパラメータ — モダンなCPU上で正常に動作し、Q4で5〜10トークン/秒で実行可能です。
ollama pull glm-5.3
VRAM Q4
4.1 GB
Q8で7GB
7

🇺🇸 Granite 4.0 3B Vision

IBM · 3B パラメータ · Apache 2.0 · コンテキスト:16,384トークン

企業文書からの情報抽出に特化した3BのVLM。OCR、表、フォーム。

このランクの理由 3Bパラメータ — モダンなCPUで正常に動作し、Q4の条件下で30〜50トークン/秒で処理可能です。
# HuggingFace : ibm-granite/granite-4.0-3b-vision
VRAM Q4
2.2GB
Q8で3.8 GB

比較表

順位 モデル Params VRAM Q4 コンテキスト ライセンス 内蔵GPU使用時/GPUなし
#1 Gemma 4 E4B 4B 10 GB 128 000 Apache 2.0 ✗
#2 Granite 4.1 3B Instruct 3B 2 GB 131 072 Apache 2.0 ✗
#3 Gemma 4 E2B 2B 3 GB 128 000 Apache 2.0 ✗
#4 Granite 4.1 3B 1.7 GB 128 000 Apache 2.0 ✗
#5 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0 ✗
#6 GLM 5.3 7B 7B 4.1 GB 128 000 MIT ✗
#7 Granite 4.0 3B Vision 3B 2.2GB 16 384 Apache 2.0 ✗
ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 30日間返金対応

ランキングの方法論

対象は8B以下のモデルのみです。それを超えると、CPUの処理速度が低すぎます。3B以下のモデル(現代のCPUでは非常に高速)と、制約の少ないライセンスには大きく加点します。

考慮した基準:

  • サイズは8B以下(理想的には3B以下)
  • CPUのスループット ≥ 5トークン/秒
  • 必要なRAM ≤ 16 GB
  • Q4でも許容できる品質

スコアリングの仕組みはすべて公開しています。 私たちの方法論 でVRAMやtokens/secの計算の詳細をご確認ください。

よくある質問

本当にGPUなしでLLMを実行できるのでしょうか?

はい — これにより、 llama.cpp + Q4_K_M量子化により、7BモデルはRyzen 7またはApple M1のCPUで毎秒5〜10トークンの速度で動作します。対話用途では、1〜3Bモデル(毎秒30〜50トークン)を目安にしてください。

RAMはどれくらい必要ですか?

7BモデルでQ4の場合:最小8GBのRAM、推奨16GB(モデルは約5GBを消費し、残りはOSおよびコンテキスト用)。3Bモデルなら6〜8GB、1Bモデルなら4GBが十分です。

LLM に適した CPU は?

コア数が多く、AVX2/AVX-512 をより活用できるほど有利です。最近の Ryzen 7/9、最近の Intel Core i7/i9、Apple M1/M2/M3 は、いずれも優れた選択肢です。高速なメモリ(DDR5 > DDR4)を優先してください。コア数よりも RAM の帯域幅が制限要因になることがよくあります。

iGPU(Intel/AMD)は役立つでしょうか?

効果は限定的です。iGPUでVulkanを使うと、CPUだけの場合に比べて性能が20〜40%向上します。劇的ではありませんが、活用する価値はあります。Apple Silicon搭載Macでは、Metal経由で内蔵GPUを利用でき、大きな違いが出ます(これが「unified memory」モードです)。

さらに詳しく

QuelLLM キット 用途別のリファレンスガイド
すべてのキットを生涯利用可能 — 49 €