ホーム › カタログ › 2026年、8 GBのVRAMで最適なLLM

2026年、8 GBのVRAMで最適なLLM

◆ ローカルAI — 1時間で、あなたのマシンにプライベートで無料のChatGPTを · 24 € · または全キットを49 €で →

ランキング更新日:09/10/2026

8 GBのVRAMはローカルAIの入門クラスです。RTX 3060 8GB、4060、5060、3070、2080などが該当します。Q4_K_Mで量子化した7〜9Bモデルは、余裕を持ってVRAMに収まります。このVRAM容量に最適な選択肢を以下に紹介します。

ローカル AI のオファーと代替案

RTX 4060 Ti 8GB :ローカルAI向けに購入できる別の選択肢 — RTX 5060 Ti 16 GB :

予算に合わせてどの PC を選ぶべき?800~3,500 ユーロのおすすめをご紹介 →

アフィリエイトリンク — ローカルLLMナビは、あなたに追加費用をかけずに購入から手数料を受け取る場合がありますが、独立して決定したランキングには影響しません。Amazonパートナーとして、ローカルLLMナビは、所定の条件を満たす購入から利益を得ています。

ランキング

1

🇺🇸 Granite 4.1 8B Instruct

IBM · 8B パラメータ · Apache 2.0 · 131 072 トークン ctx

Dense 8B、Apache 2.0、FRを含む12言語、131k ctx、GQA 32Q/8KV。MMLU 73.84、HumanEval 85.37。2026年4月29日リリース。

このランクの理由 Q5_K_Mでメモリに収まります(利用可能な8GBのVRAMのうち約6GBを使用)。パラメータ数は8B、コンテキストは131,072トークンです。
# HuggingFace : ibm-granite/granite-4.1-8b
RTX 4060 Ti 8GB での実行
Q5_K_M
6 GB · 12 tok/s
2

🇺🇸 Gemma 4 12B

Google · 12B パラメータ · Apache 2.0 · 262 144 トークン ctx

Gemma 4 12B (Google):マルチモーダル Dense モデル(テキスト、ビジョン、オーディオ)、256k コンテキスト、Q4 で VRAM 約 7 GB。Apache 2.0、多言語対応。

このランクの理由 Q4_K_Mなら収まります(利用可能な8 GBのうち約7 GB)。パラメータ数は12B、コンテキスト長は262,144トークンです。
# HuggingFace : google/gemma-4-12B
RTX 4060 Ti 8GB での実行
Q4_K_M
7GB · 18トークン/秒
3

🇺🇸 Granite 4.2 8B

IBM · 8B パラメータ · Apache 2.0 · 128 000 トークン ctx

Granite 4.2 8B (IBM):Apache 2.0 の Dense モデル、128k コンテキスト、Q4 で VRAM 約 4.6 GB。エンタープライズ向けにチャット、コード、多言語推論に対応。

このランクの理由 Q5_K_Mで収まります(利用可能な8 GBのうち約6 GBを使用)。8Bパラメータ、コンテキストは128,000トークン。
ollama pull granite4.2
RTX 4060 Ti 8GB での実行
Q5_K_M
6 GB ・ 32 tok/s
4

🇺🇸 OLMo 3 7B Think (SFT)

zimplex · 7B パラメータ · Apache 2.0 · コンテキスト:16,000トークン

OLMo 3 7BをSFTで「thinking」向けにファインチューニングしたモデル:段階的な推論、16kのコンテキスト、Q4で約4.2 GBのVRAM。100%オープン、Apache 2.0ライセンス。

このランクの理由 Q8で収まります(利用可能な8 GBのうち約8 GBを使用)。70億パラメータ、コンテキスト長16,000トークン。
# HuggingFace : zimplex/olmo3-7b-think-sft-eosfix-16k-3ep-euc
RTX 4060 Ti 8GB での実行
Q8
8 GB · 32 tok/s
5

🇨🇳 GLM 5.3 7B

Zhipu AI · 7B パラメータ · MIT · 128 000 トークン ctx

GLM 5.3 (Zhipu):コードと推論に特化した Dense 7B モデル、128k コンテキスト、Q4 で VRAM 約 4.1 GB。軽量で、6~8 GB の GPU で動作、MIT ライセンス。

このランクの理由 Q8でメモリに収まります(利用可能な8 GBのうち約7 GBを使用)。パラメータ数は7B、コンテキストは128,000トークン。
ollama pull glm-5.3
RTX 4060 Ti 8GB での実行
Q8
7 GB · 32 tok/s
6

🇺🇸 OLMo 3 7B

Allen AI · 7B パラメータ · Apache 2.0 · コンテキスト:8,192トークン

デンス型 7B、100%公開(重み + データ + コード)。研究向けに完全な透明性を確保。

このランクの理由 Q5_K_Mならメモリに収まります(利用可能なVRAM 8GBのうち約6GB)。パラメータ数は7B、コンテキストは8,192トークン。
ollama run olmo-3:7b
RTX 4060 Ti 8GB での実行
Q5_K_M
6 GB · 12 tok/s
7

🇨🇳 Qwen 3 8B

Alibaba · 8B パラメータ · Apache 2.0 · 131 072 トークン ctx

thinking/fastのハイブリッドモード。119言語、標準で32kのコンテキスト(YaRN経由で131k)。

このランクの理由 Q5_K_Mでメモリに収まります(利用可能な8GBのVRAMのうち約6GBを使用)。パラメータ数は8B、コンテキストは131,072トークンです。
ollama run qwen3:8b
RTX 4060 Ti 8GB での実行
Q5_K_M
6 GB · 12 tok/s
8

🇺🇸 LFM2.5 7B

Liquid AI · 7B パラメータ · LFM Open License v1.0 · 32 768 トークン ctx

LFM2.5 7B (Liquid AI):Liquid Foundation Model の Dense 型、32k コンテキスト、Q4 で 4.1 GB の VRAM。CPU とエッジ向けに最適化。2026 年 5 月リリース。

このランクの理由 Q8で動作(8GBのうち約7GB使用)。7Bパラメータ、コンテキスト32,768トークン。
ollama pull lfm2.5
RTX 4060 Ti 8GB での実行
Q8
7 GB · 32 tok/s

比較表

順位 モデル Params VRAM Q4 コンテキスト ライセンス RTX 4060 Ti 8GB での実行
#1 Granite 4.1 8B Instruct 8B 5 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#2 Gemma 4 12B 12B 7 GB 262 144 Apache 2.0 18 tok/s · Q4_K_M
#3 Granite 4.2 8B 8B 4.6 GB 128 000 Apache 2.0 32 tok/s · Q5_K_M
#4 OLMo 3 7B Think (SFT) 7B 4.2 GB 16 000 Apache 2.0 32 tok/s · Q8
#5 GLM 5.3 7B 7B 4.1 GB 128 000 MIT 32 tok/s · Q8
#6 OLMo 3 7B 7B 5 GB 8 192 Apache 2.0 12 tok/s · Q5_K_M
#7 Qwen 3 8B 8B 5 GB 131 072 Apache 2.0 12 tok/s · Q5_K_M
#8 LFM2.5 7B 7B 4.1 GB 32 768 LFM Open License v1.0 32 tok/s · Q8
ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

無料の要点まとめ

あなたのマシンでどのコーディング用モデルを動かせばよいですか?

メモを受け取る VRAM → 最適なコーディング用モデル → Ollamaコマンド (1画面に収まり、コピー&ペーストできます)。そして、実際に動く環境を整えるために、ローカルコパイロットキットをご利用ください。

ローカルコパイロットキット — そのまま貼り付けて使える Ollama + Cline + Aider の設定、調整済みの Modelfiles、トラブルシューティング、無期限で利用できるオンラインスペース →

スパムは送りません。配信停止は1クリックで可能です。お客様のデータは当サイトで保管し、転売することはありません。

ランキングの方法論

フィルター:Q4でのVRAM使用量が8GB以下かつ3GB以上(ハードウェアを十分に活用しない超小型モデルは除外します)。Q4_K_MでVRAMに収まり、コンテキスト用の余裕も確保できる3B〜9Bのモデルを選びます。

考慮した基準:

  • VRAM Q4 ≤ 8 GB
  • 利用可能なコンテキスト(32k以上)
  • 品質は上位クラスと同等
  • Ollama / LM Studio に対応

スコアリングの仕組みはすべて公開しています。 私たちの方法論 でVRAMやtokens/secの計算の詳細をご確認ください。

よくある質問

8GBで始めるなら、どのLLMがおすすめですか?

Granite 4.1 8B Instruct は最初の選択肢として最適です。Mistral 7B、Llama 3.1 8B、Qwen 2.5 7Bはいずれも優れており、費用もかかりません。まずはOllamaを使ってみてください(ollama run mistral:7b-instruct).

8 GBでGemma 2 9Bを動かせますか?

Q4_K_M だけ(≈ 6 GB モデル + 1-2 GB コンテキスト = ≈ 8 GB)。大きなコンテキストには余裕がありません。32k以上のトークンを快適に使う場合は、Mistral 7B をお勧めします。

8 GBではどの量子化を選べばよいですか?

7~9B には Q4_K_M、3~5B には Q5_K_M。Q8 を使うのは 3B 以下の場合に限ります。

RTX 4060とRTX 3060 12GBでは、どちらがよいですか?

4060は純粋な生成速度では15〜20%速いものの、メモリ容量が8 GBに限られるため、12Bモデルや大きなコンテキストは扱えません。3060 12 GBは製品としてのクラスが下でも、LLM用途にはより適しています。

さらに詳しく

QuelLLM キット 用途別のリファレンスガイド
すべてのキットを生涯利用可能 — 49 €