初心者 12 分概要

ローカルで使う中国発のLLM:Qwen、DeepSeek、GLM、 Kimi

2026年に、手元で動かすためにオープンウェイトの LLM をダウンロードするなら、中国発のモデルである可能性が高いでしょう。Qwen、DeepSeek、GLM、Kimi といったモデルファミリーは、公開モデルのランキング上位を占めており、欧米の研究機関のモデルよりも制約の少ないライセンスで提供されることも多くあります。この概説では、各ファミリーの実力、ライセンスが実際に定めている内容、そして中国の LLM をローカルで実行すれば、なぜプライバシーの問題をあらかじめ解決できるのかを整理します。

著者 Mohamed Meguedmi·更新 2026-09-01·Windows・macOS・Linuxでテスト済み

#なぜ中国のLLMがオープンウェイトで優位なのか?

オープンモデルをめぐる状況は大きく変わりました。2 年前には Meta(Llama)が先頭を走っていましたが、現在、最も高性能なモデルの重みを最も頻繁に公開しているのは中国の研究機関です。Alibaba(Qwen)、DeepSeek、Zhipu AI(GLM)、Moonshot(Kimi)は、小型の 3B から数千億パラメータの MoE まで、活発なペースでモデルを公開しています。

その理由は、技術面と同じくらい戦略面にもあります。重みをオープンウェイトで公開することで、世界的な認知度を高め、コミュニティを引きつけ、米国のクローズドモデルに対しても事実上の標準としての地位を確立できます。ローカルで利用する皆さんにとって、結果はシンプルです。無料で定期的に更新されるモデルの選択肢が非常に豊富で、コード、推論、多言語対応ではクラウドと互角の性能を発揮することも多いのです。

i
オープンウェイト ≠ オープンソース
「Open-weight」とは、モデルの重みを自由にダウンロードして実行できることを意味します。ただし、学習データやコード全体が公開されていることまでは保証されません。本ガイドで紹介するモデルのほぼすべてがこれに当てはまります。入手できるのはモデルであって、その作り方ではありません。

#ローカル環境がプライバシーの問題を解決します

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

よくある反射的な反論が、「中国製のLLMなら、自分のデータは中国に送られる」というものです。クラウドAPI(chat.qwen.ai、DeepSeekアプリ、Zhipuプラットフォーム)については、そのとおりです。プロンプトは確かに、中国の法律が適用される遠隔サーバーを経由します。しかし、このガイドで扱うのはローカルでの利用です。ローカルであれば、この懸念はそもそも当てはまりません。

OllamaやLM Studioでモデルを動かすときは、固定された重みファイル(たとえばGGUF)をダウンロードし、自分のGPUで回答を計算します。モデル自体にはネットワーク機能がありません。外部の提供元にこっそり通信するソフトウェアではなく、大きな数値の行列です。モデルがどこで作られたものであっても、自分のマシンから何も外へ出ません。

クラウド(API)
プロンプトはモデルの提供元に送信されます。モデルの出自と適用される法的管轄は、とても重要です。
ローカル環境
モデルの重みを使った処理は、お使いのハードウェア上で実行され、希望すればオフラインでも利用できます。データが端末の外に送られることはありません。
実際に残るリスク
モデルの回答に偏りや検閲が見られること(特定のセンシティブな話題について)であり、データ漏えいではありません。これは出力の品質の問題であって、プライバシーの問題ではありません。
→
外部に何も送信されないことを確認する
それを確かめるには:Ollamaを起動し、Wi-Fiを切断してモデルと会話してください。すべての機能が正常に動作します。ローカルLLMは、重みの初期ダウンロードを除き、ネットワーク接続は必要ありません。

#実際のライセンス:Apache 2.0およびMIT

もう一つのよくある誤解は、「中国のモデルのライセンスは不透明で、落とし穴がある」というものです。2026年の実情はその逆で、これらは市場で最も明快なライセンスであることが多いのです。この概観で紹介するモデルの大半は、Apache 2.0またはMITで公開されています。どちらも国際的に使われている、商用利用も認める寛容なライセンスです。

Qwen
最近のバリエーションの大半(Qwen3.8-27B を含む)は Apache 2.0 ライセンスで公開されており、商用利用は自由で、再配布も認められています。
DeepSeek
V3/V4 および R1 モデルは MIT ライセンスで公開されており、最も緩やかなライセンスの一つです。
GLM (Zhipu)
最新世代(例:GLM-5.2)はMITライセンスに変更されています。
Kimi(Moonshot)
バージョンに応じて、MIT/Apache系の寛容なライセンスで重みが公開されています。
!
それでもモデルカードは確認してください
一部の旧世代のモデルファミリーや特定の派生モデルには、利用条件を定めた独自ライセンスが適用される場合があります。商用導入の前には、モデルファミリーの評判だけで判断せず、実際にダウンロードするモデルのHugging FaceページにあるLICENSEファイルを必ず確認してください。

#Qwen (Alibaba):万能ツール

Qwenは、このエコシステムで最もラインナップが充実し、最も汎用性の高いモデルファミリーです。Alibabaは、エントリークラスのGPUに収まる3Bから大規模MoEまで、あらゆるサイズのモデルを展開しています。専門分野も幅広く、汎用、コード(Qwen3-Coder)、画像認識(Qwen3-VL)に加え、推論用の「thinking」モードも備えています。

長所
優れた多言語対応(非常に正確なフランス語を含む)、類を見ないサイズ範囲、成熟したツールエコシステム、OllamaでのDay-0対応。
典型的なサイズ
試用向けの3B/7Bから、品質とVRAM容量のバランスが最もよい27B(Qwen3.8)、さらに大型GPU向けのMoE 35B-A3Bまであります。
対象者
初心者で、幅広いことをそつなくこなせるモデルを求めているなら、まず選ぶべきモデルです。

#DeepSeek:論理的思考の王者

DeepSeekは、2025年初頭に業界を揺るがした、思考の連鎖による推論モデルR1で知られるようになりました。このモデルファミリーは、論理、数学、複雑なコードのタスクで引き続き定番となっています。R1の蒸留版(7B、14B、32B)によって、一般向けのハードウェアでもこの推論を利用できます。

長所
非常に高度な論理的推論および数学的処理。MITライセンス。ローカルで実行可能なディスティル版が提供されています。
罠
フラッグシップモデル(V3/V4、MoEで671B以上)は非常に大きく、単一のGPUでは対応できません。一般向けのローカル利用には、R1の蒸留モデル(distillations)を目標にしてください。
対象者
難しいコーディングや数学、論理に取り組む方、あるいはモデルが回答する前に「考える」様子を見たい方。

#GLM (Zhipu):多用途に対応するダークホース

Zhipu AIが開発するGLMは、Qwenの有力な対抗馬です。フランス語に強く、コードや推論でも優れた性能を備えています。9Bや32B前後の扱いやすいサイズで、12〜24 GBのGPUに最適なバランスを直接狙う一方、非常に大規模な構成向けにはGLM-5.2(753B)のような巨大なMoEモデルも提供しています。

長所
9B〜32Bのバリエーションにおいて品質とサイズのバランスが優れ、フランス語が良好で、最新世代ではMITライセンスが適用されています。
典型的なサイズ
8〜12 GB の GPU には9B、24 GB には32B。最先端の MoE モデルは、引き続き大容量のユニファイドメモリを搭載した Mac に限られます。
対象者
比較したいときに選べるQwenの有力な代替モデル、または控えめな性能のハードウェアでもフランス語で良好な出力が得られるモデルです。

#KimiとMiniCPM:対極にある2つのモデル

これら 2 つのファミリーはスペクトルの両極端を示しています。Kimi (Moonshot) は非常に大規模なモデルを目標としており、1 トリリオンパラメータ以上の MoE が、長いコンテキストとエージェント品質で知られています。一方、MiniCPM (OpenBMB / ModelBest チーム) はその逆を目標としており、モバイルや小型 GPU で動作することを想定したコンパクトで効率的なモデルです。

Kimi K2 / K3
巨大なMoEモデル(1T〜2.8Tパラメータ)。重みは公開されていますが、「公開」は「手元で実行できる」という意味ではありません。数十台のアクセラレータが必要です。サーバー向けで、ワークステーション向けではありません。
MiniCPM
超コンパクトなモデル、一部のマルチモーダルモデル。組み込みや小規模な構成向けに設計されています。VRAMの1GBが重要になる場合に最適です。
要点
オープンウェイトのモデルには、幅広いハードウェアに向けた選択肢があります。「モデルを自由に使える」ことと「自分のマシンで実行できる」ことを混同しないでください。

#VRAMに応じてどのモデルを選ぶか

ローカル環境における本質的な制約はモデルのブランドではなく、GPUのVRAMです。Q4_K_M(品質とサイズの最適バランス)の量子化を用いた場合、以下のハードウェアごとの具体的な基準でモデルファミリーを段階的に分類できます。

8 GB(RTX 3060 8G、4060)
Qwen 7B、GLM 9B、DeepSeek-R1 の蒸留版 7B を Q4 で使用(約 5 GB)。チャットや軽いコーディングに快適に使えます。
12GB(RTX 3060 12G、4070)
最適なバランス。Qwen 14B、GLM 9B (Q8)、DeepSeek-R1 14B (~9 GB)。より長いコンテキストに対応する余裕があります。
16GB(RTX 4080、5070 Ti)
Qwenの約24〜27Bモデル、強い量子化を施したDeepSeek-R1 32B。推論に本格的に取り組むためのクラスです。
24 GB(RTX 3090/4090)
Qwen 27-32BとGLM 32Bは全体がVRAMに収まります(約19 GB)。MoE 35B-A3Bも利用できます。一般ユーザー向けのローカル実行環境としては最高クラスです。
ユニファイドメモリ搭載Mac(48〜128 GB以上)
大型MoEモデル(GLM-5.2、DeepSeek Flash)をユニファイドメモリへのオフロードで動かすための、唯一の現実的な環境です。ただし、生成速度は控えめです。
i
Q4でのVRAM使用量の目安
3B ≈ 2 GB · 7B ≈ 5 GB · 14B ≈ 9 GB · 32B ≈ 19 GB · 70B ≈ 40 GB。コンテキストとシステム用に、必ずさらに1〜2GBを見込んでください。VRAMに収まりきらないモデルはRAMにオフロードされ(CPUオフロード)、生成スループットが大幅に低下します。

#中国製モデルを実際にインストールする

典型的な構成は、モデルの出自にかかわらず同じです。推論デーモンとしてOllama(http://localhost:11434で待ち受け)を使い、インターフェースとしてOpen WebUIまたはLM Studioを使います。以下では、各モデルファミリーから一つずつモデルを取得する方法を紹介します。

  1. 01
    Ollama のインストール
    ollama.comからデーモンをダウンロードして起動してください。ポート11434でローカルAPIを公開します。使い始めるために、それ以上の設定は必要ありません。
  2. 02
    自分のVRAMに応じてモデルを選択する
    上の表をもう一度確認してください。迷った場合は、Q4_K_MのQwen 14BまたはGLM 9Bを選んでください。これらは最近のGPUの大半のメモリに収まり、用途の90%に対応します。
  3. 03
    ダウンロードして起動する
    1つのコマンドで重みをダウンロードし、チャットを開きます。初回起動時には数 GB のデータが取得されますが、以降は瞬時です。
  4. 04
    オフラインモードの確認
    重みがキャッシュされたら、ネットワークを切断し、そのままチャットを続けてください。これが、モデルが100%ローカルで動作している証拠になります。
ターミナル
# Qwen généraliste (Alibaba, Apache 2.0)
ollama run qwen3

# DeepSeek-R1 distillé, raisonnement (MIT)
ollama run deepseek-r1:14b

# GLM, l'alternative polyvalente (Zhipu)
ollama run glm4

# Vérifier les modèles installés et que le daemon répond
curl http://localhost:11434/api/tags
→
タグの名前は変化します
Ollamaライブラリでは、正確なタグ(qwen3、deepseek-r1:14bなど)や利用可能なバージョンが頻繁に変わります。ダウンロードする前に、ollama.com/library で各バリエーションの正確な名前とGB単位のサイズを確認してください。

#さらに詳しく

この概説で全体像をつかめます。以下のガイドでは、各モデルファミリーとローカル環境での設定を詳しく解説しています。

Qwenのバランスのよい選択肢
「Qwen 3.8 27Bをローカルで動かす:Ollamaのインストール、VRAMと設定」では、具体的なコマンド、量子化方式ごとのVRAM容量、thinkingモードを詳しく説明しています。
DeepSeek の推論
「DeepSeek R1 をインストールする (Ollama)」では、7B/14B/32B の蒸留版と、ローカルでの思考の連鎖を扱っています。
GPUに応じて選択
「12 GB/16 GB/24 GB の VRAM で使うなら、どの LLM?」という各ガイドでは、これらの容量帯に応じて、GPU ごとの具体的な推奨モデルを紹介しています。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。