教育・指導に最適なオープンソースLLM
選ぶ オープンソース教育用LLM 教育的推論の品質、概念を段階的に説明する能力、および学校や教師用デスクトップでの展開に求められる物理的制約の間でバランスを取る必要があります。 オープンソース教育用LLM は、プロプライエタリなサービスに比べて決定的な利点があります。生徒のデータを自ら管理でき、利用量の制限がなく、GDPRへの準拠がより容易で、導入後の限界費用がゼロになることです。本記事では、個別指導、練習問題の生成、宿題の支援、自動採点、多言語の教材作成に特に適したオープンモデルを比較し、必要なVRAM、ライセンス、具体的な活用例を紹介します。Khanmigoへの依存から、自ら管理できるローカルの学習支援AIへの移行に役立ちます。
教育向けLLMの選定基準は?
教育向けモデルを選ぶ際の基準は、コーディング向けモデルとは異なります。優先すべき評価項目は次のとおりです。
- 多段階推論 : 数学や物理学の問題を論理的接続をスキップせずに分解する能力。AIMEおよびMATHスコア(公開されたもの) Papers With Code) は有用な指標です。
- 一般的な知識(MMLU) :各分野の網羅性(歴史、生物学、経済学)。MMLUで80%を超えるスコアを示すモデルは、中等教育および高等教育向けの有力な候補です。
- フランス語の品質 : フランス語圏向けの評価。ヨーロッパのモデルである Mistral Large 3 675B または Apertus 70B (スイスAI) は自然に優位性を持ち、同様に Salamandra 40B Instruct は、ヨーロッパの多言語コーパスで学習されています。
- パーミッシブライセンス : Apache 2.0またはMITライセンスは、学校でのデプロイにおいて法的障壁を回避できます。ライセンス Llama Communityは月間アクティブユーザー数に制限を課しています。
- コンテキストウィンドウ :教科書や複数の答案を取り込むため。 Llama 4 Scout 109B 1000万トークンのコンテキストに対応すると公表しており、 Seed-OSS 36B Instruct 524,288トークンを提供します。
- ハルシネーションの抑制 : 公式の式を独自に作成するチューターは、手順書よりも劣ります。明示的な「推論モード」を備えたモデルを優先してください。 DeepSeek R1 671B または QwQ 32B.
選定基準の包括的な分析については、 LLM選びの総合ガイド quelllm.fr
学習支援と中学校・高校向け:30〜70Bモデル
24 GBのカード(RTX 4090、RTX 5090)を搭載した教員用端末、またはデュアルGPUステーションの場合、30〜70Bクラスが最適解です。VRAMを飽和させることなく、満足できる推論が可能です。
- Qwen 3 32B (Apache 2.0):Q4で必要なVRAMは約19 GB、コンテキスト長は131,072トークン。数学とフランス語の文章に優れ、思考の連鎖(Chain of Thought)にネイティブ対応。詳細プロフィールの掲載先: HuggingFace Qwen.
- Gemma 4 31B (Gemmaライセンス):Q4で18 GB、コンテキストは256,000トークン。学校の学習者に適した応答で、語り口は落ち着いています。
- Llama 3.3 70B Instruct (Llama 3.3 Community):Q4で40 GB。一般知識の分野で確固たる基準となるモデルで、MMLUスコアも高いです。教育機関の月間アクティブユーザー数が7億人を超える場合は避けてください。この閾値に達することは教育分野ではまれです。
- DeepSeek R2 32B (MIT):Q4で19GB、明示的な推論をサポート。数学および物理・化学の演習問題へのサポートに適しています。
- OLMo 3 32B (Apache 2.0, Allen AI):Q4で19 GB。特徴:完全にオープンなモデル(重み+データ+学習レシピ)で、再現性が重要な学術用途で重宝します。詳しくは Allen AI の公式リポジトリ.
- Apertus 70B (Apache 2.0):Q4で40 GB。主権の確保を念頭にSwiss AIが設計した、欧州の多言語モデルです。
数値ベースの比較については、ページを参照してください Qwen 3 32B 対 Llama 3.3 70B.
節約:30〜40B規模のモデルが一般向けGPUでも利用可能
RTX 4090を1枚だけ備えた高校や、1台の端末を共同利用するCDI(学校の資料・情報センター)では、Q4量子化時のVRAM使用量が24 GB未満のモデルを選ぶ必要があります。
- Qwen 3.6 35B-A3B (Apache 2.0):Q4量子化で21GB、アクティブパラメータ数が3BのMoEアーキテクチャ。各トークンで関連するエキスパートだけが有効になるため、推論速度が高く、授業中に素早く応答するチューターに最適です。
- Seed-OSS 36B Instruct (Apache 2.0、ByteDance):Q4で22 GB、コンテキスト長524,288トークン。マニュアル全体や長い論文を分割せずに分析できます。
- Salamandra 40B Instruct (Apache 2.0、Barcelona Supercomputing Center):Q4で24 GB。フランス語やスペイン語を含むヨーロッパの言語に特化して学習されています。ドキュメントの掲載先: HuggingFace BSC-LT.
- Yi 1.5 34B Chat (Apache 2.0、01.AI):Q4で20 GB。汎用性は良好ですが、コンテキストは4,096トークンに限られるため、短いやり取りに用途を限定してください。
RTX 4090でQ4において推定されるトークン/秒は、32Bのデントモデルでは35〜50トークン/秒、MoEモデルでは80〜120トークン/秒です。 Qwen 3.6 35B-A3B参照してください quelllm.fr での速度ベンチマーク.
用途:練習問題の作成、答案の採点、概念の説明
学習レベルに応じた練習問題の生成。教師が学習目標と3つの難易度(補習、標準、発展)を指定します。 Mistral Small 4 (Apache 2.0、119B、Q4 で 72 GB)は、フランス語で適切に表現された問題文を生成し、難易度に関する指示を守ります。 Qwen 3.5 122B-A10B (Q4で73GB) かつ10Bのアクティブパラメータを備えることで、大量生産における速度と品質のバランスが優れています。
短い答案の採点. ファンクション・グリッド(問題文+評価基準+生徒の回答)は厳密性を要します。 DeepSeek R1 Distill 32B (MIT、Q4で19GB) または QwQ 32B (Apache 2.0)は、構造化された評価基準をうまく扱えます。最終的な採点には、引き続き人間の教師が関与する必要があります。
Khanmigoのような対話型の学習指導。目的は、答えを提示せずに導くことです。 Llama 3.3 70B Instruct et Gemma 4 31B 教育的アプローチにおいてソクラテス主義に基づいた行動を共有しています。ある Khanmigoの代替案 を完全にローカルで実現するうえで、公式カリキュラムの文書を用いたRAGと組み合わせたこの2つのモデルは、確かな基盤となります。
マルチモーダルによるわかりやすい解説. SVT の図解や歴史的な図の解説を行う場合、視覚・言語モデルに切り替えてください。 Qwen 3 VL 235B-A22B (Q4で142GB)または LLaVA-OneVision 72B (Q4で42 GB)は、十分な設備を備えた教育機関向けです。
主権、コンプライアンス、教育機関内でのホスティング
Le déploiement d'un ローカルAIチューター を学校に導入する際には、具体的に3つの課題があります:
- ホスティング :学術機関や自治体のサーバーで、外国のクラウドへの送信トラフィックがない環境。MITおよびApache 2.0ライセンスのモデル(DeepSeek R2 32B, Mistral Small 4, OLMo 3 32B)は内部での再配布を制限しません。
- GDPR(一般データ保護規則)への準拠 :生徒が入力したプロンプトが第三者に渡ることはありません。欧州の規則(EUR-Lex 2016/679)は、オンプレミスのモデルを使うほうが遵守しやすくなります。
- フィルタリングとセキュリティ :入力段階のモデレーションシステム(分類器、プロンプトのブラックリスト)は引き続き必要です。明示的な安全対策がなければ、未成年者が利用するうえで本質的に安全なオープンLLMはありません。
自立アーキテクチャの影響を検討するには、 オンプレミスデプロイメントガイド quelllm.fr
FAQ
Q:GPU予算がRTX 4090を1枚導入できる程度の場合、どのオープンソースLLMを選ぶべきですか?
単一の RTX 4090(VRAM 24 GB)では、 Qwen 3 32B または Gemma 4 31B Q4 での量子化(約19GB)により、コンテキストに余裕が生まれます。速度と品質のバランスを高めるには、 Qwen 3.6 35B-A3B はMoE構成で、アクティブパラメータ数が3Bのため、より高速に応答します。
Q:Khanmigoに代わる本格的なローカルツールはありますか?
はい。 Llama 3.3 70B Instruct または Apertus 70B ドキュメントベースのRAG(マニュアル、公式プログラム)と、教育的ソクラテス式のシステムプロンプトを組み合わせることで、Khanmigoのチューター機能を再現できます。生徒データの第三者への送信は行われません。約40GBのVRAMと2台の24GB GPUを備えたワークステーションを見込んでください。
Q:欧州のモデルは、学校で扱うフランス語に十分対応できますか?
Mistral Large 3 675B et Mistral Small 4 (Apache 2.0)はフランス語に優れ、表記・組版上の慣習にも従います。 Salamandra 40B Instruct (Apache 2.0、BSC) および Apertus 70B (Swiss AI)は、フランス語の割合が高い欧州の多言語コーパスで学習されており、主権を重視する用途に適しています。
Q:学校での展開に適したライセンスはどれですか?
Apache 2.0とMITが最も安心して利用できます。商用利用の制限も、ユーザー数の上限条件もありません。Llama Communityライセンスでは、月間アクティブユーザー数が7億人を超える場合に条件が課されます。教育機関にとって制約となることはまれですが、管轄教育行政機関の法務部門に確認する必要があります。
Q:数学の個別指導には「推論モデル」が必要ですか?
カレッジ向けには、 Gemma 4 31B 十分です。科学系高校および大学教育では、切り替えを DeepSeek R1 Distill 32B, QwQ 32B または DeepSeek R2 32B が思考の過程を公開しています。AIMEスコアは HuggingFace Open LLM Leaderboard は、複数の段階を要する問題でこれらのモデルが優れていることを裏付けています。
Q:教育用途でハルシネーションを防ぐにはどうすればよいですか?
併用できる対策は3つあります。(1) 公式の教科書やカリキュラムを収めたRAG用データベースとモデルを組み合わせる、(2) 推論モデルを使用する場合は、常に思考の連鎖を表示する、(3) システムプロンプトで方針を定める(「確信が持てない場合は、そのことを明示する」)。どの対策も、単独では誤りをなくせません。
結論
選択する オープンソース教育用LLM 利用可能なハードウェア、ターゲット言語、教育レベルに依存します。高校・中学校向けの単一GPU環境では、 Qwen 3 32B, Gemma 4 31B または Qwen 3.6 35B-A3B は有力な出発点です。一方、教育機関全体で主権を確保した導入を行う場合は、 Mistral Small 4, Apertus 70B または Llama 3.3 70B Instruct は、所有サービスと同等の品質を提供します。正確なハードウェアに合わせて調整するには、 quelllm.frのモデル選定ツール または、以下を閲覧する 全249モデルのカタログ.