2026年の企業向けGDPR対応オンプレミスLLM:最適なモデル
選ぶ GDPR 対応のオンプレミス LLM は、欧州外のSaaSプロバイダーにデータをさらすことなく文書処理を本格的に運用したい欧州企業の技術部門にとって、重要なテーマとなっています。適切に導入されたGDPR対応のオンプレミスLLMは、プロンプト、出力、そして記録される場合のログが、企業の管理する範囲から決して外に出ないことを保証します。そのため、データ保護影響評価(AIPD)や同規則第32条に基づく義務への対応が大幅に簡素化されます。本記事では、2026年に適したオープンウェイトモデルについて、必要なハードウェアリソース、ライセンス、用途、本番環境への導入前に注意すべき運用上の点を解説します。
マネージドAPIよりもRGPD対応のオンプレミスLLMを選ぶ理由
EU規則2016/679(詳細は EUR-Lexの統合版条文)EU域外へのデータ移転には厳格な規制が適用され、処理の法的根拠を明確に示す必要があります。第三者プロバイダーでホストされたAPIは、追加の委託先、維持すべき標準契約条項(CCT)、場合によってはCLOUD Actなど域外法への曝露を必ず伴います。これに対し、オンプレミス(または企業が管理するプライベートクラウド)なら、この依存関係の連鎖をなくせます。
現場からのフィードバックでは、ほかにも次の3つの動機がよく挙げられます:
- 契約上の自主性 :提供元が利用規約を変更しても、サービスが中断されることはありません。
- ファインチューニングの管理 : 社内の業務用コーパスは情報システム内にとどまるため、埋め込みによる情報漏洩のリスクを回避できます。
- 予測可能な限界費用 ハードウェアの償却が完了すると、推論は100万トークンあたりの価格に依存しなくなります。
オープンウェイトエコシステムは、ホブのようなプラットフォームで収録されています Hugging Face または以下の方法で vLLMインフェレンスサーバーにより、現在では外部に依存せずに業務用途のほぼすべてに対応できます。アーキテクチャをより幅広く概観するには、当サイトの 企業向けオープンソースLLMガイド.
2026年に選ぶオープンウェイトモデルは?
選択する 企業向けソブリンLLM 品質、コンテキストサイズ、ライセンス、VRAMのインパクトにバランスを取る必要があります。以下の選択は、私たちの 全モデルのカタログ, 使用シーンごとに分類されています。
「高密度データセンター」向け構成(Q4で必要なVRAMが200 GBを超える)
- DeepSeek V4 Pro 1.6T : 1600 milliards パラメータ、MIT ライセンス、1 000 000トークンのコンテキスト、Q4_K_M でのVRAMは約960GBと推定。対象:法的文書や規制資料の大量RAG。
- MiMo V2.5 Pro :1020B、MIT、コンテキスト1M、Q4で必要なVRAMは約595 GB。多言語で幅広い用途に対応します。
- Mistral Large 3 675B :675B、Apache 2.0、コンテキスト256,000、Q4でのVRAM使用量は約405 GB。フランスならではの強み:提供元はパリに拠点を置き、ホスティングをすべてEU域内で管理できます。
- GLM-5.1 : 744B、MITライセンス、200,000トークンのコンテキスト、VRAM Q4約445GB。
- Llama 4 Maverick 400B :400B、Llama 4 Communityライセンス(月間アクティブユーザー数が7億を超える場合の商用利用条項に注意)、コンテキスト長100万。
「中規模クラスター」構成(Q4でVRAM 60~200GB)
- Qwen 3 235B-A22B :Mixture-of-Experts(MoE)構成で235Bパラメータ(22Bが有効)、Apache 2.0、コンテキスト131,072。MoEにより、品質と推論コストのバランスが非常に優れています。
- MiniMax-M2.7 :229B、Apache 2.0、コンテキスト205,000。
- Mixtral 8x22B Instruct :141B(アクティブなパラメータは39B)、Apache 2.0、コンテキスト64,000。RAGワークロード向けの、欧州発の定評あるモデルです。
- Qwen 3.5 122B-A10B :122B、Apache 2.0、コンテキスト長262,000。
- gpt-oss 120B : 117B、Apache 2.0、コンテキスト128 000。
- Llama 4 Scout 109B :109B、Llama 4 Communityライセンス、コンテキストは10Mトークン(非常に長いプロンプトでの実際の動作は要確認)。
「単一GPUサーバー」構成(Q4でVRAM 20〜60 GB)
- Llama 3.3 70B Instruct :70B、ライセンスLlama 3.3 Community、コンテキスト128 000。Q4でRTX 6000 Ada 2枚またはH100 80 GBに収まります。
- Apertus 70B :70B、Apache 2.0、コンテキスト長65,536。スイス発のモデルで、広い意味で欧州のモデル提供元を求める組織にとって興味深い選択肢です。
- Mixtral 8x7B :47B、Apache 2.0、コンテキスト長32,768。最先端の性能をそれほど必要としないバッチ処理には、今でも有用です。
- Salamandra 40B Instruct :40B、Apache 2.0、コンテキスト長8,192。バルセロナ・スーパーコンピューティング・センター発のモデルで、欧州の多言語コーパスで学習されています。
- Qwen 3 32BとQwen 2.5 Coder 32B:32B、Apache 2.0。汎用RAGと社内向けのコードアシスタントを想定しています。
70Bクラスのより詳しい比較はこちら: Llama 3.3 70BとMixtral 8x22Bの比較.
VRAM使用量、量子化、スループット
VRAMの推定使用量は、選択する量子化によって変わります。密なモデルの場合、大まかな概算は次のとおりです:
- FP16 :パラメータあたり約2バイト
- Q8 : パラメータあたり約1バイト
- Q5_K_M :パラメータあたり約0.7バイト(推定)
- Q4_K_M : ~0.55 から 0.60 バイト/パラメータ
MoEアーキテクチャ向けに Mixtral 8x22B Instruct または Qwen 3 235B-A22B, 必要となるVRAMは、すべてのエキスパートのストレージに相当し、アクティブなエキスパートがどれだけかにかかわらず、そのすべてが保存されます。メモリが制限を課すのです。計算はそれほど影響しません。 arXiv に掲載された Mixtral 8x7B の論文 このメカニズムについて詳しく説明します。
処理速度に関しては、推論エンジンによってトークン/秒の値が大きく異なりますvLLM, TensorRT-LLM, llama.cpp, SGLang), 有効コンテキスト長およびバッチ処理のパラメータ。観察された概算値(実際の負荷による確認が必要):
- Llama 3.3 70B Q4 H100 80GB で vLLM を使用した場合:シングルストリームでは約35〜50トークン/秒、バッチ処理では数百トークン/秒。
- Mixtral 8x7B Q4 RTX 4090 24 GB で部分オフロード:~20-30トークン/秒(推定)。
- Qwen 3 30B-A3B Q4 RTX 6000 Ada 48GBで実行:シングルストリームで約60〜80トークン/秒(推定値)、MoEアーキテクチャの影響により高速化。
- DeepSeek R1 671B Q4 8×H200ノードで: シングルストリームで約15-25トークン/秒 (推論バージョンによって確認が必要)。
サーバーに必要なリソースを正確に見積もるには、 quelllm.frのモデル選定ツール GPU、RAM、対応モデルを照合します。
ライセンス:本番運用で実際に変わること
RGPDに準拠したAIだけでは不十分です。ビジネスモデルに適合するライセンスも必要です。主に次の3系統があります。
- Apache 2.0 (Mistral、Qwen、gpt-oss、Mixtral、Snowflake、MiniMax、IBM Granite、BSC Salamandra…):商用利用は自由で、再配布も許可されています。特許保護条項も含まれています。企業での導入には最もシンプルなライセンスです。
- MIT (DeepSeek V3.2、R1、V4 Pro、GLM-5.1、Ling 2.6、MiMo、Ring-1T、dots.llm1、Seed-OSS):さらに許容範囲が広いライセンスですが、明示的な特許条項はありません。
- Llama Community (Meta):月間アクティブユーザー数が7億人を超える場合を除き、商用利用が認められており、適正利用に関する条項があります。条項はこちらで確認できます: Llamaのサイト.
- Gemma (Google):商用利用は可能ですが、禁止される用途を定めたポリシーを守る必要があります。
トレーサビリティを最大限確保したい組織にとって、OLMo 3 32Bは、Allen AIがトレーニングデータを公開しているため、一部の審査を容易にします(Allen AI のブログを参照)。欧州では、Mistral Large 3 675BとApertus 70Bが構成の選択肢となります。詳細は当サイトのページフランス語で最も優れたLLMをご覧ください。
企業で自己ホストするLLMのベンチマークと活用例
公開スコアは慎重に扱う必要があります。評価手法は多様であり、テストデータの汚染が現在までに記録されています。Hugging Faceのモデルカードから得られたいくつかの参考値は以下の通りです:
- MMLU(一般知識、5ショット):200Bを超えるモデルは通常85〜89%に達します。DeepSeek R1 671B、Qwen 3 235B-A22B、Mistral Large 3 675Bがこの範囲に入ります(評価パイプラインに応じて確認が必要です)。
- HumanEval / MBPP(Pythonコード):Qwen 2.5 Coder 32BとQwen3-Coder-Next 80B-A3Bは、社内向けのコーディングアシスタントとして有力な候補です。
- AIME 2024/2025(数学的推論):DeepSeek R1 671B、QwQ 32B、Ring-1Tは、この「推論」セグメントに位置づけられています。
- Long-context (RULER, LongBench) : Llama 4 Scout 109B, Seed-OSS 36B Instruct (524,288トークン) および MiMo V2.5 Pro は、長いコンテキストの処理で優れた性能を発揮します。
情報システム部門での典型的な用途:
- 内部ドキュメントベースのRAG :32~70Bで十分に対応できます。参考: RAGに最適なLLM と当サイトの オンプレミスでのRAGガイド.
- 法務/コンプライアンス支援アシスタント :128,000トークン以上のコンテキストと、多言語対応に優れたモデル(Mistral Large 3、Qwen 3 235B)を優先する。
- コード生成 : Qwen 2.5/3 Coder, Laguna XS.2, DeepSeek R2 32B。
- マルチモーダル : Qwen 3 VL 235B-A22B, Molmo 72B, LLaVA-OneVision 72B スキャンされたドキュメントの分析に適しています。
- 軽量ワークロードおよびエッジ環境 : Granite 4.0 H-Small 32B-A9B, Gemma 4 31B, Qwen 3 30B-A3B.
また、私たちの比較を参照してください DeepSeek R1 vs Llama 3.3 70B 推論とハードウェアコストのバランスを取るために使用します。
ターゲットアーキテクチャ:POCからプロダクションへ
堅牢なオンプレミスデプロイは、4つのレイヤーを中心に構成されます:
- ハードウェア層 GPU NVIDIA(H100/H200/B200、RTX 6000 Ada、L40S)またはAMD MI300Xなどの代替品。400Bを超えるワークロードでは、8×H100 80GBまたは8×H200 141GBのノードが実用的な最小要件です。
- 推論層 スループットにはvLLMまたはSGLang、レイテンシにはTensorRT-LLM、専用GPUのないサーバーにはllama.cppを使用します。 vLLMドキュメント ここに挙げられたほとんどのモデルをカバーしています。
- オーケストレーションレイヤー : Kubernetes と NVIDIA GPU Operator、スケーリングにはKEDAを、OpenAI互換APIの統合にはLiteLLMやEnvoyなどのゲートウェイを使用します。
- コンプライアンス層 :プロンプトの暗号化ログ記録と短い保存期間、入力時のPIIのマスキング(Presidio、 CNILによるAIに関する推奨事項)、最新の状態に保たれた個人データ処理活動の記録簿、文書化されたデータ保護影響評価(AIPD)。
観測性の観点から、以下のツールが利用可能です Langfuse またはOpenTelemetryによりRAGチェーンのトレースを実行し、ログをSaaSに送信せずに記録できます。構造化されたアプローチを検討する場合は、当社の 本番環境へのLLM導入ガイド および LLM セキュリティチェックリスト.
FAQ
Q:Hugging FaceからダウンロードしたオープンウェイトのLLMは、自動的にRGPDに準拠していますか?
いいえ。モデルのライセンスと実行場所は、別々の問題です。Mistral Large 3またはDeepSeek R1の重みをダウンロードし、ご自身の管理下にある欧州のデータセンターで実行すれば、ユーザーデータのEU域外への移転はなくなります。ただし、処理に対する責任は引き続き負います(GDPR第24条)。これには、データ保護影響評価(AIPD)、保存期間、本人の権利、アクセスの安全性が含まれます。
Q:GDPR対応のオンプレミスLLMで、品質を落とさずに使うには、どの量子化方式を選べばよいですか?
プロダクション用途では Q5_K_M または Q4_K_M は、Hugging Face に公開されたコミュニティの評価によると、30Bを超えるモデルで品質とVRAM使用量の最良のバランスを実現します。それより低い量子化精度(Q3、Q2)では、推論タスクで測定可能な性能低下が生じます。規制上、特に慎重さが求められる用途では、 Q8 または FP16 VRAMに余裕があれば、引き続き推奨されます。特に70B未満のモデルではそうです。
Q:法令を遵守しながら、個人データを使ってファインチューニングできますか?
はい。ただし、法的根拠、AIPD(データ保護影響評価)、データの保持について文書化する必要があります。Apache 2.0(Mistral、Qwen、gpt-oss、IBM Granite)またはMIT(DeepSeek、GLM)ライセンスのモデルは、商用のファインチューニングを明示的に認めています。LoRAとQLoRAでは、アダプターをベースモデルの重みとは別に保持できるため、コーパスの内容から削除が必要と判断される場合に、データ主体本人からの要求に応じた削除が容易になります。
Q:最初に使うなら、Mixtral 8x22BとLlama 3.3 70Bのどちらがよいですか?
Mixtral 8x22B Instruct はVRAM消費量が多い(Q4で82 GB、比較対象は40 GB)ものの、Llama Community Licenseよりも法的な面で採用しやすいApache 2.0ライセンスで提供されています。 Llama 3.3 70B Instruct は、フランス語や汎用的なタスクで引き続き非常に高い性能を発揮します。初めての社内プロジェクトでは、Llama 3.3 70Bのほうがハードウェア要件を満たしやすいことが多く、再配布する製品では、Mixtralのほうがライセンス面で扱いやすいです。
Q:企業向けのLLMを自社でホスティングする場合、H100クラスタが必要ですか?
必ずしもそうではありません。48GBのRTX 6000 Adaを2基搭載したサーバー、または80GBのH100があれば、次を実行するのに十分です: Llama 3.3 70B または Qwen 3 32B RAGチームワークロード向けにQ4で実装されています。完全精度で100Bを超えるモデルまたは量子化で400Bを超えるモデルの場合、マルチGPUクラスタの導入が必須になります。 quelllm.frのモデル選定ツール 実用に必要な最小限のハードウェア構成を算出します。
Q:中国発のモデル(DeepSeek、Qwen、GLM、MiMo)は、RGPDに関して問題がありますか?
GDPRはデータの処理に関するものであり、パラメータの元の出所とは関係ありません。ローカルで実行されるDeepSeekモデルは第三者サーバーと通信しません — これはパラメータファイルです。確認すべき義務はライセンス(DeepSeek についてはMIT、Qwen についてはApache 2.0)および業界内での可能性のある制限です。セキュリティレビュー(パラメータの静的分析、サンドボックス化)は、外部アーテファクトに対して同様に推奨されます。
結論
採用する GDPR 対応のオンプレミス LLM 2026 年において、これはもはや探索的なプロジェクトではありません。オープンウェイトのエコシステムは、単一 GPU 上の Qwen 3 30B-A3B から高密度クラスタ上の DeepSeek V4 Pro 1.6T まで、すべての負荷プロファイルをカバーしており、本番環境と互換性のある Apache 2.0 または MIT ライセンスが付与されています。真の難しさは、ハードウェアのサイズ設定と産業化に移行しています。お使いのハードウェアと制約条件に適したモデルを特定するには、 構成ツール または、以下を閲覧する 全モデルのカタログ 249 のモデルがインデックス化されています。