2026年、法務分野に最適なオープンソースLLM
選ぶ 法律分野向けのオープンソースLLM 2026年には、特定の業務要件を満たすために、顧客データの管理を維持し、職業上の秘密を守り、内部インフラ上で許容ライセンスに基づくモデルを展開する必要があります。本ガイドは、フランス語圏の弁護士事務所、法務部門および法テック企業向けに、最も関連性の高いオープンウェイトモデルを比較し、ハードウェア仕様、検証可能なライセンス、フランス法に適合した利用事例を提示します。以下のリストは、 ローカルLLMナビ カタログ、Mistral、DeepSeek、Qwen、Llamaの各モデルファミリーの概要、組織の規模別のVRAM推奨値、そして最後にライセンス、GDPR、機密性に関する疑問に答えるFAQをご紹介します。
なぜ法務分野にオープンソースLLMを導入するのか
データの取り扱いに関する法規制は、顧客ファイル、契約書、手続き書類、非公開判例などに適用されます。自社サーバーまたは国内クラウド上でモデルをホスティングすることで、プロンプトの第三者への送信を防ぎ、RGPDへの適合を容易にできます。 RGPD また、法的義務についてもEU AI Act は2024年から段階的に適用されています。
の具体的な三つの利点 弁護士事務所向けAI をセルフホストする場合:
- プライバシー :プロンプトは一切法律事務所の外に出ないため、1971年法第66-5条が保障する職務上の秘密を保護できます。
- 業界向けのファインチューニング :内部の判例コーパス(控訴裁判所の判決、法学説、訴訟書面のひな型)を用いた調整が可能です。
- コストをコントロール :トークン単位の課金はなく、費用はGPUインフラと電力だけです。
モデルは Apache 2.0 ライセンス または MIT を優先してください。これらは、共有を強制する条項なしで、商用利用、改変、再配布を認めています。コミュニティライセンス(Llama、Gemma)も利用できますが、契約条件の確認が必要です。次をご参照ください: オープンウェイトライセンスガイド.
フランス語での法務文書作成に適したモデル
フランス語の法務分野は、ゼロショットで優れた性能を発揮するモデルが依然として少ない領域です。ヨーロッパの企業や多言語対応の大規模モデルが最も良い結果を提供しています。
Mistralファミリー — フランス発の選択肢
- Mistral Large 3 675B (Apache 2.0、Mistral AI)— パラメータ数675B、Q4で約405 GBのVRAM、コンテキスト長256,000トークン。フランスで開発され、フランス語の法律文書の構文に精通しており、非常に長い文書(訴訟に関する論述書、準備書面、改訂内容を統合した契約書)を扱えます。モデル詳細: Mistral Large 3.
- Mistral Small 4 (Apache 2.0)— 119B、Q4で約72 GBのVRAM、コンテキスト256,000。A100 80GBを2枚、またはRTX 6000 Adaを4枚備えた中規模の法律事務所にとって、バランスのよい選択肢です。モデル情報: Mistral Small 4.
- Mixtral 8x22B Instruct (Apache 2.0) — 141B(MoEで39Bがアクティブ)、Q4で約82 GB VRAM。ソリューション 法律分野向けMistral 堅牢で、複数のリーガルテック導入事例ですでに実績があります。モデル情報: Mixtral 8x22B.
- Mixtral 8x7B (Apache 2.0)— 47B、Q4でのVRAM使用量は約26GB。導入を始める際に最も手が届きやすいモデルです(RTX 4090を1枚使用し、CPUへのオフロードも可能)。モデル情報: Mixtral 8x7B.
Mistral AIはトークナイザーと重みを公開しています HuggingFace、内部監査を簡素化します。
Qwenシリーズ — 優れた多言語性能
AlibabaはApache 2.0ライセンスでQwenシリーズを公開しており、フランス語もその多言語性能の対象に含まれています。
- Qwen 3 235B-A22B (Q4でVRAM約142 GB、コンテキスト長131 072)— アクティブパラメータ数22BのMoEアーキテクチャで、長い判決文の要約に適しています。紹介ページ: Qwen 3 235B.
- Qwen 3.5 122B-A10B (Q4でVRAM約73 GB、コンテキスト長262,000)— アクティブパラメータ数は100億で、対話的な文章作成でのレイテンシが低減されます。
- Qwen 3 32B (VRAM Q4で約19 GB)— 単一の RTX 4090 またはA6000でデプロイ可能。データシート: Qwen 3 32B.
- Qwen 3 VL 235B-A22B — スキャンした書類のOCRや表の読み取りに対応するビジョン版。モデル情報: Qwen 3 VL 235B.
比較を確認 Mistral Large 3 vs Qwen 3 235B フランス語ネイティブと多言語対応の間でバランスを取るための選択
DeepSeekシリーズ — 長時間の推論
DeepSeekは構造化された推論に優れており、法的な主張の分析、法的性質の判断、論証の組み立てに役立ちます。
- DeepSeek V3.2 (MIT、685B、~410GB VRAM Q4、ctx 128 000) — データシート: DeepSeek V3.2.
- DeepSeek R1 671B (MIT、~400GB VRAM Q4) — 論理的推論モデルとして公開されました。 arXivのR1論文。モデル情報: DeepSeek R1 671B.
- DeepSeek R1 Distill 32B (Q4でVRAM約19GB)— シングルGPUサーバー向けの蒸留版。モデル情報: DeepSeek R1 Distill 32B.
- DeepSeek R2 32B (Q4でVRAM約19 GB、コンテキスト128,000)— 推論性能が向上した2026年版。
法律事務所の規模別ハードウェア仕様
必要なVRAMは、選択する量子化方式によって異なります。おおよその目安(llama.cppまたはvLLMの実装に応じて確認が必要):
- Q4 (4 bits) : パラメータ 10 億あたり約 0.60 GB
- Q5 :約0.75 GB / B
- Q8 :約1.20 GB / B
- FP16 : ~2,00 GB / B
個人事務所または小規模事務所(弁護士1〜5名)
GPU予算 2,000~6,000 €、1台の RTX 4090 24 GB または 1台の RTX 6000 Ada 48 GB :
- Qwen 3 30B-A3B (Q4で約19 GB、MoEで有効なパラメータは30億 — レイテンシが非常に低い)— fiche
- Mixtral 8x7B Q4(~26 GB、部分的なオフロード)
- Gemma 4 31B (Gemma ライセンス、~18 GB Q4、ctx 256 000) — fiche
- Qwen 3.6 35B-A3B (~21 GB Q4)
見る 24 GBのVRAMに最適なLLM で全ラインアップをご覧いただけます。
中規模事務所(10〜50名の弁護士)
2× A100 80GB サーバーまたは 4× L40S 48GB サーバー :
- Mistral Small 4 Q4 ~72 GB
- Mixtral 8x22B Q4 ~82GB
- Qwen 3.5 122B-A10B Q4 ~73 GB
- gpt-oss 120B (Apache 2.0, OpenAI) ~70 GB — fiche
大規模法務部門または legaltech
H100 80 GBを8基搭載したクラスタ(VRAM合計640 GB)、またはMI300X 192 GBを4基搭載したクラスタ:
- Mistral Large 3 675B Q4 約405 GB
- DeepSeek V3.2 ~410 GB Q4
- Llama 4 Maverick 400B (~240GB Q4、ctx 1,000,000) — fiche
マルチGPU構成とテンソル並列化については、次を参照する: 分散推論ガイド および vLLMドキュメント.
法律分野に関連するベンチマーク
フランス法を専門に評価する公開ベンチマークはありませんが、代わりの指標として利用できるものはいくつかあります:
- MMLU (サブカテゴリ
professional_lawetinternational_law)— 主に米国法を扱っていますが、指標としては役立ちます。参照資料: MMLU論文. - LegalBench (HuggingFace プロジェクト)— 英語の法律関連タスク162件。
- MMLU-Pro — 難易度を高めた版で、段階的な推論による法的な位置づけの判断に役立ちます。
これらの評価(公開された数字はバージョンによって確認が必要です):
- Mistral Large 3 : MMLU推定値 ~86 %
- DeepSeek V3.2 : MMLU ~88 %, MMLU-Pro ~75 %
- Qwen 3 235B-A22B : MMLU ~87 %
- Llama 3.3 70B Instruct : MMLU ~82 %、コンテキスト長128,000 — fiche
コーディングと推論を比較するには(法務オペレーションや条項分析の自動化に役立ちます)、次をご覧ください: コーディング向けの最適なLLM et 推論に最適なLLM.
法律事務所での具体的な活用例
- 訴訟書類の要約 :Mistral Large 3またはQwen 3.5 122B-A10B。200,000トークン以上のコンテキストに対応し、案件の資料一式を読み込めます。
- 初稿の作成 (準備書面、書簡、法律意見書):Mistral Small 4またはMixtral 8x22Bで、弁護士が確認する下書きを作成するには十分です。
- RAGを活用した法的判例検索 : パイプライン Qwen 3 32B と Légifrance/Doctrine ベースのベクトルデータベースを組み合わせたもので、単一サーバー上で展開可能です。
- 契約分析および条項検出 :DeepSeek R2 32BまたはQwQ 32Bで、契約上の義務を論理的に分解 — QwQ 32Bのモデル詳細.
- 裁判例の自動匿名化 : Granite 4.0 H-Small 32B-A9B(Apache 2.0、IBM、~19 GB Q4)— fiche.
- OCRとスキャン済み書類の読み取り :文書のマルチモーダル処理にはQwen 3 VL 235B-A22B。
欧州発の、技術主権を重視したプロジェクトも紹介しておきましょう: Apertus 70B (Swiss AI, Apache 2.0, ~40 GB Q4) — fiche — 欧州の規制への準拠と、フランス語を含むスイスの公用語に特に配慮して学習されています。
推論パフォーマンス(トークン/秒)
一般的な構成での推定値(ランタイムとバッチサイズに応じて確認が必要):
- Mixtral 8x7B Q4 RTX 4090でllama.cppを使用した場合:シングルストリームで約40〜60トークン/秒
- Qwen 3 32B Q4 RTX 6000 Ada で vLLM を使用した場合:~35-50 tok/s
- Mistral Small 4 Q4 2×A100 80GBを用いてvLLMで実行:約25〜40トークン/秒
- Mistral Large 3 Q4 をH100 80GB×8基で実行した場合:約15〜30トークン/秒。バッチ処理時のスループットは、これを大幅に上回ります
測定方法の詳細については、こちらを参照ください llama.cppコミュニティ を参照してください。再現可能なベンチマークプロトコルを確認してください。
FAQ
Q:法律事務所で商用運用する場合、どのライセンスを選べばよいですか?
優先する Apache 2.0 (Mistral, Qwen, Mixtral, gpt-oss, Apertus) または MIT (DeepSeek). これらのライセンスは明示的に商業利用、改変および再配布を許可しており、強制的な共有義務は設けられていません。コミュニティライセンス Llama および Gemma は利用可能ですが、ユーザー数の上限 (Llama) または利用制限 (Gemma) が課せられており、導入前に法務部門と確認する必要があります。
Q:内部で運用されるオープンソースLLMは、GDPRに準拠していますか?
セルフホスティングは、第三者へのデータ転送を排除することで、すでに大きなリスクの一部を解決します。しかし、最終的なコンプライアンスは影響評価(AIPD)、処理活動の記録、プロンプトと補完の保存期間の設定に依存します。セルフホスティングはコンプライアンスを容易にしますが、完全な解決ではありません。DPOによる監査は依然として必要です。
Q:Mistral Large 3 にはどのくらいのVRAMが必要ですか?
Q4量子化では、 Mistral Large 3 675B 約 405GBのVRAM 合計6台のH100 80GBまたは3台のMI300X 192GB相当。Q8(より精度の高い)の場合、約810GBを予備としてください。品質がほぼ同等になる一方で、エコシステムの負荷を軽減できます。 Mixtral 8x22B (~82 GB Q4) または Mistral Small 4 (約72GB Q4) は妥当な代替案です。
Q:24 GBのGPU1枚でフランス法に対応するにはどのモデルが適していますか?
VRAMが24GBの環境(RTX 4090、RTX 3090)では、有力な候補は Qwen 3 30B-A3B (Q4で約19 GB、MoEにより低レイテンシ)、 Mixtral 8x7B Q4(一部をオフロードした場合、約26GB)、 Gemma 4 31B (~18GB Q4) または DeepSeek R2 32B (~19 GB Q4)。詳細な選択肢は以下のページをご覧ください 24 GBのVRAMに最適なLLM.
Q:自分で保有する判例資料を使ってモデルをファインチューニングできますか?
はい、以下の方法で LoRA または QLoRA Apache 2.0 または MIT ライセンスのモデルで行えます。ベースモデルのサイズと選択したLoRAランクに応じて、24〜80 GBのVRAMを見込んでください。MoEモデル(Mixtral、Qwen MoE)では、ルーティングに特別な注意が必要です。詳しくは、 法律分野向けファインチューニングガイド 注釈付きコーパスに関するベストプラクティスについて。
Q:法律事務所では、デンスモデルとMoEモデルのどちらを優先すべきですか?
1つのモデル dense (Llama 3.3 70B, Qwen 3 32B) は一貫した品質を提供し、RAGの統合が簡単です。モデル MoE (Mixtral 8x22B, Qwen 3 235B-A22B) は、稼働中のエキスパートだけが計算リソースを使うため、推論品質とコストのバランスに優れています。ただし、すべてのエキスパートを読み込むには、より多くのVRAMが必要です。対話的な用途(文章作成支援)ではMoEが有利ですが、バッチ処理(大量分析)では密なモデルも競争力を保っています。
結論
選択する 法律分野向けのオープンソースLLM 2026 年の選択は 3 つの軸で決まります:寛容なライセンス(Apache 2.0 または MIT が優先)、フランス語圏の品質(Mistral が首位、続いて Qwen と DeepSeek)、そして現実的な GPU 予算(RTX 4090 から H100 クラスタまで)。利用可能な VRAM と具体的なユースケースに基づいて選択を絞り込むには、を実行してください quelllm.frのモデル選定ツール または、以下を閲覧する 全モデルのカタログ 249 のモデルがインデックス化されています。