医療分野に最適なオープンソースLLM(2026年版)

選ぶ オープンソース医療用 LLM 2026年には、患者データのプライバシー、臨床的正確性、GPU予算のバランスを取らなければなりません。 オープンソース医療用 LLM 自己ホストは、記録を第三者のAPIに外部送信せず、GDPRと職業上の守秘義務を守るための有力な方法です。このガイドでは、医療用途(診療記録の要約、CIM-10によるコーディング、鑑別診断の支援、文献検索)に適したオープンウェイトモデルを、VRAM仕様、ライセンス、検証可能なベンチマークとともに紹介します。

医療分野でセルフホスト型モデルを使う理由

個人データに該当する健康データはGDPR第9条の対象となり、フランス国内でのHDSホスティングが義務付けられます。クラウドAPIは、暗号化されていても、診療所や病院をEU域外へのデータ移転のリスクにさらし、監査を複雑にします。オープンウェイトモデルをローカルGPUまたはオンプレミスサーバーでセルフホスティングすれば、このリスクを排除できます。

2つ目の論点は追跡可能性です。ローカルで重み付けされたモデル(重みが固定され、システムプロンプトがバージョン管理されている)は、重みが事前通知なしに変更される可能性のあるプロプライエタリなエンドポイントとは異なり、再現可能な出力を生成します。ある 診断用LLM 医療上の意思決定支援に用いる場合、この再現性はMDR 2017/745規則における機器の認定に必要です。

プロジェクト Google Health の MedGemma, しばしば参考として引用されるもので、次のアプローチを示しています:公開されたウェイト、医療分野の公開データセット(MIMIC、PubMed)上でフィンーティング、透明な評価。より広いモデルファミリーの概要については、当社の インデックス済みの249モデルを網羅したカタログ.

臨床用途に適したモデルファミリー

2026年時点で、医療機器として正式に承認された汎用モデルはありません。モデルは、MedQA、MedMCQA、PubMedQA、MMLU-Medicalのベンチマークで測定された医学的推論の質と、ハードウェアの制約を照らし合わせて選びます。

推論モデル(鑑別診断、症例の要約)

医療分野で優れた性能を発揮する汎用モデル

画像およびスキャンされたレポート向けのマルチモーダルモデル

VRAM、量子化、ターゲットハードウェア

ハードウェアのスペックは、すべてのデプロイにおいて決定要因です。ローカルで動作する医療AI. 以下に示す値は推論に関するもので、トレーニングバッチを除きます。

個人事業主(開業医、研究者医)向け : - Qwen 3.6 35B-A3B — Q4で約21 GB、32 GBのVRAMを搭載したRTX 5090に収まります — Granite 4.0 H-Small 32B-A9B — Q4で約19 GB、 IBM Research の Apache 2.0 ライセンス - Gemma 4 31B — Q4 約18 GB、Gemmaライセンス(臨床導入前に確認すること) - Seed-OSS 36B Instruct — ctx 524 288、複数の診療記録を読み込むのに役立ちます

病院の診療部門向け(DGXまたはH100サーバー1〜2台) : - Llama 4 Scout 109B — Q4 約65 GB、コンテキスト1,000万トークン(本番環境での確認が必要) - Mistral Small 4 — Q4 ~72 GB - Qwen 3.5 122B-A10B —— Q4 約73 GB - Mixtral 8x22B Instruct — Q4で約82 GB、医療文書作成に定評のある選択肢

大学病院(CHU)または医療分野のソフトウェアベンダー向け(マルチノードクラスタ) : - DeepSeek V3.2 — Q4 ~410 GB - GLM-5.1 — Q4 ~445 GB、コンテキスト 200,000 - Mistral Large 3 675B — Q4 ~405 GB

Q5の推定容量は約25%増え、FP16ではこれらの容量が2倍になります。より正確に見積もるには、こちらをご利用ください: GPU設定ツール は、コンテキストウィンドウを最大まで使用した場合のKVキャッシュも考慮します。

ライセンス:臨床現場で使用できるものと、使用を阻害するもの

ライセンスによって、モデルを医療機関向けに販売される製品に統合できるかどうかが決まります。

主権を重視する欧州の組織にとって、 Mistral Large 3 675B, Apertus 70B (Swiss AI) および Salamandra 40B Instruct (Barcelona Supercomputing Center)は、重み全体をEU域内でホストできます。これらの選択肢を比較するページはこちら: Mistral と Llama の比較.

医療ベンチマーク:数字が意味するもの

2026年に最も使われている公開医療ベンチマーク:

汎用モデルのMedQAスコア(pass@1。HuggingFaceのモデルカードと技術論文に基づく推定値で、重大な判断に関わる用途では確認が必要):

バイオメディカル分野のパイプライン用ツールのプログラミング(FHIRの解析、DICOM画像の抽出スクリプト)では、 Qwen 2.5 Coder 32B または Qwen3-Coder-Next 80B-A3B HumanEvalで85%を超えるスコアを達成しています。

注意 :MedQAベンチマークで高いスコアを得ても、市場投入の承認を得たことにはなりません。クラスIIa以上の医療機器には、IEC 62304規格およびMDR規則に準拠した臨床検証が必要です。

実際の利用事例と推奨されるパイプライン

手術記録の要約 : Mistral Small 4 または Llama 3.3 70B, コンテキスト 128,000 テキスト。SOAP形式の構造化プロンプトで要約を要求します。詳細は当社の 医療分野向けファインチューニングガイド.

CIM-10およびCCAMに基づく医療コード付与の支援 : Granite 4.0 H-Small 公式な分類体系に基づくRAGベースで。IBMは評価を公開しています。 自社のGraniteハブ.

文献検索:PubMed : Qwen 3 VL 235B-A22B 図を読み取るために、ベクトルインデックスと組み合わせて使用します。参照先: 医療用RAGガイド.

鑑別診断の支援 : DeepSeek R1 671B または DeepSeek R2 32B を段階的な推論に利用します。必ず人間による検証を行い、補助として使用し、代替としては使用しないでください。

遠隔診療と文字起こし : Whisper-large-v3(OpenAIのリポジトリ) を先に使い、その後 Mistral Large 3 体裁を整えるために。

他の分野と比較するには、以下のページをご参照ください。 法律分野に最適なLLM または コード向けに最適なLLM.

FAQ

Q : MedGemma は quelllm.fr に掲載されていますか?

医療分野に特化したモデルのバリエーションは別途管理されているため、MedGemmaはまだ249モデルを収録したカタログには掲載されていません。すぐに導入する場合は、 Gemma 4 31B はGemmaライセンスの下でベースモデルとなり、内部コーパスでファインチューニングすることを想定しています。MedGemmaファミリーについてはGoogle HealthがHuggingFace上でドキュメントを公開しており、標準的なvLLMサーバーとの互換性も維持されています。

Q:臨床用途での単独使用に必要な最小の VRAM はどれですか?

32BモデルをQ4量子化で、32,000トークンの有効コンテキストで動作させるには、20〜24 GBのVRAMを確保してください。32 GBの RTX 5090、48 GBの RTX 6000 Ada、または96 GBのMac Studio M3 Ultraが適しています。16 GB未満の場合、7B〜13Bのモデルに限定されますが、その医療分野での品質はプロフェッショナルな用途には不十分と判断されています。

Q:オープンソースの医療用LLMをプロダクション環境で展開する場合、認証は必要ですか?

医療判断に影響を与える場合を除き、内部文書作成のための内部利用は可能です。医療診断、処方、患者分類に影響を与える場合、MDR 2017/745規則の適用範囲に入ります。 ANSMによるデジタル医療機器に関するドキュメント しきい値を明確にします。

Q:医療分野では、DeepSeek R1とR2にどのような違いがありますか?

DeepSeek R1 671B は、長い推論と百科事典的な知識の深さにおいて引き続き基準となるモデルですが、約400 GBのVRAMを必要とします。 DeepSeek R2 32B は単一GPUで動作する蒸留版で、入手可能な技術レポートによれば、MedQAでは元のモデルの約90%の性能を維持しています(要確認)。

Q:中国製モデルは患者データに対してリスクをもたらしますか?

重みが公開されているモデル(DeepSeek、Qwen、GLM、MiMo)は、外部にテレメトリーを送信せずにローカルで動作します。リスクはデータの流出ではなく、疾患、用法・用量、治療プロトコルに関する文化的バイアスです。フランス語圏の事例を用いた内部評価が必要です。比較対象: Mistral と DeepSeek の比較.

Q:フランス語の医療分野の文字起こしには、どのモデルを選べばよいですか?

生の文字起こしでは、Whisper-large-v3が依然として定番です。逐語録を報告書の形式に整える際は、 Mistral Small 4 または Llama 3.3 70B 自然な医療用フランス語を生成します。関連する専門分野を明確に示すシステムプロンプトを追加してください。

結論

選択する オープンソース医療用 LLM 2026年には、まず利用可能なハードウェアと適用を想定する規制の枠組みに左右されます。診療所では、 DeepSeek R2 32B または Granite 4.0 H-Small 十分です。大学病院の場合、 Mistral Large 3 675B または DeepSeek R1 671B 複雑なケースをカバーします。選択を調整するため、以下のを参照してください GPU設定ツール または、以下を閲覧する 全モデルのカタログ ライセンスおよびVRAMによってフィルタリングされます。

記事の公開および更新日 著者: Mohamed Meguedmi · データソース: /api/models.json · コンテンツのライセンス: CC BY 4.0.

報告したい誤りや更新情報はありますか? 参加する.