Mistral Magistral:モデルをインストールします。 論理的推論
MagistralはMistral AIの推論モデルです。DeepSeek R1やOpenAI o1のように、回答する前に「考えを言葉にする」モデルですが、フランス語では、他のどのオープンウェイト推論モデルも及ばないネイティブレベルの品質を備えています。このガイドでは、Ollamaを使ってMistral Magistralをローカルにインストールし、適切なプロンプトテンプレートで設定し、蒸留版DeepSeek R1と公正に比較する方法を紹介します。
#他の推論モデルではなく、Magistralを選ぶ理由は?
推論モデル(reasoning models)は、最終回答の前に明示的な思考の連鎖を生成します。数学、論理、扱いの難しいコード、法的分析といった複雑な問題では、同じ規模の汎用モデルに比べてベンチマークで10〜30ポイント高いスコアを得ます。その代償として、速度が遅く、回答が冗長になります。
Magistralが登場するまでは、オープンウェイトの選択肢は主に中国発のモデルでした。DeepSeek R1とその蒸留モデル、thinkingモードのQwen3、GLMなどです。いずれも英語と中国語では申し分なく推論できますが、プロンプトがフランス語でも、思考の連鎖がしばしば中国語に切り替わります。Magistralは、推論過程の記録をプロンプトと同じ言語に保つよう、専用の訓練を受けています。
- 多言語での推論に標準対応
- フランス語で入力すれば、思考の連鎖もフランス語のままです。中国語や英語に突然切り替わることはありません。
- Small バージョンでは Apache 2.0 ライセンスです
- 商用利用が認められ、ファインチューニングも自由に行え、再配布も許可されています。一部の制限の厳しい「オープン」ライセンスに見られるような曖昧な部分はありません。
- ベースはMistral Small 3.1
- ベースモデルから受け継いだフランス語の文章力の高さは、法律や行政に関する回答の文章にも表れます。
- コンテキスト長:4万トークン
- 長く複雑な問題文、複数のコードファイル、または数十ページの契約書に十分に対応できます。
#Magistral Small と Magistral Medium の比較
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
Mistral AIはMagistralを2つのバージョンで公開しており、両者はよく混同されます。mistral magistralをローカルにインストールする場合、利用できるのはSmallのみです。MediumはAPI経由でしか利用できません。
- Magistral Small (24B)
- Apache 2.0ライセンスで重みが公開されています。ローカルにインストールするのは、まさにこのモデルです。パラメータ数は240億で、Mistral Small 3.1から派生しています。
- Magistral Medium
- プロプライエタリモデルで、MistralのAPIまたはLe Chatからのみ利用できます。性能は上回りますが、セルフホスティングはできません。このガイドの対象外です。
#ハードウェア要件
Magistral Smallのパラメータ数は24Bです。Q4_K_M量子化(Ollamaの標準)では、モデルの読み込みに約14 GBのVRAMが必要で、さらにコンテキストの長さに応じて1~3 GBのVRAMが必要です。
- 快適に使える最低限の構成
- RTX 4080 16 GB、RTX 4090 24 GB、RTX 3090 24 GB、または24 GBのユニファイドメモリを搭載したApple SiliconのMac。
- 余裕はほとんどないが、実行は可能
- RTX 4070 Ti Super 16GB(Q4でぎりぎり収まるため、短いコンテキストが必須)、または部分的にオフロードするMac Mシリーズ16GB。
- 不十分です
- VRAMが12GB以下のGPUはすべて該当します。モデルがVRAMに収まらず、一部がCPU側のRAMに配置されるため、速度は毎秒2〜4トークンに落ちます。回答する前に数千トークンを生成する必要があるモデルには、実用にならない速度です。
- Ollama およびドライバー
- Ollama ≥ 0.5.xと比較的新しいNVIDIAドライバー(CUDA 12)、またはMacの場合はMetalが必要です。`ollama --version`で確認してください。
#1. Ollama を使用したインストール
Magistral Smallは、Mistral の公式リリース以来、Ollama Hubで公開されています。インストールは1つのコマンドで完了します。
- 01Ollamaが起動していることを確認してくださいWindows/macOSでは、アプリケーションが起動している必要があります(タスクバーにアイコンが表示されます)。Linuxでは、`systemctl status ollama`でサービスが稼働中であることを確認できます。
- 02モデルをダウンロードOllama が提供するデフォルトの量子化は Q4_K_M です。これは 16〜24 GB の VRAM に最適なバランスです。
- 03初回起動Ollama は最初の `pull` で約14GBをダウンロードします。初期ダウンロードは接続環境により10から30分かかる場合があります。
- 04読み込みテストまず `ollama run magistral` を起動し、その後短い質問を入力してください。モデルが5〜10秒の「warmup」後に応答する場合、正常に動作しています。
モデルが CPU 側の RAM ではなく、確実に GPU を使っていることを確認するには、次の確認コマンドを使います:
PROCESSOR列には`100% GPU`と表示されるはずです。`45% CPU / 55% GPU`と表示される場合は、VRAMが不足しており、Ollamaがモデルの一部をシステムRAMに移しています。モデルは動作しますが、速度は1〜3トークン/秒になります。
#2. オフィシャルのプロンプトテンプレート
Magistral は、推論を正しく有効にするために専用のプロンプト形式を使用します。Ollama の公式 Modelfile にはすでにこのテンプレートが組み込まれていますが、システムプロンプトの配置を誤って意図せずテンプレートを壊さないよう、その仕組みを理解しておくとよいでしょう。
期待される構造の簡略化版:
実際には、これらのタグを手動で入力することはありません。Ollamaが自動的に挿入します。知っておくべき点は、モデルには推論するよう指示する必要があることです。短く明確なシステムプロンプトで、品質が大幅に向上します。
#3. フランス語での最初の実践テスト
Magistralを典型的なタスクで素早く評価するための3つのプロンプトを以下に示します。なお、応答は2段階で返されます。まず思考チェーン(`<think>...</think>`)、次に最終的な回答です。
Magistralは、借りたラクダを使う定番の推論を順に展開します。明確で番号付きの最終回答が出るまでに、思考部分で1,500~2,500トークンを使うと見込んでください。
アルゴリズムの質を確認する良い機会です。Magistralは通常、累積和を使った辞書による解法を提示し、推論中にそのデータ構造を選んだ理由を説明します。
このような依頼では、Magistralのフランス語の質が差を生みます。生成された条項は構文が正しく、有効性の条件(期間と地域の制限、金銭的な対価)を明記し、フランスの法律用語を使っています。英語をぎこちなく訳した文章ではありません。
#4. パフォーマンス:AIME、数学、コード
Mistral AIはMagistral SmallとMediumの公式数値を公表しています。以下はSmall(セルフホスティングできる唯一のバージョン)のスコアを丸めた値です。あくまで目安であり、実際の結果は量子化やサンプリングによって変わります。
- AIME 2024(数学オリンピック)
- Magistral Smallは約70%、推論特化型ではないMistral Small 3.1は約50%です。この種の問題では、推論モードによる改善は非常に大きくなります。
- LiveCodeBench(コード)
- 難易度 medium の問題では Qwen3-Coder 30B-A3B と同等かやや高いスコア、難易度 hard の問題ではそれを下回るスコア。
- MMLU FR
- ベースモデルの Mistral Small 3.1 と同程度です。一般知識の多肢選択式問題では、答えを記憶しているかどうかで決まるため、推論による利点はありません。
- GPQA Diamond(科学的推論)
- thinkingモードでは明確な改善が見られ、推論なしのベースモデルの35〜40%に対し、約50〜55%となります。
#5. Magistral SmallとDeepSeek R1の蒸留版14Bの比較
フランス語話者にとって有用なのは、DeepSeek-R1-Distill-Qwen-14Bとの比較です。ローカルでの推論を求める人にとって、これは直接競合するオープンウェイトモデルです。両者にはそれぞれ強みがあります。以下では、実際のテストでわかったことを紹介します。
- メモリフットプリント
- DeepSeek R1 14B Q4 ≈ 9 GB、Magistral 24B Q4 ≈ 14 GB。GPUが12GBまでに制限されている場合、DeepSeek の利点が明確になります。
- フランス語での推論品質
- Magistralは最初から最後までフランス語を維持します。DeepSeek R1の蒸留モデルは、フランス語の使用を厳格に指定するシステムプロンプトを使っても、思考の連鎖の中で中国語や英語に頻繁に切り替わります。この点ではMagistralが優位です。
- フランス語の最終回答の品質
- Magistral は、語彙、文法上の一致、文体の面で、より質の高いフランス語を生成します。DeepSeek R1 14B には、翻訳されたモデルに典型的な言葉遣いの誤りが見られます。Magistral が優勢です。
- 純粋な数学(AIME、AMC)
- DeepSeek R1の蒸留版14Bは、厳密な形式に基づく問題ではMagistral Smallよりわずかに優れています。DeepSeekが優勢です。
- コード
- 実用上は互角です。どちらも中程度の難易度の問題で正しいコードを生成します。フランス語を使ったコード(コメント、変数名)では、Magistralのほうが整っています。
- 生成速度
- DeepSeek 14Bは、同じVRAM容量で約1.7倍高速です。これは単にモデルサイズの違いによるものです。対話形式のセッションでは、この差が重要になります。
#6. 使用例:ローカルでの法的分析
フランス語の品質、推論能力、セルフホスティングの組み合わせにより、Magistralは機密性の高い法務タスクに非常に有力な候補となります。法務関連の内容が自分のマシンの外に出ることはありません。案件資料をOpenAIに送れない法律事務所にとって、これは決定的な利点です。
うまく機能する具体的な3つのケース:
- 契約条項の分析
- 契約条項を貼り付け、いずれかの当事者にとってのリスクを特定するよう求める。Magistralは推論の過程を明示するため、分析を検証できます。モデルがどの箇所に問題を見いだしたのかを、人間が確認できます。
- バージョン比較
- 変更契約書の二つのバージョンを貼り付け、表面的な違いではなく実質的な違いの一覧と、その影響を求める。推論モードは、些細な違いと重要な変更を区別するのに役立ちます。
- 内部メモの作成
- 法律の条文や判決をもとに要約メモの作成を依頼する。ここでは、フランス語の文章品質が差を生む要因です。
#トラブルシューティング
- モデルはthinking中に英語に切り替わる
- システムプロンプトに「思考も回答もフランス語のみで行うこと」という明示的な指示を加えて強化してください。それでも不十分な場合は、本題の質問の前に、最初のメッセージとして短いフランス語の文を送り、使用言語を定着させてください。
- 結論に達する前に途切れる回答
- モデルが思考処理中にトークン予算を使い切りました。`/set parameter num_ctx 16384`と`/set parameter num_predict 4096`でウィンドウを拡大してください。
- 1〜2トークン/秒の生成
- モデルはCPU上で動作しているか、一部がオフロードされています。`ollama ps`で確認できます。対処法:VRAMを解放する(ChromeやSteamを閉じる)、Q3_K_Mなどのより強い量子化に切り替える、またはこのGPUでは不十分だと受け入れる。
- 最終回答に<think>タグが表示されます
- 加工せずに出力するモードでは、想定どおりの動作です。Open WebUIやLM Studioのようなインターフェースでは、これらは自動的に、展開・折りたたみ可能な「reasoning」ブロックにまとめられます。OllamaのCLIでは表示されたままになります。これは設計上の仕様です。
- モデルが最近の事実について「ハルシネーション」を起こす
- マギストラル・スモールの知識は、学習時点のままです。最新の事実に関する質問(最近の判例、ニュースなど)に答えるには、モデル単体ではなく RAG パイプラインが必要です。
#さらに詳しく
Magistral は、必要な GPU を備えている方にとって優れたフランス語モデルです。導入した環境を最大限に活用するためのヒントをいくつか紹介します。
- 自分のマシンでDeepSeek R1と比較する
- DeepSeek R1のインストールガイドでは、Magistralと併用できるように14Bの蒸留モデルをインストールし、ご自身のプロンプトで両者を比較する方法を紹介しています。
- Magistralを法律関連のPDFに接続する
- PrivateGPT v2 ガイドは、機密文書の分析に Magistral を完璧に補完する 100% ローカルの RAG パイプラインを説明しています。
- 最も適した量子化を選ぶ
- Q4_K_M、Q5_K_M、Q6_Kのどれを選ぶか迷ったら、「量子化の選び方」ガイドでトレードオフを確認してください。推論モデルでは、汎用モデルよりも量子化による性能低下が目立ちます。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。