ローカルLLMのベンチマーク:MMLU、HumanEval、AIME 2026

Un ローカルLLMベンチマーク を評価方法を考慮せずに読むことは、コースの標高変化を知らずに2つのマラソンのタイムを比較するようなものです。MMLUで88点と発表された2つのモデルでも、chain-of-thoughtによる学習の有無、量子化形式、デコード手順(cons@64と厳密なpass@1)、読み込んだデータセットの正確なバージョンによって、MMLU-Proでは16点、AIME 2026では30点の差が生じることがあります。このページは購入ガイドではありません。従来から使われている3つの評価スイート(MMLU/MMLU-Pro、HumanEval/HumanEval+、AIME 2024/2025/2026)を検証するための一覧で、公開スコア、再現に必要な条件、Q4でのVRAM使用量の実測値、実際の構成での処理速度(トークン/秒)、そしてベンダーの発表では触れられないバイアスをまとめています。目的は、シードを固定して自分で測定を再実行し、数値を再現できるように、必要なツールを提供することです。プロプライエタリモデルとオープンウェイトモデルのどちらを選ぶべきか判断することではありません。

2026年の評価の枠組みでは、なぜ2024年より前のベンチマークが無効になるのか

エコシステムは2年間で大きく変化しました。4択MMLUはすでに Llama 3.1 405B の88.6というスコアの時点で飽和しており、エキスパートを選択的に有効化するアーキテクチャ(DeepSeek V3, Qwen 3, GLM-5.1)はすでに上限に迫っており、MMLUスコアを0.5点単位で読み取っても情報価値はなくなりました。3つの構造的変化がマトリックスを再編しました:

  1. RLで訓練された推論モデル (DeepSeek R1, Ring-1T, gpt-oss 120B thinkingが有効になる機能を備え、AIMEおよびMATH-500をトップクラスの判別器に変換します。AIME 2024において、Llama 3.1 405B(~23 pass@1)とDeepSeek R1 671B(~79 pass@1)の間の差は55点に達します——MMLUではこの差を観察することが不可能です。
  2. 総パラメータ数とアクティブパラメータ数の比較. Qwen 3 235B-A22B トークンごとに22Bパラメータのみを有効化し、 MiniMax-M2.7 も同じMoEの仕組みに従います。ベンチマークは、表示されている総パラメータ数ではなく、推論コスト(トークン/秒 × VRAM)が同等の条件で解釈する必要があります。
  3. データ汚染対策を施したベンチマークスイート。LiveBenchは毎月テスト項目を更新し、LiveCodeBenchはCodeforcesの問題に日時情報を付け、事前学習データの基準日より後の問題を抽出します。SimpleBenchは、MMLUでは評価が頭打ちになる領域で、常識に基づく判断の頑健性を測定します。 HuggingFace Open LLM Leaderboard v2 は、この理由からMMLU-Pro、GPQA、MUSR、IFEvalへの移行を明示的に行いました。

単独のスコアを見るだけでは、もはや有用な情報は得られません。{MMLU-Pro, HumanEval+, AIME 2026, SWE-bench Verified, RULER 128k, GPQA Diamond}を組み合わせた評価マトリクスだけが、有用な判断材料をもたらします。ガイド /guide/matrice-benchmarks-2026 推奨される重み付けを明確に説明します

評価方法:各評価スイートが実際に測定するもの

Le MMLU LLM (Massive Multitask Language Understanding、Hendrycksほか、2021年)は、57分野(医学、法律、倫理、初等数学)を4択問題で網羅し、標準の5-shot評価手順を採用しています。参照リポジトリ: GitHub Hendrycks、論文 arXiv:2009.0330085%を超えると、それより後続のモデルが置き換えられました MMLU-Pro (10選、多段階推論、12,032アイテム) で HuggingFace TIGER-Lab、従来のMMLUと比べると通常15〜25ポイント低下します。新たに登場している派生版: MMLU-Redux (arXiv論文:2406.04127)は、元のデータセットのうち、誤りや曖昧さがあると認められた項目約6.5%を修正しています。この点はあまり指摘されませんが、同じ条件で2回実行しても、読み込むバージョンによって結果に1〜2ポイントの差が出る理由となります。フィルターと評価手順についての参照先は /guide/mmlu-pro-protocole-strict.

HumanEval, OpenAI(arXiv:2107.03374), Python の 164 問の問題を関数シグネチャとユニットテストに基づいて評価します。標準メトリクスは pass@1 mais pass@10 et pass@100 それぞれ10および100のサンプルごとに問題を処理するため、評価コストがそれに応じて増加します。その次世代モデルは HumanEval+ (evalplus)は、ミューテーションによって生成したテストケースを約80倍の数だけ追加します。過学習したモデルは、通常、両バージョン間でスコアが5〜10ポイント低下し、元のテストへの過学習の度合いが直接明らかになります。実際のコードについてさらに詳しく知るには、 SWE-bench Verified 実際のGitHubのissueを解決する能力を評価し(人間が検証した500件のチケット)、 LiveCodeBench は、日付で絞り込めるタイムスタンプ付きのCodeforces問題を継続的に提供しています。HumanEval+での抽出手順全体については、次のページで解説しています: /guide/humaneval-plus-protocole.

AIME 2024 LLM は、American Invitational Mathematics Examinationで毎年出題される15問(AIME IとIIの2回の実施)に対応し、解答は0〜999の整数です。推論モデルの登場によって中心的な評価指標となり、RLで訓練されたchain-of-thoughtを備えるアーキテクチャと備えないアーキテクチャの違いを明確に示します。2024年の問題セットの参照先は、 DeepSeek R1 のモデルカード。2024年の問題文が大量にインデックス化されたため、現在はAIME 2025(2025年3月)、続いてAIME 2026(2026年2月)が新しい評価問題として使われています。2025年末の技術レポートでは、cons@64(64サンプルでの多数決、温度0.6、top-p 0.95)がよく使われており、温度0での厳密なpass@1と比べて、生のスコアが10〜15ポイント高く出る可能性があります。

これら 3 つの柱に加えて、2026 年のグリッドは GPQA Diamond (専門家が検証した博士課程レベルの198問)、 MATH-500 (数学オリンピックの問題)、 MuSR (物語に基づく多段階の推論)、 RULER (最大100万トークンの長いコンテキスト内での情報検索)、 IFEval (厳密な指示への追従)、 BFCL v3 (Berkeley Function Calling Leaderboard)は、構造化されたツール呼び出し向けです。信頼できる技術レポートでは現在、MMLUの単独スコアではなく、この評価項目全体のマトリクスを公開しています。

公開スコア:同等のハードウェア条件で比較する

以下の数字は、公式技術資料またはHuggingFaceのレポートから来ています。これらは以下の通りに再現されます。 EleutherAIのlm-evaluation-harnessであり、オープンソースコミュニティで権威ある独立した唯一のプロトコルです。

Tier S — 最先端の推論モデル(パラメータ数6,000億超) :

Tier A — ハイエンドGPU 1〜4基で実行可能(100B〜400Bモデル) :

B段階 — 個別ワークステーション(40〜80 GB VRAM) :

比較データは以下のサイトで入手可能です /compare/deepseek-r1-distill-llama-70b-vs-llama33-70b et /compare/qwen3-235b-a22b-vs-llama-3-1-405b.

ハードウェアコストの詳細:VRAM、量子化、実測の処理速度

推論コストがなければ、純粋なスコアは意味を持ちません。以下の値はQ4_K_M形式の、 llama.cppQ5_K_M、Q8_0、またはFP16への変換により、VRAMはそれぞれ概ね1.25倍、2倍、4倍になります。 quelllm.fr/configurateurの計算ツール GPU予算に応じて絞り込みます。

モデル Q4 VRAM ターゲット設定 Q4の推定処理速度
DeepSeek V4 Pro 1.6T ~960 GB 8×H200 141 GB、pod TPU v5p テンソル並列で15~20 tok/s
MiMo V2.5 Pro 1020B ~595 GB 8×H100 80 GB テンソル並列 20〜30 tok/s
Mistral Large 3 675B ~405 GB 6×H100 80GBまたは4×H200 25-35 tok/s
Llama 3.1 405B ~240 GB 4×A100 80GB または 3×H100 20〜30 tok/s
Qwen 3 235B-A22B ~142GB 2×H100または1×H200 141GB 40-60 tok/s (MoE)
Hunyuan Large 2.0 ~245 GB 3×H100 80 GB 25〜30 tok/s
gpt-oss 120B ~70 GB 1×H100、Mac Studio M3 Ultra 192 GB 35-50 tok/s
Mistral Small 4 119B ~72GB 1×H100、A100 80 GB 30-45 tok/s
Llama 3.3 70B ~40 GB RTX A6000 48 GB、2×RTX 4090 4090を2枚使用した場合、15〜25トークン/秒
DBRX Instruct 132B ~76 GB 1×H100、2×A100 40GB 30〜40トークン/秒

以下の数字はシングルバッチでの概算値です。マルチテナントデプロイメントでは、 vLLM または SGLang 継続的なバッチ処理とプレフィックスキャッシュにより、合計処理能力が5倍まで向上します。Mac Studio M3 Ultra(メモリ帯域800 GB/s)において、 Llama 3.3 70B Q4_K_M では、有効なコンテキスト長に応じて、シングルストリームで毎秒 8 から 12 トークンに達します。MoE アーキテクチャ(Mixtral 8x22B, Qwen 3, DeepSeek V3) は、バッチ処理による専門ルーティングの恩恵を受けてSGLangで特に優れています。ガイド /guide/quantization-q4-q5-q8 では、品質とVRAMのトレードオフを詳しく解説しています。また、 /guide/inference-vllm-vs-llamacpp 各エンジンを深く比較。自らのセットアップをベンチマークするには、 /guide/bench-tokens-par-seconde.

ランキングの解釈を歪める3つのバイアス

  1. データセットの汚染. MMLU および HumanEval は2021年から実施されており、一部のモデルは事前トレーニング段階で問題を経験しており、これによりスコアが人工的に高まっています。この作業 LiveCodeBench は、事前学習データの収集期限より後の問題を切り分けるために、HumanEvalの問題を時系列で追跡する仕組みを提供しています。n-gramの重複によるデータ汚染の検出(手法: arXiv:2311.04850)によると、MMLUの設問の最大12%が、インデックス化されたウェブコーパスにそのままの文面で含まれています。
  2. デコードのばらつき温度0.6、64サンプル(cons@64、多数決)で算出されたAIME pass@1スコアは、厳密な温度0でのpass@1と比較して10点程度異なる可能性があります。GSM8Kにおいては、サンプル数に応じて自己一貫性の誤差は5〜8点まで達します。常に確認してください temperature, top_p, max_tokens, サンプル数および集計ルールはモデルカードまたは技術報告書に記載されています。
  3. 特定のプロンプト。DeepSeek、Qwen、Mistralのレポートでは、最適化されたシステムプロンプトがよく使われ、手作業で選別されたfew-shotの例が使われることもあります。特別な調整をせずにzero-shotで数値を再現しようとすると、通常は3~8ポイント低くなり、推論系の評価セットではさらに差が広がることもあります。AIMEでは、推論過程を出力するように訓練されていないモデルに「Let's think step by step」という接頭辞を追加すると、スコアが4~6ポイント変動することがあります。

ユーザーのタスクに焦点を当てたベンチマーク — LMArena (旧称Chatbot Arena)、 LiveBench, SWE-bench Verified — 結果を恣意的に操作しにくい補完的な評価手段となります。SWE-benchは、実際のコードでエージェント型モデルを評価する際の代表的な基準であり続けています: DeepSeek V3.2 et Qwen3-Coder-Next 80B-A3B はそこで40%を超えるスコアを記録していますが、これらの数値は更新されたリーダーボードで確認する必要があります。 BFCL v3 は、エージェント型の導入に役立つ、構造化されたツール呼び出しの評価という観点を加えます。

ベンチマークを最初から最後まで再現する:標準手順

2026年のAIMEスコアを防御するためには、例えば、 DeepSeek R1 Distill Llama 70B :

  1. 重みを取得する HuggingFace(# HuggingFace : deepseek-ai/DeepSeek-R1-Distill-Llama-70B) その後、GGUF Q4_K_M に変換 llama.cpp/convert_hf_to_gguf.py CPU/Appleをターゲットにした場合、またはvLLMでsafetensorsを維持するようにする
  2. ハイパーパラメータを設定する : 温度 0.6、top-p 0.95、max_tokens 32768(モデルは長時間推論を行う必要があります)、再現性を確保するためのseedが記録されています。
  3. AIME 2026のデータセットを読み込む 更新済みのHuggingFaceデータセットから。データセットの公開者が誤ってプロンプトに解答を含めていないか確認すること。最近のフォークでよく見られる不備です。
  4. 問題ごとに64件の補完を生成する をcons@64用に生成し、厳密なpass@1用には温度0で1件の出力を生成する。
  5. 最終回答を抽出する ラベルの内側にregexで検索 \boxed{} または末尾の1〜3桁の数字列。モデルが複数のタグを出力する場合に対応する <thinking> 組み込まれたもの。
  6. 公式解答と比較する AIME(0〜999の整数)、スクリプトとシードを公開する。

2×H100で70Bモデルを使い、AIME 2026の15問をcons@64で処理する場合、約6〜10時間を見込んでください。ガイド /guide/reproduire-benchmark-aime 応答抽出の罠について詳しく説明し、タグの管理についても述べます <thinking> 論理的推論モデルおよび出力分数の標準化に適しています。

数値付きケーススタディ:具体的な3つのシナリオ

シナリオA — 大学研究室で4×A100 80GBを用いて数学的推論を評価する場合。 目標:再現可能なAIME 2024/2025/2026の成績曲線を作成すること。適した選択肢: DeepSeek R1 Distill Llama 70B Q8_0(140 GB、2つのGPU)で、~と比較して Llama 3.3 70B は残りの2基のGPUで推論モードを使わずに実行し、思考の連鎖(chain-of-thought)そのものの効果を測定します。45問(AIME 2024 + 2025 + 2026)に対するcons@64の一通りの評価に必要な計算資源は、約30 GPU時間です。参照: /compare/deepseek-r1-distill-llama-70b-vs-llama33-70b.

シナリオB — 1台のH100 80GBを備えたスタートアップが、コードアシスタントをベンチマークする場合。 三つの候補を比較します: Qwen3-Coder-Next 80B-A3B, gpt-oss 120B et Mistral Small 4 119B. プロトコル: HumanEval+ pass@1、MBPP+ pass@1、2024年10月以降の問題に絞り込んだLiveCodeBench、SWE-bench Verified Lite(50件のissue)。Qwen3-Coder-Next(アクティブ3B)のMoEの処理速度により、同程度のVRAMを持つDenseモデルと比較して、通常1時間あたり3倍の候補を生成でき、これにより激しい量子化の有用性が低下します。

シナリオC — データチームがMac Studio M3 Ultra 192GBを使用する場合。 メモリ帯域 800 GB/s は依然として制限要因です。 Llama 3.3 70B Q5_K_Mはメモリに余裕を持って収まり、6〜10トークン/秒の生成速度を実現します。 Qwen 3 235B-A22B はQ4で142 GBを使用してぎりぎり収まり、生成速度は4〜6トークン/秒ですが、品質はより高くなります。 gpt-oss 120B Q4では70GBを消費し、長コンテキスト用のKVキャッシュに余裕を残す。詳細は /guide/llm-mac-studio-m3-ultra.

シナリオD — ファインチューニング済みの2つのチェックポイント間で性能低下をベンチマークする。 典型的な産業用途例:10kの業界用例に基づくLoRAファインチューニングを実施する Llama 3.3 70B。リスクは、汎用的な能力が壊滅的に低下することです。最低限の評価手順:ファインチューニングの前後に、同じシードでMMLU(5-shot)、IFEval、GSM8K、HumanEval+を実行します。4つの評価スイートのうち2つで2ポイントを超える低下があれば、過学習の兆候です。参照: /guide/fine-tuning-sans-regression.

商業利用に関する正確なライセンスおよび条件

Le ローカルLLMベンチマーク は、想定するデプロイがライセンスで禁止されている場合、役に立ちません。2026年のオープンウェイトのエコシステムでは、次の4つの系統が中心となっています:

詳細なライセンスごとの比較については、 /guide/licences-llm-open-source.

ターゲットとなるベンチマークプロファイルに応じてモデルを選択

FAQ

Q:MMLUとMMLU-Proの違いは?

MMLUは各問題に4つの選択肢を備えており、オープンウェイトの最上位モデルでも約88〜90%で頭打ちになるため、識別力が低いです。MMLU-Proは選択肢を10個に増やし、曖昧な問題を排除するとともに、多段階の推論を要求する項目を追加しています。スコアは通常15〜25ポイント低下し、識別力が回復します。DeepSeek V3.2やQwen 3 235B-A22Bのような最新のモデルを比較する場合は、従来のMMLUよりもMMLU-Proの方がより適切です。

Q:HumanEvalスコアをローカルで再現するにはどうすればよいですか?

インストール evalplus, モデルを vLLM または llama.cpp で読み込み、評価指標に応じて問題ごとに 1 回から 200 回まで補完を生成し、その後 Python テストを実行します。70B モデルの 164 問に対する pass@1 では GPU 1 日分を要し、pass@100 の場合はさらに多くの時間がかかります。温度 0 でのスコアと複数サンプルの平均スコアは異なります。相互比較を可能にするため、ハイパーパラメータを常に文書化し、スクリプトを公開してください。

Q:信頼性の高いベンチマークを行うために、Q4、Q5、またはQ8のどれを優先すべきですか?

Q4_K_M は、FP16 と比較して MMLU で通常 1 から 3 ポイント失われます。AIME では、長文推論が累積エラーに敏感なため、さらに大きな低下が見られることもあります。Q5_K_M と Q6_K は、この差を 1 ポイント未満に縮小します。Q8_0 は、ほとんどのベンチマークで FP16 とほぼ区別がつかないレベルです。誠実なベンチマークを行うためには、常に使用した量子化方式を明記してください。ガイド /guide/quantization-q4-q5-q8 では、形式ごとに測定されたスコアの低下を詳しく説明しています。

Q:AIME 2024 のスコアは汚染されているのでしょうか?

AIME 2024の問題文は2024年2月にオンラインで公開され、その後まもなくクローラーによってインデックス化されました。そのため、学習データのカットオフが2024年半ばより後のモデルは、解答を見ている可能性があります。このため、最近の評価では、モデルが問題や解答に触れていないことを条件に、AIME 2025とAIME 2026が優先されています。モデル提供元がモデルカードで公表している事前学習データのカットオフ日を必ず確認し、LiveBenchとも照合して確かめてください。

Q:24GBのVRAMを持つデバイス向けにどのモデルが適していますか?

24 GBでは、Q4で最低40 GBを必要とする70B以上のモデルは動かせません。実用的な選択肢は、Q4の30B~40Bモデル、またはIQ2_XXSのような極端な量子化を施した70Bモデルですが、後者は品質の大幅な低下(MMLUで5~10ポイント低下)を伴います。許容できる品質を保つには、14B~32Bモデルを選ぶこと。構成ツールを参照: /configurateur で、VRAM容量による絞り込みができます。

Q:HuggingFaceとベンダーの報告書でスコアが異なるのはなぜですか?

エディタがプロンプトを最適化し、特定のデコード方式(cons@64、多数決)を用い、場合によっては複数のシードでの実行結果から最適なものを選択します。独立したレーダーボードなどでは HuggingFace Open LLM Leaderboard 統一されたプロトコル(ゼロショット、または条件を固定したフューショット、標準化されたプロンプト)を義務付けています。2つの情報源の間では、3〜10ポイントの差が想定されます。本番環境で重要なのは、最高の数値ではなく、再現可能なプロトコルです。

結論

Un ローカルLLMベンチマーク ライセンス、量子化、および誤解を招くデコードプロトコルに関する文脈が一切含まれていません。信頼性の高い方法は、MMLU-Pro、HumanEval+、AIME 2025/2026、およびSWE-bench Verified型のエージェントベンチマークを最低限組み合わせ、ターゲットのVRAMとライセンスを確認した上で実施することです。ここでは意図的に範囲を制限しています。このページで重要なのは、公開された数字を再現できること、その誤差範囲を理解できること、そして自社のハードウェア上でその値が成立することです。GPU予算と使用用途に応じてインデックスされたモデルをフィルタリングするには、 quelllm.frのモデル選定ツール または、以下を閲覧する 全モデルのカタログ.

記事の公開および更新日 著者: Mohamed Meguedmi · データソース: /api/models.json · コンテンツのライセンス: CC BY 4.0.

報告したい誤りや更新情報はありますか? 参加する.