QuelLLMで測定

3 つのモデル、1 台のマシン、証拠

2026年9月12日にRTX 5070 Ti Laptopで行った試験:実測値12,227 MiB、Ollama使用、コンテキスト4096、リクエストは一度に1件。デスクトップ版、RTX 5090、Macへの外挿は行っていません。

以前の複数マシンの比較表は、検証に必要な成果物がないため撤去されました。本ページで公開するのは、このパイロットでの測定結果のみです。各モデルについて、ウォームアップの後に5回繰り返し測定しています。

モデル量子化tok/sの中央値Min–maxコード FRフランス語ドキュメント
qwen3:8bQ4_K_M59.7159.45–59.96成功事実と形式の両方で合格
hermes3:8bQ4_071.9771.79–72.15失敗事実の成功、鍵が異なる
mistral-nemo:12bQ4_047.4447.37–47.56成功事実と形式の両方で合格

このテストから言えること

Hermes3はこのテストでは生成が速いものの、その関数は重複を正しく削除できず、値を並べ替えてしまいます。Qwen3とMistral Nemoはこの課題に成功しています。したがって、生成速度だけでは品質を証明できません。コードの課題1件と合成データを使った抽出課題1件だけでは、あらゆる用途についてモデルの順位を決めるには不十分です。また、Hermes3の出力は256トークンの上限にも達しています。

データの再現と検証

生データでは、プロンプト処理と生成が分けられています。プレフィックスキャッシュは前者に影響する可能性がありますが、表示されるスループットは生成のみを対象としています。これはエネルギーの測定値でも、アプリケーション全体のレイテンシでもありません。

3つのデータの種類

「QuelLLMによる測定」は、実験の成果物と結び付いた実験を指します。「外部測定」には、測定者と測定手順を明記する必要があります。「推定」は、特に構成ツールの経験則に基づく速度やメモリ所要量の見積もりを指します。これらの値は、今回の新しいテストから得られたものではありません。

方法論 · 自分のマシンに合わせて選ぶ · ローカルAIを無料でインストール