QuelLLMで測定
3 つのモデル、1 台のマシン、証拠
2026年9月12日にRTX 5070 Ti Laptopで行った試験:実測値12,227 MiB、Ollama使用、コンテキスト4096、リクエストは一度に1件。デスクトップ版、RTX 5090、Macへの外挿は行っていません。
以前の複数マシンの比較表は、検証に必要な成果物がないため撤去されました。本ページで公開するのは、このパイロットでの測定結果のみです。各モデルについて、ウォームアップの後に5回繰り返し測定しています。
| モデル | 量子化 | tok/sの中央値 | Min–max | コード FR | フランス語ドキュメント |
|---|---|---|---|---|---|
| qwen3:8b | Q4_K_M | 59.71 | 59.45–59.96 | 成功 | 事実と形式の両方で合格 |
| hermes3:8b | Q4_0 | 71.97 | 71.79–72.15 | 失敗 | 事実の成功、鍵が異なる |
| mistral-nemo:12b | Q4_0 | 47.44 | 47.37–47.56 | 成功 | 事実と形式の両方で合格 |
このテストから言えること
Hermes3はこのテストでは生成が速いものの、その関数は重複を正しく削除できず、値を並べ替えてしまいます。Qwen3とMistral Nemoはこの課題に成功しています。したがって、生成速度だけでは品質を証明できません。コードの課題1件と合成データを使った抽出課題1件だけでは、あらゆる用途についてモデルの順位を決めるには不十分です。また、Hermes3の出力は256トークンの上限にも達しています。
データの再現と検証
- プロトコル、パラメータ、制限
- 回答全文とGPUへの配置 — 生のJSON
- 全反復測定データ — CSV
- 結果、識別子および量子化
- ハードウェア、バージョン、初期状態
- 再現可能なスクリプト
- 入力と出力を含む一式の資料
生データでは、プロンプト処理と生成が分けられています。プレフィックスキャッシュは前者に影響する可能性がありますが、表示されるスループットは生成のみを対象としています。これはエネルギーの測定値でも、アプリケーション全体のレイテンシでもありません。
3つのデータの種類
「QuelLLMによる測定」は、実験の成果物と結び付いた実験を指します。「外部測定」には、測定者と測定手順を明記する必要があります。「推定」は、特に構成ツールの経験則に基づく速度やメモリ所要量の見積もりを指します。これらの値は、今回の新しいテストから得られたものではありません。