測定方法

数字による評価 検証可能な

このサイトでは、構成ツールの推定値、カタログの評価、実測ベンチマークなどの数値を掲載しています。ここでは、それらの出典と計算方法を具体的に説明します。

パイロット測定とその限界を見る · 再現可能なプロトコル · 公開されているエンジン

3つの原則

  1. 01

    推定値と実測値を区別します

    構成ツールは、計算式に基づく推定トークン/秒を示します。ベンチマークページは、実測したトークン/秒を表示します。両者を混同しないよう、異なるラベルを付けています。

  2. 02

    誤差範囲を表示しています

    すべての推定値について、校正済みの誤差区間を用意できているわけではありません。実測したパイロットテストでは、5回の繰り返し測定の中央値、最小値、最大値を公開しています。

  3. 03

    日付をすべて記録します

    各ガイド、各モデルページには最終確認日が記載されています。6か月前にはOllamaについて正しかったことが、今では当てはまらないこともよくあります。

使用する計算式

公開されている互換性判定エンジンのルールです。メモリと速度の目安を評価するもので、品質のランキングを示すものではありません。

01
重みのメモリ予算
予算 ≥ カタログに記載された量子化方式の閾値

Q4/Q5/Q8/FP16のしきい値は、カタログに基づく概算です。エンジンは指定されたコンテキストのKVキャッシュを計算に含めないため、余裕を確保すること。

02
GPUの推定速度
tok/s = GPUのクラスに応じた、そのモデルのlow、mid、highのいずれかの値

経験則に基づく推定です。お使いのマシンで測定したものではありません。Appleの構成プロファイルでは、利用可能なユニファイドメモリ容量を用います。

03
CPUへのフォールバック
≤3B : mid × 0.3 ; ≤8B : low × 0.4 ; それ以外は max(1, low × 0.15)

トークン/秒単位で丸めます。この分岐は、GPUが搭載されていても、そのメモリにモデルの重みが格納されていない場合にも使用されます。

これらは データ

すべての情報に出典があります。根拠なく作り上げた情報はありません。情報が誤っていたり古くなっていたりする場合は、 signalez-la.

Hugging Face
モデルの仕様、サイズ、アーキテクチャ一覧
huggingface.co
Ollama library
利用可能な量子化と重み
ollama.com/library
llama.cpp
PPLベンチマーク、サポートされるアーキテクチャ
github.com/ggerganov/llama.cpp
TechPowerUp
GPU仕様(VRAM、帯域幅)
techpowerup.com/gpu-specs
私たちのテストベンチ
3つのモデル、1台の RTX 5070 Ti Laptop、公開された生データ
ベンチマークを参照してください

既知のバイアス

!
数値を読む前に知っておくべきこと
  • tokens/sの推定値は、マシンの性能を仮定しています アイドル状態, Chrome なしで 40 ページを表示。
  • 2026年9月12日の試験運用はOllama 0.30.6で実施されており、そのオプションとバージョンはアーカイブされています。
  • 設定ツールは Mac の挙動を正確にモデル化していません。Apple Silicon では非常に大きなモデルに対して非線形な挙動が見られます。
  • エンジンは、重みに割り当てたメモリ容量に収まる範囲で、最も高い量子化レベルを選びます。この選択は、長いコンテキストでの読み込みも、用途に合った品質も保証しません。