LLMの7B、30B、70B:これらのサイズは何を意味するのか ?
Hugging Face や Ollama では、各モデルに 1B、7B、32B、70B という数値が付与されています。この数値はパラメータの億単位を示し、モデルの機能、必要な VRAM、および処理速度を決定します。しかし、最近の 7B LLM は 2 年前の 70B を上回ることもあり、「大きい」ことは必ずしも「あなたにとって最良」を意味しません。本ガイドでは、パラメータの定義、各規模が実際にもたらす利点、そしてマーケティングに惑わされずにサイズ、量子化、ハードウェアのバランスをどのように取るかを解説します。
#パラメータとは、実際には何を指すのか
パラメータは一つの数値です。それ以上のものではありません。学習中に学習される数値で、多くの場合16ビットで表現されます。「7B」モデルには70億個のパラメータが含まれています。これらの数値は、ニューラルネットワーク内の人工ニューロン間の接続の重みであり、モデルが「知っている」すべて、つまり文法、事実、言い回し、概念同士の関連を符号化しています。
最も適切な比喩はシナプスです。パラメータとは、脳内の2つのニューロン間の結合の強さのようなものです。結合が多いほど、ネットワークはより多くのニュアンスや微細なパターンを記憶できます。10億パラメータのモデルには約10億個のこうした調整があり、70Bモデルにはその70倍あります。個々のパラメータは微小で単純ですが、その数と配置によって言語が生成されます。
実際にはこれらのパラメータは容量を占めます。16ビット(FP16)では、各パラメータが2バイトを消費します。したがって、7Bモデルはフル精度で約14GBを占めます。これはディスク上およびメモリ上でのサイズであり、モデルがマシンに収まるかどうかを決定します。ここでは、これらの重みを圧縮する量子化について後ほど詳しく説明します。
#1Bから70Bまで、実際の能力はどう変わるか
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 30日間返金対応
能力はモデルのサイズに比例して伸びるわけではなく、段階的に向上します。パラメータ数がある一定のしきい値を超えると、新しい能力が突然現れます。これが「創発的能力」と呼ばれるものです。以下では、最近のモデルで実際に観察されることを紹介します。
- 1B – 3B
- テキスト補完、簡単な言い換え、分類、キーワード抽出。モバイルやエッジ環境で役立ちますが、推論能力は頼りなく、タスクが複雑になるとハルシネーションが頻発します。
- 7B – 8B
- 実用性がはっきりと現れる最初の段階です。一貫した会話、信頼できる要約、簡単なコードの作成、適切な指示への対応が可能です。本格的にローカル LLM を使うための出発点となります。
- 13B – 14B
- 長いタスクでも安定して対応でき、事実に関する誤りが少なく、生成するコードもより堅牢です。7Bより一段きめ細かく対応でき、VRAMの消費量も極端には増えません。
- 30B – 34B
- より信頼性の高い多段階の推論、ニュアンスのある回答、質のよいコードと翻訳。高い品質が求められるローカル利用で、品質とコストのバランスが最もよい選択肢です。
- 70B
- 一般ユーザー向けではトップクラスです。多くのタスクでクラウドモデルに近い推論能力を備え、詳細できめ細かな回答を生成します。高性能な構成、またはオフロードが必要です。
覚えておくべき点は、サイズを倍にするたびに実際の向上はあるものの、効果は逓減することです。1Bから7Bへの飛躍は劇的ですが、30Bから70Bへの向上は実在するものの、はるかに微妙であり、タスクが必要とする場合にのみ意味があります。
#1BのLLMにはできず、7BのLLMにはできること
これは最も明確な比較です。見た目では僅かなサイズの差に見えるものの、実際には大きなギャップがあります。1Bモデルは繰り返しパターンを生成します。7Bモデルはすでに論理的思考を始めます。この両者の間の移行により、すぐに実際の使用で感じられる具体的な能力が解放されます。
- 複数の要素を含む指示に従う
- 1Bモデルは、依頼の後半を忘れてしまうことがよくあります。7Bモデルなら、「このテキストを3つのポイントに要約し、その後、それらを英語に翻訳してください」といった指示に従えます。
- 連鎖的な推論
- 2ステップまたは3ステップの論理問題や数学問題は、1Bモデルの能力を超えています。7Bモデルは、多くの場合、正しく分解します。
- 長文における一貫性
- 1Bモデルは数段落で話の筋を見失います。7Bモデルは回答全体を通して、文脈、トーン、固有名詞を維持します。
- 正しく動作するコード
- 特化した7Bモデルは正しい関数を書き、簡単なバグを修正できます。一方、1Bモデルが生成するのは、主にコードに「見える」だけのものです。
- ハルシネーションが少ない
- 7Bモデルでもハルシネーションはなくなりませんが、事実を捏造することが明らかに減り、わからないと答えられることが増えます。
#サイズとVRAM:重要な表
実務的な問題は「どのモデルが最良か」ではなく、「どのモデルが自分のカードに収まるか」です。必要なVRAMはパラメータ数に直接比例します。以下は、デフォルトで推奨される量子化形式Q4_K_Mの目安です。この形式はFP16と比較してサイズを約4分の1に縮小します。
- 3B ≈ 2 GB
- どこでも動作し、エントリークラスのグラフィックスカードやCPUのみでも使えます。モバイル環境や簡単なタスクに最適です。
- 7B ≈ 5 GB
- RTX 3060 12 GBまたはRTX 4070 12 GBで快適に動作します。性能と手の届きやすさのバランスが最も優れています。
- 14B ≈ 9 GB
- 12GBのVRAMで妥当なコンテキストを処理可能で、16GBでは快適に動作します。
- 32B ≈ 19 GB
- RTX 4090 24 GBを目安にするか、16 GBのカードで一部をRAMへオフロードしてください。
- 70B ≈ 40 GB
- 一般消費者向けの単一GPUでは対応困難:デュアルGPU構成、RAM/SSDオフロード、または十分な統一メモリを搭載した Apple シリコン採用の Mac(M4 Pro 48 GB)。
#サイズと量子化:本質的な選択
限られたVRAMに対して、2つの選択肢があります。より小さいモデルを選ぶか、より大きくても圧縮率の高いモデルを選ぶかです。量子化は、パラメータの精度を16ビットから4ビットまたは8ビットに下げ、モデルをより少ないメモリに収めることを可能にしますが、品質のわずかな低下を伴います。
実際の利用で裏付けられた経験則として、VRAM容量が同じなら、より低いビット数に量子化した大きなモデルは、フル精度の小さなモデルをほぼ常に上回ります。Q4の13BモデルはQ8の7Bモデルと同じメモリ容量に収まり、一般により高い能力を発揮します。精度を表す最後の数ビットよりも、パラメータ数のほうが大きく影響します。
- Q4_K_M
- 推奨されるデフォルト設定。品質の低下は最小限で、メモリは約 4 倍に分割されます。ほぼすべての用途においてデフォルトとして選ばれます。
- Q5_K_M
- VRAMを少し多く使う代わりに、品質が一段上がります。メモリに余裕があれば、バランスのよい選択です。
- Q8_0
- FP16 とほぼ区別がつきません。小さいモデル、または VRAM 容量が非常に大きいグラフィックカード向けです。
- FP16
- フル精度。Q8 の2倍のサイズ。主にファインチューニングに有用で、推論にはほとんど必要ありません。
#なぜ新しい小型モデルが古い大型モデルを上回るのか
初心者を最も戸惑わせるのがこの点です。2026年の7B LLMは、2023年の70Bを上回る可能性があります。サイズは品質の要因の一つに過ぎず、必ずしも最も決定的な要因ではありません。他の三つの要素が大幅に向上しました。
- データの品質
- 最近のモデルは、より適切にフィルタリングされ、重複が除去され、高品質な合成データが追加されたコーパスで訓練されています。同じサイズでも、はるかに多くを学習します。
- トレーニングデータの規模
- 現在の7Bモデルは、従来の大型モデルよりもはるかに多い、数十兆ものトークンを使って学習しています。十分に学習した小さなネットワークは、学習が不十分な大きなネットワークを上回ります。
- アーキテクチャとポストトレーニング
- より優れたアーキテクチャ、RLHFによるアラインメント、推論に特化した学習。これらはいずれも、パラメータ数とは関係のない性能向上につながります。
蒸留も重要な役割を果たします。非常に大きなモデルの知識を小さなモデルに移すことで、小さなモデルは元のモデルよりはるかに小さいサイズで、その能力の一部を受け継ぎます。こうして、蒸留された7Bや8Bのモデルが、はるかに大きなモデルのように推論できるようになります。実用上のポイントは、パラメータ数だけを見るのではなく、必ずリリース日と最近のベンチマークを確認することです。
#実用上のサイズの選び方
適切なサイズとは、お使いのハードウェアに収まり、用途も満たすサイズです。まず、最近のモデルの中から、Q4でVRAMに収まる最も大きなモデルを選び、実際に必要な速度や精度に応じて調整してください。
- 01VRAMを確認してくださいGPUのメモリ容量(Macの場合はユニファイドメモリ容量)を確認してください。この容量が厳格な上限となり、大きすぎるモデルを最初から候補から除外できます。
- 02Q4でメモリに収まる最近のモデルのうち、最大のものを選びましょう12GBなら最近の14Bモデル、24GBなら32Bモデル、8GBなら性能の良い7B/8Bモデルを選んでください。常に、古い大規模モデルよりも最近リリースされたモデルを優先してください。
- 03使用に応じて調整してください普段のチャットや速度を重視する場合は、7B~14B にとどめてください。推論、難度の高いコーディング、精度の高い翻訳には、メモリ容量が十分なら 30B 以上のモデルを選んでください。
- 04速度を確認してくださいトークン/秒で表される生成速度に不満がある場合は、モデルのサイズを一段階下げてください。対話用途では、高速な7Bモデルのほうが、動作の遅い32Bモデルより使いやすいことがよくあります。
#5分で2つのサイズを比較する
違いを実感する最善の方法は、自分のマシンでサイズの異なる2つのモデルを並べて実行することです。Ollamaがインストールされ、デフォルトのポート(http://localhost:11434)で待ち受けていれば、2つのコマンドで十分です。
両方に同じ推論問題(例えば、複数の段階を含む簡単な論理問題)を出し、回答の質と、--verboseで表示される処理速度を比較してください。お使いのハードウェアで、能力と速度のトレードオフが実際にどこにあるかが分かります。
#さらに詳しく
モデルのサイズは、ローカル実行に関するほかの基本概念と結び付けると、より理解しやすくなります。以下のガイドでは、このガイドの内容をさらに掘り下げています。
- 量子化の選択(Q4、Q5、Q8、FP16)
- メモリをめぐる選択のもう一つの側面:モデルの品質を損なわずに圧縮する方法を、図解ガイドで解説します。
- MoE の解説:なぜ 30B-A3B は小型モデルのように動作するのか
- モデルのサイズと速度が直結しないことを示す、2つの数値を使った表記法についてのガイドです。このガイドの次に読んでください。
- 蒸留:小型モデルが大型モデルから能力を受け継ぐ仕組み
- 比較的新しい小型モデルが古い大型モデルを上回ることがある理由を、深く理解するために。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。