初心者 9 分Edge

SmolLM3:Hugging Faceのこの小型モデルの実力はどれほどか ?

端的な回答

SmolLM3は、Hugging Faceの30億パラメータのモデルです。フランス語を含む多言語に対応し、学習済みのコンテキスト長は64,000トークンで、128,000トークンまで拡張できます。また、システムプロンプトに/thinkを指定すると、推論モードを有効にできます。インストール前に押さえておきたい重要な点として、Ollamaには公式のlibrary/smollm3モデルページはありません。利用できるのはコミュニティのタグ、またはHugging Faceでホストされている公式GGUFのみで、後者は完全なアドレスを指定して取得する必要があります。

SmolLM3はHugging Faceが公開した小型言語モデルで、控えめな性能のハードウェアでも動作し、長いコンテキストと任意で有効にできる推論モードを備えるよう設計されています。本ガイドでは、モデルが実際に提供する機能を確認し、入手元を間違えずにインストールする方法を示すとともに、3Bパラメータのモデルに合理的に期待できることを整理します。

著者 Mohamed Meguedmi·更新 2026-09-28·Windows・macOS・Linuxでテスト済み

#SmolLM3 を一文で説明

SmolLM3は、Hugging Faceが公開した30億パラメータの言語モデルです。汎用的な用途には能力が限られる10億パラメータのモデルと、より多くのメモリを必要とする70〜80億パラメータのモデルの中間に位置します。この規模のモデルの魅力は、300億パラメータ以上のモデルと競うことではありません。専用GPUのないノートパソコンやミニPCなど、控えめな構成のマシンに収まり、要約、短文の作成、簡単な事実に関する質問に使えることです。

#モデルが実際に提供する内容

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

Hugging Face によると、SmolLM3 は3段階の戦略に基づき、11.2兆トークンで学習されています。学習時のコンテキスト長は段階的に拡張され、まず4,000トークンから32,000トークンへ、次に32,000トークンから64,000トークンへと増やされています。それを超える長さについては、YARN と呼ばれる外挿技術により、128,000トークンまで対応できます。これは実際に学習したコンテキスト長の2倍です。この長さ全体で一定の品質を保証するものではなく、対応可能な最大コンテキスト長として捉えるべきです。

SmolLM3:公式モデルカードで確認されている内容
特徴値
パラメータ30億
学習時のコンテキスト64,000トークン
拡張コンテキスト (YARN)128 000 トークン
トレーニングトークン11,2 T
ネイティブで対応している言語6(フランス語を含む)

#3Bモデルがメモリ使用量を抑えながら長いコンテキストを扱える理由

Hugging Face は、この長いコンテキストを比較的性能の低いハードウェアで実用的にするためのアーキテクチャ上の選択を詳細に説明しています。SmolLM3 は、従来のマルチヘッドアテンションを、わずか 4 グループのGrouped-Query Attentionに置き換えています。これにより、生成されるトークンごとにメモリに保持する必要がある KV キャッシュのサイズが直接削減されます。これは、コンテキストが長くなると RAM や VRAM を逼迫させる主な要因です。このモデルは、NoPE(No Positional Encoding)と呼ばれる技術も適用しています。これは、通常の位置エンコーディングである RoPE を、4 層に 1 層の割合で取り除くことで、短いコンテキストでの性能を損なうことなく、長いコンテキストでの耐性を高めるための文書化された妥協点です。

品質に具体的な影響を与える学習上の工夫がもう一つあります。アテンションに文書内マスキングを使っている点です。つまり、異なる二つの文書を同じ学習シーケンスに連結しても、それぞれの文書のトークンは互いに影響しません。利用者にとっては、複数の情報源を同じコンテキストに組み込んだときに、小型モデルが無関係な情報を「混ぜてしまう」リスクを抑える効果があります。この問題は、大型モデルよりも小型モデルで目立ちやすいものです。

→
推奨されるサンプリング設定
Hugging Face は、標準モードでの応答に temperature=0.6 と top_p=0.95 を推奨しています。これらはあらゆる用途に適した値ではありません。創造性と一貫性のバランスを左右する値であり、用途に応じて調整する際の出発点となります(例えば、より事実に即した回答を求める場合は温度を下げます)。

#ネイティブ対応のフランス語

多くの小規模モデルが最初に英語向けに設計され、その後適応されているのとは異なり、SmolLM3は、英語、スペイン語、ドイツ語、イタリア語、ポルトガル語と並んで、フランス語をネイティブサポートする六つの言語の一つとして発表しています。Hugging Faceはまた、モデルがアラビア語、中国語、ロシア語のデータに接触したことも明記していますが、六つの主要言語よりも量は少ないとされています。これらのセカンダリ言語では注意して使用してください。公式の仕様書は同等の品質を主張していません。

i
驚きのグラデーション
小型の多言語モデルだからといって、フランス語が得意とは限りません。重要なのは、列挙された言語の数ではなく、実際の学習データにおける言語ごとの割合です。このモデルでは、フランス語は主要な学習基盤の一部であり、ごくわずかに追加されたものではありません。

#インストール:タグに注意してください

まず避けたい落とし穴があります。執筆時点では、Ollamaの公開カタログに「library/smollm3」の公式ページはありません。ollama.comでこの名前を使っているタグは、個人の名前空間でコミュニティが再公開したもので、元のリポジトリに準拠している保証はありません。信頼できる方法は、ggml-orgがHugging Faceで公開している公式GGUFを利用することです。Ollamaとllama.cppは、その完全なアドレスを指定して直接読み込めます。

  1. 01
    情報の元を確認
    モデルとトークナイザーが正しい仕様に適合していることを確実にするため、未検証のコミュニティタグではなく、Hugging Face上の公式リポジトリ ggml-org/SmolLM3-3B-GGUF を使う。
  2. 02
    Ollama で起動する
    ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M を実行する。このコマンドでHugging FaceからQ4_K_M量子化版をダウンロードし、そのまま起動する。
  3. 03
    またはllama.cppで起動
    ローカルサーバーにはllama-server -hf ggml-org/SmolLM3-3B-GGUF:Q4_K_Mを、コマンドラインでのセッションにはllama-cliを使用する。
  4. 04
    量子化を選択する
    大半のマシンにはQ4_K_M(1.92 GB)、十分なメモリがあり、品質の低下を抑えたい場合にはQ8_0(3.28 GB)を選びます。F16(6.16 GB)は比較の基準として使う場合に限ります。
Ollama を介して SmolLM3 を起動(Hugging Face オフィシャルリポジトリ)
ollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_M

コミュニティタグ alibayram/smollm3 もOllamaの公開カタログに直接登録されており(ollama pull alibayram/smollm3)、Hugging Faceの完全なアドレスを使わずに利用できます。ただし、保守しているのは個人の貢献者であり、Hugging FaceでもOllamaチームでもありません。バージョンについて疑問がある場合や予期しない動作が見られる場合は、モデル自体のバグだと結論づける前に、ggml-orgの公式GGUFを比較の基準としてください。

#推論モードを有効にする

SmolLM3は、直接モードと、回答する前に一連の思考を生成する推論モードの2つで動作します。推論モードは、モデルに送信するシステムプロンプトに/thinkを追加すると有効になり、/no_thinkを追加すると無効になります。この設定は起動オプションではなく、システムメッセージで行います。そのため、システムプロンプトをカスタマイズできるインターフェースであれば、どれでもこのモードを有効にできます。

→
llama.cppを使用する場合
llama.cppで拡張推論モードを利用するには、公式ドキュメントでは起動時に--jinjaオプションを追加することが推奨されています。このオプションにより、このモードに必要なチャットテンプレートが正しく処理されるようになります。

推論モードには直接的なコストが伴います。各回答では、最終的なテキストを出力する前に、長さの異なる内部思考の段階が入るため、生成されるトークン数が増え、応答時間も長くなります。単純な事実確認の質問なら、直接モード(/no_think)で十分であり、応答もはるかに速くなります。

#サイズの異なるモデルと比べたSmolLM3の位置づけ

パラメータ数が3Bのモデルは、小型モデル市場で中間的な位置にあります。1Bより高性能ですが、対応できるのは単純なタスクに限られることが多く、表現もかなり硬直的です。一方、8GB以上のRAMを搭載したマシンで汎用用途の基準となっている7〜8Bモデルほどの汎用性はありません。考えるべきなのは、単に「SmolLM3は優れているのか?」ではなく、「自分のマシンと用途を考えると、7〜8Bを使い続けるよりも3Bに下げる理由があるのか?」ということです。

公表されているコンテキスト長(64,000トークンで学習済み、外挿で最大128,000トークン)は、8,000または32,000トークンに制限されることが多い競合の小型モデルとの差別化要因です。具体的には、例えば要約のために、より長い文書を事前に分割せず一度に入力できます。ただし、このコンテキスト長の利点で純粋な推論能力の不足を補うことはできません。複数の論理的な段階を順にたどる必要がある質問では、コンテキストが長いかどうかにかかわらず、一般により大きなモデルのほうが信頼できます。

i
情報ゲイン
Hugging Faceが文書化した段階的なコンテキストの拡張(4k、次に32k、さらに64k)は、長文コンテキストの学習が、単一のパスではなく、専用のトークン量(コンテキスト拡張だけでも1000億トークン)を用いた段階的なプロセスであることを示しています。これは、宣言された上限を下回っていても、処理されるテキストの実際の長さに応じて品質が変動する理由を理解するために有用な情報です。

性能面では、Hugging Faceは、SmolLM3が知識、推論、数学、コードを対象とする12の公開ベンチマークでLlama-3.2-3BとQwen2.5-3Bを上回り、より大きな4Bモデルにも引けを取らないと発表しています。これはモデルの開発元が公表した数値であり、独立した測定結果ではありません。同規模のモデルの中でSmolLM3がトップクラスに位置することを示していますが、用途がこれらの一般的なベンチマークの範囲を外れる場合、ご自身のプロンプトでのテストに代わるものではありません。

学習の進行段階別の学習データ配分(出典:Hugging Face)
ステップ累計トークン数Webコード数学
ステージ10 à 8 T85 %12 %3 %
ステージ28 à 10 T75 %15 %10 %
ステージ310 à 11,1 T63 %24 %13 %

学習の終盤にコードと数学の比率を高めたこと(コードは12%から24%へ、数学は3%から13%へ)が、この規模のモデルでも簡単なプログラミングや計算タスクをこなせる理由の一部を説明しています。一方、一般的なウェブテキストだけで学習した小型モデルは、こうしたタスクでより頻繁に失敗します。

#3Bが本当に役立つ用途

短いテキストの要約
数ページのドキュメントに効果的で、訓練済みコンテキストは最大64,000トークンまでサポートしています。
短い草案の作成
メール、メッセージ、言い換え:コンパクトなモデルの典型的な用途で、高度な創作を目指すものではありません。
単純な事実確認質問
一般的な事実については正しく答えますが、専門性の高い質問では、より大きなモデルよりも誤答のリスクが高くなります。
組み込みシステムへの統合
モデルのサイズが小さく、軽量な量子化版(Q4_K_M で 1.92 GB)もあるため、複雑な推論を要するタスクよりも、メモリ容量が限られたマシンでの利用に向いています。

#3Bモデルが行えないこと

Raspberry Piのような一般向けハードウェアでのSmolLM3の性能測定値を公開している公式情報源はありません。そのような性能をうたう主張は、導入計画の前提にする前に、自分で検証する必要があります。同様に、YARNによってコンテキストを128,000トークンまで拡張できることは技術的な能力であり、それほど長いドキュメントでも回答の品質が一定に保たれる証拠ではありません。重要な用途で頼りにする前に、自分のユースケースでテストする必要があります。

!
反論:「最初から7Bモデルを使えばよいのでは?」
お使いのマシンに8GB以上のRAMがある場合、Q4の7〜8Bモデルのほうが、通常は幅広い用途でより良い結果を得られます。SmolLM3が適しているのは、メモリやストレージに実際に制約がある場合、または3Bモデルで長いコンテキストを扱えることが、用途上の決め手となる場合です。
よくある質問
SmolLM3 は Ollama で直接利用可能ですか?+
執筆時点では、公式のlibrary/smollm3ページ経由では利用できません。確実なコマンドは引き続きollama run hf.co/ggml-org/SmolLM3-3B-GGUF:Q4_K_Mで、Hugging Faceから公式GGUFを選択した量子化方式でダウンロードします。コミュニティのタグalibayram/smollm3も存在し、動作しますが、保守しているのは個人の貢献者だけで、Hugging FaceやOllamaチームではありません。
SmolLM3はフランス語をよく話せますか?+
Hugging Faceのモデルカードによると、フランス語は、英語、スペイン語、ドイツ語、イタリア語、ポルトガル語と並ぶ、標準で対応している6言語の一つです。わずかに追加された程度ではなく、専用の学習データが基盤となっています。これは、主に英語を重視した小型モデルと比べたときの、このモデルの強みの一つです。
SmolLM3の推論モードを有効にする方法は?+
モデルに送るシステムプロンプトに /think を追加することで有効にできます(無効にして、より高速な直接回答モードのまま使うには /no_think を追加します)。llama.cpp では、起動時に --jinja オプションを追加して、このモードに必要なチャットテンプレートが正しく適用されるようにしてください。そうしないと、思考フェーズが正常に終了しないままになる可能性があります。
SmolLM3にどの量子化を適用すべきですか?+
Q4_K_M(1.92 GB)はほとんどのマシンに適しており、品質とメモリ使用量のバランスがよいため、引き続きデフォルトの選択肢として推奨されます。メモリに余裕があれば、Q8_0(3.28 GB)で品質の低下を抑えられます。F16(6.16 GB)は主にテスト時の比較基準として使うもので、3Bモデルの通常利用では役立つ場面はまれです。
SmolLM3では、どのようなサンプリング設定を使うべきですか?+
Hugging Faceは、標準モードでの出発点としてtemperature=0.6とtop_p=0.95を推奨しています。回答の一貫性と多様性のバランスを取る値です。ただし、あらゆる用途に適した設定ではありません。値を下げると、技術的な用途で、より事実に即した再現性の高い回答を得やすくなります。少し上げると、創作的な文章を書く際に、より多様な言い換えが得られやすくなります。
SmolLM3はQwen2.5-3BまたはLlama-3.2-3Bよりも優れているでしょうか?+
Hugging Faceは、SmolLM3が知識、推論、数学、コードに関する12の公開ベンチマークでこれら2つのモデルを上回り、4Bモデルと比べても競争力を保っていると発表しています。これはモデルの提供元が公開した結果です。実際の用途がこれらの汎用ベンチマークと異なる場合は、ご自身のプロンプトで確認してください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。