ローカルでNemotron 3:モデル NVIDIA と Ollama
NVIDIAはGPUを製造するだけではありません。自社のLLM群であるNemotronファミリーの事後学習も行っています。このガイドでは、Ollamaを使ってNemotron 3をローカルにインストールする方法、VRAMに応じて選ぶべきバリエーション(Nano、Super)、NVIDIAが他社とは異なる形で最適化している点——制御可能な推論とエージェントとしての利用——、そして同等のQwen3モデルと比べてこれらのモデルを選ぶ価値があるのはどのような場合かを説明します。
#他のモデルではなくNemotronを選ぶ理由
Nemotronはゼロから学習したモデルではありません。NVIDIAは、バージョンに応じてLlamaやQwenなどの実績あるオープンウェイトモデルをベースに、独自の事後学習手法を適用します。サイズを小さくするためのプルーニング(pruning)、失われた品質を取り戻すための蒸留、そして推論、数学、コード、ツール呼び出しに重点を置いた大規模なファインチューニングです。目指すのは、汎用的な会話ではなく、エージェントのタスクで品質と計算コストの比率を最適にするという明確な目標です。
もう一つの特徴は、NVIDIAがこれらのモデルを自社のハードウェアと推論パイプライン向けに最適化している点です。その結果、NVIDIA GPUで良好な処理速度が得られ、モデル群も統一されたラインアップとして設計されています。一般向けのグラフィックカード用の小型版、ワークステーション用の中型版、サーバー用の巨大版があり、プロンプトの組み立て方を変えずに、利用可能なVRAMに応じて選べます。
#Nano、Super、Ultra:どのバリエーションが適しているか
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
Nemotron 3 シリーズは3つのサイズで展開され、それぞれが特定の機器カテゴリを対象としています。名称は正確なパラメータ数よりも、ターゲットを示しています。
- Nano(約8~9B)
- 一般消費者向けGPU用のバージョンです。Q4なら、RTX 3060 12 GBや、VRAMが8 GB以上の任意のGPUに余裕を持って収まります。Nemotronを試したり、軽量なエージェントに使ったりするのに最適な入門モデルです。
- Super(約49B)
- ワークステーションと大型GPU向けのバージョンです。NVIDIAのプルーニングにより、より少ない計算コストで70Bモデル並みの品質を目指します。RTX 4090 24GB(Q4でも余裕は少なめ)が必要で、できれば32〜48GBのカードが望ましいです。
- Ultra (~253B)
- 一般向けのマシンでは扱えないサーバー版です。マルチGPUワークステーションまたはデータセンター向けです。ここではラインアップ全体の中での位置づけを示すために紹介しており、一般的なローカル利用を想定したものではありません。
ローカルのマシンで使うなら、実際の選択肢はNanoとSuperです。8〜16 GBのGPUカードを使っている場合や速度を優先する場合はNanoを選びます。24 GB以上のGPUカードがあり、高度な推論や難度の高いコーディングで最高の品質を求める場合はSuperを選びます。
#前提条件および各バリエーションのVRAM
どのローカルモデルでも同様ですが、VRAM が制約になります。以下は、品質とメモリ使用量のバランスが最も優れているため標準で推奨される Q4_K_M 量子化での目安です。コンテキストウィンドウは重みに加えてメモリを消費するので、その分の余裕を必ず見込んでください。
- Nemotron Nano (~9B) — Q4
- VRAMは約6〜7 GB。RTX 3060 12 GB、RTX 4070 12 GB、または16 GB以上のユニファイドメモリを搭載したApple Silicon Macで快適に動作します。
- Nemotron Super(~49B)— Q4
- 約28〜30 GB。オフロードなしでは、単一の RTX 4090 24 GB では収まりません。32 GB以上のGPU、2つのGPU、または48 GBの統合メモリを搭載したMac M4 Pro/Maxを想定してください。
- Nemotron Super — Q5/Q8
- Q5_K_Mでは約35 GBまで増え、Q8_0では50 GBを超えます。大容量VRAMまたはマルチGPU構成向けです。
- コンテキスト用のメモリ余裕容量
- 目標とするコンテキスト長に応じて、1〜4GBを追加してください。長いコンテキストで推論すると中間トークンが多く生成されるため、メモリ使用量が増えます。
ソフトウェアの前提条件は最小限で、Ollamaデーモンがインストールされていれば十分です。デフォルトではhttp://localhost:11434で接続を待ち受けます。NVIDIA GPUを使う場合は、CUDAドライバーが最新であることを確認してください。OllamaはGPUを自動検出します。Open WebUIやLM Studioのようなインターフェースを追加すると便利ですが、必須ではありません。
#NemotronをOllama経由でインストールします
インストールはOllamaの標準的なフローに完全に従います。デーモンが既に実行されている場合、単一のコマンドでモデルをダウンロードし、起動します。
- 01Ollama が実行されていることを確認ターミナルを開き、「ollama --version」を実行してください。コマンドが応答する場合、デーモンが準備完了です。応答しない場合は、まずOllamaをインストールしてください(記事の末尾にあるインストールガイドを参照)。
- 02Nano版をダウンロードするVRAMに関するリスクを避けて試すには、まずNanoから始めてください。このコマンドはモデルの重みをダウンロードし、そのままターミナル内でチャットセッションを開始します。
- 03GPUに十分な余裕があればSuperに切り替える使い方に慣れ、十分なVRAMがある場合は、推論とコードの品質を高めるためにSuper版をダウンロードしてください。
- 04モデルを一覧表示して管理する「ollama list」は、インストール済みのモデルとディスク上のサイズを表示します。「ollama rm <modèle>」は、使わなくなったバリアントを削除してディスクの空き容量を増やします。
自分で作成したスクリプトから Nemotron を呼び出す場合も、Ollama の REST API を同じポートで利用できます。「model」フィールドには、取得したモデルのタグを正確に指定します。
#制御可能な推論モード
Nemotron モデルの特徴は、オンデマンドでオン/オフ切り替え可能な推論機能です。NVIDIA は、これらのモデルを、システムプロンプトを通じて要求された場合に詳細な思考連鎖を生成し、そうでない場合は直接回答するように訓練しました。具体的には、単なるシステム指示で2つのモードを切り替えます。「detailed thinking on」で段階的な推論を強制し、「detailed thinking off」で簡潔で迅速な回答を得ます。
このスイッチが役立つのは、推論にはコストがかかるためです。思考の連鎖は大量の中間トークンを生成します。数学や論理の問題、微妙な不具合のデバッグには有用ですが、メールの言い換えには無駄になります。Nemotronでは、この追加コストをかけるかどうかをプロンプトごとに決められます。
この仕組みにより、Nemotronの動作はDeepSeek R1やQwen3の「thinking」モードに近くなりますが、制御はより明示的です。推論はモデル全体に適用されるモードではなく、会話の進行に合わせて調整できる設定です。
#コード、エージェント、ツール呼び出し
NVIDIAはNemotronを、主に推論とAIエージェントという2つの用途に向けて最適化しています。コードの生成、説明、修正では、Super版は優秀な32B〜70Bモデルに引けを取りません。Nanoも単発の支援には十分使えますが、長いタスクや大規模なリファクタリングでは限界が見えてきます。これは、この規模のモデルでは想定どおりです。
真の差別化要因は function calling です。Nemotron は、信頼性が高く、形式が整ったツール呼び出しを生成するように訓練されており、ローカルエージェントの構築に適した候補となります。これは、関数の呼び出しを判断し、結果を読み取り、次の処理へとつなげるモデルです。推論モードと組み合わせることで、行動前に計画を立てられるエージェントが実現し、安易に行動するのではなく、計画的に動けるようになります。
- 推論 / 数学
- 明確な強みで、特にSuperで「detailed thinking on」を有効にした場合に際立ちます。思考の連鎖により、計算や論理の誤りが減ります。
- コード
- Superは生成とデバッグで70Bモデルに匹敵し、Nanoは軽い支援や自動補完に適しています。
- エージェントとツール
- ツール呼び出しの信頼性が高く、JSON形式も守られます。ローカルでの自動化は、このモデルファミリーが特に力を発揮する用途の一つです。
- フランス語 / 一般会話
- まずまずの性能ですが、この分野で最高というわけではありません。Nemotron は推論や行動に適しており、多言語での雑談はそれほど得意ではありません。
#Qwen3との比較:どのような場合にNemotronを選ぶべきか
Qwen3は、比較の基準となるオープンウェイトモデルです。両モデルファミリーは、推論、コード、複数のモデルサイズ、思考モードという同じ領域で競合しているためです。多くの汎用タスクとフランス語の品質では、同じサイズならQwen3が依然として優位です。より汎用性が高く、多言語に関する学習もより充実しています。
Nemotronは、AIエージェントの活用やNVIDIAエコシステムへの統合に比重を置く場合に、再び優位になります。ツール呼び出しの多いエージェントを構築する場合、プロンプトごとに推論を明示的に制御したい場合、または推論スループットが重要なNVIDIA GPU群を運用する場合は、Nemotronを試す価値があります。一方、フランス語の汎用会話アシスタントには、Qwen3を標準の選択肢とする方が無難です。
- Nemotron を選ぶべき場合
- ツール呼び出しを多用するエージェント、推論のオン・オフをきめ細かく切り替える必要がある場合、インフラが100% NVIDIAの場合、または純粋な推論で計算量に対する品質の比率を最大化したい場合。
- Qwen3を選ぶ条件
- 汎用アシスタントとして使いたい場合、フランス語と多言語対応を優先する場合、幅広い会話に対応させたい場合、あるいは単に幅広い用途で最も実績のあるモデルを求める場合。
- 実用的な結論
- 同程度のサイズで両者(NanoとQwen3-8B、SuperとQwen3-32B)を、ご自身が実際に使うプロンプトでテストしてください。性能差を大きく左右するのはタスクであり、抽象的なランキングではありません。
#トラブルシューティング
- pull時の「model not found」
- この名前でのタグは存在しません。ollama.com/library で正確なスペルを確認してください — Nemotronの名前は世代ごとに変化します。
- Superで速度が大幅に低下する
- VRAMが不足しているため、モデルの一部がシステムRAMに移っています。「ollama ps」にはGPUとCPUへの処理の分配が表示されます。Nanoに切り替えるか、量子化のビット数を下げてQ4にするか、GPUを追加してください。
- 推論機能が有効にならない
- システムプロンプトは適用されません。インタラクティブなセッションでは「/set system detailed thinking on」を実行してください。APIでは、systemフィールドに指示を入力し、ユーザーのプロンプトに記述しないでください。
- 回答が冗長すぎる
- 推論モードはデフォルトで有効または継承されます。簡単なタスクでは「detailed thinking off」に切り替えてください。
- 「Connection refused」
- Ollamaのデーモンが起動していません。「ollama ps」で確認し、サービスがhttp://localhost:11434で待ち受けていることも確認してください。
#さらに詳しく
Nemotronは、当サイトですでに解説している構成要素を基盤としています。以下のガイドは、このガイドの内容をさらに掘り下げるものです。
- Qwen 3 のローカル実行:詳細なテストと実測ベンチマーク
- Nemotronを主要なオープンウェイトの代替モデルと比較して位置づけるために欠かせない比較記事です。トークン/秒の数値も掲載しています。
- 量子化の選択(Q4、Q5、Q8、FP16)
- Nemotron Superにおける品質とVRAMのバランスを調整する上で、各量子化レベルはカード上のメモリ使用量に直接影響を与えます。
- LinuxへのOllamaインストール
- デーモンがまだ導入されていない場合に必要となる準備です。インストールスクリプト、systemd サービス、NVIDIA GPU の設定を扱います。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。