初心者 8 分Ollama

DeepSeek R1 のインストール Ollama

DeepSeek R1は、DeepSeekがMITライセンスで公開した、思考連鎖(Chain-of-Thought)を用いる推論モデルです。完全版は6,710億パラメータを持ち、個人用マシンで扱える範囲を超えていますが、蒸留版(1.5B〜70B)は一般消費者向けのハードウェアに無理なく収まります。このチュートリアルでは、OllamaでDeepSeek R1をインストールし、適切なサイズを選び、推論モードを活用する方法を説明します。

著者 Mohamed Meguedmi·更新 2026-08-27·Windows・macOS・Linuxでテスト済み

#なぜ DeepSeek R1 なのか

R1は「通常の」LLMではありません。回答する前に、<think>...</think>タグで囲まれた、目に見える推論の流れを生成します。この段階があることで、直接回答を生成するモデルがしばしば解けない数学・論理・コードの問題を解決できます。AIME 2024とMATH-500では、14Bと32Bの蒸留モデルが、モデル規模ではその2〜5倍もあるLlama 3.1 70B Instructを大きく上回ります。

もう一つの利点は、商用利用や利用地域に制限のないMITライセンスです。誰にも許可を求めずに、R1を製品、エージェント、社内ツールに組み込めます。この水準の推論モデルでは珍しいことです。

i
蒸留を簡単に説明すると
完全版R1(671B MoE)は数百万件の推論例を生成し、それらがその後、より小さなモデル(Qwen 7B/14B/32BおよびLlama 8B/70B)のファインチューニングに使われました。したがって、蒸留モデルはR1そのものではなく、R1のように推論することを学んだQwen/Llamaです。

#利用可能な蒸留版

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

Ollama は、deepseek-r1 という同じ名前で 7 つのサイズを提供しています。デフォルトのタグは 7B の蒸留版(Qwen 7B base)を指しています。

deepseek-r1:1.5b
Qwen 2.5 Math 1.5Bがベースです。軽量で、GPUのないノートパソコンで試すのに最適です。複雑な問題では回答の質に限界があります。
deepseek-r1:7b
Qwen 2.5 Math 7B ベース。デフォルトのタグ。VRAM 8 GB の環境でバランスのよい選択です。最初に試すモデルとして最適です。
deepseek-r1:8b
Llama 3.1 8Bがベースです。7B版よりやや饒舌で、フランス語の性能も優れています。
deepseek-r1:14b
ベースは Qwen 2.5 14B。数学の性能が大きく向上しています。VRAM 12 GB の環境で使うには、バランスのよい選択です。
deepseek-r1:32b
ベースはQwen 2.5 32B。ほとんどの推論ベンチマークでo1-miniと同等の性能。Q4ではVRAM 24 GBが必要です。
deepseek-r1:70b
Llama 3.3 70Bベース。蒸留モデルの中で最も高性能。RTX 5090 32 GBまたはMac Studio 64 GB以上。
deepseek-r1:671b
完全モデル (MoE 671B、37B がアクティブ)。個人用マシンでは対応できませんが、Mac Studio Ultra 512 GB では可能となります。

#動作要件とモデルサイズ別のVRAM容量

OllamaでDeepSeek R1をインストールする前に、Ollamaがインストール済みであること(デーモンはデフォルトで http://localhost:11434 で待ち受けます)と、GPUに目的のモデルサイズに十分なメモリがあることを確認してください。以下は、OllamaがデフォルトでダウンロードするQ4_K_M量子化で必要なVRAM容量です。

1.5B Q4
VRAMは約1.1GB。どのGPUでも、CPUのみでも動作します(15〜25トークン/秒)。
7B Q4
~4.7 GBのVRAM。RTX 3050 8GB、4060 8GB、Mac M1/M2 16GB。
8B Q4
VRAMは約5.2GB。想定する用途は7Bモデルと同じですが、6GBでは余裕がより少なくなります。
14B Q4
~9GBのVRAM。RTX 3060 12GB、4070 12GB、M2 Pro 16GB
32B Q4
~19 GB VRAM。RTX 3090/4090 24 GB、M3 Max 36 GB。
70B Q4
VRAMは約40 GB。オフロードを併用するRTX 5090 32 GB、またはMac Studio Ultra 64 GB以上。
→
お使いの VRAM 容量がわかりませんか?
Windowsでは、タスクマネージャーを開き、「パフォーマンス」タブの「GPU」を確認してください。Linuxでは、NVIDIA には nvidia-smi、AMDには rocm-smi を使用します。Macではメモリが統合型のため、LLMで利用可能なVRAMとして、RAM総量の約75%を考慮してください。

#1. モデルをインストール

コマンドは1つで十分です。Ollamaは自身の公式レジストリから重みをダウンロードし、初回使用時にモデルをメモリに読み込みます。

7B モデルをデフォルトでインストール
ollama run deepseek-r1

特定のサイズを指定するには、タグを追加してください:

明示的にサイズを選択する
# Version la plus légère (1.5B)
ollama run deepseek-r1:1.5b

# Sweet spot 12 Go VRAM
ollama run deepseek-r1:14b

# Pour RTX 3090/4090
ollama run deepseek-r1:32b

最初の起動ではモデルがダウンロードされます(1.5Bモデルは1GB、70Bモデルは40GB)。以降の起動は、モデルがOllamaのキャッシュに残っている限り、即時実行されます。

!
:cloudは絶対に使わない
deepseek-r1:cloud がどこかに表示された場合は無視してください。これは Ollama Cloud サーバーにルーティングされるタグであり、使用量に応じて課金されます。完全なセルフホスティングを維持する場合は、1.5b、7b、14b、32b、70b といった番号付きタグのみを使用してください。

#2. サイズの選定

サイズ選択は 3 つの変数に依存します:VRAM、タスクの種類、および待ち時間の許容度。R1 は最終回答の前に平均して 500 から 2,000 トークンの推論を生成します。これは、直接生成を行う従来のチャットモデルの 3 から 10 倍のトークン数です。速度は本当に重要です。

高性能GPUなしでR1をテスト
1.5Bまたは7B。CPUだけでも、チャットで実用になる応答時間です。
高校レベルの数学/簡単なPython
7Bまたは8B。80%の場合は十分ですが、高度な代数では期待に応えられません。
高度な数学、論理、長い推論
最低でも14Bが必要です。AIMEとMATH-500では、8Bから14Bになると性能が大きく向上します。
o1-miniレベル、複雑なデバッグ、デモンストレーション
32Bは、VRAMが24GBある場合の最適なターゲットです。
ローカルで実行できる最大規模
70B Q4は、オフロードを使うRTX 5090、または64 GB以上のMac Studioで実行できます。
→
シンプルなルール
VRAMが12GBある場合は、14Bモデルから始めてください。この規模からR1の魅力が本格的に出てきます。7Bモデルは主に使い方に慣れるためのものです。

#3. 最初の推論用プロンプト

R1は、複数の段階を踏む必要がある問題で力を発揮します。14Bモデルでも取り組めるAIMEの定番問題で試してみましょう:

数学の例
>>> Un train part de Lyon à 8h à 90 km/h vers Paris.
... Un autre part de Paris à 9h à 110 km/h vers Lyon.
... La distance Lyon-Paris est 460 km. À quelle heure se croisent-ils ?

<think>
À 9h, le premier train a parcouru 90 km. Il reste 460 - 90 = 370 km
entre les deux trains. Ils se rapprochent à 90 + 110 = 200 km/h.
Temps avant croisement : 370 / 200 = 1,85 h = 1h51min.
Donc croisement à 9h + 1h51 = 10h51.
</think>

Les deux trains se croisent à 10h51.

構造に注目してください。<think>と</think>の間にある内容はすべて、モデルの思考の連鎖です。エンドユーザーに表示したり、非表示にしたり、デバッグ用にログに記録したりできます。これは、アプリの説明可能性を高める優れた手段です。

i
<think>を削除しないでください
よくやってしまいがちなのが、「思考の連鎖を生成しない」と指示するシステムプロンプトを追加することです。これは得策ではありません。品質が大幅に低下します。推論こそがモデルそのものです。生成時にそのブロックを削除するのではなく、UI側で非表示にしてください。

#4. Q4とQ8:量子化の選択

デフォルトでは、OllamaはQ4_K_Mをダウンロードします(品質とメモリ使用量のバランスがよい推奨設定)。推論モデルでは、Q8_0に上げることを好むユーザーもいます。思考の連鎖では、通常のチャットよりも品質の低下が目立つためです。

Ollamaの量子化タグ
# Q4_K_M (défaut) — recommandé pour 80 % des cas
ollama pull deepseek-r1:14b

# Q8_0 — qualité maximale, mémoire doublée
ollama pull deepseek-r1:14b-q8_0

# Liste complète des tags disponibles
ollama show deepseek-r1:14b --modelfile
Q4_K_M
標準的なバランス重視の選択肢です。数学のベンチマークでは、FP16と比べて品質が2~4%低下します。まずはこちらを選ぶのがおすすめです。
Q5_K_M
Q4比で品質が+1%、メモリ使用量が+25%。VRAMに余裕はあるものの、さらに大きなモデルには移行できない場合に有用です。
Q8_0
ほぼFP16相当の品質(-0.5%)。Q4と比較してメモリが2倍になります。14Bまたは32Bで最高品質を求め、十分なVRAMがある場合に推奨されます。
FP16
フル精度の基準。蒸留モデルではQ8と比べて実用上の利点がなく、Q4の4倍の容量を使います。
→
Q4 14B > Q8 7B
量子化のビット数を上げるか、モデルのサイズを大きくするかで迷ったら、常にモデルのサイズを大きくしてください。14BのQ4モデルは、VRAM使用量がほぼ同じ7BのQ8モデルを、推論性能で常に上回ります。

#DeepSeek R1とQwen 3.8 27Bの比較

Qwenチームが2026年8月14日にリリースしたQwen 3.8 27Bは、2026年を代表するオープンウェイトの汎用モデルです。262kトークンのコンテキスト、画像認識機能、Apache 2.0ライセンス、そして何より、内蔵の推論モードを備えています。推論も、それ以外のあらゆるタスクもこなせる一つのモデルを求めるなら、R1に代わる自然な選択肢です。どちらを選ぶべきでしょうか?

DeepSeek R1 32B
純粋な推論に特化しています。数学ベンチマーク(AIME、MATH-500)では、より優れています。推論は常に表示され、<think>...</think>を使って簡単にパースできます。それだけに特化していますが、非常に高い能力を発揮します。
Qwen 3.8 27B
推論機能を内蔵した2026年の汎用モデルです。コンテキスト長は262k、視覚機能あり、Apache 2.0ライセンス、Q4で約18 GB。デフォルトでは考えすぎる傾向があり、簡単な質問でも不要な長い思考過程を展開します。直接的な回答を得るには、推論レベルをlowに設定してください。
実用的な結論
R1 32Bは、純粋な数学・論理の課題と、安定してログに記録できる推論形式という点で、依然として優位です。必要に応じて推論できる汎用モデル(コード、チャット、ビジョン、長いコンテキスト)が欲しい場合は、Qwen 3.8 27Bが優れています。フランス語については、どちらも堅実です。
リソース
必要なリソースは同程度です。R1 32BはQ4なら24 GB(RTX 3090/4090)に収まります。Qwen 3.8 27Bはやや軽量(Q4で約18 GB)で、同じカードでもコンテキストに使えるメモリの余裕が増えます。
i
両方を試すのに時間はかかりません
ollama pull qwen3.8:27b à côté de deepseek-r1:32b, puis comparez sur vos vrais prompts. Pensez à baisser le niveau de raisonnement de Qwen 3.8 en low si vous le trouvez trop bavard. C'est l'arbitrage le plus fiable — vos cas d'usage valent mieux que n'importe quel benchmark public.

#トラブルシューティング

<think>を表示しないモデル
XMLタグが隠されている可能性のあるクライアントを使用しているかもしれません。ollama run en CLIを使って、モデルがタグを正しく生成するか確認してください。API JSONがタグを切断する場合は、クライアント側の問題です。
切り詰められた応答
Ollamaのデフォルトコンテキストは4096トークンです。R1は推論に多くのトークンを消費します。コンテキストを増やすには、セッション内で/set parameter num_ctx 16384を実行するか、APIのoptions.num_ctxパラメータを使用してください。
良いGPUを備えているにもかかわらず非常に遅い
ollama psで、モデルが100% GPU上で動作していることを確認してください。PROCESSOR列にCPUが表示されている場合、モデルがGPUメモリに収まらず、一部がシステムRAMにオフロードされています。モデルを一段小さいサイズにするか、さらに低ビットの量子化に切り替えてください。
モデルが思考のループに陥る
これは、小型の蒸留モデル(1.5B、7B)に難しすぎる問題を解かせたときによく見られる現象です。より大きなモデルを使うか、もっと簡単な問題を出すか、プロンプトに「推論を500トークン未満に収めて回答してください」と追加してください。
「insufficient memory」エラー
モデルが大きすぎて、お使いのVRAMに収まりません。ollama rm deepseek-r1:32bを実行してから、ollama pull deepseek-r1:14bを実行してください。OLLAMA_GPU_LAYERSを使って、部分的なオフロードを強制することもできます。

#さらに詳しく

インストール後に取り組むとよいことをいくつか紹介します:

量子化を理解する
当サイトの Q4/Q5/Q8 ガイドでは、具体的なトレードオフを詳しく解説しています。より大きなモデルに移行する前に役立ちます。
R1向けGPUの選定
32B版の利用を本格的に考えているなら、GPU購入ガイドで、2026年に目安とすべき24 GB/32 GBの基準を確認できます。
R1をインターフェースに接続する
Open WebUIやLM Studioは<think>タグに標準対応しており、推論内容を折りたたんだり展開したりできます。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。