DeepSeek R1 のインストール Ollama
DeepSeek R1は、DeepSeekがMITライセンスで公開した、思考連鎖(Chain-of-Thought)を用いる推論モデルです。完全版は6,710億パラメータを持ち、個人用マシンで扱える範囲を超えていますが、蒸留版(1.5B〜70B)は一般消費者向けのハードウェアに無理なく収まります。このチュートリアルでは、OllamaでDeepSeek R1をインストールし、適切なサイズを選び、推論モードを活用する方法を説明します。
#なぜ DeepSeek R1 なのか
R1は「通常の」LLMではありません。回答する前に、<think>...</think>タグで囲まれた、目に見える推論の流れを生成します。この段階があることで、直接回答を生成するモデルがしばしば解けない数学・論理・コードの問題を解決できます。AIME 2024とMATH-500では、14Bと32Bの蒸留モデルが、モデル規模ではその2〜5倍もあるLlama 3.1 70B Instructを大きく上回ります。
もう一つの利点は、商用利用や利用地域に制限のないMITライセンスです。誰にも許可を求めずに、R1を製品、エージェント、社内ツールに組み込めます。この水準の推論モデルでは珍しいことです。
#利用可能な蒸留版
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
Ollama は、deepseek-r1 という同じ名前で 7 つのサイズを提供しています。デフォルトのタグは 7B の蒸留版(Qwen 7B base)を指しています。
- deepseek-r1:1.5b
- Qwen 2.5 Math 1.5Bがベースです。軽量で、GPUのないノートパソコンで試すのに最適です。複雑な問題では回答の質に限界があります。
- deepseek-r1:7b
- Qwen 2.5 Math 7B ベース。デフォルトのタグ。VRAM 8 GB の環境でバランスのよい選択です。最初に試すモデルとして最適です。
- deepseek-r1:8b
- Llama 3.1 8Bがベースです。7B版よりやや饒舌で、フランス語の性能も優れています。
- deepseek-r1:14b
- ベースは Qwen 2.5 14B。数学の性能が大きく向上しています。VRAM 12 GB の環境で使うには、バランスのよい選択です。
- deepseek-r1:32b
- ベースはQwen 2.5 32B。ほとんどの推論ベンチマークでo1-miniと同等の性能。Q4ではVRAM 24 GBが必要です。
- deepseek-r1:70b
- Llama 3.3 70Bベース。蒸留モデルの中で最も高性能。RTX 5090 32 GBまたはMac Studio 64 GB以上。
- deepseek-r1:671b
- 完全モデル (MoE 671B、37B がアクティブ)。個人用マシンでは対応できませんが、Mac Studio Ultra 512 GB では可能となります。
#動作要件とモデルサイズ別のVRAM容量
OllamaでDeepSeek R1をインストールする前に、Ollamaがインストール済みであること(デーモンはデフォルトで http://localhost:11434 で待ち受けます)と、GPUに目的のモデルサイズに十分なメモリがあることを確認してください。以下は、OllamaがデフォルトでダウンロードするQ4_K_M量子化で必要なVRAM容量です。
- 1.5B Q4
- VRAMは約1.1GB。どのGPUでも、CPUのみでも動作します(15〜25トークン/秒)。
- 7B Q4
- ~4.7 GBのVRAM。RTX 3050 8GB、4060 8GB、Mac M1/M2 16GB。
- 8B Q4
- VRAMは約5.2GB。想定する用途は7Bモデルと同じですが、6GBでは余裕がより少なくなります。
- 14B Q4
- ~9GBのVRAM。RTX 3060 12GB、4070 12GB、M2 Pro 16GB
- 32B Q4
- ~19 GB VRAM。RTX 3090/4090 24 GB、M3 Max 36 GB。
- 70B Q4
- VRAMは約40 GB。オフロードを併用するRTX 5090 32 GB、またはMac Studio Ultra 64 GB以上。
#1. モデルをインストール
コマンドは1つで十分です。Ollamaは自身の公式レジストリから重みをダウンロードし、初回使用時にモデルをメモリに読み込みます。
特定のサイズを指定するには、タグを追加してください:
最初の起動ではモデルがダウンロードされます(1.5Bモデルは1GB、70Bモデルは40GB)。以降の起動は、モデルがOllamaのキャッシュに残っている限り、即時実行されます。
#2. サイズの選定
サイズ選択は 3 つの変数に依存します:VRAM、タスクの種類、および待ち時間の許容度。R1 は最終回答の前に平均して 500 から 2,000 トークンの推論を生成します。これは、直接生成を行う従来のチャットモデルの 3 から 10 倍のトークン数です。速度は本当に重要です。
- 高性能GPUなしでR1をテスト
- 1.5Bまたは7B。CPUだけでも、チャットで実用になる応答時間です。
- 高校レベルの数学/簡単なPython
- 7Bまたは8B。80%の場合は十分ですが、高度な代数では期待に応えられません。
- 高度な数学、論理、長い推論
- 最低でも14Bが必要です。AIMEとMATH-500では、8Bから14Bになると性能が大きく向上します。
- o1-miniレベル、複雑なデバッグ、デモンストレーション
- 32Bは、VRAMが24GBある場合の最適なターゲットです。
- ローカルで実行できる最大規模
- 70B Q4は、オフロードを使うRTX 5090、または64 GB以上のMac Studioで実行できます。
#3. 最初の推論用プロンプト
R1は、複数の段階を踏む必要がある問題で力を発揮します。14Bモデルでも取り組めるAIMEの定番問題で試してみましょう:
構造に注目してください。<think>と</think>の間にある内容はすべて、モデルの思考の連鎖です。エンドユーザーに表示したり、非表示にしたり、デバッグ用にログに記録したりできます。これは、アプリの説明可能性を高める優れた手段です。
#4. Q4とQ8:量子化の選択
デフォルトでは、OllamaはQ4_K_Mをダウンロードします(品質とメモリ使用量のバランスがよい推奨設定)。推論モデルでは、Q8_0に上げることを好むユーザーもいます。思考の連鎖では、通常のチャットよりも品質の低下が目立つためです。
- Q4_K_M
- 標準的なバランス重視の選択肢です。数学のベンチマークでは、FP16と比べて品質が2~4%低下します。まずはこちらを選ぶのがおすすめです。
- Q5_K_M
- Q4比で品質が+1%、メモリ使用量が+25%。VRAMに余裕はあるものの、さらに大きなモデルには移行できない場合に有用です。
- Q8_0
- ほぼFP16相当の品質(-0.5%)。Q4と比較してメモリが2倍になります。14Bまたは32Bで最高品質を求め、十分なVRAMがある場合に推奨されます。
- FP16
- フル精度の基準。蒸留モデルではQ8と比べて実用上の利点がなく、Q4の4倍の容量を使います。
#DeepSeek R1とQwen 3.8 27Bの比較
Qwenチームが2026年8月14日にリリースしたQwen 3.8 27Bは、2026年を代表するオープンウェイトの汎用モデルです。262kトークンのコンテキスト、画像認識機能、Apache 2.0ライセンス、そして何より、内蔵の推論モードを備えています。推論も、それ以外のあらゆるタスクもこなせる一つのモデルを求めるなら、R1に代わる自然な選択肢です。どちらを選ぶべきでしょうか?
- DeepSeek R1 32B
- 純粋な推論に特化しています。数学ベンチマーク(AIME、MATH-500)では、より優れています。推論は常に表示され、<think>...</think>を使って簡単にパースできます。それだけに特化していますが、非常に高い能力を発揮します。
- Qwen 3.8 27B
- 推論機能を内蔵した2026年の汎用モデルです。コンテキスト長は262k、視覚機能あり、Apache 2.0ライセンス、Q4で約18 GB。デフォルトでは考えすぎる傾向があり、簡単な質問でも不要な長い思考過程を展開します。直接的な回答を得るには、推論レベルをlowに設定してください。
- 実用的な結論
- R1 32Bは、純粋な数学・論理の課題と、安定してログに記録できる推論形式という点で、依然として優位です。必要に応じて推論できる汎用モデル(コード、チャット、ビジョン、長いコンテキスト)が欲しい場合は、Qwen 3.8 27Bが優れています。フランス語については、どちらも堅実です。
- リソース
- 必要なリソースは同程度です。R1 32BはQ4なら24 GB(RTX 3090/4090)に収まります。Qwen 3.8 27Bはやや軽量(Q4で約18 GB)で、同じカードでもコンテキストに使えるメモリの余裕が増えます。
#トラブルシューティング
- <think>を表示しないモデル
- XMLタグが隠されている可能性のあるクライアントを使用しているかもしれません。ollama run en CLIを使って、モデルがタグを正しく生成するか確認してください。API JSONがタグを切断する場合は、クライアント側の問題です。
- 切り詰められた応答
- Ollamaのデフォルトコンテキストは4096トークンです。R1は推論に多くのトークンを消費します。コンテキストを増やすには、セッション内で/set parameter num_ctx 16384を実行するか、APIのoptions.num_ctxパラメータを使用してください。
- 良いGPUを備えているにもかかわらず非常に遅い
- ollama psで、モデルが100% GPU上で動作していることを確認してください。PROCESSOR列にCPUが表示されている場合、モデルがGPUメモリに収まらず、一部がシステムRAMにオフロードされています。モデルを一段小さいサイズにするか、さらに低ビットの量子化に切り替えてください。
- モデルが思考のループに陥る
- これは、小型の蒸留モデル(1.5B、7B)に難しすぎる問題を解かせたときによく見られる現象です。より大きなモデルを使うか、もっと簡単な問題を出すか、プロンプトに「推論を500トークン未満に収めて回答してください」と追加してください。
- 「insufficient memory」エラー
- モデルが大きすぎて、お使いのVRAMに収まりません。ollama rm deepseek-r1:32bを実行してから、ollama pull deepseek-r1:14bを実行してください。OLLAMA_GPU_LAYERSを使って、部分的なオフロードを強制することもできます。
#さらに詳しく
インストール後に取り組むとよいことをいくつか紹介します:
- 量子化を理解する
- 当サイトの Q4/Q5/Q8 ガイドでは、具体的なトレードオフを詳しく解説しています。より大きなモデルに移行する前に役立ちます。
- R1向けGPUの選定
- 32B版の利用を本格的に考えているなら、GPU購入ガイドで、2026年に目安とすべき24 GB/32 GBの基準を確認できます。
- R1をインターフェースに接続する
- Open WebUIやLM Studioは<think>タグに標準対応しており、推論内容を折りたたんだり展開したりできます。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。