中級 10 分OpenAI

gpt-oss ローカル版:OpenAIのオープンウェイトモデルで、 Ollama

OpenAIがついにモデルの重みを公開しました。gpt-oss-20bとgpt-oss-120bは、Apache 2.0ライセンスの下で公開された二つのMoE(Mixture of Experts)モデルです。このガイドでは、Ollamaでgpt-ossを動かす方法、各バージョンに必要なVRAM容量、ネイティブなMXFP4量子化の仕組み、推論にかける労力の調整方法を説明します。最後に、これらのオープンウェイトモデルがQwenやDeepSeekと比べて実際にどの程度の実力を持つのかを検証します。

著者 Clara M.·更新 2026-07-24·Windows・macOS・Linuxでテスト済み

#なぜgpt-ossが状況を変えるのか

OpenAIは長年、自社モデルを非公開にしてきました。gpt-ossは、GPT-2以来、同社が実際にダウンロードできる重みの提供を再開した初のモデルです。今回はApache 2.0ライセンスで提供され、商用利用が認められ、共有を強制する条項もユーザー数の制限もありません。重みをダウンロードすれば、自分のマシンで実行でき、ネットワークの外に何も出ません。

技術的には、gpt-ossはMoE(Mixture of Experts)アーキテクチャを採用しています。モデル全体には多くのパラメータがありますが、各トークンで有効になるのはごく一部だけです。その結果、はるかに小さいモデルと同程度のメモリ使用量と速度で、大規模なデンスモデルに近い品質を実現します。2つのバージョンはいずれも推論、ツール呼び出し、指示への追従を重視しており、コンテキスト長は128kトークンです。

gpt-oss-20b
総パラメータ数は約210億、トークンあたりのアクティブパラメータ数は約36億。16 GBの一般向けグラフィックカード1枚で動作することを想定して設計されています。
gpt-oss-120b
総パラメータ数は約1,170億、トークンごとのアクティブパラメータ数は約51億。80 GBのデータセンター向けカード、または大容量のユニファイドメモリを搭載したマシンを想定しています。
ライセンス
Apache 2.0 — 商用利用可、再配布可能、使用制限なしでファインチューニング可能です。
量子化
エキスパートの重みにMXFP4ネイティブ対応:4ビットフォーマットは公表されたものであり、第三者による近似変換は行われません。

#gpt-oss ollama:20bと120b、どちらを選ぶ?

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

選択は、ほぼご使用のハードウェアだけで決まります。両モデルは同じファミリーに属し、回答の書式も同じです。品質には差がありますが、「自分のVRAMに収まるか」という問題に比べれば、その差は二次的です。以下が簡単な目安です。

20b — 適切なデフォルト
MXFP4でロードした状態では約14〜16GBのメモリを消費します。RTX 4080 16GBまたはRTX 4090で動作可能です。また、24GB以上の統合メモリを備えたMac Apple Siliconでも動作します。これは最初にインストールすべきバージョンです。
120b — 十分なメモリがある場合
MXFP4で約60〜65GBです。80GBのGPU(H100/A100クラス)、マルチGPU搭載マシン、または大容量のユニファイドメモリを搭載したMac(M3/M5 Ultra 96GB以上)を想定しています。モデルに使えるメモリが64GB未満なら、試しても意味がありません。
相対的な品質
120bは、多段階の推論、長文コード、曖昧なタスクにおいて優位性を広げます。一般的な質問応答やフランス語においては、20bもすでに非常に良好な性能を発揮しています。
i
MoE:有効になるパラメータは少なくても、全パラメータ分のメモリが必要
MoEアーキテクチャが減らすのはトークンあたりの計算量であり、メモリ使用量ではありません。各ステップで動作するのが1つのグループだけでも、すべてのエキスパートをVRAMに読み込む必要があります。そのため、120bは約50億のパラメータしか有効にしないにもかかわらず、約65 GBを必要とします。

#前提条件

特別なものは必要ありません。最新版のOllamaをインストールし、使いたいバージョンに十分なメモリを用意するだけです。Ollamaが、ダウンロード、MXFP4量子化、GPU/CPUへのオフロードを自動で管理します。

最近のバージョンのOllama
gpt-oss と MXFP4 に対応したバージョン。始める前に更新してください。古すぎるバージョンはこの形式を認識できません。
VRAM/ユニファイドメモリ
20bには16 GB以上、120bには64 GB以上が必要です。それ未満では、Ollamaがモデルの一部をCPU側のRAMに読み込むため、速度が大幅に低下します。
ディスク容量
20bは約12〜14GB、120bは約60〜65GBです。重みはOllamaのモデルフォルダに保存されます。
待ち受け中のデーモン
Ollamaはデフォルトでhttp://localhost:11434にAPIを公開しており、Open WebUIや自分のコードを接続するのに便利です。
→
まだ Ollama をインストールしていませんか?
まず、ご利用の OS(Windows、macOS、Linux)向けの Ollama インストールガイドに沿ってインストールを行い、その後ここに戻ってください。このガイドの以降の内容はすべて、ターミナルで ollama コマンドが応答することを前提としています。

#1つのコマンドで gpt-oss-20b をインストール

20b バージョンは 1 行でインストールして起動できます。Ollama は MXFP4 ウェイトをダウンロードし、GPU にロードして、チャットセッションを開きます。

ターミナル
# Télécharge et lance gpt-oss-20b
ollama run gpt-oss:20b

初回起動時には、約13GB のダウンロードにかかる時間を見込んでください。その後、モデルはキャッシュに保持されます。対話型セッションを開かずに重みだけを取得するには、pull を使用してください。

ターミナル
# Récupérer sans lancer le chat
ollama pull gpt-oss:20b

# Vérifier que le modèle est présent
ollama list

# Voir s'il tourne bien sur le GPU
ollama ps

ollama psでは、GPUの割合が高いことを確認してください。列に「100% CPU」と表示されている場合は、モデルがVRAMに収まらず、システムRAMにあふれているため、生成が遅くなります。RTX 4090なら、対話用途で快適な生成速度が期待できます。4080 16 GBでは20bは収まりますが、大きなコンテキストを使う余裕はありません。

チャットではなくAPIでモデルを操作したい場合、エンドポイントはすでに用意されています。以下は最小限の呼び出し例です。

API — 生成
curl http://localhost:11434/api/generate -d '{
  "model": "gpt-oss:20b",
  "prompt": "Explique la quantification MXFP4 en trois phrases.",
  "stream": false
}'

#120bモデルは、どのマシンで使用できるか

コマンドは同じで、変わるのはタグだけです。ただし、必要なメモリが実際にある場合にのみ実行してください。64 GB未満では、Ollamaが一部のエキスパートをCPU側にオフロードし、生成速度はよくても毎秒数トークンにとどまります。

ターミナル
# ~60-65 Go de mémoire nécessaires
ollama pull gpt-oss:120b
ollama run gpt-oss:120b
  1. 01
    使用可能なメモリを確認
    NVIDIA GPUを使う場合、nvidia-smiで80GBのカードが1枚、または合計で十分なVRAM容量を持つ複数のカードが表示される必要があります。Macでは、96GB以上のユニファイドメモリがあれば、モデルとシステムのための余裕を確保できます。
  2. 02
    pull を実行
    ダウンロード容量は大きい(約60GB)ため、通信速度とディスクの空き容量を考慮して準備してください。MXFP4形式なので、自分で再量子化する必要はありません。
  3. 03
    配置を確認
    ollama runの実行後、別のターミナルでollama psを実行すると、GPUに割り当てられた割合を確認できます。CPUへの大量のオフロードはメモリ不足を意味します。20bに戻してください。
  4. 04
    コンテキストを調整
    120bは128kトークンをサポートしますが、フルコンテキストを使用すると追加のメモリ消費が大きくなります。VRAMが限られている場合はnum_ctxを減らしてください。
!
一般向けGPUの複数枚構成:過度な期待は禁物
2枚のRTX 4090(48 GB)を組み合わせても120bには不十分であり、PCIe経由のGPU間共有はレイテンシを追加します。このモデルでは、単一の80 GBカードまたは大容量の統合メモリの方が、マルチカードの自作構成よりもはるかにスムーズです。

#推論にかける労力を調整する

gpt-ossの特徴は、モデルが回答前に推論の過程を生成し、そこにかける推論の度合いを調整できることです。low、medium、highの3段階で、速度と推論の深さのバランスを選べます。低く設定すると簡単なタスクに素早く回答し、高く設定すると数学、コード、多段階の論理問題についてより長く考えます。

設定はシステムメッセージで行います。希望するレベルを指定すると、モデルが内部での思考の長さを調整します。

API — 推論の effort を高く設定
curl http://localhost:11434/api/chat -d '{
  "model": "gpt-oss:20b",
  "messages": [
    { "role": "system", "content": "Reasoning: high" },
    { "role": "user", "content": "Résous : un train part à 14h à 120 km/h, un autre à 15h à 150 km/h. Quand se rejoignent-ils ?" }
  ],
  "stream": false
}'
Reasoning: low
応答が速く、表に出る思考過程は少なめです。言い換え、短い要約、事実に関する質問に最適です。
Reasoning: medium
デフォルトとしてバランスのよい選択肢です。ある程度の推論を行いつつ、応答の遅延を大幅に増やさずに済みます。
Reasoning: high
深い思考が可能で、難解な問題に優れますが、生成時間が長くなり、消費されるトークン数も増加します。
→
推論にはトークンを消費します
推論の労力を「high」に設定すると、最終回答の前に使う思考トークン数が大幅に増えます。簡単なタスクでは、「low」または「medium」のままにすることで、体感上の品質を落とさずに応答時間を大幅に短縮できます。

#Qwen および DeepSeek との比較における強みと弱み

gpt-oss が登場した分野には、すでに非常に優れたオープンウェイトモデルが存在します。ここでは、gpt-oss がどの点で優れ、どの点で他のモデルに後れを取っているのかを、甘い評価をせずに紹介します。

長所
推論とツール呼び出しの完成度が高く、推論にかける労力を調整可能。明快なApache 2.0ライセンスを採用し、MoE + MXFP4によってメモリ使用量も抑えられています。20bは、16 GBのグラフィックスカード1枚で、VRAM使用量に対して非常に高い品質を実現します。
Qwen3 との比較
多言語対応やフランス語ではQwenが優位に立つことが多く、モデルのサイズも4Bから大規模なMoEまで幅広く揃っています。gpt-ossは、推論過程の質と指示に的確に従う能力でその差を補っています。
DeepSeekとの比較
DeepSeek の推論モデル(R1 と V3.2)は、非常に難しい問題ではさらに高い能力を発揮しますが、大規模なバージョンにははるかに多くのハードウェアリソースが必要です。gpt-oss の20bは手軽なローカル利用を目指しているのに対し、DeepSeek V3.2はハイエンドを目指しています。
知っておきたい弱点
gpt-ossではフランス語は優先されていません。フランス語での品質は良好ですが、英語よりやや劣り、場合によってはQwenにも劣ります。判断する前に、ご自身のプロンプトでテストしてください。

#トラブルシューティング

「unknown model」または認識できないフォーマット
お使いのOllamaはバージョンが古すぎてMXFP4に対応していません。新しいバージョンに更新してから、pullを再実行してください。
20bモデルでは生成が非常に遅い
ollama ps montre du CPU au lieu du GPU : le modèle a débordé. Fermez les autres applis gourmandes en VRAM, réduisez num_ctx, ou vérifiez que le GPU est bien détecté.
120bがクラッシュする、または動作が極端に遅い
メモリが不足しています。モデルに実際に使えるメモリが64GB未満なら、20bを使い続けてください。120bはお使いのマシンには適していません。
普段使いには応答が遅すぎる
システムメッセージで推論の強度をlowまたはmediumに下げてください。highは大量の思考トークンを消費します。
VRAMを超過するコンテキスト
128kトークンは多くのメモリを消費します。日常的な用途では、num_ctxを妥当な値(例:8192)に設定してください。

#さらに詳しく

gpt-ossの導入後は、当サイトの以下のガイドが、ローカル環境の構成をさらに調整し、モデルを比較するのに役立ちます:

量子化の選択(Q4、Q5、Q8、FP16)
MXFP4が従来のGGUF形式と比べてどのような位置づけにあるかを理解し、ほかのモデルで品質とメモリ使用量のバランスを判断するために。
ローカルAI向けGPUの選び方
16GBで20bを動かしたい場合も、より多くのリソースを必要とするモデルを使いたい場合も、必要な性能やメモリ容量のカードを選ぶための2026年版購入ガイドです。
Ollama で DeepSeek R1 をインストール
推論能力を直接比較するには、R1をインストールし、gpt-ossと比較して評価してください。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。