中級 14 分Ollama

Qwen 3.8 27B をローカルで使用:Ollama のインストールと VRAM

Qwen3.8-27Bの重みは2026年8月14日にHugging FaceでApache 2.0ライセンスの下で公開され、Ollamaの公式タグも同日に公開されました。これは3.8世代で初めて、実際に自分のマシンにインストールできるモデルです。デンス型で、マルチモーダル(画像と動画)に対応し、ネイティブのコンテキスト長は262,144トークンです。本ガイドでは、正確なコマンド、タグごとに実際に必要なVRAM容量、デフォルトで有効な「thinking」モードの設定、そして初回の試行のほとんどを台無しにする2つの落とし穴——通知なしのコンテキスト切り詰めと、モデルの一部がシステムRAMにオフロードされること——を解説します。

著者 Mohamed Meguedmi·更新 2026-08-27·Windows・macOS・Linuxでテスト済み

#30秒で結論

Qwen 3.8 27Bは「ollama run qwen3.8:27b」という1つのコマンドでインストールできます。デフォルトのパッケージ(Q4_K_M)は18 GBで、快適に使うには、24 GBのVRAMを搭載したグラフィックカード(RTX 3090、4090、5090)、または32 GB以上のユニファイドメモリを搭載したApple Silicon Macが必要です。それ未満でもモデルは動作しますが、一部のレイヤーの処理がCPUに移り、生成速度が大幅に低下します。

概要
270億パラメータの密なモデルで、画像と動画を扱う視覚言語機能を標準で備え、コンテキスト長は262,144トークンです。Apache 2.0ライセンスのため、制限条項なしで商用利用できます。
現実的な前提条件
Q4_K_Mバージョンは24GBのVRAMまたは32GBの統合メモリが必要です。Q8バージョンは30GBのファイルと約40GBのVRAM、BF16バージョンは56GBが必要です。
コマンド
ollama pull qwen3.8:27b puis ollama run qwen3.8:27b. Sur Mac, préférez le tag -mlx, optimisé Metal.
落とし穴その1
公称コンテキスト長は256kですが、Ollamaのデフォルトのコンテキストウィンドウはそれよりはるかに小さく、警告なしに切り詰められます。num_ctxを手動で設定する必要があります。
2番目の罠
「thinking」モードはデフォルトで有効となっており、応答前に多くのトークンを消費します。ローカル環境では、簡単なタスクではreasoning_effortを下げたり、そのモードを無効にしたりしてください。
!
性能の数値はAlibabaが公表したものです
このガイドの公開時点では、Qwen3.8-27Bについて独立したベンチマークの結果は再現されていません。以下に掲載するスコアはすべて公式モデルカードに由来します。前世代との整合性はありますが、モデル提供元が公表した数値として扱う必要があります。

#Qwen 3.8 27Bの実像

ローカルAIキット

お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。

  • 永久に利用できるオンラインスペース
  • PDF + ファイル
  • 生涯アップデート

Mixture-of-Experts(MoE)が流行する中、Qwen3.8-27Bはデンスモデルです。270億のパラメータすべてが、トークンごとに有効になります。そのためメモリ使用量を予測しやすく、生成速度が予想以上に速くなることも、VRAM使用量が予想以上に増えることもありません。また、同程度の規模のMoEモデルに比べて、ローカルでの生成速度が控えめになる理由もここにあります。

アーキテクチャ
64層を16ブロックにまとめた構成で、各ブロックは「3 × (Gated DeltaNet → FFN)、その後に1 × (Gated Attention → FFN)」からなります。ハイブリッド型のアテンション機構で、大半の層にはメモリ効率の高い線形アテンションを使い、その間に精度を確保するための通常のアテンション層を挟んでいます。
モダリティ
視覚と言語を扱う機能をネイティブに備えています。対象は静止画像、文書、科学的な図表、動画です。後から付け足したアダプターではありません。
コンテキスト
ネイティブで262,144トークンに対応し、YaRNで1,000,000トークンまで拡張できます。ただし、この拡張が可能なのはvLLM、SGLang、TokenSpeedのみで、Ollamaでは拡張できません。
ライセンス
Apache 2.0。商用利用が認められており、Llamaのようなユーザー数の上限も、Gemmaのような利用に関する条項もありません。
特徴
モデルはMulti-Token Prediction(MTP)を使って学習されています。そのため、Ollamaでは「mtp」タグが付いており、MTPを活用できるエンジンでは生成が高速化されます。
i
Qwen 3.8-Max とは混同しないでください
Qwen 3.8-Maxは2026年8月3日にリリースされたMoEモデルで、約2,400兆パラメータを備え、APIのみでの利用が可能であり、自宅で実行する方法は存在しません。27Bは同世代のオープンウェイトバージョンです。完全なリリーススケジュールは、私たちのオープンウェイトガイド Qwen 3.8 でご確認ください。

#タグごとに必要なハードウェア

Ollama ライブラリは 12 種類のバリアントを公開しています。ダウンロードの重さは必要な VRAM とは異なります:コンテキスト長に応じて増加する KV キャッシュと、ビジュアルエンコーダーを加える必要があります。ファイルサイズより 15% から 25% の余裕を見込んでください。

Ollama上のQwen 3.8 27Bの公式バリエーション(2026年8月18日調べ)
Tagサイズ余裕を持って使えるメモリ容量対象者
qwen3.8:27b (Q4_K_M, デフォルト)18 GB24 GBデフォルトの選択:RTX 3090/4090/5090、Mac 32 GB
qwen3.8:27b-q8_030 GB40 GB 以上ほぼ最適な品質:RTX Pro 6000、24GBの双GPU
qwen3.8:27b-bf1656 GB80 GB基準となるモデル重み、計算用マシン(H100、H200)
qwen3.8:27b-mlx18 GB32GB統合メモリApple Silicon:Metalビルド。Macでの標準的な選択肢として適切
qwen3.8:27b-mxfp832 GB48 GBのユニファイドメモリMac Studio / M4 Max 64 GB、より高い品質
qwen3.8:27b-mlx-bf1656 GB96GBの統合メモリMac Studio 128 GB、量子化による損失なし
qwen3.8:27b-mtp-q4_K_M18 GB24 GBデフォルトと同じで、マルチトークン予測を明示的に指定
!
16GBのVRAM:可能ですが、快適ではありません
RTX 4060 Ti 16 GBや5070 Tiでは、Q4_K_Mはメモリに完全に収まりません。Ollamaは残りをプロセッサに配置し、生成速度は5トークン/秒を下回ることもよくあります。16 GBの場合、120億から140億パラメータのモデルの方が、マシンの利用効率としてははるかに優れています。

生成速度については、Q4の27Bデンスモデルで、ミドルレンジの構成なら約14トークン/秒、最近のハイエンド構成なら約22トークン/秒と推定しています。これらは計算に基づく概算であり、実測値ではありません。さらに、デフォルトで有効な「thinking」モードによって、回答の最初の行が表示されるまでの体感待ち時間が2倍になる可能性があります。

#Qwen 3.8 27BをOllamaでインストールする

  1. 01
    Ollama を更新してください
    Qwen 3.8 のハイブリッドレイヤーとビジョンパーサーには、Ollama の新しいバージョンが必要です。2026 年 8 月より前のバージョンでは、アーキテクチャエラー、または誤解を招く「model not found」が返されます。公式サイトから再インストールするか、Linux ではインストールスクリプトを再実行してください。
  2. 02
    モデルをダウンロードする
    18GBのデータが転送されます。Ollamaがblobを保存するシステムディスクに、空き容量を確保してください。接続が切れても、pullは中断したところから再開できます。
  3. 03
    最初のやり取りを開始してください
    最初の応答は、モデルの重みをメモリに読み込む時間が必要なため遅くなります。応答が始まるまでに1分以上かかる場合は、処理の一部がCPUにオフロードされている兆候です。
  4. 04
    モデルがどこで実行されているかを確認してください
    ollama ps コマンドはGPUとCPUへの処理の割り当てを表示します。「100 % GPU」と表示されない限り、各トークンの処理コストは高くなります。量子化のビット数を一段階下げるか、コンテキストを短くしてください。
インストールと初期テスト
# 1. Récupérer le modèle (18 Go)
ollama pull qwen3.8:27b

# 2. Discuter avec
ollama run qwen3.8:27b

# 3. Vérifier la répartition GPU / CPU
ollama ps
i
qwen3.8とだけ指定すると27B
タグ「qwen3.8:latest」は現在、「qwen3.8:27b」と同じ blob を指しています。これは公式ライブラリで公開されている唯一の形式です。「ollama run qwen3.8」と書いても、まったく同じ結果になります。ただし、スクリプト内でモデルのサイズを固定しておけば、今後ほかのバリエーションが登場した際に、予期しない結果を避けられます。

#Apple Silicon搭載MacではMLX版を選んでください

Ollamaは、AppleのMetalエンジン向けにコンパイルされたMLXビルドを公開しています。ファイルサイズが同じ18 GBでも、M3、M4およびそれ以降のチップでは、ユニファイドメモリをより効率よく活用し、汎用GGUFよりも明らかに高いスループットを実現します。

Apple Silicon搭載Mac
# Build MLX (Metal) — recommandé sur M1/M2/M3/M4
ollama run qwen3.8:27b-mlx

# Mac 64 Go et plus : qualité supérieure
ollama run qwen3.8:27b-mxfp8
Mac 16GB
不十分です。macOSでは、ユニファイドメモリの約70%しかGPUに割り当てられないため、モデルがスワップされ、使いものにならなくなります。
Mac 24 GB
コンテキストが短く、ほかに重いアプリケーションを開いていなければ、ぎりぎり動作します。試すには許容範囲ですが、実際に使うとストレスがたまります。
Mac 32 GB
実用的な最低ラインです。モデルがメモリに収まり、KVキャッシュとシステム用にも余裕が残ります。
Mac 64GB以上
余裕があり、mxfp8に移行したり、長い文書を扱ったりできます。

#256kコンテキストの落とし穴

これは、使い始めたばかりのユーザーのほとんどが犯す間違いです。モデルは 262,144 トークンに対応するとされていますが、Ollama はデフォルトでははるかに短いコンテキストウィンドウを適用します。その長さを超えると、文書の先頭がエラーメッセージなしで切り捨てられます。モデルは、全文を読んでいないテキストについて、自信を持って回答します。

コンテキストウィンドウの設定
# Dans une session interactive
/set parameter num_ctx 32768

# Ou via un Modelfile réutilisable
cat > Modelfile <<'EOF'
FROM qwen3.8:27b
PARAMETER num_ctx 32768
PARAMETER temperature 1.0
PARAMETER top_p 0.95
PARAMETER top_k 20
EOF
ollama create qwen38-long -f Modelfile
!
公称256k、手元の環境では16k〜64k
KVキャッシュはコンテキスト長にほぼ比例して増加し、モデルの重み18GBに加えてメモリを消費します。VRAMが24GBのグラフィックスカードでは、32,000トークンのコンテキストウィンドウが無理のない設定です。64,000トークンも多少速度が落ちるものの収まりますが、262,144トークンは収まりません。Flash Attentionを有効にし、KVキャッシュをq8_0に量子化すると(変数OLLAMA_FLASH_ATTENTIONとOLLAMA_KV_CACHE_TYPE)、数GBのメモリを節約できます。

発表された100万トークンについては、モデルの構成ファイルに設定されたYaRN拡張に基づいており、vLLM、SGLang、またはTokenSpeedでのみサポートされています。現在、Ollamaからこれにアクセスする手段はありません。

#Thinking mode とサンプリングパラメータ

Qwen 3.8は回答前に考えるようになっています。『think』タグで囲まれた思考ブロックを生成し、その後に最終回答を出力します。これはデフォルトで有効になっており、ユーザーが感じる主な遅延の原因です。対応するエンジンでは、reasoning_effortで深さを調整できます。デフォルトはxhighで、次にmedium、lowに設定可能です。

アリババが推奨するサンプリングパラメータ
モードtemperaturetop_ptop_kpresence_penalty
Thinking(デフォルト)1.00.95200.0
Instruct(思考なし)0.70.80201.5
ローカルでの短いタスク処理
reasoning_effort を low または medium に設定してください。言い換えや抽出タスクでは、長時間の推論は品質に影響を与えず、待機時間が3倍になります。
エージェントタスク
xhighを維持してください。Alibabaは、低い設定では分析が不十分になり、やり直しが発生するため、ターンごとの利得が失敗によって相殺されると指摘しています。
同じ内容を繰り返す応答
presence_penaltyを上げてください(0〜2の範囲)。1.5を超えると、モデルが複数の言語を混ぜ始めます。
出力に推論過程が混入する
アプリケーションに思考タグが表示される場合は、reasoning_content と最終的な回答が分離されていないことを意味します。この用途では、出力後にテキストをフィルタリングするのではなく、思考機能を無効にしてください。

#画像またはドキュメントの分析

画像認識に標準対応しており、スクリーンショット、板書の写真、技術図、スキャンしたページを扱えます。コマンドラインでは、プロンプトにファイルのパスを指定するだけです。API 経由の場合、画像は base64 でエンコードし、Ollama が用意しているフィールドに入れて送信します。

コマンドラインでの視覚認識
ollama run qwen3.8:27b
>>> Décris ce schéma et liste les valeurs lisibles ./schema.png
!
プロダクション導入前に視覚機能をテストしてください
マルチモーダル対応の経路は、リリース直後にパーサーの修正パッチが適用されました。応答が画像を無視しているか、別のものを説明している場合は、さらに調査を進める前に Ollama を更新してください。また、本番運用に移行する前に、ご自身のドキュメントを10件程度で検証してください。

#公表されたスコアをどう評価するか

前世代の同サイズモデルである Qwen 3.6-27B に対する主張されている性能向上は大きく、特にエージェント型コードやコンピュータ操作において顕著です。以下はAlibabaが公開した数値ですが、独立した再現試験は行われていない点にご注意ください。

Qwen3.8-27B と Qwen3.6-27B — アリババが提供したスコア(2026年8月)
テストQwen3.8-27BQwen3.6-27B
Terminal Bench 2.1(エージェントによるコーディング)73,063,4
SWE-bench Pro61,753,5
LiveCodeBench v690,383,9
IFBench(指示追従)79,569,1
GPQA Diamond(科学分野)89,287,8
OSWorld-Verified(コンピュータ操作)84,363,9
MathVision(視覚情報を含む数学問題)90,085,1
OmniDocBench 1.5(ドキュメント)91,189,4

ローカル利用で押さえておきたいのは、進歩が主に、時間のかかるツールを使ったタスクに集中していることです。ターミナルを操作する、リポジトリを修正する、途中で脱線せずに複数の手順を続けて実行するといったタスクです。単純な会話や要約では、前世代との差は、これらの数字から想像するほど目立ちません。

#Qwen 3.6、Gemma 4、gpt-ossから乗り換えるべきですか?

Qwen 3.6-27Bをお使いの場合
はい、更新する価値があります。メモリ使用量も自由度の高いライセンスも同じで、コーディングとエージェント機能の性能は明確に向上しています。出力のスタイルが変わるため、使用しているプロンプトの検証が済むまでは古いタグを残しておいてください。
Gemma 4 26Bを使っている場合
Qwen 3.8は、コーディングとエージェントとしての処理で引き続き優位に立っています。ライセンスについては、Gemmaが2026年4月にパーミッシブライセンスへ移行したため、現在はどちらもApache 2.0です。Gemma 4(MoE 26B-A4B、マルチモーダル)は、フランス語での会話ではより自然で、起動もより速いことが多いです。
gpt-oss-20bを使用している場合
設計思想が異なります。gpt-ossはより軽量で高速です。一方、Qwen 3.8は画像を認識でき、はるかに長いコンテキストに対応し、長時間にわたるタスクを想定しています。利用可能なVRAMに応じて選んでください。
主にコーディングを目的としています
コードに特化した30BのMoEモデルのほうが、自動補完では依然として高速です。エージェントが複数のファイルを読み、計画を立て、変更する必要がある場合には、Qwen 3.8 27Bを選ぶ理由があります。
24GB未満です
無理に動かそうとしないでください。CPU側にオフロードされる27Bよりも、Q4の12~14Bのほうが快適に使えます。

#トラブルシューティング

pull時の「model not found」
Ollama が古すぎてこのリポジトリを認識できないか、タグの綴りが間違っています。正しいタグは「qwen3.8:27b」で、ハイフンではなくピリオドを使います。Ollama を更新してから、再度実行してください。
ロード時のアーキテクチャエラー
原因は同じです。Qwen 3.8のハイブリッド層に対応しているのは、エンジンの比較的新しいバージョンだけです。
非常に遅い生成(5トークン/秒未満)
モデルがVRAMに収まらず、一部がシステムRAMにオフロードされています。ollama psで確認してください。割り当てが100% GPUでない場合は、num_ctxを減らすか、GPUを使う他のアプリケーションを閉じるか、より小さなモデルに切り替えてください。
ドキュメントの最初を無視する回答
コンテキストが通知なく切り詰められています。実際の入力長に合わせて num_ctx を設定するか、文書を分割してください。
モデルがいつまでも「考え」続ける
タスクに対してreasoning_effortの設定が高すぎます。mediumまたはlowに下げるか、単純なタスクでは思考を無効にしてください。
画像は無視されます
ファイルのパスは、Ollamaのプロセスからアクセスできる必要があります。また、画像解析のパーサーを使うには最新のバージョンが必要です。モデルに原因があると判断する前に、ローカルに保存した単純な画像でテストしてください。
ディスクスペース不足
ブロブとキャッシュを合わせ、インストール中は公表サイズの2倍を確保してください。ディスク容量不足でpullが中断されると断片が残ります。その場合はollama rmを実行してから、もう一度pullしてください。
よくある質問
Qwen 3.8 27B にはどのくらいの VRAM が必要ですか?+
標準のQ4_K_M版には24GBのVRAMが必要です。モデルファイルは18GBで、これにKVキャッシュが加わります。Q8版には40GB、BF16の重みには56GBを見込んでください。Macでは少なくとも32GBのユニファイドメモリが必要です。
Qwen 3.8 27B をローカルでインストールする方法は?+
Ollamaをインストールまたは更新し、その後、「ollama pull qwen3.8:27b」と「ollama run qwen3.8:27b」を実行してください。ダウンロードサイズは18GBです。Apple Silicon搭載のMacでは、代わりにMetal向けに最適化されたタグ qwen3.8:27b-mlx を使用してください。
Qwen 3.8 27Bは無料で、企業でも利用できますか?+
はい。重みはApache 2.0ライセンスで公開されており、商業利用、改変、再配布が可能で、ユーザー数の上限や使用制限の規定はありません。オープンモデルの中では最も自由なライセンスの一つです。
Qwen 3.8 27B と Qwen 3.8-Max の違いは?+
Qwen 3.8-Maxは、約2.4兆パラメータのMixture-of-Experts型のプロプライエタリモデルであり、API経由でのみアクセス可能です。Qwen3.8-27Bは、同じ世代のオープンウェイトのデンスモデルのバリアントです。この2つのうち、ご自身のマシンで実行できるのはこのモデルのみです。
Qwen 3.8 27Bを16GBのVRAMで実行できますか?+
技術的には可能ですが、モデルの一部がCPUで処理されるようになり、通常は処理速度が毎秒5トークン未満に落ちます。16GBのVRAMなら、120億~140億パラメータのモデルのほうが、はるかに快適に使えます。
Qwen 3.8 27BはQwen 3.6 27Bよりも優れていますか?+
Alibabaが公表した数値によると、はい。エージェントによるコーディング(Terminal Bench 2.1で73.0対63.4)とコンピュータ操作(OSWorld-Verifiedで84.3対63.9)では、明確に優れています。これらのスコアはまだ独立した検証で再現されておらず、会話用途では差がそれほど顕著ではありません。
Qwen 3.8の「思考モード」を無効にできますか?+
はい。thinkingモードはデフォルトで有効ですが、リクエストごとに無効にできます。思考の深さはreasoning_effortパラメータ(xhigh、medium、low)で調整できます。直接回答モードでの推奨設定は、temperature 0.7とtop_p 0.80です。
100万トークンのコンテキストはローカルで利用可能ですか?+
Ollama経由ではできません。ネイティブコンテキストは262,144トークンであり、100万トークンへの拡張は、vLLM、SGLang、TokenSpeedのみがサポートするYaRN設定によって行われます。実際には、24 GBのGPUカードでは、16,000から64,000トークンのウィンドウが現実的な設定です。

#さらに詳しく

このガイドは、Ollamaが正常に動作する状態でインストールされており、量子化方式を納得したうえで選んでいることを前提としています。以下のページで、このテーマを補足しています:

Ollama のインストール
Windows、macOS、Linuxでエンジンがまだインストールされていない場合に必要な準備と、Qwen 3.8を使うために欠かせないアップデートについて。
量子化の選び方
Q4、Q8、BF16 を十分に理解したうえで選ぶために、各段階で必要なメモリ量と得られる品質を解説します。
Qwen 3.8:オープンウェイトのタイムライン
APIで提供されるMaxとオープンな27Bモデルが混同される理由と、実際に何がいつ発表されたのか。
VRAM 24 GBで使えるLLMはどれ?
Qwen 3.8 27B と、より軽量な代替モデルのどちらを選ぶかまだ迷っている方に向けた、24 GB のグラフィックカードに収まるモデルの比較です。
このガイドは役に立ちましたか?

ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。