Qwen 3.8 27B をローカルで使用:Ollama のインストールと VRAM
Qwen3.8-27Bの重みは2026年8月14日にHugging FaceでApache 2.0ライセンスの下で公開され、Ollamaの公式タグも同日に公開されました。これは3.8世代で初めて、実際に自分のマシンにインストールできるモデルです。デンス型で、マルチモーダル(画像と動画)に対応し、ネイティブのコンテキスト長は262,144トークンです。本ガイドでは、正確なコマンド、タグごとに実際に必要なVRAM容量、デフォルトで有効な「thinking」モードの設定、そして初回の試行のほとんどを台無しにする2つの落とし穴——通知なしのコンテキスト切り詰めと、モデルの一部がシステムRAMにオフロードされること——を解説します。
#30秒で結論
Qwen 3.8 27Bは「ollama run qwen3.8:27b」という1つのコマンドでインストールできます。デフォルトのパッケージ(Q4_K_M)は18 GBで、快適に使うには、24 GBのVRAMを搭載したグラフィックカード(RTX 3090、4090、5090)、または32 GB以上のユニファイドメモリを搭載したApple Silicon Macが必要です。それ未満でもモデルは動作しますが、一部のレイヤーの処理がCPUに移り、生成速度が大幅に低下します。
- 概要
- 270億パラメータの密なモデルで、画像と動画を扱う視覚言語機能を標準で備え、コンテキスト長は262,144トークンです。Apache 2.0ライセンスのため、制限条項なしで商用利用できます。
- 現実的な前提条件
- Q4_K_Mバージョンは24GBのVRAMまたは32GBの統合メモリが必要です。Q8バージョンは30GBのファイルと約40GBのVRAM、BF16バージョンは56GBが必要です。
- コマンド
- ollama pull qwen3.8:27b puis ollama run qwen3.8:27b. Sur Mac, préférez le tag -mlx, optimisé Metal.
- 落とし穴その1
- 公称コンテキスト長は256kですが、Ollamaのデフォルトのコンテキストウィンドウはそれよりはるかに小さく、警告なしに切り詰められます。num_ctxを手動で設定する必要があります。
- 2番目の罠
- 「thinking」モードはデフォルトで有効となっており、応答前に多くのトークンを消費します。ローカル環境では、簡単なタスクではreasoning_effortを下げたり、そのモードを無効にしたりしてください。
#Qwen 3.8 27Bの実像
お使いのマシンで、プライベートかつ無料のChatGPTを1時間で構築 — LM Studio、Ollama、Open WebUI、ご自身のドキュメント、クラウド不要。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
Mixture-of-Experts(MoE)が流行する中、Qwen3.8-27Bはデンスモデルです。270億のパラメータすべてが、トークンごとに有効になります。そのためメモリ使用量を予測しやすく、生成速度が予想以上に速くなることも、VRAM使用量が予想以上に増えることもありません。また、同程度の規模のMoEモデルに比べて、ローカルでの生成速度が控えめになる理由もここにあります。
- アーキテクチャ
- 64層を16ブロックにまとめた構成で、各ブロックは「3 × (Gated DeltaNet → FFN)、その後に1 × (Gated Attention → FFN)」からなります。ハイブリッド型のアテンション機構で、大半の層にはメモリ効率の高い線形アテンションを使い、その間に精度を確保するための通常のアテンション層を挟んでいます。
- モダリティ
- 視覚と言語を扱う機能をネイティブに備えています。対象は静止画像、文書、科学的な図表、動画です。後から付け足したアダプターではありません。
- コンテキスト
- ネイティブで262,144トークンに対応し、YaRNで1,000,000トークンまで拡張できます。ただし、この拡張が可能なのはvLLM、SGLang、TokenSpeedのみで、Ollamaでは拡張できません。
- ライセンス
- Apache 2.0。商用利用が認められており、Llamaのようなユーザー数の上限も、Gemmaのような利用に関する条項もありません。
- 特徴
- モデルはMulti-Token Prediction(MTP)を使って学習されています。そのため、Ollamaでは「mtp」タグが付いており、MTPを活用できるエンジンでは生成が高速化されます。
#タグごとに必要なハードウェア
Ollama ライブラリは 12 種類のバリアントを公開しています。ダウンロードの重さは必要な VRAM とは異なります:コンテキスト長に応じて増加する KV キャッシュと、ビジュアルエンコーダーを加える必要があります。ファイルサイズより 15% から 25% の余裕を見込んでください。
| Tag | サイズ | 余裕を持って使えるメモリ容量 | 対象者 |
|---|---|---|---|
| qwen3.8:27b (Q4_K_M, デフォルト) | 18 GB | 24 GB | デフォルトの選択:RTX 3090/4090/5090、Mac 32 GB |
| qwen3.8:27b-q8_0 | 30 GB | 40 GB 以上 | ほぼ最適な品質:RTX Pro 6000、24GBの双GPU |
| qwen3.8:27b-bf16 | 56 GB | 80 GB | 基準となるモデル重み、計算用マシン(H100、H200) |
| qwen3.8:27b-mlx | 18 GB | 32GB統合メモリ | Apple Silicon:Metalビルド。Macでの標準的な選択肢として適切 |
| qwen3.8:27b-mxfp8 | 32 GB | 48 GBのユニファイドメモリ | Mac Studio / M4 Max 64 GB、より高い品質 |
| qwen3.8:27b-mlx-bf16 | 56 GB | 96GBの統合メモリ | Mac Studio 128 GB、量子化による損失なし |
| qwen3.8:27b-mtp-q4_K_M | 18 GB | 24 GB | デフォルトと同じで、マルチトークン予測を明示的に指定 |
生成速度については、Q4の27Bデンスモデルで、ミドルレンジの構成なら約14トークン/秒、最近のハイエンド構成なら約22トークン/秒と推定しています。これらは計算に基づく概算であり、実測値ではありません。さらに、デフォルトで有効な「thinking」モードによって、回答の最初の行が表示されるまでの体感待ち時間が2倍になる可能性があります。
#Qwen 3.8 27BをOllamaでインストールする
- 01Ollama を更新してくださいQwen 3.8 のハイブリッドレイヤーとビジョンパーサーには、Ollama の新しいバージョンが必要です。2026 年 8 月より前のバージョンでは、アーキテクチャエラー、または誤解を招く「model not found」が返されます。公式サイトから再インストールするか、Linux ではインストールスクリプトを再実行してください。
- 02モデルをダウンロードする18GBのデータが転送されます。Ollamaがblobを保存するシステムディスクに、空き容量を確保してください。接続が切れても、pullは中断したところから再開できます。
- 03最初のやり取りを開始してください最初の応答は、モデルの重みをメモリに読み込む時間が必要なため遅くなります。応答が始まるまでに1分以上かかる場合は、処理の一部がCPUにオフロードされている兆候です。
- 04モデルがどこで実行されているかを確認してくださいollama ps コマンドはGPUとCPUへの処理の割り当てを表示します。「100 % GPU」と表示されない限り、各トークンの処理コストは高くなります。量子化のビット数を一段階下げるか、コンテキストを短くしてください。
#Apple Silicon搭載MacではMLX版を選んでください
Ollamaは、AppleのMetalエンジン向けにコンパイルされたMLXビルドを公開しています。ファイルサイズが同じ18 GBでも、M3、M4およびそれ以降のチップでは、ユニファイドメモリをより効率よく活用し、汎用GGUFよりも明らかに高いスループットを実現します。
- Mac 16GB
- 不十分です。macOSでは、ユニファイドメモリの約70%しかGPUに割り当てられないため、モデルがスワップされ、使いものにならなくなります。
- Mac 24 GB
- コンテキストが短く、ほかに重いアプリケーションを開いていなければ、ぎりぎり動作します。試すには許容範囲ですが、実際に使うとストレスがたまります。
- Mac 32 GB
- 実用的な最低ラインです。モデルがメモリに収まり、KVキャッシュとシステム用にも余裕が残ります。
- Mac 64GB以上
- 余裕があり、mxfp8に移行したり、長い文書を扱ったりできます。
#256kコンテキストの落とし穴
これは、使い始めたばかりのユーザーのほとんどが犯す間違いです。モデルは 262,144 トークンに対応するとされていますが、Ollama はデフォルトでははるかに短いコンテキストウィンドウを適用します。その長さを超えると、文書の先頭がエラーメッセージなしで切り捨てられます。モデルは、全文を読んでいないテキストについて、自信を持って回答します。
発表された100万トークンについては、モデルの構成ファイルに設定されたYaRN拡張に基づいており、vLLM、SGLang、またはTokenSpeedでのみサポートされています。現在、Ollamaからこれにアクセスする手段はありません。
#Thinking mode とサンプリングパラメータ
Qwen 3.8は回答前に考えるようになっています。『think』タグで囲まれた思考ブロックを生成し、その後に最終回答を出力します。これはデフォルトで有効になっており、ユーザーが感じる主な遅延の原因です。対応するエンジンでは、reasoning_effortで深さを調整できます。デフォルトはxhighで、次にmedium、lowに設定可能です。
| モード | temperature | top_p | top_k | presence_penalty |
|---|---|---|---|---|
| Thinking(デフォルト) | 1.0 | 0.95 | 20 | 0.0 |
| Instruct(思考なし) | 0.7 | 0.80 | 20 | 1.5 |
- ローカルでの短いタスク処理
- reasoning_effort を low または medium に設定してください。言い換えや抽出タスクでは、長時間の推論は品質に影響を与えず、待機時間が3倍になります。
- エージェントタスク
- xhighを維持してください。Alibabaは、低い設定では分析が不十分になり、やり直しが発生するため、ターンごとの利得が失敗によって相殺されると指摘しています。
- 同じ内容を繰り返す応答
- presence_penaltyを上げてください(0〜2の範囲)。1.5を超えると、モデルが複数の言語を混ぜ始めます。
- 出力に推論過程が混入する
- アプリケーションに思考タグが表示される場合は、reasoning_content と最終的な回答が分離されていないことを意味します。この用途では、出力後にテキストをフィルタリングするのではなく、思考機能を無効にしてください。
#画像またはドキュメントの分析
画像認識に標準対応しており、スクリーンショット、板書の写真、技術図、スキャンしたページを扱えます。コマンドラインでは、プロンプトにファイルのパスを指定するだけです。API 経由の場合、画像は base64 でエンコードし、Ollama が用意しているフィールドに入れて送信します。
#公表されたスコアをどう評価するか
前世代の同サイズモデルである Qwen 3.6-27B に対する主張されている性能向上は大きく、特にエージェント型コードやコンピュータ操作において顕著です。以下はAlibabaが公開した数値ですが、独立した再現試験は行われていない点にご注意ください。
| テスト | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| Terminal Bench 2.1(エージェントによるコーディング) | 73,0 | 63,4 |
| SWE-bench Pro | 61,7 | 53,5 |
| LiveCodeBench v6 | 90,3 | 83,9 |
| IFBench(指示追従) | 79,5 | 69,1 |
| GPQA Diamond(科学分野) | 89,2 | 87,8 |
| OSWorld-Verified(コンピュータ操作) | 84,3 | 63,9 |
| MathVision(視覚情報を含む数学問題) | 90,0 | 85,1 |
| OmniDocBench 1.5(ドキュメント) | 91,1 | 89,4 |
ローカル利用で押さえておきたいのは、進歩が主に、時間のかかるツールを使ったタスクに集中していることです。ターミナルを操作する、リポジトリを修正する、途中で脱線せずに複数の手順を続けて実行するといったタスクです。単純な会話や要約では、前世代との差は、これらの数字から想像するほど目立ちません。
#Qwen 3.6、Gemma 4、gpt-ossから乗り換えるべきですか?
- Qwen 3.6-27Bをお使いの場合
- はい、更新する価値があります。メモリ使用量も自由度の高いライセンスも同じで、コーディングとエージェント機能の性能は明確に向上しています。出力のスタイルが変わるため、使用しているプロンプトの検証が済むまでは古いタグを残しておいてください。
- Gemma 4 26Bを使っている場合
- Qwen 3.8は、コーディングとエージェントとしての処理で引き続き優位に立っています。ライセンスについては、Gemmaが2026年4月にパーミッシブライセンスへ移行したため、現在はどちらもApache 2.0です。Gemma 4(MoE 26B-A4B、マルチモーダル)は、フランス語での会話ではより自然で、起動もより速いことが多いです。
- gpt-oss-20bを使用している場合
- 設計思想が異なります。gpt-ossはより軽量で高速です。一方、Qwen 3.8は画像を認識でき、はるかに長いコンテキストに対応し、長時間にわたるタスクを想定しています。利用可能なVRAMに応じて選んでください。
- 主にコーディングを目的としています
- コードに特化した30BのMoEモデルのほうが、自動補完では依然として高速です。エージェントが複数のファイルを読み、計画を立て、変更する必要がある場合には、Qwen 3.8 27Bを選ぶ理由があります。
- 24GB未満です
- 無理に動かそうとしないでください。CPU側にオフロードされる27Bよりも、Q4の12~14Bのほうが快適に使えます。
#トラブルシューティング
- pull時の「model not found」
- Ollama が古すぎてこのリポジトリを認識できないか、タグの綴りが間違っています。正しいタグは「qwen3.8:27b」で、ハイフンではなくピリオドを使います。Ollama を更新してから、再度実行してください。
- ロード時のアーキテクチャエラー
- 原因は同じです。Qwen 3.8のハイブリッド層に対応しているのは、エンジンの比較的新しいバージョンだけです。
- 非常に遅い生成(5トークン/秒未満)
- モデルがVRAMに収まらず、一部がシステムRAMにオフロードされています。ollama psで確認してください。割り当てが100% GPUでない場合は、num_ctxを減らすか、GPUを使う他のアプリケーションを閉じるか、より小さなモデルに切り替えてください。
- ドキュメントの最初を無視する回答
- コンテキストが通知なく切り詰められています。実際の入力長に合わせて num_ctx を設定するか、文書を分割してください。
- モデルがいつまでも「考え」続ける
- タスクに対してreasoning_effortの設定が高すぎます。mediumまたはlowに下げるか、単純なタスクでは思考を無効にしてください。
- 画像は無視されます
- ファイルのパスは、Ollamaのプロセスからアクセスできる必要があります。また、画像解析のパーサーを使うには最新のバージョンが必要です。モデルに原因があると判断する前に、ローカルに保存した単純な画像でテストしてください。
- ディスクスペース不足
- ブロブとキャッシュを合わせ、インストール中は公表サイズの2倍を確保してください。ディスク容量不足でpullが中断されると断片が残ります。その場合はollama rmを実行してから、もう一度pullしてください。
Qwen 3.8 27B にはどのくらいの VRAM が必要ですか?+
Qwen 3.8 27B をローカルでインストールする方法は?+
Qwen 3.8 27Bは無料で、企業でも利用できますか?+
Qwen 3.8 27B と Qwen 3.8-Max の違いは?+
Qwen 3.8 27Bを16GBのVRAMで実行できますか?+
Qwen 3.8 27BはQwen 3.6 27Bよりも優れていますか?+
Qwen 3.8の「思考モード」を無効にできますか?+
100万トークンのコンテキストはローカルで利用可能ですか?+
#さらに詳しく
このガイドは、Ollamaが正常に動作する状態でインストールされており、量子化方式を納得したうえで選んでいることを前提としています。以下のページで、このテーマを補足しています:
- Ollama のインストール
- Windows、macOS、Linuxでエンジンがまだインストールされていない場合に必要な準備と、Qwen 3.8を使うために欠かせないアップデートについて。
- 量子化の選び方
- Q4、Q8、BF16 を十分に理解したうえで選ぶために、各段階で必要なメモリ量と得られる品質を解説します。
- Qwen 3.8:オープンウェイトのタイムライン
- APIで提供されるMaxとオープンな27Bモデルが混同される理由と、実際に何がいつ発表されたのか。
- VRAM 24 GBで使えるLLMはどれ?
- Qwen 3.8 27B と、より軽量な代替モデルのどちらを選ぶかまだ迷っている方に向けた、24 GB のグラフィックカードに収まるモデルの比較です。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。