Qwen-Image-Editをローカルで実行:ComfyUIとVRAM 必須
Qwen-Image-Editは、Alibabaのオープンな画像編集モデルです。写真と自然言語の指示を渡すと、それ以外の部分を保ったまま画像を編集します。ComfyUIでローカル実行できますが、200億パラメーターのモデルであり、誰もが行き詰まる疑問は同じです。FP8とGGUFのどちらをダウンロードすべきか、そしてどれだけのビデオメモリを用意すべきかです。このガイドではComfyUIの公式手順に沿って、ソース内でファイルサイズとVRAM要件を確認する場所を示し、頻出するnodeエラーを一覧にしています。専用ガイドで扱っているComfyUI自体のインストールは対象外です。
#なぜQwen-Image-Editなのか、そしてこのファミリーに含まれるもの
Qwen-Imageファミリーは2つの用途をまとめています。Qwen-Imageはテキストから画像を生成し、技術レポートでも認められている強みとして、画像内のテキスト、なかでも文章全体やラテン文字以外のアルファベットの描画に優れています。Qwen-Image-Editは、この同じモデルを起点に既存の画像を編集します。GitHubリポジトリQwenLM/Qwen-ImageとHugging FaceのモデルページQwen/Qwen-Image-Editでは、編集を2種類に分けています。意味編集は対象の同一性を保ちながら内容やスタイルを変更し、外観編集は残りの部分に触れずに要素を追加、削除、置換します。モデルは、フォントとレイアウトを維持したまま、画像内のテキストを修正または置換することもできます。
何かをダウンロードする前に押さえておくべき二つの事実は、アーキテクチャとライセンスです。拡散モデルは、約200億パラメーターのマルチモーダルトランスフォーマー(MMDiT)です。テキストエンコーダーは小型のCLIPではありません。入力した指示と入力画像の両方を読み取る、完全な視覚言語モデルであるQwen2.5-VL 7Bです。どちらもApache 2.0ライセンスで公開されているため、重みを商用利用できます。各コンポーネントは個別にダウンロードする必要があり、下記で説明するノードエラーの大半は、この三つのファイルへの分散が原因です。
この系統は急速に進化しています。Qwen-Image-Editの初版は2025年8月に公開されました。続いて2025年9月に2509という日付のバージョンが登場し、複数の入力画像を受け付け、深度マップ、輪郭、ポーズなど、ControlNet系の条件をネイティブに理解します。2511は2025年末に登場し、被写体の一貫性が向上しました。また、生成モデル側では2512への改訂が行われました。2.x系のバージョンは2026年に発表されています。このガイドは、2025年8月版から2511まで、ComfyUIが手順ごとに文書化した系統に基づいています。そこではノードとファイル構成が同じです。選ぶ前に、公開日付きで各バージョンを一覧にしているGitHub READMEの冒頭を読んでください。
#ネイティブ、FP8、GGUF:ダウンロードするQwen-Image-Editのバージョン
ローカルでの AI 画像・動画生成、制限なし:ComfyUI、Flux、Z-Image、Wan 2.2 を GPU や Mac で — ワークフローはそのまま読み込め、法的枠組みも解説。
- 永久に利用できるオンラインスペース
- PDF + ファイル
- 生涯アップデート
同じモデルには三つの形態が流通しており、使い方はそれぞれ異なります。
- ネイティブ(bf16、Diffusers形式)
- Hugging Face上のQwen/Qwen-Image-Editリポジトリ。複数のsafetensorsファイルに分割され、PythonのDiffusersライブラリ向けに用意されています。bf16では、200億パラメータがトランスフォーマーだけで約40 GBを占め、さらにテキストエンコーダーが必要です。これはPythonスクリプトと48 GB以上のグラフィックカード、または一部をRAMにオフロードする構成向けです。ComfyUI向けではありません。
- Comfy OrgによるFP8再パッケージ版
- Hugging Face上のComfy-Org/Qwen-Image-Edit_ComfyUIリポジトリでは、重みを単一のFP8ファイル(e4m3fn形式)にまとめ、テキストエンコーダーとVAEをサブフォルダーに分けています。これはComfyUIの公式ワークフローで使用されているバージョンです。拡散モデルのファイルサイズは20 GBを少し超えます。同じリポジトリには、空き容量のあるカード向けに、約41 GBのbf16版もあります。
- コミュニティ製GGUF
- city96、QuantStack、Unslothなどのコントリビューターが公開している、量子化LLM用フォーマットであるGGUF形式への変換です。Q8_0、Q6_K、Q5_K_M、Q4_K_M、Q3_K_M、Q2_Kまで量子化でき、ComfyUI-GGUF拡張機能が必要です。16 GB未満のVRAMでは最も現実的な選択肢であり、Macでは最も快適に使えます。
選択ルールは単純です。24 GB のカードなら、迷わず公式 FP8 を選びます。16 GB のカードでは、ComfyUI のメモリオフロードにより FP8 が動作しますが、速度低下を避けるには GGUF Q6_K または Q5_K_M が適しています。12 GB のカードなら GGUF Q4_K_M 以下です。Mac Apple Silicon では GGUF を使います。ComfyUI は Metal 上で FP8 の計算を行わず、読み込み時にこれらの重みをデクォンタイズするため、使用メモリが倍増するからです。
#必要なVRAM:数値の確認場所と解釈方法
GitHubのREADMEにも、QwenのHugging Faceページにも、「このカードならこれだけのVRAM」という表はありません。このモデルについてはComfyUIのドキュメントにもありません。チュートリアルには、ダウンロードするファイル、保存先フォルダー、ワークフローが列挙され、場合によっては独自の試行で使用したハードウェアと時間も示されていますが、これは保証ではなく目安として扱うべきです。信頼でき、日付があり、検証可能なデータは、Hugging Faceの各ページに表示される各ファイルのサイズです。それ以外はすべてそこから導き出せます。
- 拡散モデル
- FP8では約20 GB(Comfy-Orgのリポジトリにある、2025年8月公開のqwen_image_edit_fp8_e4m3fn.safetensorsファイル)、bf16では約41 GBです。GGUFでは、必要な容量は次のように計算します。200億パラメータにパラメータあたりのビット数を掛け、8で割ります。8.5ビットのQ8_0は約21 GB、4.5~5ビットのQ4_K_Mは約12 GB、Q3_K_Mは約9~10 GB、Q2_Kは約7 GBです。各GGUFリポジトリのページには、各ファイルの正確な値が表示されています。
- テキストエンコーダー
- Comfy-Orgリポジトリのqwen_2.5_vl_7b_fp8_scaled.safetensorsファイルは、約9.4 GBあります。デノイズ中にVRAMに残しておく必要はありません。ComfyUIはプロンプトと画像のエンコード時に読み込み、空きが不足するとアンロードします。そのため、20 GBのモデルと9 GBのエンコーダーを24 GBのカード上で動かせます。
- VAE
- qwen_image_vae.safetensorsファイルは約250 MBです。メモリ上は無視できる程度ですが必須であり、このモデルファミリー専用です。FluxやSDXLのVAEを使うと、色付きノイズが生成されます。
- アクティベーション
- 計算処理そのものにも、重みとは別に容量が必要で、解像度が高いほど必要量は増えます。公式ワークフローでは入力画像を約一メガピクセルに縮小するため、この部分には上限があります。出力解像度を二倍にすると、この余裕も大きくなります。
ComfyUIではデフォルトでVRAMの動的管理が有効になっており、インストールガイドで説明しています。重みがカードの容量を超えると、一部がRAMに残り、必要に応じて転送されます。その場合、モデルは12または16 GBのカードで動作しますが、一方から他方へ切り替えるたびに時間がかかり、システムRAMが実質的な上限になります。20 GBのモデルと9 GBのエンコーダーでは、RAM 32 GBが最低限必要で、64 GBあれば快適です。以下の目安表は、測定値を示すものではなく、この考え方をまとめたものです。
- 24 GB以上(RTX 3090、4090、5090)
- 完全な公式FP8、FP8エンコーダー、オフロードなしのメガピクセル画像出力。41 GBのbf16は48 GBのプロフェッショナル向けカード専用です。
- 16 GB (RTX 4080、5080、4060 Ti 16 GB)
- オフロード付きのFP8、またはエンコーダーをステップ間でアンロードすればカード内に収まるGGUF Q6_KからQ5_K_M。
- 12 GB(RTX 3060 12 GB、4070、5070、5070 Ti)
- GGUF Q4_K_MまたはQ3_K_M、読み込み後にアンロードされるFP8エンコーダー、RAM 32 GB。SDXLよりも生成時間が明らかに長くなります。
- 8 GB
- 大幅なオフロードを行えばQ2_KまたはQ3で可能ですが、速度と品質が低下します。たまに編集する場合に限ります。
- Apple Silicon搭載Mac
- 統合メモリをVRAMとして使用します。12 GBのGGUF Q4_K_Mと9 GBのエンコーダーには32 GBのMacが必要です。余裕を持って作業するには48 GB以上を用意してください。
#前提条件
- ComfyUIを最新の状態にする
- TextEncodeQwenImageEditなど、Qwen-Image専用のノードは2025年8月にComfyUIへ追加され、2509版のノードは2025年9月に追加されました。古いインストール環境ではこれらが無視され、赤いノードが表示されます。まず更新してください。Desktopは自動更新され、ポータブルアーカイブはupdateスクリプトで、手動インストールはgit pullで更新します。
- 最低12 GBのNVIDIAカード、または32 GBのMac
- それより少ない場合でも編集は可能ですが、忍耐力を試される作業になります。AMDはLinuxではROCmで動作し、2026年1月以降はWindowsでもDesktopアプリケーションで動作します。
- ディスク上の空き容量
- FP8:モデル、エンコーダー、VAEの三点セットで30 GB強。試すGGUFバリアントごとに10から21 GBを追加してください。
- すでに動作しているComfyUIのインストール
- SDXLまたはFluxで最初の画像を生成します。そうでない場合は、まずインストールガイドに従ってください。このガイドはComfyUIがhttp://127.0.0.1:8188で開いた時点から始まります。
#ステップ1と2:正しいファイルをダウンロードして整理する
最短の方法は、ComfyUIに統合されたワークフローモデルライブラリを使うことです。Workflowメニューから「Browse models」、Imageカテゴリ、続いて関心のあるバージョンに応じてQwen-Image-Editモデル、またはその2509版か2511版を選びます。ComfyUIは不足しているファイルを検出し、正しいフォルダーへ直接ダウンロードするよう提案します。手動でダウンロードしたい場合、たとえば選択したバリエーションを自分で管理したい場合は、docs.comfy.orgのチュートリアルQwen-Image-Editに記載されている、次の構成にしてください。
- 01拡散モデルをダウンロードするHugging FaceのリポジトリComfy-Org/Qwen-Image-Edit_ComfyUIにあるsplit_files/diffusion_modelsフォルダーを開きます。必要なバージョンに対応するFP8ファイルを取得してください。クリックする前にページに表示されたサイズを確認し、受け取ったファイルと比較してください。途中で切れたダウンロードではファイルが不完全になり、読み込み時に判読しにくいエラーが発生します。
- 02テキストエンコーダーと VAE をダウンロード同じリポジトリのsplit_files/text_encodersフォルダーとsplit_files/vaeフォルダーを使います。エンコーダーはQwen-Imageと、すべてのQwen-Image-Edit版で共通です。そのため、モデルを複数バージョンインストールする場合でも、必要なのは単一のコピーだけです。VAEも同様です。
- 03各ファイルを対応するサブフォルダーに整理するモデルはdiffusion_models、エンコーダーはtext_encoders、VAEはvaeに置きます。ComfyUI Desktopでは、modelsフォルダーはインストール時に選択した場所にあり、アプリケーションの設定で確認できます。diffusion_modelsではなくcheckpointsに置いたファイルは、読み込みノードに表示されません。
- 04任意:Lightning LoRAlightx2v/Qwen-Image-Lightning リポジトリでは、Qwen-Image と Qwen-Image-Edit の両方について、生成ステップ数を20ではなく4または8に減らす LoRA を公開しています。ファイルは models/loras に置きます。後発の編集モデルには、それぞれ専用の Lightning LoRA があります。使用するバージョン名が付いたものを選んでください。
- 05ComfyUI を更新するファイルをコピーしたら、インターフェースの更新ボタンをクリックするか、ページを再読み込みしてください。読み込みノードがフォルダーを読み直すのはこの時点であり、継続的に監視しているわけではありません。
#ステップ3:編集ワークフローを読み込み、そのノードを理解する
ライブラリからワークフローのQwen-Image-Editモデルを開きます。ファイルを手動でダウンロードした場合、ComfyUIが再ダウンロードを提案することがあります。その場合は拒否し、読み込みノードで自分のファイルを選択してください。グラフには十数個のノードがあり、それぞれに明確な役割があります。
- Load Diffusion Model
- models/diffusion_modelsからファイルを読み込みます。ドロップダウンメニューにQwen-Image-Editファイルが表示されるはずです。空の場合は、ファイルの配置場所が間違っているか、インターフェースが更新されていません。
- CLIPを読み込む、タイプqwen_image
- models/text_encodersからQwen2.5-VLエンコーダーを読み込みます。typeフィールドはqwen_imageに設定する必要があります。別のタイプを指定するとエンコーダーはエラーなく読み込まれますが、プロンプトが正しく解釈されず、まともに動作しません。
- Load VAE
- VAE Qwen-Image。それ以外はありません。
- Load Image、続いてScale Image to Total Pixels
- 変更する画像を約百万画素まで縮小したものです。このリサイズは任意ではありません。モデルはこの規模で学習されており、入力がはるかに大きいと一貫性が低下し、VRAMも膨らむためです。
- TextEncodeQwenImageEdit
- このファミリー専用のnodeです。エンコーダー、VAE、画像、入力した指示を受け取り、コンディショニングを生成します。二つあり、一つは肯定的な指示用、もう一つは否定的な指示用です。バージョン2509以降では、nodeの名前はTextEncodeQwenImageEditPlusで、最大三枚の画像を受け付けます。
- ModelSamplingAuraFlowとCFGNorm
- 公式ワークフローであらかじめ設定された、デノイズ調整用の2つのノードです。そのうち1つには約3のシフト(shift)が設定されています。削除しないでください。これらがないと、画像が色あせたり、彩度が高くなりすぎたりします。
- KSampler、VAE Decode、Save Image
- 他のComfyUIワークフローと同様に、ノイズ除去、デコード、保存を行います。画像はoutputフォルダーに出力され、完全なワークフローがPNGに埋め込まれます。
最終的な画像の説明ではなく、指示としてプロンプトを書きます:「replace the text on the sign with OUVERT, keep the same font」「change the jacket to red leather, keep everything else」「remove the person on the left」。モデルは中国語と英語を優先的に理解します。フランス語もたいてい機能しますが、正確な指示では英語のほうが信頼性が高いままです。ネガティブプロンプトは空欄にするか、ごく短くしてください。
#ステップ4:設定と、高速化のためのLoRA Lightning
公式ワークフローは20ステップ、CFG 2,5、eulerサンプラー、simpleスケジューラーから始まります。これらは適切な出発点です。このモデルのCFGは設計上低く、SDXLのように7まで上げると、彩度が高すぎて歪んだ画像になります。まずseedを変えてバリエーションを作り、結果の精細さが足りない場合はステップ数を変更してください。
- 01LoRAなしの初版ワークフローをそのまま単純な画像に対して実行し、短い指示を与えてください。ターミナルを確認してください。初回の実行ではディスクから30 GBの重みをロードするため、数分かかることがあります。以降の実行では、メモリ上にあるものを再利用します。
- 02Lightning LoRAを追加するLoad Diffusion ModelとModelSamplingAuraFlowの間にnode LoraLoaderModelOnlyを挿入し、LoRA Lightning 4ステップ、強度1を選択します。KSamplerを4ステップ、CFGを1,0に設定してください。これらのLoRAはガイダンスなしで動作するように学習されています。ステップ数は五分の一になるため、同じ割合でノイズ除去時間も短縮されますが、細部やテキストの忠実度が低下する可能性があります。LoRAのリポジトリでは、その程度を数値化していません。
- 03比較用にシードを固定二つのプロンプト、または二つのモデルバリエーションを比較する前に、KSamplerを固定シードに設定してください。そうしないと、設定による違いだと思ったものが、実際にはランダム性によるものになります。
- 04複数の編集を連続して実行する複数回の処理で修正する場合は、出力画像を新しい入力として再読み込みしてください。各処理でVAEを通るため、細部が少し失われます。2~3回にとどめ、元画像を保存しておいてください。
#ステップ5:12~16 GBのGPUとMac向けGGUF版
ComfyUIはGGUFをネイティブには読み込めません。ComfyUI-Managerから利用するか、custom_nodesフォルダーにGitでクローンできるcity96のComfyUI-GGUF拡張機能が必要です。この拡張機能によって専用の読み込みノードが追加され、ファイルの整理方法は同じままです。
- 01量子化を選択する選択したGGUFリポジトリ、たとえばcity96/Qwen-Image-Edit-ggufやQuantStack/Qwen-Image-Edit-2509-GGUFでは、ページに各ファイルのサイズが一覧表示されています。目標解像度を差し引いた後のVRAMに約2 GBの余裕が残る、最も大きなものを選びます。16 GBならQ6_KまたはQ5_K_M、12 GBならQ4_K_Mです。LLMと同様、通常はQ4_K_Mが妥当なバランスです。Q3未満では、テキストや細部の品質が低下します。
- 02ファイルを配置する拡散モデルのGGUFはmodels/diffusion_modelsに配置します。拡張機能が読み込むmodels/unetにも配置できます。テキストエンコーダーとVAEは、ステップ1のものをsafetensors形式のまま使用します。
- 03ロードノードを置き換える公式ワークフローで Load Diffusion Model を削除し、その場所に Unet Loader (GGUF) を配置します。その model 出力を、以前のノードにつながっていた場所へ接続します。グラフの残りの部分は変わりません。TextEncodeQwenImageEdit、VAE、KSampler はすべて同じように動作します。
- 04エンコーダーをsafetensorsのまま保持するQwen2.5-VL 7BのGGUFは存在しますが、llama.cpp向けに生成されたものは対話用に設計されており、編集処理で入力画像を読み取るために必要なビジョン部分が必ずしも含まれていません。公式のqwen_2.5_vl_7b_fp8_scaled.safetensorsファイルを使えば、エラー原因を一つ排除できます。リポジトリがComfyUI-GGUFでのQwen-Image-Editとの互換性を明示している場合に限り、GGUFエンコーダーに切り替えてください。
Macでも同じ手順を適用できますが、違いは一つだけです。アクティビティモニタでメモリの圧迫状況を監視してください。ユニファイドメモリがあふれると、macOSがSSDに書き込み、エラーメッセージが表示されないまま、画像1枚あたりの処理時間が何倍も長くなります。
#Qwen-Image-Editでよくあるノードエラー
- 赤いノード:TextEncodeQwenImageEditまたはTextEncodeQwenImageEditPlusが見つかりません
- ComfyUIが古すぎます。これらのノードは拡張機能ではなくComfyUIのコアに含まれているため、どのマネージャーでも見つかりません。ComfyUIを更新して再起動してください。
- Prompt outputs failed validation, value not in list
- ロードノードで選択されているファイルが、想定されたフォルダーに存在しません。これは、ファイル名が手元のものと異なるダウンロード済みワークフローを開いたときに起こります。各ロードノードのドロップダウンメニューを開き直し、自分のファイルを選択してください。
- Load CLIPにqwen_imageタイプが表示されない
- 原因は同じです:2025年8月より前のComfyUIバージョンです。更新してください。
- デノイズ開始時のCUDA out of memory
- 重みがVRAMを超えており、オフロードでも不十分でした。順番に、出力解像度を下げ、より小さいGGUF量子化に切り替え、GPUを使用している他のアプリケーションを終了し、その後、VRAMの予約や動的VRAMの無効化など、インストールガイドで説明しているComfyUIのメモリオプションを試してください。
- 色付きのノイズ、または黒一色の出力画像
- 別系統のVAEまたはエンコーダー。Load VAEがqwen_image_vae.safetensorsを指し、Load CLIPがqwen_image型のQwen2.5-VLエンコーダーを指していることを確認してください。
- 画像は変更されていないか、ほとんど変更されていません
- 指示が曖昧か、LoRA LightningなしでCFGが1まで下がっています。LoRAなしならCFGを2.5に戻し、指示を直接的な命令に書き換え、画像がVAE EncodeだけでなくTextEncodeQwenImageEditノードにも正しく接続されていることを確認してください。
- 書き直されたテキストが誤っている、または読めない
- 指示の中で、必要なテキストを引用符で囲み、フォントを維持するよう指定してください。最も強い量子化であるQ2とQ3は、まずこの能力を損ないます。テキスト編集ではQ4またはFP8に戻してください。
- バージョン2509のワークフローは画像を一枚しか受け付けません
- 古いTextEncodeQwenImageEditノードを読み込んでいます。これをTextEncodeQwenImageEditPlusに置き換えてください。このノードではimage1、image2、image3の入力が公開されています。
- 拡張機能のインストール後にUnet Loader (GGUF)がない
- Pythonの依存関係がインストールされていないか、ComfyUIが再起動されていません。ComfyUIの環境で、拡張機能のrequirements.txtファイルに対してpip installを再実行し、その後再起動してください。起動時に、ターミナルには読み込まれた拡張機能の一覧と、インポートエラーがあればその内容が表示されます。
#さらに詳しく
- ComfyUIをインストールしてメモリオプションを理解する
- デスクトップ、ノートPC、または手動、モデルフォルダー、動的VRAM、コマンドラインオプション。https://quelllm.fr/guide/comfyui-installation-guide-debutant
- ローカルでの画像生成:全体像
- Mac 上の Stable Diffusion、Flux、ComfyUI、Draw Things:どのハードウェアにどの選択肢が適しているか。https://quelllm.fr/guide/generer-images-en-local-guide
- ControlNet:構図を自在に制御する
- ポーズ、輪郭、奥行き:Qwen-Image-Editのバージョン2509がネイティブに統合している機能を、Stable Diffusionで解説。https://quelllm.fr/guide/controlnet-guide-stable-diffusion
- VRAMとは何か、どれだけ必要か
- グラフィックカードのメモリを読み取り、RAMへのオフロードを理解し、カードを選ぶ。https://quelllm.fr/guide/vram-c-est-quoi-combien-pour-ia
- 公式ソース
- GitHubリポジトリQwenLM/Qwen-Image(バージョン一覧と日付)、Hugging FaceのQwen/Qwen-Image-Editページ(Apache 2.0ライセンス、Diffusersの例)、Comfy-Org/Qwen-Image-Edit_ComfyUIおよびComfy-Org/Qwen-Image_ComfyUIリポジトリ(FP8ファイル、サイズ)、docs.comfy.orgのQwen-ImageおよびQwen-Image-Editチュートリアル(ディレクトリ構成、ワークフロー)、github.com/city96/ComfyUI-GGUF拡張機能。
ご意見、誤りのご指摘、補足はありますか?ぜひお知らせください。皆さんにとってより良いガイドにするために役立ちます。