Qwen-Image-2.1のGGUF化モデルがComfyUIでローカル画像生成に対応
25秒でわかる内容解説
Qwen Researchが公開した画像生成モデルをabenzerpsがGGUF形式に量子化し、Hugging Faceで配布を開始した。ComfyUIとの連携により、ローカル環境でのテキストから画像生成が可能になった。テキストエンコーダーをシステムRAMにオフロードできる設計のため、VRAMの消費を大幅に抑えられる。中低スペックのGPUを搭載したPCでも高品質な画像を生成できる環境が整った。
量子化ファイルの提供とComfyUIでの設定
Qwen Researchが公開した画像生成モデルをabenzerpsがGGUF形式に量子化した。GGUFはllm.cppやComfyUI-GGUFなどで使用されるローカル推論向けのモデルファイル形式である。提供される量子化ファイルは5種類で、サイズは4.05GBから7.59GBまで異なる。Q4_K_M量子化版が推奨され、容量と画質のバランスが最適とされる。
ComfyUIでの動作にはleejetがメンテナンスするComfyUI-GGUFノードの導入が必須だ。DiffusionモデルにはUnet Loader (GGUF)ノードを割り当てる。テキストエンコーダーにはCLIPLoaderノードを、VAEには標準のVAELoaderノードを使用する。公式のワークフローテンプレートも提供されており、UNetLoaderノードを置き換えるだけで動作する。
旧版city96/ComfyUI-GGUFを使用している場合は、Unknown model architectureエラーが発生する可能性がある。テキストエンコーダーにはBF16版とInt8版が用意される。BF16版は17.53GB、Int8版は9.35GBの容量を持つ。
VAEファイルは676MBでbf16形式だ。これらをComfyUIのmodelsディレクトリに配置する。各ファイルはdiffusion_models、text_encoders、vaeフォルダに格納する。
Comfy-Orgが提供するText-to-ImageとImage Editのテンプレートが公開されている。ユーザーはこれらのJSONファイルをローカル環境に合わせてカスタマイズして使用している。
| 量子化 | ファイルサイズ |
|---|---|
| Q8_0 | 7.59 GB |
| Q6_K | 5.88 GB |
| Q5_K_M | 5.22 GB |
| Q4_K_M | 4.60 GB |
| Q4_0 | 4.05 GB |
VRAM節約設計と低メモリ環境での動作
画像生成においてGPUのメモリ容量は動作の可否を左右する。VRAMはGPUが画像生成モデルを読み込み処理する際に使用するグラフィック専用メモリである。本モデルはテキストエンコーダーの処理をシステムRAMにオフロードする設計を採用している。テキストエンコーディングはプロンプトごとに一度だけ実行されるため、VRAMの9〜17GBを節約できる。オフロードによる生成速度の低下はほぼない。
安全フィルターを内蔵しないため、プロンプト次第でNSFW画像を直接生成する。VRAMが不足する環境では、ComfyUI起動引数に--lowvramを指定することでメモリ使用量を調整できる。推奨構成ではDiffusionモデルにQ4_K_Mを、テキストエンコーダーにInt8版を割り当てる。
この組み合わせによりVRAM使用量を4.6GBに抑えられる。テキストエンコーダーはRAMに9.35GBを消費するが、速度への影響は virtually zeroだ。
ソースリビジョンはb3179ad3で、stable-diffusion.cppのコミット1330cebaを基に量子化が実施された。ライセンスはQwen Research Licenseだ。テキストエンコーダーのInt8版はconvrot形式を採用している。SHA256SUMSファイルによりファイルの整合性が確認できる。
ベンチマーク結果とローカルAIコミュニティの反応
リポジトリにはQwen-Image-2.1のベンチマーク結果が掲載されている。下の画像では、画像生成モデルの動作負荷に直結するVRAMの消費量と生成速度の推移がグラフで確認できる。
コミュニティからはまだ具体的なコメントは寄せられていないが、ComfyUIユーザーの間で設定ファイルの共有が進んでいる。日本ではローカルAI愛好家がComfyUIを標準的なワークフローとして利用している。パイプラインタグはtext-to-imageに設定され、ggufタグが付けられている。
テキストエンコーダーをRAMに預ける設定により、従来のフルロード方式と比較してメモリ使用量が大幅に削減される。横軸にステップ数、縦軸にメモリ使用量と速度が取られたデータが確認できる。ローカル環境での実測値が反映されており、Q4_K_MとQ8_0の差も視覚化されている。
日本技術者の間では、ComfyUI-GGUFノードのインストールとワークフロー展開が主流だ。Comfy-Orgが提供するText-to-ImageとImage Editのテンプレートも公開されている。ユーザーはこれらのテンプレートをローカル環境に合わせてカスタマイズしている。
uncensored版の追加予定とライセンス
完全なuncensored版が現在開発中で、近日中にリポジトリに追加される予定である。開発元のabenzerpsは、安全フィルターを完全に除去したモデルファイルの公開を明言している。この版の追加により、プロンプト拒否やモザイク処理のない画像生成が定常的に可能になる。2026年9月21日に公開された本モデルは、Qwen Research Licenseの下で配布されている。
ソースリビジョンはb3179ad3で、stable-diffusion.cppのコミット1330cebaを基に量子化が実施された。近日中にuncensored版が追加され、ローカル推論の選択肢がさらに広がる。リポジトリ上部のNotice欄に開発状況が記載されている。base_model_relationにはquantizedが設定されている。
テキストエンコーダーのBF16版は17.53GB、Int8版は9.35GBの容量を持つ。VAEはqwen_image_2.1_vae_bf16.safetensorsとして配布される。近日中にuncensored版が追加され、ローカル推論の選択肢がさらに広がる。
用語の注釈
- GGUF
- AIモデルの重みや実行情報を保存するファイル形式。llama.cppやComfyUIなどのローカル推論環境でモデルを高速に読み込むために使用される。(参考:GGUF量子化ってなんだ?〜ローカルLLMを爆速で動かすための ...)
- VRAM
- GPUが画像生成モデルを読み込み処理する際に使用するグラフィック専用メモリ。容量が大きいほど負荷の高いローカル推論を安定して実行できる。(参考:VRAM(GPUメモリ)とは?不足時の症状や使用量の確認方法 ...)
出典
- abenzerps/Qwen-Image-2.1-GGUF (text-to-image)(Hugging Face trending) · 議論