资讯详情

资讯详情

开源大模型追踪:Qwen-Image-2.1 :7B 视觉生成模型开源榜登顶 60.28,原生 RGBA 透明出图

Qwen-Image-2.1 是阿里巴巴 Qwen 团队于 2026-09-20 开源的图像生成与编辑一体化模型视觉生成部分为一个 7B 参数的 32 层单流 DiT搭配 Qwen3-VL 8B 文本编码器与 64 通道 RGBA VAE。BF16 全量权重约 33GBINT8 量化栈可压到约 14GBUnsloth 的 Q4_K_M GGUF 甚至能在 12GB 显存上跑通vLLM-Omni 在 1024² 40 步下实测约 3.3–4.5 秒/张厂商数据。它最大亮点是原生 RGBA 透明出图与最多 10 张参考图编辑在 Qwen 自建开源榜拿到 60.28 分同级第一梯队。需要本地可控出图、透明素材、商品合成的设计与算法团队。需注意它采用 Qwen Research License仅研究/评估非商用与历代 Apache 2.0 的 Qwen-Image 不同商用需向阿里单独申请。一、模型速览项目说明发布方阿里巴巴 Qwen 团队发布时间2026-09-20本周新发开源权重上架 HF ModelScope架构7B 单流 DiT32 层 Qwen3-VL 8B 文本编码器 64 通道 RGBA VAE16× 空间压缩能力文生图、图像编辑、最多 10 张参考图合成、原生 RGBA 透明出图分辨率原生 2K2048×2048支持 7 种比例含 16:9 的 2752×1536许可证Qwen Research License仅研究/评估非商用商用需向阿里单独申请权重体积BF16 全量约 33GBINT8 栈约 14GBQ4_K_M GGUF 约 4.2GB仅 DiT一句话它把生成 编辑 透明塞进一个 7B 检查点是把上代 20B MMDiT 砍到三分之一体量、却补齐原生透明通道的瘦身旗舰。它与本专栏 8/25 写过的 SenseNova U1.5 Lite理解生图编辑三合一路线相似但 Qwen-Image-2.1 是纯视觉生成模型、参数更小、且原生 RGBA——对透明贴纸 / 图层合成这类设计苦活是直接利好不像通用多模态模型要靠后期抠图。数据来源Qwen/Qwen-Image-2.1 模型卡 QwenLM GitHub README。关键提醒前代 Qwen-Image 1.0 / Edit / 2512 全部 Apache 2.02.1 改为研究许可这是本周开源图像模型里最该先读清楚的一条。二、核心亮点为什么 2.1 值得本地跑1. 体量砍三分之二能力不降反补。上代 Qwen-Image 1.0 是 20B MMDiT、BF16 单 DiT 就 40.9GB2.1 的视觉 DiT 仅 7B14.2GB BF1632 层单流整包含 8B 编码器 VAE约 33GB。7B这个 headline 数字其实只算生成器真正吃显存的大头是 Qwen3-VL 8B 文本编码器17.5GB BF16——它既读提示词又编码参考图没有独立图像编码器。所以容量规划要对着7B 8B算而不是对着 7B 算来源PacketNebula 拆解。2. 原生 RGBA抠图步骤直接消失。64 通道 VAE 在生成管线上就带 alpha 通道出图即透明 PNG编辑时也能保留透明、把照片主体提进透明层再复用。官方推荐的提示词约定是This is an RGBA image with transparency. ... The image has alpha channel and the background is transparent. 对贴纸、图标、电商抠图这类高频活这一步能去掉最常见的毛边来源来源模型卡 / saascity 指南。3. 一次调用吃 10 张参考图做局部编辑。编辑支持圆形、手绘标记或独立 mask 圈定区域多参考图场景下条件图像与文本只需编码一次、在去噪步间复用前缀 KV cachemixed-granularity attention prefix KV-cache reuse降低重复计算。模型卡给出的样例包括6 张人像拼合群像5 张参考图组装穿搭来源官方示例 / aicybr。4. 日零生态 一个必须警惕的许可坑。DiffusersQwenImage21PipelinePR#14804、ComfyUIPR#16400、vLLM-Omni、SGLang-Diffusion、LightX2V、stable-diffusion.cpp 均在发布当天给出支持。但许可证从 Apache 2.0 退回 Qwen Research License——research or evaluation purposes only产品化需向阿里申请商业许可首批 14 个社区微调衍生权重同样受该条款约束。这意味着能下载≠能上线部署前先谈许可别等上线才发现来源dev.to / pondero / saascity。三、部署实战两条可运行链路环境准备Diffusers 路线最通用需源码版 diffuserspip install --upgrade torch2.4.0 transformers5.17 accelerate pillow pip install githttps://github.com/huggingface/diffusers推理代码文生图 原生 RGBA 透明 PNGimport torch from diffusers import QwenImage21Pipeline ​ # 1. 加载 BF16 权重首次会自动下载约 33GB pipe QwenImage21Pipeline.from_pretrained( Qwen/Qwen-Image-2.1, torch_dtypetorch.bfloat16 ) # 2. 24GB 消费级显卡靠 CPU 卸载跑通显存足可去掉此行 pipe.enable_model_cpu_offload() ​ # 3. 按官方约定写 RGBA 提示词否则背景不透明 prompt ( This is an RGBA image with transparency. 一个扁平矢量风格的深色咖啡杯吉祥物贴纸粗描边柔和投影。 The image has alpha channel and the background is transparent. ) # 4. 原生 2K默认 40 步、不带 classifier-free guidance image pipe( promptprompt, width2048, height2048, num_inference_steps40, generatortorch.Generator(cuda).manual_seed(42), ).images[0] image.save(sticker_rgba.png) # 直接存为透明 PNG效果验证计时 峰值显存自检复制即跑import torch, time from diffusers import QwenImage21Pipeline ​ pipe QwenImage21Pipeline.from_pretrained( Qwen/Qwen-Image-2.1, torch_dtypetorch.bfloat16 ) pipe.enable_model_cpu_offload() ​ t0 time.time() img pipe( prompt一只戴宇航头盔的柴犬写实摄影风格背景纯净, width1024, height1024, num_inference_steps40, generatortorch.Generator(cuda).manual_seed(1), ).images[0] img.save(verify.png) print(f耗时 {time.time()-t0:.1f}s | 峰值显存 {torch.cuda.max_memory_allocated()/1e9:.1f}GB)备选链路低显存 GGUF12GB 卡可跑# 用 stable-diffusion.cppllama.cpp 的扩散兄弟项目跑量化版无需 CUDA # DiT: leejet/Qwen-Image-2.1-GGUFQ2_K 2.6GB ~ Q8_0 7.7GB推荐 Q4_K_M 约 4.2GB # 编码器: Qwen/Qwen3-VL-8B-Instruct-GGUFQ4_K_M 约 5GB # VAE: Comfy-Org/Qwen-Image-2.1 的 vae_bf16.safetensors约 0.68GB sd-cli --diffusion-model qwen-image-2.1-Q4_K_M.gguf \ --vae qwen_image_2.1_vae_bf16.safetensors \ --llm Qwen3VL-8B-Instruct-Q4_K_M.gguf \ -p 一个卡通树懒吉祥物在挥手扁平矢量插画明亮色彩 \ --steps 20 --cfg-scale 6.0 --sampling-method euler -W 1024 -H 1024 -o out.png说明以上来自 Qwen 官方 Quickstart、Diffusers PR#14804 与 leejet/stable-diffusion.cpp 文档enable_model_cpu_offload()是官方为显存受限 GPU 提供的选项。多参考图编辑走同一 pipeline 的image入参最多 10 张具体参数名以最新 diffusers 源码为准。本机无 GPU未做实测请读者按自有硬件验证速度与显存。四、性能测评同级模型怎么选模型生成组件许可证原生 RGBA最大分辨率显存(BF16)开源榜(Qwen-Image-Bench)Qwen-Image-2.17B DiT 8B TEQwen Research(非商用)支持2K(2048²)~33GB 全量 / ~14GB INT860.2829 款中第 7Qwen-Image 1.020B MMDiTApache 2.0不支持1K~41GB—FLUX.1-dev12BApache 2.0(非商用)不支持1M px~24GB—Nano Banana 2.0闭源对照—闭源 API不支持——59.82数据来源Qwen-Image-Bench 为阿里自建基准29 款模型vendor 自测非第三方审计Nano Banana 2.0 / GPT Image 1.5(59.65) / GPT Image 2.5 Sunburst(67.01) 为闭源对照仅作方向参考。生成质量看三个维度出图速度——vLLM-Omni 在 1024² / 40 步 / 单张数据中心 GPU / BF16 下实测约 3.3–4.5 秒/张来源vLLM-Omni recipe / PacketNebula厂商称 2K 10 参考图编辑约 1.59 秒CellCog 引用vendor 口径stable-diffusion.cpp 在 AMD iGPU 上约 20 分钟/张1024²、20 步社区数据显存——BF16 全量约 33GB含 8B 编码器INT8 栈约 14GBUnsloth Q4_K_M GGUF 可在 12GB 卡跑通有用户报告 16GB 卡开 offload 峰值约 13.9GB单一数据点待复现生成质量——Qwen-Image-Bench 60.28 排在 29 款中第 7领先同档开源 Nano Banana 2.0(59.82) 与 GPT Image 1.5(59.65)但落后闭源 GPT Image 2.5 Sunburst(67.01)。它的长板在透明 多参考编辑 中文/长文本渲染这些是设计流水线的真实痛点而非单纯美学跑分。为什么 RGBA 是这次最该关注的点因为传统出图后还要接一步抠图/去背而抠图恰恰是毛边、锯齿、半透明丢失的高发区。Qwen-Image-2.1 把 alpha 做到生成管线里贴纸、图标、商品图层能直接产出可用素材——对设计岗是省掉一个易错环节对算法岗是少维护一条后处理链路。数据口径提醒Qwen-Image-Bench 为厂商自建基准目前无独立第三方复测分数作方向性参考出图速度除 vLLM-Omni 的 3.3–4.5s 为 recipe 实测外其余为厂商/社区口径且标注来源本文未做本机实测显存与速度请读者按硬件自查。Qwen-Image-2.1 是本周最值得本地试的图像开源权重——7B 体量 原生 RGBA 日零生态把设计可用往前推了一步但研究许可是它的硬约束原型、评估、内部研究随便用凡涉及商用上线先向阿里申请商业许可别把能下载误当成能发布。五、使用建议部署档位速查12–16GB 显卡Unsloth / leejet 的 Q4_K_M GGUFDiT ~4.2GB 编码器 ~5GB stable-diffusion.cpp 或 ComfyUI开 offload24GB 单卡BF16 全量 enable_model_cpu_offload()Diffusers 直跑 2K多卡 / 集群vLLM-Omni 或 SGLang-Diffusion走/v1/images/generationsOpenAI 兼容接口FP8 张量并行提吞吐Mac / 无独显stable-diffusion.cpp Vulkan 版AMD/Intel 核显或 M 系芯片全精度峰值约 31GB 内存适用场景透明贴纸/图标/图层素材生成电商多参考图合成与局部改款需要中文/长文本渲染的 poster、信息图研究评估与内部原型。不适用场景任何未获阿里商业许可的产品化部署研究许可禁止追求闭源榜首画质GPT Image 2.5 Sunburst 67.01 仍领先需要视频生成它是图像模型不含视频。调优提示① 透明图务必在提示词写明 RGBA 约定句式否则背景不透明② 显存吃紧先量化 8B 编码器INT8/W4A8 收益最大③ 默认 40 步、CFG 可关加true_cfg_scale1会近似翻倍单步计算④ 多参考编辑用 mask/手绘圈定区域比整图重绘更稳。
觉得有用,分享给同行:

为您的企业打造数字门面

稳重轻奢商务风格,端正雅致视觉,长效耐看不易过时。

立即咨询 →