AI AI工具情报站
模型动态Qwen:Blog Retrieval(API)

7B 统一生成与编辑并原生支持透明图像

📰 Qwen:Blog Retrieval(API)📅 2026-09-20T12:00:00.000Z

核心亮点

Qwen 团队公开了 Qwen-Image-2.1 的代码并允许免费使用,把文生图与图像编辑统一进同一个模型。它的视觉生成组件只有 7B 参数,却原生支持生成和编辑透明图像——也就是能直接产出带 alpha 通道的素材,而不必事后抠图。对一个开源图像模型来说,"统一+透明+轻量"这三点叠在一起,定位相当清晰。

具体能力

模型支持最多 10 张参考图,可以用圆形、涂鸦或独立蒙版来指定局部区域进行编辑。通过混合粒度注意力(mixed-granularity attention)架构和 KV cache 复用,推理效率得到提升。在质量控制上,这一版改进了文字渲染、人像光照,以及人物与产品的保真度,并覆盖了全景图、信息图和分镜等任务类型,适用面比单纯出图要宽。

技术细节

"统一生成与编辑"的关键,是让模型在同一套表征里学会画和改,避免两套权重之间的风格漂移。混合粒度注意力让模型既能把握全局构图,又能盯住局部细节;KV cache 复用则减少重复计算,对长参考图、多轮编辑尤其有用。原生透明通道意味着 alpha 信息是模型直接生成的,边界质量通常好过后处理抠图,对贴纸、Logo、商品图这类需求很实用。

与竞品对比

对比 Flux 和 SDXL,Qwen-Image-2.1 不主打极致写实,而是用"一个模型干两件事+原生透明"切入。Flux 质感强但生成与编辑割裂,SDXL 生态成熟但透明输出要靠后处理。Qwen 这版的差异化在于工作流整合:参考图多、蒙版灵活、透明原生,正好契合以图改图的真实生产场景,而不是比谁的单张图更惊艳。

行业影响

7B 的体量加上开放权重,意味着社区可以在消费级显卡上微调、做 LoRA、固化风格,门槛被进一步压低。说白了,当"出图+修图+透明"都能在一个轻量开源模型里完成时,中小团队做电商素材、社媒视觉和分镜预览的成本会明显下降。配套支持 ComfyUI 后,这套模型真正接进了最活跃的创作者工作流。

对创作者而言,一个能本地跑、能抠透明图、能接 ComfyUI 的开源模型,意味着从出图到成片的链路被显著缩短;对选型者,这也降低了在多个图像模型间试错与切换的边际成本。