阿里巴巴 Qwen 团队于 9 月 20 日开源发布 Qwen-Image-2.1。该模型将文生图与图像编辑能力统一进单一架构,视觉生成部分采用 32 层 Single-Stream DiT 设计,仅 7B 参数。
Qwen-Image-2.1 原生支持 2K 分辨率输出、RGBA 透明通道生成与编辑,以及最多 10 张参考图输入。用户可通过圈选、涂抹或独立掩码指定编辑区域,强化人像与商品一致性。模型已同步接入 ComfyUI、Diffusers 与 vLLM-Omni,首日即获社区广泛支持。
在 Qwen-Image-Bench 评测中,该模型获得 60.28 分。混合粒度注意力与 KV Cache 复用机制使其在多图输入场景下的推理效率与显存开销均有显著改善。
【AICOR 点评】过去设计师需要多个专用模型拼接才能完成"出图+改字+抠透明"的完整管线,现在一个 7B 开源模型即可在本地消费级显卡上跑通。这不仅是技术收敛,更是生产力民主化——小团队和个人创作者首次能以零调用成本获得过去需要排队调用的商业级生图能力。AICOR 认为,AI 工具正在从"云端租赁"走向"本地拥有",这对企业数据安全和定制化需求是重大利好。
Copyright Notice This article is AI-assisted, rewritten from public reports. Copyright of the information belongs to the original authors and media; content is for industry sharing only and does not constitute investment or business advice.
For copyright concerns, contact AICOR (400-601-8080 / WeChat: aicor-ai); we will handle it promptly upon notification.