视觉生成部分仅7B参数,却在Qwen-Image-Bench公开评测中拿下60.28总分登顶开源第一,甚至超过闭源的Nano Banana 2.0(59.82)和GPT Image 1.5(59.65),官方将其定位为千问图像系列当前”最平衡、性价比最高”的开源生图模型。这一成绩表明,小参数量模型通过架构优化和数据策略同样能在关键指标上匹敌大模型,也反映出开源社区在图像生成领域的快速追赶速度。
视觉生成部分采用32层Single-Stream DiT,原生支持2K分辨率输出,整个管线(含Qwen3-VL 8B文本编码器)总参数量约16.22B。相比前代模型,Single-Stream架构在推理时延和显存占用上更优,更适合部署在消费级显卡上。
多图输入场景下的效率提升尤为明显,兼顾了推理速度与显存开销。实测表明,在处理多参考图片任务时,显存占用较同规模模型降低约15%,这对需要批量生成的商业应用来说是个重要利好。
原生RGBA透明图是本次更新最具实用价值的能力,模型可根据提示词自动决定输出普通图像还是带透明通道的图像,无需额外的抠图环节。这一机制依赖训练时对Alpha通道的专门建模,避免了传统后处理流程中的边缘毛刺问题。
输入一张RGB真实照片,模型可提取主体输出带Alpha通道的RGBA图层,毛发边缘这类传统抠图痛点从根源上被绕开。该能力直接适用于电商产品图制作、用户头像合成等场景,减少了设计师手动调整的工作量。
人像与商品保真增强,修图前后面部特征保持高度一致,商品在新场景中文字、纹理与形态不走样;同时覆盖全景图、信息图、分镜图等多种任务类型。从评测数据看,人像一致性得分提升了约8%,说明模型在细节保留上做了针对性优化。
文字生成除内容准确外,更注重字体、排版与画面的整体协调;人物表现上强化光影与细节刻画,让生成结果更接近真实质感。这得益于训练集中增加了大量高分辨率商业素材,使模型学会了更精细的纹理映射。
综合来看,Qwen-Image-2.1在保持轻量级的同时,通过透明通道、多图参考、高保真人像等特性,补齐了开源生图模型在实用场景中的关键短板。其开源策略也降低了开发者集成门槛,未来有望催生更多垂直领域的定制化应用。









