7B小模型超越闭源 千问图像2.1开源 原生透明图 最多10张参考图

视觉生成部分仅7B参数,却在Qwen-Image-Bench公开评测中拿下60.28总分登顶开源第一,甚至超过闭源的Nano Banana 2.0(59.82)和GPT Image 1.5(59.65),官方将其定位为千问图像系列当前”最平衡、性价比最高”的开源生图模型。这一成绩表明,小参数量模型通过架构优化和数据策略同样能在关键指标上匹敌大模型,也反映出开源社区在图像生成领域的快速追赶速度。

7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图

视觉生成部分采用32层Single-Stream DiT,原生支持2K分辨率输出,整个管线(含Qwen3-VL 8B文本编码器)总参数量约16.22B。相比前代模型,Single-Stream架构在推理时延和显存占用上更优,更适合部署在消费级显卡上。

多图输入场景下的效率提升尤为明显,兼顾了推理速度与显存开销。实测表明,在处理多参考图片任务时,显存占用较同规模模型降低约15%,这对需要批量生成的商业应用来说是个重要利好。

7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图

原生RGBA透明图是本次更新最具实用价值的能力,模型可根据提示词自动决定输出普通图像还是带透明通道的图像,无需额外的抠图环节。这一机制依赖训练时对Alpha通道的专门建模,避免了传统后处理流程中的边缘毛刺问题。

7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图

输入一张RGB真实照片,模型可提取主体输出带Alpha通道的RGBA图层,毛发边缘这类传统抠图痛点从根源上被绕开。该能力直接适用于电商产品图制作、用户头像合成等场景,减少了设计师手动调整的工作量。

7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图

人像与商品保真增强,修图前后面部特征保持高度一致,商品在新场景中文字、纹理与形态不走样;同时覆盖全景图、信息图、分镜图等多种任务类型。从评测数据看,人像一致性得分提升了约8%,说明模型在细节保留上做了针对性优化。

文字生成除内容准确外,更注重字体、排版与画面的整体协调;人物表现上强化光影与细节刻画,让生成结果更接近真实质感。这得益于训练集中增加了大量高分辨率商业素材,使模型学会了更精细的纹理映射。

7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图

7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图

7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图

7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图

7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图

7B小模型超越闭源!千问Qwen-Image-2.1开源:原生透明图 最多10张参考图

综合来看,Qwen-Image-2.1在保持轻量级的同时,通过透明通道、多图参考、高保真人像等特性,补齐了开源生图模型在实用场景中的关键短板。其开源策略也降低了开发者集成门槛,未来有望催生更多垂直领域的定制化应用。

免责声明:本网站内容主要来自原创、合作伙伴供稿和第三方自媒体作者投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。任何单位或个人认为本网站中的网页或链接内容可能涉嫌侵犯其知识产权或存在不实内容时,可联系本站进行审核删除。
(0)
AI 怪盗团AI 怪盗团
顺风车乱象:司机超载将两名高中女孩扔路边
上一篇 1天前
西贝被曝两三个月倒闭,高管回应称键盘侠
下一篇 1天前

相关推荐

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注