AI生图赛道又掀起新一轮军备竞赛。就在大家还在纠结“画手”和“文字乱码”的时候,xAI直接放出了大招——Imagine Image 2.0。这次不是小修小补,而是直接把矛头指向了AI生图最致命的三个短板:可控布局、字体渲染、视觉一致性。从产品定位来看,xAI显然想让Grok的生图能力从“娱乐玩具”升级为“生产力工具”。
xAI正式发布了Imagine Image 2.0,这是基于Web版Imagine服务以及Grok的iOS和Android应用推出的一种全新质量模式。它的重点场景非常明确:需要可控布局、清晰字体和一致视觉元素的创意工作流。不过,别急着用API去薅羊毛——目前模型对应的API访问计划还在开发当中,尚未正式对外开放。
xAI官方表示,Image 2.0具备理解复杂指令的能力,能够在密集布局中完成字体与版式规划,同时保持小字号文本的清晰可读。换句话说,以前AI生成海报上的文字经常“糊成一团”或“缺胳膊少腿”,这次官方是把文字渲染当成了头号攻坚目标。

更值得关注的是多轮生成与编辑能力。Image 2.0支持在同一会话中反复调整,并且能在多次修改后依然保留用户指定的视觉元素。配合魔棒和分割功能,用户可以精准选中图像中的特定区域做局部修改,而不会影响画面其他部分。此外,它还支持一键移除背景、导出透明图像,最高支持一次性融合五张参考图像生成单一画面。这个能力对需要大量素材合成的设计师来说,确实能省下不少手工操作的功夫。
除了编辑,Image 2.0还加入了一项智能尺寸扩展功能。它可以将图像扩展至指定画幅尺寸,支持从1:2到9:16的宽高比,也兼容方形、横向以及2:1格式。这意味着同一张主视觉可以快速适配不同平台的投放需求,免去了反复裁图重排的麻烦。
xAI还顺带引入了一组模板工作流,专门针对重复性较高的创意任务,覆盖照片修图、产品换色、电商配图、职业头像、图标、角色精灵、表情包和产品设计等场景。在视频规划场景中,相关模板还能帮助用户分别生成角色、场景和道具,并保持一致的视觉风格,从而构建出一个连续且不跳戏的内容世界。
客观来看,Image 2.0这次的方向抓得很准:AI生图要从“能看”走向“能用”,就必须解决可控性和一致性问题。尤其在企业级应用和商业设计场景中,字体不乱、布局不崩、角色不“换脸”,比单纯生成一张“惊艳但没法用”的图重要得多。不过需要泼一盆冷水的是,目前API还没开放,实际生成效果是否真如官方演示那般稳定,仍需等待更多真实用户的验证。AI生图这局棋,xAI已经落下关键一子,但距离彻底改写创作流程,还有一段路要走。