在大模型竞赛蔓延至3D空间的当下,李飞飞团队交出了一份极具分量的答卷。World Labs正式推出的Atlas,宣称是全球首个多模态世界模型,其核心突破在于将像素级相机控制与3D空间重建融为一体——这与当前主流的视频生成模型有着本质区别。相比Sora等只能生成二维视角的模型,Atlas真正让AI拥有了对三维世界的“操控力”。
被誉为“AI教母”的李飞飞创办的World Labs,近日正式发布了这一模型。Atlas最大的亮点是:通过单张或几张输入图像,即可生成具有像素级精确相机控制的图像和视频帧,并且在3D空间内完美重建。这种能力使得用户能够像在电影《黑客帝国》中那样实现“子弹时间”效果,甚至生成清晰的三维模型。
Atlas从零开始预训练,能够无缝接收包括相机运动在内的多模态输入,并转换为立体3D视图。通过将多个输入视图精确定位到模型的空间上下文中,用户可以实现绝对控制下的生成,轻松复现好莱坞级别的拍摄手法。此外,它还能从单张或多张图像输出清晰的3D模型,在重建质量上超越了众多顶尖的开源重建模型。

具体工作机制上,Atlas根据用户指定的任意相机位置和角度,生成一张或多张与原始内容及几何形状完美匹配的参考图像,实现场景的平滑扩展,并自主想象和填充输入中不可见的场景细节。官方介绍称,它能自动补全被遮挡的部分,生成连贯的3D场景,这在以往的世界模型或NeRF方法中是很难做到的。
据官方介绍,Atlas可胜任世界生成、重建和模拟等广泛任务。首先,在相机控制生成方面,它可从单张或多张图像输出高达1440p分辨率、最长1分钟的高清视频,且像素级精确控制。其次,在空间重建方面,不仅能够从几十张输入图像重建真实场景,还能从新视角生成图像帧并提供显式3D输出。此外,模型还支持时空模拟功能,通过输入视频建模空间和时间,重组视频以增强戏剧视觉效果,并支持机器人的真实到模拟工作流。同时,它还支持从文本生成图像和360度全景图,精确遵循复杂提示,渲染文字和呈现各种视觉风格。
目前,World Labs表示部分合作伙伴已获得早期访问权,并计划在未来几周内向更广泛的早期用户开放。这一节奏与许多前沿AI模型类似——先小范围验证,再逐步扩大。
总体来看,Atlas的出现标志着世界模型从概念走向了实用。它解决了传统视频生成模型缺乏3D一致性和相机控制的关键痛点,为影视制作、游戏开发、机器人仿真等领域提供了全新工具。但值得注意的是,当前模型仍处于早期阶段,其生成质量和计算效率还有待市场验证。不过,由李飞飞领衔的World Labs团队,拥有世界级计算机视觉和AI研究背景,这一突破无疑将加速3D生成式AI的落地进程。