全球首个多模态世界模型图谱,像素级镜头控制捕捉子弹时间

在大模型竞赛蔓延至3D空间的当下,李飞飞团队交出了一份极具分量的答卷。World Labs正式推出的Atlas,宣称是全球首个多模态世界模型,其核心突破在于将像素级相机控制与3D空间重建融为一体——这与当前主流的视频生成模型有着本质区别。相比Sora等只能生成二维视角的模型,Atlas真正让AI拥有了对三维世界的“操控力”。

被誉为“AI教母”的李飞飞创办的World Labs,近日正式发布了这一模型。Atlas最大的亮点是:通过单张或几张输入图像,即可生成具有像素级精确相机控制的图像和视频帧,并且在3D空间内完美重建。这种能力使得用户能够像在电影《黑客帝国》中那样实现“子弹时间”效果,甚至生成清晰的三维模型。

Atlas从零开始预训练,能够无缝接收包括相机运动在内的多模态输入,并转换为立体3D视图。通过将多个输入视图精确定位到模型的空间上下文中,用户可以实现绝对控制下的生成,轻松复现好莱坞级别的拍摄手法。此外,它还能从单张或多张图像输出清晰的3D模型,在重建质量上超越了众多顶尖的开源重建模型。

image.png

具体工作机制上,Atlas根据用户指定的任意相机位置和角度,生成一张或多张与原始内容及几何形状完美匹配的参考图像,实现场景的平滑扩展,并自主想象和填充输入中不可见的场景细节。官方介绍称,它能自动补全被遮挡的部分,生成连贯的3D场景,这在以往的世界模型或NeRF方法中是很难做到的。

据官方介绍,Atlas可胜任世界生成、重建和模拟等广泛任务。首先,在相机控制生成方面,它可从单张或多张图像输出高达1440p分辨率、最长1分钟的高清视频,且像素级精确控制。其次,在空间重建方面,不仅能够从几十张输入图像重建真实场景,还能从新视角生成图像帧并提供显式3D输出。此外,模型还支持时空模拟功能,通过输入视频建模空间和时间,重组视频以增强戏剧视觉效果,并支持机器人的真实到模拟工作流。同时,它还支持从文本生成图像和360度全景图,精确遵循复杂提示,渲染文字和呈现各种视觉风格。

目前,World Labs表示部分合作伙伴已获得早期访问权,并计划在未来几周内向更广泛的早期用户开放。这一节奏与许多前沿AI模型类似——先小范围验证,再逐步扩大。

总体来看,Atlas的出现标志着世界模型从概念走向了实用。它解决了传统视频生成模型缺乏3D一致性和相机控制的关键痛点,为影视制作、游戏开发、机器人仿真等领域提供了全新工具。但值得注意的是,当前模型仍处于早期阶段,其生成质量和计算效率还有待市场验证。不过,由李飞飞领衔的World Labs团队,拥有世界级计算机视觉和AI研究背景,这一突破无疑将加速3D生成式AI的落地进程。

免责声明:本网站内容主要来自原创、合作伙伴供稿和第三方自媒体作者投稿,凡在本网站出现的信息,均仅供参考。本网站将尽力确保所提供信息的准确性及可靠性,但不保证有关资料的准确性及可靠性,读者在使用前请进一步核实,并对任何自主决定的行为负责。本网站对有关资料所引致的错误、不确或遗漏,概不负任何法律责任。任何单位或个人认为本网站中的网页或链接内容可能涉嫌侵犯其知识产权或存在不实内容时,可联系本站进行审核删除。
(0)
AI快讯网编辑-青青AI快讯网编辑-青青
旅客执意下机致航班二次延误,多人中转泡汤,海航拒赔
上一篇 1小时前
首发玄戒O3!雷军展示小米18 Fold真机
下一篇 4分钟前

相关推荐

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注