业界对于“AI原生操作系统”的想象,终于有了一个具体的雏形。日前,Runway正式发布了其全新“界面世界模型”系列的首个核心模型——Solaris。这套系统宣告了一个重要转折:软件与网页的界面,将不再依赖预先写死的代码和固定的框架,而是像电影一样,在你使用的每一帧,实时渲染出整个图形用户界面。
这背后其实是AI从“大脑”进化为“双手与双眼”的过程。长期以来,数字世界存在一条分界线:一边是“懂得事情”的AI助手(如大模型和搜索引擎,擅长提供文本、图片等静态内容),另一边是“实时响应”的传统程序(如游戏引擎和前端代码,擅长渲染动态效果,但对你的任务意图一无所知)。结果就是,操作系统与应用程序之间的每一次交互,都必须通过代码或中间表示来显式定义,这不仅牺牲了视觉表达的丰富性,更严重“有损压缩”了我们与机器的交互操作空间。

Solaris这一次的核心突破,在于它捏碎了渲染与交互之间的那层玻璃。它不再需要一个中间的代码层来做翻译,而是直接将每一帧作为一个完整的世界模型生成,并对每一次用户输入提供即时、连贯的动态响应。这意味着,当你浏览一个虚拟服装店时,可以直接像在现实中一样,用自己的照片当模特,把衣架上的衣服“拽”到身上;或者通过一句简单的语音指令,让餐桌椅的位置、物体的颜色随着光线实时演变。这种开放式的沉浸体验,让软件变得像活的场景,而不是一堆冷冰冰的脚本。
这种革命性技术的实现,依赖于其底层架构的硬核创新。Solaris建立在Runway的Gen-4.5视频生成模型之上,并在速度、连贯性和成本控制三个关键维度上实现了突破。首先,它通过自回归生成机制和多步去噪蒸馏技术,将原本数秒甚至分钟级的视频生成过程,压缩成与人机交互节奏匹配的实时运算。其次,它采用大语言模型与世界模型的协同架构:大模型负责翻译用户意图并引导场景演进,世界模型则专职处理实时的视觉渲染。最后,通过对快速模型的持续化训练,模型在保持长会话和多步交互连贯性的同时,大幅降低了推理成本。
在客观的学术与用户评测中,Solaris展现出了独特的优势。在多模态大模型仅凭截图还原界面能力的基准测试中,研究发现传统翻译方法会随着视觉复杂性增加而不可避免地丢失细节,而Solaris从第一帧开始就完美保留了界面的视觉与语义状态。在涉及超过7500对对比的用户研究中,参与者在“准确遵循指令”和“行为自然”两个方面对Solaris的偏好分别达到了61%和71%,远超传统编码界面孤立更新UI的表现。
当然,作为前沿探索,Solaris也面临一些需要攻克的难点。例如,高精度的实时文字生成目前仍是视频生成领域的一大挑战;在长期开放式交互下保持视觉与语义一致性,也还需要进一步优化;同时,它还需解决与现有屏幕阅读器及无障碍API的对接问题。
尽管还有这些问题,但界面世界模型的到来,已经勾勒出了下一代计算平台的初始形态。它有可能彻底消灭传统“应用”的边界,让软件能够根据用户当下的意图,动态地重塑自身,从而根本性地改变我们与数字世界的连接方式。目前,Runway已经对这一模型开放了早期访问权限申请,供核心合作伙伴体验。
官方地址:https://runway.com/news/research/introducing-solaris