Runway发布界面世界模型Solaris,App界面像视频一样实时生成

首页 / AI资讯 / AI视频

0:00
0:00
1x
定时

Runway日前公布了首个界面世界模型Solaris,让App与网页界面可以像视频一样被实时生成:用户点击、拖拽之后,模型直接生成下一帧画面,无需开发者预先编写任何代码。这套方案基于Runway的Gen-4.5视频模型改造,采用逐帧自回归、少步蒸馏与自生成结果训练,在720p分辨率下实现了实时交互,由语言模型负责推理、世界模型负责渲染,人类对比测试中指令遵循与行为自然度的偏好率分别达到61%和71%。

界面不再是代码写出来的,而是模型"演"出来的

传统App开发中,每一个按钮、每一处跳转都需要开发者编写界面代码与交互逻辑。Solaris的思路完全相反:它把界面本身当作世界模型的一个状态序列,用户与界面的每一次交互都成为世界模型的下一个输入,模型随即渲染出后续画面。对于开发者而言,这意味着产品原型可以跳过漫长的编码过程,直接用自然语言描述需求,让模型"演"出一个可交互的界面。

实现这一效果的技术路径颇具巧思。Solaris基于Gen-4.5视频模型改造,采用逐帧自回归的生成方式,每一帧都依赖前序帧的状态;少步蒸馏技术把推理步数压缩到实时可用的范围;自生成结果训练则让模型在自身产出的交互序列上持续学习,强化界面状态转换的一致性。整个系统中,语言模型承担意图理解与推理,世界模型负责画面渲染,二者分工明确,共同维持交互的流畅性。

Runway公布的人类对比测试数据,直观展示了Solaris的能力边界:在指令遵循与行为自然度两个维度上,Solaris的偏好率分别达到61%与71%,明显高于传统代码方案的对照组。测试者普遍认为,Solaris生成的交互过程更贴近真实应用的行为逻辑,点击、拖拽后的反馈响应自然,页面转场连贯,几乎看不出"机器生成"的痕迹。

值得注意的是,Solaris并非要取代现有的设计工具与低代码平台。在Runway的构想中,模型生成的是界面的表达层,开发者仍可在生成结果之上叠加业务逻辑、数据绑定与后端接口,两者是互补关系而非零和竞争。这意味着原型阶段可以跳过手写代码,快速验证交互方案,进入正式开发时再把真实逻辑接回去,产品的探索成本因此大幅下降。

实时生成背后的技术账,逐帧自回归如何跑进720p

界面世界模型最大的技术挑战是延迟。视频模型逐帧生成天然昂贵,若每帧推理耗时数百毫秒,交互体验就无从谈起。Solaris通过少步蒸馏显著压缩了单帧的采样步数,再结合自回归的局部重算策略,只在界面状态发生变化的区域执行密集计算,静态区域复用既有帧,从而把整体延迟压到实时交互的阈值之内。

分辨率方面,Solaris在720p下实现了流畅交互,这一规格覆盖了绝大多数网页与移动应用的显示需求。Runway表示,更高分辨率的支持正在优化中,但受限于推理成本,短期内不会无上限提升。训练数据的构建同样关键:团队用自生成结果训练的方式,让模型在"自己演出的界面"上持续迭代,形成反馈闭环,这种自举式训练绕开了人工标注海量界面状态序列的高昂成本。

值得关注的是,Solaris的架构与Runway此前的视频生成路线一脉相承。Gen-4.5作为底层视频模型提供了时空一致的渲染能力,Solaris则在其上叠加了交互状态机与界面语义理解,相当于给视频模型装上了"可点击的输入层"。这种复用策略让Runway不必从零构建世界模型,而是把成熟的视频生成能力平移到界面场景,技术路线的复用性是其快速推出产品级方案的关键。

交互一致性的维护是另一道技术关。用户在同一会话中反复点击、输入时,模型必须记住此前的界面状态,避免每操作一次界面就失忆重来。Solaris在处理这类长交互序列时,引入了对话级的状态记忆,让后续帧在生成时参考前序交互的历史信息,这与视频生成中的跨帧一致性是同一类挑战,但约束对象从画面像素变成了界面元素。

Computer Use Agent训练场,Solaris的另一重价值

除了直接生成可交互界面,Solaris还有一个被业界看重的用途:为Computer Use Agent提供泛化的训练环境。所谓计算机使用智能体,是指能够像人一样操作浏览器和软件完成任务的AI。这类智能体的训练需要海量真实界面交互数据,而真实环境的数据获取受限于隐私、成本与场景覆盖,Solaris生成的合成界面恰好可以充当低成本、高泛化的训练场。

在合成环境中,智能体可以反复练习点击、填表、导航等操作,模型会基于界面状态即时反馈结果,训练效率远高于在真实网站上的缓慢试错。Runway指出,Solaris生成的界面在行为逻辑上与真实应用高度一致,智能体在合成环境中习得的技能可以迁移到真实场景,这为计算机使用智能体的规模化训练提供了一条新路径。

从行业视角看,界面世界模型的想象空间不止于App原型设计。它让"软件即内容"成为可能,产品的界面不再是静态资产,而是可以随时按需生成、动态演化的交互内容;它也让软件测试、产品评审、教学演示等环节的效率大幅提升。随着Solaris开源相关技术与接入生态的扩展,界面生成有望继文生图、文生视频之后,成为生成式AI的下一个规模化落地场景。

从生态规划看,Runway透露Solaris将逐步开放开发者接口,允许第三方把界面生成能力嵌入自己的产品。这意味着未来的App原型、内部工具、教学演示都可能由模型直接生成,软件开发的起点将从写代码前移到描述需求,产品经理、运营人员也可以亲手搭建可交互的演示界面,界面生成的普及速度可能比文生图当年更快。

素材来源:腾讯研究院、Runway官方、搜狐科技 发布时间:2026-09-02