Solaris 是 Runway 于 2026 年 8 月 31 日公布的实验性研究模型,不是通过 HTML、CSS、JavaScript 和预制页面搭建应用,而是直接逐帧生成用户看到的界面。[19][27] 系统将负责理解用户意图的语言模型,与基于 Runway Gen 4.5 视频技术的视觉世界模型结合,让点击、拖拽、输入文字和自然语言指令影响下一步画面。[4][6][19][38] 在 Runway 报告的 250 人用户研究中,Solaris 在指令遵循和行为自然度方面分别有 61% 和 71% 的偏好率;但文字稳定性、事实准确性、长时连贯性、成本和无障碍支持仍是关键难题。[19][25]
研究答案

Create a landscape editorial hero image for this Studio Global article: What is Runway’s Solaris, announced on August 31 as an experimental “Interface World Model,” how does it generate fully interactive apps and. Article summary: Runway’s Solaris is an experimental “Interface World Model” announced on August 31 that treats an app or website as a continuously generated visual environment, rather than code—HTML, CSS, JavaScript, a DOM, and prebuilt. Topic tags: general, documentation, general web, academic, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
Runway Solaris 试图改变软件的基本形态:用户打开的可能不再是由代码预先定义好的页面,而是一个会随着操作持续“长出来”的视觉界面。点击、拖拽、输入文字,甚至用自然语言描述需求,都可能成为生成下一帧画面的条件。38
因此,Solaris 不只是一个“不会写代码也能做应用”的工具。它更接近一种面向软件界面的世界模型:屏幕不是浏览器根据固定实现渲染出来的结果,而是一连串由 AI 持续生成、并能对用户行为作出回应的视觉状态。
Runway 于 2026 年 8 月 31 日公布 Solaris,并将其称为实验性的“界面世界模型”(Interface World Model)。传统软件的流程通常是开发者先编写 HTML、CSS 和 JavaScript,再由浏览器渲染成页面;Solaris 则试图跳过这条路径,直接生成用户看到的界面。
一次 Solaris 体验可以从一张图片或一个视觉场景开始,例如产品展示图、品牌空间或某种应用环境。模型围绕这个起点生成界面,并在用户操作后继续更新画面。开发者不必提前为每一种可能的状态制作页面,系统会尝试推断“接下来应该出现什么”。
这一区别尤其适用于视觉信息复杂的场景。把图片或概念先转换成代码,往往会丢失布局、氛围和物体关系等细节;Solaris 选择让视觉场景本身成为主要输出。Runway 表示,这种方式旨在让场景在交互过程中保持更好的连贯性,并呈现更自然的行为。
Solaris 将“理解用户想做什么”和“把结果画出来”分给两个部分处理:
视觉部分建立在 Runway 的 Gen-4.5 视频生成技术之上。Runway 的开发者文档将 Gen-4.5 描述为支持文生视频和图生视频的模型,而 Solaris 则把这套视频生成基础应用到了可交互、逐步生成的场景中。4
6
每次操作都重新生成视觉状态,和制作一段几秒钟的视频完全不同。为了让交互尽可能接近实时,Solaris 使用了几种优化方法。
Solaris 以自回归方式逐帧生成画面,每一帧都参考此前的帧。这样,用户点击或拖拽后,模型可以沿着当前视觉状态继续推进,而不是从零开始生成一个彼此无关的结果。
Runway 表示,它把需要较多计算的扩散模型作为“教师模型”,蒸馏成只需少量去噪步骤的快速模型。目标是在尽量保留视觉质量的同时,减少每次响应所需的计算量。
Runway 还称,快速模型会使用自身生成的结果进行训练。这样做是为了降低长时间交互中的质量衰减,因为在一连串相互依赖的帧里,早期的小错误可能逐步累积。
Runway 给出的设计目标包括将交互延迟控制在约半秒以内、维持整段会话的连贯性,以及达到 720p 的视觉质量。不过,这些是研究目标,并不意味着每次 Solaris 交互都能稳定达到这些指标。
Runway 报告了一项涉及 250 名参与者的用户研究。在 30 个交互案例中,研究收集了约 7,500 次两两比较,让参与者将 Solaris 生成的界面与 Claude Opus 5 通过代码生成的界面进行比较。
按 Runway 公布的结果,参与者在以下维度更偏好 Solaris:
这说明在某些交互场景中,逐帧生成的界面可能显得更连贯,或更符合人们对物体和场景运动的直觉。但这并不能证明 Solaris 在整体意义上优于传统软件。该比较主要衡量主观交互感受,并没有证明它在可靠性、正确性、安全性、可维护性、成本、性能或无障碍能力方面更好。现有材料也不足以独立核验这项研究的完整方法和统计分析。
Solaris 的灵活性来自“现场生成”,但同一机制也带来了产品化和工程实现上的难题。
对实时图像和视频生成来说,稳定地产生清晰、准确的文字一直很困难。界面可能整体看起来十分漂亮,但按钮名称、数字、菜单或操作说明却出现错别字、乱码或内容错误。Runway 将文字生成列为尚未解决的问题,并提出一种可能的混合方案:在文字密集的静态画面中使用图像模型,在连续交互中使用视频模型。
视觉上有说服力的界面,不等于事实可靠。Solaris 目前主要依赖起始图像和用户提供的参考资料进行约束,因此可能自信地展示错误答案、产品信息或视觉表示。Runway 将更丰富的已验证数据、文档和参考材料列为后续研究方向。
由于每个状态都依赖此前生成的画面和模型决策,错误可能在开放式使用中逐步放大。让场景、物体属性、用户指令和交互历史在长时间会话中始终一致,仍是一个活跃的研究问题。
普通网站通常只需向设备传送代码和资源,再由设备完成渲染;Solaris 则要持续进行生成计算,才能产出用户看到的画面。Runway 表示,其优化方案比标准视频扩散便宜得多,但逐帧生成仍比加载固定代码页面更消耗计算资源。该原型公布的视觉质量目标为 720p。
一张渲染出来的图像不会自动提供屏幕阅读器和其他辅助技术所依赖的结构化语义。它也不会天然具备传统软件常见的可检查状态、事件结构和可预测接口。
分析人士指出,缺少传统 DOM(文档对象模型)以及无障碍接口,是这类方案进入银行、医疗等需要高度审计或无障碍支持场景时的重大障碍。
Solaris 被 Runway 作为实验性研究项目发布,而不是面向大众的成熟应用开发平台。相关报道将其描述为研究预览,当前可能需要申请早期访问或通过请求获得权限,并非所有用户都能直接使用。
所以,Solaris 眼下最重要的价值仍然是展示一种可能的软件方向。它证明了“让界面本身成为生成结果”在研究层面是可行的,但尚未证明团队可以把它当作传统代码应用的即插即用替代方案。
Solaris 延续了 Runway 的世界模型研究路线,但目标更为具体。Runway 将 GWM-1 描述为一种通用实时模拟器,覆盖可探索环境、虚拟角色和机器人操作等场景;Solaris 则把“世界模型”的概念收窄到软件界面:被模拟的世界是一款应用或网站,而用户操作推动这个世界不断变化。12
换句话说,Runway 正在尝试把重点从“生成可观看的媒体”进一步推向“生成可操作的视觉环境”。Solaris 不是一段只能播放的视频,而是一个会响应用户动作、并在交互继续时重新生成的场景。
如果这套方法最终足够可靠,创作者或许可以用自然语言描述视觉环境、产品、目标和行为,而不是用代码逐一实现所有可能的界面状态。这对空间化、视觉化或探索性体验尤其有吸引力,因为传统 UI 布局有时会限制设计表达。
但代价也很明显:这种灵活性来自生成,而不是明确的程序逻辑。生产级软件仍然需要可预测的行为、可测试性、数据完整性、无障碍支持以及与其他系统的稳定集成。Solaris 尚未证明自己能够取代这些传统工程实践。
Solaris 还指向了另一种可能:让 AI Agent 在陌生的视觉环境中工作。Agent 不必完全依赖固定 API 或硬编码流程,而是可以把界面理解为一个动态世界,执行操作、观察结果,再根据新的状态继续行动。
对于那些没有为自动化预留固定模式的界面,这一设想颇具吸引力。但它目前仍属于研究方向。需要审计、精确执行和可重复结果的任务,依旧更适合使用可靠的结构化 API,以及具备明确语义和无障碍支持的传统软件。
Solaris 最适合被理解为生成式软件界面的研究预览,而不是应用代码的终结。它的核心创意是:让界面本身成为模型输出,由语言模型负责理解意图,再由视觉世界模型根据用户动作逐帧生成下一状态。
Runway 公布的研究显示,在指令遵循和行为自然度方面,人们有时确实更喜欢这种界面。但文字准确性、事实可信度、长会话连贯性、生成成本、无障碍能力和软件集成,都是决定产品能否落地的核心要求,而不是后期润色的小问题。
Solaris 让我们提前看到了“界面世界模型”可能的样子,也同时说明了为什么传统代码在短期内仍然难以被取代。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Solaris 是 Runway 于 2026 年 8 月 31 日公布的实验性研究模型,不是通过 HTML、CSS、JavaScript 和预制页面搭建应用,而是直接逐帧生成用户看到的界面。[19][27]
Solaris 是 Runway 于 2026 年 8 月 31 日公布的实验性研究模型,不是通过 HTML、CSS、JavaScript 和预制页面搭建应用,而是直接逐帧生成用户看到的界面。[19][27] 系统将负责理解用户意图的语言模型,与基于 Runway Gen 4.5 视频技术的视觉世界模型结合,让点击、拖拽、输入文字和自然语言指令影响下一步画面。[4][6][19][38]
在 Runway 报告的 250 人用户研究中,Solaris 在指令遵循和行为自然度方面分别有 61% 和 71% 的偏好率;但文字稳定性、事实准确性、长时连贯性、成本和无障碍支持仍是关键难题。[19][25]