AI资讯 / 产业

产业 / 媒体

边输入提示词边生成画面

The Decoder

AI视频公司 Runway 近日公开了其实时视频生成研究方向。与现有模式不同,用户无需输入提示词后等待数秒乃至数分钟,而是可以在描述内容的同时即时接收视频流。这一方向建立在 Runway 于2025年12月发布的通用世界模型 GWM-1 之上,该模型逐帧生成视频,并支持摄像机运动、机器人指令及音频等多种控制输入。Runway 认为,实时生成能够缩短创意与执行之间的距离,让用户将更多时间用于主动引导内容,而非被动等待。与此同时,更快的模型意味着更低的 GPU 占用,有望降低单位输出成本,使此前在经济上不可行的应用场景变得可行。Runway 还将这一技术的长期价值延伸至教育、游戏、机器人训练及自动驾驶仿真等领域,目前尚未公布正式上线时间表。

当前主流AI视频工具的工作流程分为明显的两个阶段:用户输入提示词,然后等待模型渲染出完整片段。如果结果不符合预期,则需要重新开始。Runway 表示,用户反复提到在生成与修改视频上耗费了最多时间,因此公司希望将首帧出现的等待时间压缩至最低,并在用户持续输入提示的过程中同步推送视频流。

这一构想的技术基础是 GWM-1,即 Runway 于2025年12月推出的首个通用世界模型。GWM-1 在 Gen-4.5 基础上构建,采用逐帧生成方式,并可接受摄像机运动、机器人指令或音频作为控制信号。今年3月,Runway 已通过 Runway Characters 项目初步展示了这一思路;数周前发布的 Solaris 系统则进一步将逐帧生成应用于用户界面,支持点击与语音输入响应。

实时视频生成面临一个视频模型特有的技术难题:文本模型可以在生成过程中自我纠错,但视频模型的每一帧都建立在前一帧之上,微小误差会随时间不断累积,最终演变为严重的画面失真。Runway 的应对策略是在训练阶段让模型接触自身的输出结果,而非仅使用无误差的标准数据,从而训练模型识别并修正自身偏差,而非放大错误。初创公司 Decart 在其实时模型 MirageLSD 中采用了类似思路,在训练中刻意引入有缺陷或失真的图像。

在成本层面,Runway 指出实时生成将计算压力从训练阶段转移至推理阶段——模型需要在多个会话共享硬件的条件下,以足够快的速度生成每一帧以维持正常播放。但更快的模型同时也意味着更低的 GPU 时间消耗。Runway 认为,特定质量水平下的单位输出成本决定了哪些应用在商业上具有可行性,实时生成有望降低这一门槛,让此前无利可图的场景重新具备经济价值。

Runway 将互动式应用视为AI生成媒体最重要的长期方向。教育、游戏与机器人领域都需要能够即时响应用户操作的视频内容。在自动驾驶领域,Waymo 正以类似逻辑使用基于 Genie 3 的 Waymo World Model 模拟车队从未遭遇过的极端场景,例如路遇大象、龙卷风或被洪水淹没的住宅区。Runway 此前也推出了专为机器人生成合成训练数据的 GWM Robotics 变体,并在英伟达 GTC 大会上展示了与英伟达联合开发的实时模型原型,目标是在 Vera Rubin 平台上将首帧延迟压缩至100毫秒以内。

要点

  • Runway 正在研究实时AI视频流技术,用户可在输入提示词的同时即时接收生成画面,无需等待完整渲染。
  • 技术核心是通用世界模型 GWM-1,通过逐帧生成并在训练中引入自身输出来抑制误差累积问题。
  • 实时生成有望降低 GPU 成本,使此前经济上不可行的应用场景变得可行。
  • Runway 将该技术的长期价值延伸至机器人训练数据生成与自动驾驶仿真,与 Waymo 的世界模型路线形成呼应。
  • Runway 与英伟达联合开发的实时模型原型目标首帧延迟低于100毫秒,但正式上线时间表尚未公布。
查看原始来源

原始标题:Runway wants to turn AI video generation into a live stream you control in real time

本文由 DataHub 基于公开来源整理,用于信息发现与摘要阅读;具体事实、数据和后续更新以原始来源为准。