2026 年 9 月 3 日,Runway 在研究页面发布 GWM Worlds 2,页面标注为研究预览(Research Preview)。它是 2025 年 12 月展示的 GWM Worlds 的下一代:实时生成连续的 720p、24 fps 视频和 48,000 Hz 音频,用户在生成过程中用文本动作和摄像机输入操控世界,世界从每次输入后的状态接着演进,不按固定片段或脚本播放。官方列出的相对上一代的新增内容,是音频生成以及对主体和场景更细的控制。

已知事实

  • 规格:GWM Worlds 2 是自回归扩散音视频模型,生成 720p、24 fps 视频与 48,000 Hz 音频;视频与音频解码器均为因果结构,带缓存以加快解码。
  • WorldPrompt 输入格式:Runway 把一个世界拆成两类状态,一类持续存在,一类随时间变化,对应两层输入。持续层包括创世提示词(genesis prompt,写明环境布局、材质、光照与环境声,可参与事件的主体及其属性,以及从重力、碰撞到角色能力、摄像机视角的「法则」)和一张用于视觉定位的首帧;变化层是带时间戳的事件流,每个动作是一段指向某个主体或整个场景的自由文本,带起止时间,多个动作可以重叠,另有逐帧的摄像机平移与旋转输入。
  • 训练路线:先用 WorldPrompt 格式微调自研音视频基础模型。微调后的模型是双向结构,速度不够,也无法自回归生成,Runway 再把它后训练成实时自回归模型,也就是 GWM Worlds 2,因此不受固定时长限制,可以一直生成下去。每一步自回归生成以三类上下文为条件:全局上下文(创世提示词与首帧)、当前帧输入(摄像机与覆盖当前帧的文本动作)、以滑动窗口缓存的历史帧。
  • 可操控内容:支持第一人称和第三人称的行走、驾驶、骑行,摄像机与主体可以分别控制;主体和场景可执行奔跑、攀爬、跳跃,开灯、改灯色,舞台起火等动作与事件;角色能对话,可控制语音、语气和语种,口型与台词同步生成;常用动作可以绑定到按键。
  • 三种使用方式:预先编写(一次写好整条事件流再生成,官方列举的用途是电影与广告)、回合制(生成到决策点暂停,用户选动作后继续,用于视觉小说、互动影像)、实时(生成持续进行,动作即时生效,用于游戏与互动体验)。官方称目前预先编写方式的画面质量更好,因为文本能提前描述更多场景细节;实时演示中,按键和鼠标绑定的是预设动作提示词。
  • 其他演示:可以用一段已有视频(示例为 8 秒生成视频)预填充,再接着实时游玩,模型保持环境与音频一致;可让智能体同时控制角色和环境,把 GWM Worlds 2 当作评估、训练智能体的模拟环境,在「走到红旗或蓝旗」的简单测试中,智能体首次尝试即完成;多人可按角色(玩家 1、玩家 2、导演)分别控制各自的主体,演示用 LiveKit 向所有参与者推送音视频;还可借助大语言模型,从一句描述生成首帧、创世提示词和绑定到按键的动作预设。
  • 官方列出的方向:互动娱乐、虚拟角色、机器人与具身智能体模拟、生成式设计与界面。
  • 官方说明的局限:实时生成仍以画质换速度;快速旋转等较难的摄像机输入会让细节、纹理和几何退化;长期记忆不完善;除首帧或预填充的音视频外,不支持其他图像参考;要充分利用自由文本控制,可能需要外部实时系统跟踪世界状态、即时生成动作,例如 NPC 与玩家的对话。
  • 开放状态:研究页面标注为研究预览,未写明对外开放方式与时间表。
  • 上一代 GWM-1:2025 年 12 月 11 日,Runway 发布基于 Gen-4.5 的自回归通用世界模型 GWM-1,分为 GWM Worlds(可探索环境)、GWM Avatars(对话角色)、GWM Robotics(机器人操作)三个后训练变体,官方称计划把它们统一到一个基础世界模型中;GWM-1 页面列出的规格为最长 2 分钟视频、720p,TechCrunch 报道 GWM-Worlds 以 24 fps、720p 运行。

横向与纵向定位

横向看,近一年多来已有几家公开了实时或可交互世界模型的具体指标。Google DeepMind 2025 年 8 月发布的 Genie 3 可以根据文本提示生成可实时漫游的世界,24 fps、720p,一致性可维持几分钟,并支持用文本触发「可提示的世界事件」,例如改变天气、加入新物体和角色;2026 年 1 月 29 日,Google 向美国 18 岁以上的 Google AI Ultra 订阅用户开放实验原型 Project Genie,生成时长限制为 60 秒,世界事件功能暂未放进原型。World Labs 9 月 1 日发布的 Atlas 侧重按机位生成与场景重建:原生处理文本、图像、视频和 3D,把精确的摄像机几何作为输入,示例用少量参考图生成 1 分钟、1440p 的视频,也能从照片重建真实场景,目前以早期访问形式向部分合作方开放。GWM Worlds 2 与 Genie 3 的分辨率、帧率相同;Runway 官方材料着重介绍的是另外几项:同步生成 48 kHz 音频和角色对白,文本动作可以带时间戳、指向具体主体,多名用户可以分角色同时操控。

纵向看,Runway 在 2025 年 12 月的 GWM-1 页面称,两年前已提出「通用世界模型」研究方向。2025 年 12 月的 GWM-1 把能力拆成环境、角色、机器人三个独立模型,列出的规格是 720p、最长 2 分钟;9 个月后的 GWM Worlds 2 仍是 720p、24 fps,变化落在音频、主体级的文本控制和不设预设时长上。同一时期 Runway 围绕实时生成连续发布了几项工作:8 月 31 日的 Solaris 被 Runway 称为「界面世界模型」,逐帧实时生成应用和网页界面,GWM Worlds 2 页面列出的方向里也有「生成式设计与界面」;9 月 8 日,专注三维人体动作与物理一致视频生成的巴黎研究实验室 Kinetix 团队加入 Runway,官方称将用于推进面向机器人的世界模型研究;9 月 10 日的研究文章讨论缩短首帧等待时间、边提示边流式输出视频;9 月 16 日的安全文章说明,实时视频流在最终安全检查之前就会显示给用户,因此在输入审核和最终审核之外,增加了对视频流的逐帧同步审核,平均审核耗时不到 0.5 秒。

⚠️ 待核实:官方页面没有给出实时交互的端到端延迟、所需算力和单次会话成本;「会话没有预设时长」为官方表述,受「长期记忆不完善」的限制,实际能连续运行多久、画面能保持多久一致,需以公开试用检验;预先编写与实时两种方式的画质差距只有官方的定性描述;智能体走到旗帜的测试是官方演示中的简单场景。

参考来源:

  • Runway Research·Introducing GWM Worlds 2(2026-09-03):https://runway.com/research/introducing-gwm-worlds-2
  • Runway Research·Introducing Runway GWM-1(2025-12-11):https://runway.com/research/introducing-runway-gwm-1
  • TechCrunch(2025-12-11,GWM-1 发布):https://techcrunch.com/2025/12/11/runway-releases-its-first-world-model-adds-native-audio-to-latest-video-model/
  • Runway News·Introducing Solaris(2026-08-31):https://runway.com/news/research/introducing-solaris
  • Runway News·The Kinetix Team is Joining Runway(2026-09-08):https://runway.com/news/company-news/kinetix-joins-runway
  • Runway News·Towards Instant Video Generation(2026-09-10):https://runway.com/news/research/towards-instant-video-generation
  • Runway News·Moderation in Real Time(2026-09-16):https://runway.com/news/safety/moderation-in-real-time
  • Google DeepMind·Genie 3(2025-08-05):https://deepmind.google/blog/genie-3-a-new-frontier-for-world-models/
  • Google 官方博客·Project Genie(2026-01-29):https://blog.google/innovation-and-ai/models-and-research/google-deepmind/project-genie/
  • World Labs·Atlas(2026-09-01):https://www.worldlabs.ai/blog/atlas