2026 年 7 月 3 日,生数科技(ShengShu Technology)在 2026 全球数字经济大会发布新一代视频基础模型 Vidu S1,主打实时交互视频生成。与过去”提交提示词—等待渲染—消费成片”的单向生成不同,Vidu S1 让用户用一张照片加持续语音,实时驱动一个可互动的 AI 数字角色——被官方定位为把 AI 视频从”单段内容创作”带入”持续实时互动”。

已知事实

  • 交互方式:输入一张照片(真人、动漫角色或萌宠)+ 持续语音,模型据语音的语义与情绪,实时生成带唇动、表情、手势与肢体动作的角色,可持续对话。
  • 技术规格:分辨率 540P(960×540),帧率 25 FPS(最高约 42 FPS);可在消费级 GPU 上运行,而非依赖大型服务器集群;通过连续帧预测支持不限时长的实时生成。
  • 架构与关键技术:自回归 + 扩散(AR + Diffusion)混合架构;官方提及 TurboDiffusion(加速)、SageAttention(8-bit 注意力)、SLA 与 SpargeAttention(稀疏注意力)、TurboServe(推理调度引擎,动态分配算力以维持低延迟)。
  • 应用场景:实时视频对话、互动直播、AI 陪伴、互动游戏与 NPC、XR 体验、虚拟主播、客服、在线教育等。
  • 可用性:通过 vidu.com/vidu-stream 面向公众开放,并提供开发者 API。

横向与纵向定位

横向看,同期 AI 视频的主流仍是”批量生成成片”(如可灵、Runway、Veo 等)——先提交、后等待、再消费。Vidu S1 切的是另一个维度:不追求更长更精的成片,而追求”实时、可对话”。它更接近”AI 演员/AI 数字人”,而非”AI 视频工厂”;能在消费级 GPU 上跑,也降低了实时数字人的部署门槛。两条路线服务的是不同需求。

纵向看,AI 视频的形态正从”内容”向”媒介”演进:早期是把文字/图片变成一段视频(内容生成),Vidu S1 则让视频成为一个可实时交互的界面(对话媒介)。这类似通讯技术从”录制、发送、播放”到”实时通话”的转变——一旦生成不再需要等待,视频就可能从”被观看的成品”变成”被对话的对象”。不过实时交互的画质(540P)、稳定性与延迟表现,仍需在真实场景中检验。

⚠️ 待核实:模型侧约 200ms、总延迟约 550ms 等具体延迟数字来自加更简报与中文报道,官方新闻稿未明确给出,以官方为准;发布会举办城市在不同来源中表述不一(简报作北京,部分英文源作新加坡),以主办方与官方为准;”清华 AIR Lab 孵化背书”等公司背景源自简报,未在官方新闻稿逐项确认;”全球首个正式商用实时交互视频生成”为官方与报道口径,具体以行业认定为准。

Vidu S1 以”照片+实时语音→可互动数字角色”实现实时交互视频生成,标志 AI 视频从单向”生成内容”向双向”实时对话”媒介演进;对数字媒体、交互设计与影视动画方向的教学与实践,它把实时数字人的创建门槛从”专业团队+高算力”降到”一张照片+消费级设备”,但实时画质与稳定性仍需实测。

参考来源

  • PR Newswire(官方新闻稿):https://www.prnewswire.com/news-releases/shengshu-technology-unveils-vidu-s1-bringing-real-time-interactive-generation-to-ai-video-302817626.html
  • 雷锋网:https://www.leiphone.com/category/industrynews/6GlFzI5hMwcfRoGZ.html
  • IT之家:https://www.ithome.com/0/972/436.htm
  • DigitalPhablet(英文):https://digitalphablet.com/ai/vidu-s1-launches-real-time-video-generation-begins/