浅译快报

视频生成

「视频生成」方向的资讯,按发布日倒序。

Semafor(独家)/ AlphaSignal· 9月17日 产品

Pika 将产品从单一视频生成工具重构为多模型创意工作室,集成 7 个 AI 模型并新增逐镜头清单生成、重打光与换装工具套件。

Pika 于9月17日宣布将产品从单一视频生成工具重构为多模型创意工作室,集成 Seedance 2.5、Veo 3.1、GPT Image 2.5、MiniMax H3、Grok Imagine 等 7 个 AI 模型,并推出独立应用套件(Video Studio、Color Grade、Extend Video、Edit Image、Character Studio、Product Shot);核心新特性包括:输入基本描述后自动生成可编辑逐镜头清单、重打光工具、角色与服装替换工具套件;平台自动路由至最优模型,同时支持手动指定。

Pika 的转型说明 AI 视频工具的竞争焦点已从单一模型质量转向多模型整合平台体验,逐镜头清单生成对短片创作和教学视频制作有实用价值。

查看原始来源 ↗

arXiv(arXiv:2609.11638)+ 生数...· 9月15日一手 模型

生数科技发布 Vidu S2,包含实时 720p 数字人生成与无中断流式视频风格编辑两个子模型,在线演示同步开放。

生数科技(Shengshu Technology)于9月15日发布 Vidu S2,包含两个子模型:Vidu S2-Avatar 支持实时生成 720p 数字人,可在对话中动态替换参考图、跟随舞蹈等复杂肢体指令;Vidu S2-Editing 实现流式实时视频风格编辑,包括风格渲染、换装、换人、换背景,整个过程无需中断视频流。论文同时展示了 VR 空间中的实时视频生成与编辑能力,配套在线演示已开放(vidu.com/vidu-stream),对应论文为 arXiv:2609.11638。

实时流式视频编辑能力让换装、换背景等操作接近「直播即生成」,对影视、时尚设计与数字人方向的创作工具链影响直接,VR 空间扩展亦值得关注。

查看原始来源 ↗

GitHub (comfyanonymous/Comf...· 9月15日一手 产品

ComfyUI v0.36.0 新增 FastH3 8步蒸馏视频、BFL FLUX 视频编辑、YuE2 音乐生成与 Tripo P2 3D 等多项节点,单一工作流覆盖文字到视频配乐完整链路。

ComfyUI 于9月15日发布 v0.36.0,新增多项重量级节点:FastVideo FastH3(8步蒸馏 MiniMax H3,支持文生视频、图生视频与原生音频同步)、BFL FLUX Video Edit($0.03/秒视频编辑 API,保留原片运动轨迹与音频)、YuE2 音乐生成模型、Tripo P2(文字/图像/多视角→3D)、Marigold V2(深度/法线/反照率估计)以及 Generic Loops 与 Video Concatenate 节点;H3 ControlNet 获 Comfy Compiler 完整兼容支持;配套发布 ComfyUI Desktop v1.6.0,支持 Apple Silicon 全原生 MPS 加速。

单一 ComfyUI 工作流现已覆盖文字到视频再到配乐的完整链路,FastH3 仅需 8 步即可生成带原生音频的视频,BFL FLUX Video Edit 的低单价亦使学生作业级实操具备可行性。

查看原始来源 ↗

X (@higgsfield) / AI media· 9月12日 产品

Higgsfield AI 推出 Motion Designer 插件,在 After Effects / Premiere Pro 时间线上选取片段、输入文字提示即可原地生成或替换运动画面,已开放候补名单申请。

Higgsfield AI 于 2026 年 9 月 12 日发布 Motion Designer,以原生插件形式直接集成进 Adobe After Effects 与 Premiere Pro;用户在时间线上选取片段,输入文字提示即可生成或替换运动画面,无需导出到外部平台;支持与现有合成工作流无缝衔接,已开放候补名单申请。

继 Runway 插件(09-08)之后,Higgsfield Motion Designer 进一步证实 AI 视频生成插件向标准后期工具宿主渗透的趋势正在加速。

查看原始来源 ↗

Ars Electronica 官方· 9月10日一手 赛展

第 38 届 Prix Ars Electronica 2026 颁奖,Andrew Herzog 的「Deer Hunter」以档案素材与生成式 AI 融合叙事摘得新动画艺术金熊奖(Golden Nica)。

第 38 届 Prix Ars Electronica 2026 颁奖典礼于 9 月 10 日举行,共收到来自 106 个国家的 4329 份参赛作品。新动画艺术类金熊奖授予美国艺术家 Andrew Herzog 的「Deer Hunter」,作品以家庭录像与档案素材结合生成式 AI 融合,探讨移民经历与男性气质叙事。u19 年龄组金奖由 Jannis Berner 的「Reverse Rendering」摘得,该作品将数字模糊效果转化至实体空间呈现。Ars Electronica Festival 2026 于 9 月 9—13 日在奥地利林茨举行。

全球历史最悠久的媒体艺术奖项将生成式 AI 融合叙事作品列为最高荣誉获奖者,标志 AI 创作技术在国际学术与专业评审体系中获得主流认可。

查看原始来源 ↗

OpenAI官方/The Verge/TechCrunch· 9月9日一手 行业

OpenAI Sora API将于2026年9月24日终止服务,独立app已于4月下线,与迪士尼约$10亿规模的AI视频合作随之流产

OpenAI宣布Sora API将于2026年9月24日正式关停。Sora独立应用此前已于4月26日下线。与此同时,此前报道中规模约$10亿的Sora与迪士尼AI视频战略合作也随Sora产品线关停而终止。2024年2月发布时引爆行业想象力的旗舰AI视频产品,在不到两年内完成从里程碑到退出的完整周期。开源阵营(FLUX 3 Video、LTX-2.5、MiniMax H3)及国产视频模型(Wan 3.0、Seedance 2.5、Kling 3.5)在此期间已具备替代能力。

Sora从2024年全球最具关注度的AI视频到2026年关停,是AI商业化复杂性的典型案例;$10亿迪士尼协议流产将成为AI与传统内容产业合作中商业风险的重要参照案例。

查看原始来源 ↗

ECCV 2026官方/AI4VA Workshop官方· 9月9日一手 论文

ECCV 2026第四届AI for Visual Arts专题工作坊于9月9日在瑞典马尔默举办,聚焦世界模型、长视频生成、神经三维等视觉艺术AI前沿方向

ECCV 2026(欧洲计算机视觉顶级会议,9月8–12日,瑞典马尔默)第四届AI for Visual Arts(AI4VA)专题工作坊于9月9日举办,聚焦为视觉艺术服务的前沿计算机视觉研究方向:用于艺术创作的世界模型、长视频生成、神经三维重建、生成式艺术批评与评估方法等。本届ECCV接收的LiveEdit(清华×港科大实时流式视频编辑)、A²-Edit(上交大任意物体参考编辑)等论文均在相关方向有成果展示。AI4VA是计算机视觉研究与艺术创作应用交叉的年度国际风向标。

ECCV AI4VA工作坊汇聚视觉艺术AI研究的顶尖成果,对跟踪”AI技术如何重塑视觉艺术创作工具”的研究者和教育者是最直接的学术信号来源。

查看原始来源 ↗

Runway 官方 / Adobe 官方· 9月8日一手 产品

Runway 推出 Adobe Premiere Pro 和 After Effects 官方原生插件,专业剪辑者可在时间轴内直接调用 Runway Aleph 2 完成 AI 视频生成、风格化与超分辨率,无需离开剪辑软件。

Runway 于 2026 年 9 月 8 日正式发布 Adobe Premiere Pro 和 After Effects 原生插件,用户无需离开剪辑软件,可在时间轴内直接调用 Runway Aleph 2 等模型完成 AI 视频生成、风格化、扩展和超分辨率处理;Adobe 同步宣布合作,Runway 成为首批官方集成进 Adobe 专业剪辑工具的 AI 视频生成供应商之一。此前需导出帧→上传外部平台→处理→重导入的繁琐工作流被彻底打通。

Runway AI 视频能力以插件形式进入 Premiere 和 After Effects,是 AI 视频生成从创作平台向专业后期工具链整合的重要节点。

查看原始来源 ↗

Bloomberg / TechTimes· 9月8日 行业

Runway AI 年收入从 4 月 1 亿美元跃升至 9 月 2 亿美元,同时宣布收购专研三维人体动作的巴黎实验室 Kinetix。

Runway AI 年度重复收入(ARR)于 2026 年 9 月达 2 亿美元,较 4 月 1 亿美元在五个月内翻倍;净收入留存率超 300%,现有企业客户平均三倍扩消费。增长几乎全部由大型媒体、广告与游戏公司驱动,这些机构已将 Runway 工具嵌入专业制作管线。Runway 同期宣布收购巴黎 AI 实验室 Kinetix(7 人),该团队专研三维人体动作模拟与具身视频生成,此前已集成于 Unity Muse 与 Adobe Mixamo。Runway AI Summit 将于 9 月 30 日在旧金山举行。

AI 视频生成商业化成熟度的关键指标:净留存率超 300% 表明企业用户在扩大而非缩减对 AI 视频工具的投入,Kinetix 收购预示其在角色动画与互动媒体方向的能力延伸。

查看原始来源 ↗

Adobe 官方博客 / No Film School...· 9月8日一手 产品

Adobe 于 IBC 2026 推出 Premiere Pro Generative Media Tool,时间轴内框选即可调用 Firefly、Runway、Kling、Veo、Luma 五大 AI 视频模型,并同步新增 AI 音效与声景生成。

Adobe 于 2026 年 9 月 8 日(IBC 2026 期间)正式推出 Premiere Pro Generative Media Tool:编辑者在时间轴任意轨道框选范围、输入文字提示,即可在原地生成视频片段(参考帧采样保持风格一致),Firefly、Google Veo、Runway、Kling、Luma 五个 AI 视频模型可在同一工具栏直接切换,完全消除往返导出流程。同步发布的 AI SFX 支持声音引导节奏的音效生成;Generate Soundscape Beta 可将 15 秒视频自动生成多层音轨底稿;After Effects 同步推出 AI 助手 Beta,自然语言指令可完成项目重组、expression 修复和 rig 创建。

将五个主流 AI 视频模型统一在专业剪辑时间轴中可切换调用,标志 AI 视频生成从独立创作平台向标准后期工具链深度整合的转折。

查看原始来源 ↗

ComfyUI官方GitHub/ComfyUI Wiki· 9月5日一手 产品

ComfyUI v0.34.4首发Meta Muse视频生成节点;v0.34.5新增子工作流嵌套调用及Comfy Cloud原生视频流式预览

ComfyUI连续发布两个版本:v0.34.4(9月4日)首次集成Meta Muse文生视频节点,是Meta旗下视频生成模型在ComfyUI的首个合作接入;v0.34.5(9月5日)新增子工作流嵌套调用功能,支持将复杂工作流拆分为可复用模块,通过嵌套方式组合调用;同时新增Comfy Cloud原生视频流式预览,生成的视频可在节点内直接播放,无需下载至本地。两次更新同步带来新模型扩展和工程基础设施升级。

子工作流嵌套是ComfyUI向”工作流平台”演进的重要步骤,使复杂AI创作管线的模块化管理和团队共享成为可能。

查看原始来源 ↗

Runway官方研究博客· 9月3日一手 模型

Runway发布通用世界模型第二代GWM Worlds 2,持续生成720p/24fps视频并响应用户实时文字操控指令,世界从当前状态延续而非重置

Runway于9月3日发布通用世界模型第二代GWM Worlds 2,核心特性为持续生成720p/24fps视频与48,000Hz原生音频,并在不重置世界状态的前提下响应用户实时文字操控指令。与此前AI视频”提示词→固定片段”的生成模式不同,GWM Worlds 2的世界在用户每次输入操控指令后从当前状态延续,支持自由文本动作指令寻址角色或场景整体,以及持续的摄像机运动控制。官方定位覆盖互动娱乐、虚拟角色、机器人训练与具身Agent仿真,目前为研究预览阶段。

GWM Worlds 2标志着AI视频生成从”内容输出”向”可实时导演的连续世界”的范式跃迁,持续响应式世界模型为互动叙事和AI驱动场景仿真开辟了新的可能。

查看原始来源 ↗

阿里巴巴官方· 8月27日一手 模型

阿里Wan3.0 Prime快速变体上线,定价$0.06–$0.30/秒,支持文字转视频、图像转视频及音频驱动视频生成三类任务

阿里巴巴推出Wan3.0 Prime,作为Wan3.0全功能版的快速变体,在生成速度和成本之间做出权衡:API定价$0.06至$0.30/秒(根据分辨率和输出质量)。Wan3.0 Prime支持三类输入模式:文字描述直接转视频、静态图像转动态视频、以及音频驱动的视频生成(音乐或语音节奏同步生成视觉内容)。快速变体定位于高频调用和批量生产场景,与Wan3.0旗舰版形成差异化产品矩阵。

Prime快速变体与旗舰版并行的产品策略,反映了AI视频生成商业化中”质量-速度-成本”三角的精细化运营思路,也是平台满足不同用户群体需求的标配模式。

查看原始来源 ↗

MiniMax官方/fal.ai· 8月27日一手 模型

MiniMax与fal.ai联合发布H3 Max,相比H3标准版实现35倍推理加速,在Design Arena视频质量评测中位列全球第一

MiniMax与AI推理平台fal.ai联合发布H3 Max,是MiniMax H3视频生成模型的加速优化版本:通过fal.ai的推理基础设施优化,生成速度相较H3标准版提升35倍,同时在Design Arena全球视频生成质量排行榜中位列第一。H3 Max通过fal.ai API开放调用,按使用量计费。加速优化主要应用于中等分辨率视频的快速生成场景,4K超高清模式维持原有推理路径。

H3 Max将MiniMax的视频生成质量优势与大幅降低的推理延迟结合,使其在实时创作预览和高频调用场景具备更强竞争力。

查看原始来源 ↗

Google DeepMind官方· 8月27日一手 模型

Google发布Gemini Omni 1.1 Flash,支持40秒视频生成、首尾帧双重锁定、4K输出及$0.03/秒的Draft快速模式

Google DeepMind于8月27日发布Gemini Omni 1.1 Flash视频生成模型,在上一代基础上引入四项升级:最长单次生成时长从15秒延伸至40秒;新增首帧+尾帧双重锁定功能,用户可同时指定视频开头和结尾的画面,模型负责填充中间的运动过渡;原生输出分辨率升至4K;并推出Draft Mode,以$0.03/秒的定价大幅降低快速预览成本,正式模式仍维持原价。

Gemini Omni 1.1 Flash的首尾帧双锁定是AI视频生成向精确叙事控制迈进的关键功能,结合40秒时长和4K输出,覆盖了从快速原型到可交付成品的完整创作链路。

查看原始来源 ↗

阿里巴巴官方/TechCrunch· 8月24日一手 模型

阿里巴巴Wan3.0全球发布,支持最长30秒视频生成、PDF/PPT/Word文档直接转视频,定价$0.05–$0.20/秒

阿里巴巴于8月24日正式向全球发布Wan3.0视频生成模型,主要规格:最长单次生成30秒,较上一代翻倍;新增多模态文档输入支持,用户可直接上传PDF、PPT或Word文件,模型将文档内容转化为视频叙事;API定价区间为$0.05至$0.20/秒,根据分辨率和质量档位浮动。Wan3.0同步开放了ComfyUI原生节点,支持与现有工作流无缝集成。与Seedance 2.5、Kling 3.5共同构成2026年国产AI视频模型的主流选项。

Wan3.0将文档作为原生视频输入格式,是AI视频生成从”纯创意工具”向”学术与工作场景实用工具”延伸的代表性进展。

查看原始来源 ↗

Runway官方· 8月12日一手 产品

Runway新增Gemini Omni Flash接入并推出API Model Router,根据任务类型自动选择最优底层视频模型

Runway于8月12日在平台接入Google Gemini Omni Flash视频生成能力,同时推出API Model Router功能:开发者通过Runway API调用视频生成时,Model Router根据任务参数(分辨率、时长、风格描述、成本预算)自动在Runway Gen-4、Gemini Omni Flash等底层模型间进行路由选择,无需手动指定模型版本。这一机制将底层模型差异对开发者透明化,降低了在多模型生态中构建视频生成应用的复杂度。

API Model Router将视频生成的模型选择从”开发者决策”转移至”平台智能调度”,是AI视频生成基础设施走向统一抽象层的进展。

查看原始来源 ↗

TechNode Global / Alizila· 8月10日 模型

阿里通义实验室Wan 3.0于8月6日开公测、8月10日杭州发布活动正式上线:单镜30秒(Wan 2.7为15秒上限);全模态输入——PDF、PPT、Excel、网页均可作为输入源,生成文档转视频;API计价¥0.30–1.20/秒(480P–1080P)。

阿里通义实验室Wan 3.0于8月6日开公测、8月10日杭州发布活动正式上线:单镜30秒(Wan 2.7为15秒上限);全模态输入——PDF、PPT、Excel、网页均可作为输入源,生成文档转视频;API计价¥0.30–1.20/秒(480P–1080P)。暂无开权重。

中文API定价、全文档输入、国产生态,直接对应对影视与建筑动画方向的学员价值显著。

查看原始来源 ↗

Google Developers Blog / Ge...· 8月5日一手 模型

Google Veo 3.1于2026年8月5日登陆Gemini API付费预览:视频时长从8秒升至120秒,支持4K分辨率、原生立体声音频全链路生成(对话/音效/环境音)、跨场景角色一致性、竖版9:16,最多3张参考图引导生图到视频;Veo 3.1 Lite专注高并发与快速迭代,同步上线。

Google Veo 3.1于2026年8月5日登陆Gemini API付费预览:视频时长从8秒升至120秒,支持4K分辨率、原生立体声音频全链路生成(对话/音效/环境音)、跨场景角色一致性、竖版9:16,最多3张参考图引导生图到视频;Veo 3.1 Lite专注高并发与快速迭代,同步上线。

视频时长×15(8s→120s)是AI视频从”片段”到”短片”的门槛跨越

查看原始来源 ↗

Black Forest Labs 官方 / Vent...· 8月5日一手 模型

Black Forest Labs 于 2026-08-05 将 FLUX 3 Video 推送至生产可用(GA):单次最长 20 秒视频生成,内置原生音频联动输出,Draft 模式定价 $0.06/s(约 ¥0.44/s),首发 1080p(2K/4K 已在路线图);依托 FLUX API 及授权合作平台接入,ComfyUI Partner Nodes 预计跟进。

Black Forest Labs 于 2026-08-05 将 FLUX 3 Video 推送至生产可用(GA):单次最长 20 秒视频生成,内置原生音频联动输出,Draft 模式定价 $0.06/s(约 ¥0.44/s),首发 1080p(2K/4K 已在路线图);依托 FLUX API 及授权合作平台接入,ComfyUI Partner Nodes 预计跟进。前序:FLUX 3 统一多模态框架 2026-07-23 发布(图像+视频+音频同权重),本次为视频 GA 里程碑。

FLUX 生态是视频 GA 使无需更换工具链

查看原始来源 ↗

量子位 / 新浪科技· 7月31日 模型

字节跳动Seedance 2.5于7月31日正式发布,单次AI视频生成时长从10秒提升至30秒,支持50个多模态参考素材(图像+视频+文字混合),新增局部编辑,发布Maya/Blender插件打通影视工业流程;已全量上线即梦AI与豆包专业版。

字节跳动Seedance 2.5于7月31日正式发布,单次AI视频生成时长从10秒提升至30秒,支持50个多模态参考素材(图像+视频+文字混合),新增局部编辑,发布Maya/Blender插件打通影视工业流程;已全量上线即梦AI与豆包专业版。

30秒直出意味着一个完整分镜可在单次推理内完成

查看原始来源 ↗

MarkTechPost/ComfyUI官方/Civitai· 7月31日一手 模型

MiniMax发布H3(Hailuo 3.0),支持全模态输入生成最高2K分辨率、15秒、原生立体声视频,API当日可调用,开源权重首发ModelScope,ComfyUI同步支持。

MiniMax发布H3(Hailuo 3.0),统一全模态转换器同时理解文本、图像、视频与音频,可生成最高2K分辨率、4至15秒视频,并附原生生成的同步立体声(对话、音效与环境音一次通过)。API与ComfyUI Partner Nodes于7月31日首日即可调用;开源权重于8月3日首发ModelScope(营收低于2000万美元可免费商用),后续同步HuggingFace。ComfyUI v0.30.0同步原生支持H3的4个新节点与6套官方工作流,定价约0.13美元/秒。

首个同时具备全模态输入、2K分辨率与原生立体声的视频生成模型并开源权重,本地部署后可在单次生成中产出画面与空间感音效一体的短片,为AI影像课程提供了新的工作流参照。

查看原始来源 ↗

LottieFiles官方X + ProductHunt· 7月28日一手 产品

LottieFiles发布Lottie Creator 2.0:浏览器内完整运动设计工具,Motion Copilot AI可从自然语言描述直接生成关键帧动画;新增图形编辑器、State Machine可交互性系统;支持导入AI/EPS/PDF/PSD/SVG/AEP/FLA等16种格式;无需安装,导出生产级Lottie动画;定价$19.99/月。

LottieFiles发布Lottie Creator 2.0:浏览器内完整运动设计工具,Motion Copilot AI可从自然语言描述直接生成关键帧动画;新增图形编辑器、State Machine可交互性系统;支持导入AI/EPS/PDF/PSD/SVG/AEP/FLA等16种格式;无需安装,导出生产级Lottie动画;定价$19.99/月。

直接面向动效设计师的生产工具,AI自然语言→关键帧动画降低动效制作门槛

查看原始来源 ↗

量子位/极客公园/网易/36氪· 7月25日 模型

Vivix灵动时刻A1实现AI角色全身表演与全双工实时交互,TTFF低于0.6秒;W1支持统一流式交互叙事,单卡突破10000 video tokens/s,成本0.2美元/小时。

Vivix灵动时刻A1首个实现AI角色全身表演加全双工实时交互,面部、肢体与口型同步,首帧延迟(TTFF)低于0.6秒;W1统一流式架构打通多模态参考、实时交互与流式生成,实现从「生成一段视频」到「生成一场互动」的范式转移。约30B激活参数,通过MJD蒸馏、原生NVFP4与自研推理引擎在消费级显卡实现单卡突破10000 video tokens/s,成本约0.2美元/小时(同类低一到两个数量级)。量子位、极客公园、网易、36氪等多源报道。

消费级显卡即可部署的实时全双工AI视频交互,对互动叙事、数字人设计与虚拟角色装置课题提供了实用级工具参照。

查看原始来源 ↗

Black Forest Labs 官方博客/Vent...· 7月23日一手 模型

Black Forest Labs 发布 FLUX 3,首个统一图像生成、20 秒视频与原生音频输出的多模态流模型,Canva 等首批生态伙伴同步接入。

Black Forest Labs 于 2026 年 7 月 23 日发布 FLUX 3,将图像生成、视频生成与音频理解统一在单一前沿模型架构中;视频生成支持 20 秒连贯输出并含原生音频轨;与 FLUX.2 系列相比是架构层面的代际跨越;Canva、Krea、Magnific、Picsart 为首批生态接入伙伴;Dev 权重承诺 2026 年内开源。

FLUX 系列开源图像模型首次将静态图像、有声视频与机器人动作预测纳入单套权重,标志 AI 视觉基础模型从单模态工具向统一多模态引擎的代际跨越。

查看原始来源 ↗

新浪科技 / 搜狐 / 腾讯新闻(多源)· 7月20日 产品

万兴科技在WAIC 2026展示三条AI视频产品线:万兴剧厂推出无限画布节点式影视工作流和专属AI Agent助手,Filmora.AI提供专业TVC画布级工作台,Virbo AI定位短视频电商带货场景,CEO宣布将推动AI影视规模化商业化。

万兴科技(Wondershare)在WAIC 2026展示三条AI视频产品线的集中更新:万兴剧厂推出”无限画布”节点式影视工作流,搭配专属AI Agent助手,面向剧情内容生产场景;Filmora.AI为专业TVC制作人群提供画布级工作台;Virbo AI定位短视频电商带货场景并在WAIC完成全球首秀;CEO吴太兵表示将推动AI影视的规模化商业化落地。三条产品线覆盖剧情创作、专业广告片和电商内容全场景。

万兴科技三条线覆盖剧情→专业TVC→电商带货全场景,无限画布+节点式工作流体现了AI视频工具从单片段生成向完整工业化管线演进的趋势方向。

查看原始来源 ↗

NVIDIA官方Blog/WCCFTech/Digit...· 7月20日一手 产品

NVIDIA在SIGGRAPH 2026发布Synthetic Video Detector NIM,22ms/帧检测速度、92%精准率,通过标准API调用,填补AI生成视频内容真实性验证空白,与Adobe Content Credentials、C2PA标准形成生态配合。

NVIDIA于SIGGRAPH 2026(2026年7月20日)发布Synthetic Video Detector NIM(网络推理微服务),专用于检测AI生成视频;官方测试数据:22ms/帧检测速度,92%精准率,4%误报率,通过标准API调用,无需本地GPU部署。此前NVIDIA已发布AI图像检测NIM,此次视频版填补了内容真实性验证的空白;技术上与Adobe Content Credentials、C2PA标准形成生态配合。

22ms/帧的实时检测能力意味着平台可在视频发布流程中大规模部署,AI生成视频的可检测性将实质影响内容发布规则与合规要求,是AI内容伦理与合规领域的标志性技术进展。

查看原始来源 ↗

量子位 / 环球网 / 凤凰科技 / 雷锋网 / Ch...· 7月20日 产品

智象未来(HiDream.ai)在WAIC 2026发布基于自研HD-AgentOS的vivago R1,突破行业15-30秒视频时长限制,支持任意时长视频连续连贯生成,叙事逻辑/画面风格/角色IP全程统一,商业可用率达85%,适配短剧/专题片/品牌宣传片等长周期创作场景。

智象未来(HiDream.ai)于2026年7月20日在WAIC 2026(上海)发布vivago R1,基于自研HD-AgentOS多模态Agent操作系统构建,突破AI视频生成行业长期存在的15–30秒时长上限,支持任意时长视频的连续连贯生成;在整个生成过程中保持叙事逻辑、画面风格和角色IP的统一;内部评测商业可用率达85%,适配品牌宣传片、AI短剧、专题纪录片等需要完整叙事周期的创作场景;发布当日获量子位、环球网、凤凰科技、雷锋网、Chinaz等5家以上中文媒体同步报道。

AI视频生成的时长上限是制约商业落地的核心瓶颈,vivago R1”任意时长”的突破标志着AI视频工具从片段演示走向完整商业作品交付的关键里程碑。

查看原始来源 ↗

机器之心 / QQ新闻· 7月18日 论文

Google 团队提出 VGGRPO,通过隐空间 4D 几何奖励进行强化学习后训练,解决视频扩散模型几何漂移与摄像机轨迹不稳定问题,已被 ECCV 2026 收录。

ECCV 2026 收录 Google 团队提出的 VGGRPO:通过在 4D 隐空间中引入几何一致性奖励信号进行强化学习后训练,提升视频扩散模型的几何稳定性,解决几何漂移、摄像机轨迹不连贯和场景结构不稳定等问题,且无需对 VAE 进行额外解码。

几何一致性是 AI 视频生成进入专业影视和动画制作流程的核心障碍之一,VGGRPO 提供了可落地的 RL 后训练方案,对评估主流视频生成工具的底层几何稳定性有参考价值。

查看原始来源 ↗

IT之家 / 虎嗅 / 同花顺· 7月17日 模型

阿里通义实验室发布 Wan-Streamer v0.2,将听、看、说、演统一进单个 Transformer,端到端交互延迟约 550ms,较 v0.1 大幅改善。

阿里通义实验室发布实时全双工多模态模型 Wan-Streamer v0.2,将「听、看、说、演」四类感知与表达能力统一进单个 Transformer 架构,端到端交互延迟约 0.55 秒;相比 v0.1 版本延迟大幅降低,可实现 AI 在视频通话中边听边看边实时回应。

550ms 端到端延迟是 AI 视频通话趋近实用门槛的关键指标;统一多模态 Transformer 区别于分离模块架构,与 MiniMax H3 和 Gemini Omni 并行出现,指向多模态实时交互领域的技术路线正在趋同。

查看原始来源 ↗

中新网 / 36氪 / AIbase(多源)· 7月16日一手 产品

昆仑万维发布天工短剧工作台 SkyProduction,Agent 智能分镜可在视频生成前规划角色站位与机位;DramaWave 平台 3 部 AI 短剧 7 天内均破百万美元流水。

昆仑万维发布天工短剧工作台 SkyProduction:Agent 智能分镜模块可在视频生成前先规划角色站位与机位(参考上一镜构图生成下一镜站位图),无限画布支持 720° 全景图、3D 导演台与多角度打光编辑器,已接入 Seedance 2.5、可灵等主流视频生成模型。DramaWave 平台上线的 3 部 AI 短剧在发布后 7 天内均实现流水破百万美元。

AI 短剧生产从「随机抽卡祈祷出好镜头」到「先规划导演思维再生成视频」的范式转移,标志着 AI 视频创作工具链向可控性迈出实质性一步;6 源齐发叠加百万美元商业数据双重验证,是目前最完整的 AI 短剧可控生产公开案例。

查看原始来源 ↗

Google Blog / TechCrunch· 7月16日一手 产品

Google Workspace 正式推出个人 AI 数字人,用户录制一次自拍和声音样本,即可在 Vids 中以本人形象出镜任意视频,并内嵌 SynthID 隐形水印。

Google Workspace 在 Vids 中正式上线「个人 AI 数字人」:用户录制一次自拍和声音样本,即可在后续所有 Vids 视频中以本人形象出镜;同步接入 Gemini Omni,支持自然语言驱动视频生成、背景替换与光效修复,并内嵌 SynthID 隐形水印。此次更新直接对标 HeyGen 和 Synthesia,将 AI 数字人与视频生成统一进 Workspace 生产力套件。

Google 通过办公视频场景将 AI 数字人主流化,打破了专用 AI 视频工具的订阅壁垒,为企业和教育场景的低成本 AI 讲解视频制作提供了新路径。

查看原始来源 ↗

量子位/36氪/凤凰科技等· 7月15日 模型

Xmax AI发布X2.0模型,实现端侧实时交互视频生成,延迟低于300ms,是端侧推理能力在视频生成场景的重要突破。

Xmax AI于2026年7月15日发布X2.0模型,实现在端侧设备上进行实时交互式视频生成,官方公布的响应延迟低于300ms,支持用户通过文字或动作输入实时驱动视频内容变化。该成果获量子位、36氪、凤凰科技等多家媒体重点报道,被视为端侧推理能力突破在视频生成场景的标志性进展。

端侧实时视频生成打破了视频AI工具必须依赖云端算力的限制,为离线创作场景与实时表演互动等方向开辟了新的技术可能性,是近期AI视频赛道最值得关注的硬件性能突破之一。

查看原始来源 ↗

PixVerse官方博客/Yahoo Finance等· 7月15日一手 产品

PixVerse宣布完成C轮融资延伸轮并进军交互娱乐,发布Game AI引擎,支持实时视频生成驱动游戏场景与角色行为。

PixVerse于2026年7月15日宣布完成C轮融资延伸轮,同步发布Game AI引擎并正式进军交互娱乐领域,该引擎支持通过实时视频生成驱动游戏场景变化与角色行为响应,将视频生成能力从内容创作延伸至游戏交互场景。消息由PixVerse官方博客发布,Yahoo Finance等国际媒体同步跟进。

PixVerse从视频创作工具转向交互娱乐引擎,代表AI视频生成能力向游戏化交互场景的战略扩展,对数字媒体艺术与游戏设计方向的课题有直接的前沿参照意义。

查看原始来源 ↗

ComfyUI官方GitHub· 7月15日一手 产品

ComfyUI发布v0.28.0版本,新增原生视频处理节点并优化整体运行性能,进一步强化其作为AI创作工作流核心枢纽的地位。

ComfyUI于2026年7月15日发布v0.28.0版本,本次更新新增原生视频处理节点支持,允许在工作流中直接处理视频帧序列,同时对调度器与显存管理进行了性能优化,提升大型工作流的运行稳定性。更新内容由ComfyUI官方GitHub发布。

ComfyUI持续向视频方向扩展原生能力,对以其为工作流核心工具的院校AI创作课程而言,本次更新值得在工具链维护时跟进评估。

查看原始来源 ↗

人民网/上海交大· 7月13日 论文

上海交通大学于2026年7月13日发布WNM(World Narrative Model)世界叙事模型,支持创作者与AI协同构建可编辑、可交互的叙事时空,专门针对现有AI视频生成在叙事连贯性和创作可控性上的瓶颈,面向影视级视频媒体制作场景。

上海交通大学于2026年7月13日发布WNM(World Narrative Model,世界叙事模型),人民网和上海交大官方渠道同步报道。WNM的核心设计目标是实现创作者与AI系统协同构建叙事时空:创作者可对生成的叙事结构进行直接编辑与交互调整,而非接受AI一次性输出的不可干预结果。该模型针对当前AI视频生成领域普遍存在的「不可控」瓶颈——即叙事连贯性难以维持、场景过渡逻辑混乱——提出结构性解法,设计目标面向影视级视频媒体制作场景。研究目前处于发布初期,工程化落地情况有待跟踪。

AI视频生成从「一键出片」走向「叙事可编辑」,这一研究方向与影视、动画、数字媒体专业的创作需求直接对应,值得关注其后续工程化进展。

查看原始来源 ↗

Variety/BusinessWire/新智元/51CTO· 7月9日 案例

好莱坞独立导演PJ Ace使用PAI 2.0生成的3分钟AI短片播放量破百万,Utopai Studios平台在60天内年化营收达1100万美元,PAI Pro Skill矩阵开源并已接入Claude Code与Cursor。

据Variety及多源报道,好莱坞独立导演PJ Ace使用Utopai Studios的PAI 2.0平台制作的3分钟AI生成短片播放量突破百万,成为AI视频进入主流专业创作圈的典型案例。Utopai Studios公开数据显示,该平台在正式发布后60天内实现年化营收(ARR)约1100万美元。与此同时,PAI Pro Skill矩阵开源,并已实现与Claude Code、Cursor等AI编码Agent的无缝协作。

从创作工具到有可查商业数据的AI视频平台,PAI 2.0的好莱坞落地案例展示了AI生成视频在专业级内容创作中商业化路径的完整闭环,可作为影视、数媒方向的产业实践案例。

查看原始来源 ↗

新智元/搜狐/知乎· 7月9日 论文

Ant Group旗下Robbyant开源LingBot-World 2.0,实现全球首个小时级连续运行世界模型,支持720p/60fps实时生成,一张图片可延展为无限AI世界。

Ant Group旗下Robbyant团队开源了LingBot-World 2.0世界模型,据多源报道,这是目前全球首个支持小时级连续运行的世界生成模型,可在720p分辨率、60帧每秒的条件下实时生成场景。其核心特性是可从单张图片出发,生成持续延展的AI世界,突破了此前视频生成模型的短片级时长瓶颈。

小时级连续运行世界模型的开源,为游戏环境生成、影视场景设计与虚拟空间教育场景提供了新的技术参照,对数字媒体、交互设计、游戏设计方向的研究与教学有参考价值。

查看原始来源 ↗

Google官方Blog· 7月8日一手 产品

Google Photos上线Video Remix功能,由Gemini Omni驱动,支持将用户视频转换为水彩、素描、油画艺术风格及电影级色彩重映,已在14国上线。

Google Photos于2026年7月8日推出Video Remix功能,由Gemini Omni模型驱动,支持对用户手机视频应用三档艺术风格——水彩、素描、油画——以及电影级色彩重映和背景替换效果。功能入口位于Google Photos「创意」标签页,已在14个国家面向Google AI Plus/Pro/Ultra订阅用户上线。

消费级应用将AI风格迁移能力直接集成到手机相册内,艺术类风格的实时可及性大幅提升,也为风格迁移技术的实际使用门槛与审美偏好提供了大规模用户验证场景。

查看原始来源 ↗

机器之心 / arXiv· 7月7日编辑精选 论文

TryOnCrafter提出首个支持自由视角的视频虚拟试衣DiT框架,引入4D试衣代理机制,入选ECCV 2026,机器之心与arXiv双源确认。

TryOnCrafter是一个基于扩散Transformer(DiT)的视频虚拟试衣框架,提出了首个支持自由视角的4D试衣代理机制,可从多个视角对服装穿着效果进行视频级生成与评估。研究成果入选ECCV 2026计算机视觉领域顶级会议,由机器之心及arXiv于2026年7月7日报道发布。与既有方法相比,TryOnCrafter在视角自由度与时序一致性上有系统性改进。

自由视角的视频级虚拟试衣能力在电商、数字服装及AI辅助设计等场景中有直接应用价值,ECCV 2026的入选也为该方向的学术认可度提供了参照。

查看原始来源 ↗

量子位· 7月7日 模型

魔芯发布Flash World Model,视频世界模型训练成本较同类降低70%,实现50FPS实时交互世界生成。

魔芯发布Flash World Model,在视频世界模型训练成本上实现约70%的降幅,同时支持50FPS的实时交互世界生成。该成果由机器之心与量子位等媒体报道。

世界模型训练成本大幅压缩有助于降低实时交互场景的部署门槛,推动AI生成内容向实时可控方向演进。

查看原始来源 ↗

量子位 / TechTimes / AI Weekly...· 7月6日编辑精选 案例

独立电影人群体正悄然转向字节Seedance 2.5,AI视频生成成本约$9/分钟较传统摄制$24/分钟大幅压低,量子位、Variety等多源报道证实这一趋势正在专业创作圈扩散。

量子位、TechTimes、AI Weekly及Variety等多源报道显示,字节旗下AI视频生成工具Seedance 2.5正在好莱坞独立电影人群体中加速渗透。核心驱动因素在于成本差距:AI视频生成约$9/分钟,较传统专业摄制的$24/分钟降低约62%,价差推动部分独立电影人将其纳入正式制作流程,而非仅用于概念验证。相关加更长文已于2026-07-08写就。

AI视频工具从创意探索进入专业制作采购决策的转折,标志着成本驱动的替代逻辑开始在影视产业链中实际生效,对AI视频生成商业化进程及国内竞品格局具有直接参照价值。

查看原始来源 ↗

IT之家 / 量子位 / 36氪 / 雷锋网 / 新浪科技· 7月6日编辑精选 模型

字节跳动即梦旗下 Seedance 2.5 视频生成模型公布:主打多镜头跨场景人物一致性与专业运镜控制;公测尚未正式面向全体用户开放,具体上线时间以官方为准

字节跳动旗下即梦(Dreamina)公布新一代视频生成模型 Seedance 2.5,核心能力包括多镜头叙事场景下的跨片段人物/场景一致性保持,以及专业级运镜控制(推拉摇移跟等镜头语言),在连贯性与画面质量上均有提升。公测尚未正式面向全体用户开放,具体开放时间与范围以官方公告为准。

多镜头一致性与运镜控制是 AI 视频从「单段生成」走向「可导演式叙事视频」的关键门槛,值得关注其后续公测节奏。

查看原始来源 ↗

优设情报 / IT之家· 7月6日编辑精选 模型

Gemini Omni Flash 在 Video Arena 盲测中以 1404 Elo 分领先全部 AI 视频模型,字节 Seedance 2.0 Mini 以 1303 Elo 居次,前十名 Google 占 5 席

Video Arena 最新盲测排行显示(2026 年 7 月 6 日),Gemini Omni Flash 以 1404 Elo 分登顶所有 AI 视频生成模型,字节 Seedance 2.0 Mini 以 1303 Elo 居次,前十名中 Google 旗下产品占据 5 个席位。此次排名基于 Video Arena 公认的公正第三方盲测机制,由优设情报与 IT 之家双源报道。

Video Arena 盲测为目前公认的 AI 视频生成横向评测基准,该排名为 AI 视频教学工具选型和课程演示提供了当前最具参考价值的综合横向对比数据。

查看原始来源 ↗

arXiv / 优设· 7月4日一手 模型

Wan-Streamer v0.1 提出端到端实时音视频流数字人生成框架,论文 arXiv:2606.25041 提前公开,覆盖音频驱动唇形同步与实时视频流输出全链路

arXiv 论文 2606.25041 提前公布 Wan-Streamer v0.1,这是一个面向实时音视频流数字人场景的端到端生成框架:输入实时音频流,直接输出可流式传输的数字人视频,覆盖音频驱动、唇形同步与实时编码全链路,无需离线分段渲染。优设同期跟进了技术解读。

端到端流式架构将数字人生成从「离线渲染后播放」推向「实时流媒体直推」范式,对直播、客服、数字主播等场景的工程化落地路径有直接参考价值。

查看原始来源 ↗

PR Newswire / 雷锋网 / IT之家 / 量子位· 7月3日一手编辑精选 模型

生数科技发布 Vidu S1:一张照片 + 实时语音即可生成可持续互动的 AI 数字角色,540P/25FPS 全双工交互,AR+扩散混合架构,模型侧延迟约 200ms

生数科技于 2026 全球数字经济大会(7/3)发布 Vidu S1 实时交互视频生成模型:输入一张照片与实时语音,即可生成支持持续对话互动的 AI 数字角色,输出规格为 540P/25FPS 全双工交互,采用 AR+扩散混合架构,模型侧延迟约 200ms;支持真人、动漫、萌宠等多种视觉风格。消息由 PR Newswire 官方英文稿及中文 6 个信源同步确认。

AI 视频生成首次跨越从「批量预渲染」到「实时双向交互」的技术边界,将数字角色从单向播放内容升级为可持续对话的交互对象。

查看原始来源 ↗

SIGGRAPH 2026 官方 / PRNewswire· 7月2日一手 案例

SIGGRAPH 2026 计算机动画节入选 Google DeepMind 团队 AI 辅助油画风动画短片,艺术家全程主导 + AI 协同创作模式获学院奖认证节展认可

SIGGRAPH 2026 计算机动画节(CAF)公布入选名单,Google DeepMind 团队创作的 AI 辅助动画短片《Dear Upstairs Neighbors》入选,作品采用油画风格,由艺术家全程主导创作方向,AI 在过程中担任协同角色。CAF 为学院奖认证评审节展,将于 7 月 19–23 日在洛杉矶举办,同场包含《阿凡达:烈焰与灰烬》《曼达洛人与格罗古》等好莱坞大制作生产揭秘环节。

学院奖认证节展正式接纳 AI 辅助创作作品,且作品来自 Google DeepMind,是 AI 在主流动画产业认可体系中获得正式位置的参照节点。

查看原始来源 ↗

Runway 官方 changelog· 7月2日一手 产品

Runway 推出 Agent Skills(7/2),支持用简单命令构建完整广告活动与商业视频,AI 代理接管从概念到成片的全流程

Runway 于 7 月 2 日在官方 changelog 发布 Agent Skills:用户通过简单的命令描述即可触发 AI 代理自动完成从概念设定、脚本规划到视频成片的完整商业视频生产流程;支持广告活动、品牌推广视频、本地化广告等场景,AI 代理负责中间所有编排步骤。

商业视频生产从「工具辅助」转向「Agent 全流程接管」的实践案例,反映出 AI 视频工具在内容生产自动化程度上的阶段性跃升。

查看原始来源 ↗

Google 官方 / CineD / NoFilmS...· 7月1日一手 模型

Google Veo 3.1 新增原生 9:16 竖版视频输出、1080p-4K 超分辨率及跨场景角色一致性能力,已上线 Gemini App、YouTube Shorts、Gemini API 等平台

Google 于 7 月 1 日发布 Veo 3.1 重大功能更新:新增原生 9:16 竖版视频输出(适配 YouTube Shorts 等竖屏平台)、1080p-4K 超分辨率处理,以及跨场景叙事中同一角色外观一致性的显著提升。更新已同步上线 Gemini App、YouTube Shorts、Flow 创作平台、Gemini API 及 Vertex AI。

Veo 3.1 将竖版格式作为原生输出选项,反映出主流 AI 视频生成工具开始原生适应短视频平台的竖屏内容生产需求。

查看原始来源 ↗

Apple Newsroom / PetaPixel ...· 6月30日一手编辑精选 产品

Apple 于 2026-06-30 免费更新 Creator Studio:Final Cut Pro 新增端侧 AI 的 Auto Mask(自动分离皮肤/头发/天空等)、Generate Subtitles(自动字幕转录)、Edit Detection(从成品还原原始片段);Pixelmator Pro 与 FCP/Keynote/Pages/Numbers 跨应用实时同步编辑。

Apple 于 2026-06-30 发布 Creator Studio 重大更新(免费):Final Cut Pro 新增三项端侧 AI 功能——Auto Mask(自动识别并分离皮肤、头发、天空、植被、衣物)、Generate Subtitles(自动字幕转录)、Edit Detection(从渲染成品还原对应原始片段);Pixelmator Pro 与 Final Cut Pro、Keynote、Pages、Numbers 深度打通,实现跨应用同步编辑;AI 图像生成与矢量形状生成功能宣布即将到来,需 Apple Intelligence 设备支持。

Auto Mask 将视频后期逐帧手绘遮罩这一最耗时的工序压缩至秒级,直接影响影视剪辑课程的操作流程;Pixelmator Pro 打通「精修→剪辑→演示」全链路,使学生在 Mac 生态内完成从静态设计稿到动态视频输出的全流程成为可能,对开设摄影后期、影视制作方向的院系有直接工具升级意义。

查看原始来源 ↗

量子位 / 新智元 / 甲子光年· 6月30日编辑精选 产品

Agnes AI 发布 PC 端创作平台 Pavo,用智能路由把「一句话」自动拆成剧本、角色设计、分镜直至成片;其自研文本/图像/视频全模态模型 API 自 6 月起永久免费、不限量,在烧钱的 AI 短剧赛道以「免费」切入。

2026 年 6 月底,Agnes AI 发布 PC 端创作平台 Pavo,将「拆剧本 → 角色设计 → 分镜 → 成片」整合进一条工作流——用户一句话描述,平台经智能路由自动完成多步生成,无需在多个工具间切换;其自研文本 / 图像 / 视频全模态模型 API 自 6 月起永久免费、不限量。

在普遍烧钱的 AI 短剧 / 视频赛道以「免费 + 一站式工作流」切入,是该领域商业模式与工具形态的一个值得观察的样本,对 AI 影像创作的教学与研究具参照意义。

查看原始来源 ↗

央视网 / 人民日报 / 澎湃· 6月29日 行业

广电总局发布微短剧分类分层管理标准,按投资额与题材分三类实行备案与发行许可,并要求 AI 生成、制作的微短剧在每集明显位置添加提示标识,自 2026 年 7 月 1 日起施行。

国家广播电视总局发布微短剧分类分层管理标准,自 2026 年 7 月 1 日起施行:按投资额与题材分三类实行备案公示与发行许可;并专门规定,使用 AI 生成、制作的微短剧,制作机构与播出单位应在每集明显位置添加提示标识。

「AI 生成内容须标识」首次明确落到微短剧这一高速增长形态,是 AIGC 内容合规化的一个标志性节点,对 AI 影像创作与内容生产方向具直接政策参照价值。

查看原始来源 ↗

新浪财经· 6月26日 观点

字节 Seedance 2.5 与阿里 HappyHorse 1.1 同日亮相,可灵估值下调至 150 亿美元,Sand.ai 融资超亿美元——深度分析认为国内 AI 视频赛道正从「技术炫技」进入「商业化验证」阶段。

2026 年 6 月下旬,字节 Seedance 2.5 与阿里 HappyHorse 1.1 几乎同日发布,与此同时可灵估值从高点下调至约 150 亿美元,Sand.ai 完成超亿美元新一轮融资。新浪财经对上述动态进行深度分析,认为国内 AI 视频赛道的竞争重心已从模型能力演示转向可量化的商业场景落地——谁能在影视、广告、短视频平台等方向率先实现稳定的付费闭环,将决定下一阶段的格局走向。

生成式 AI 视频的技术迭代速度趋于收敛,商业化路径与产品化能力的差异正在取代参数指标,成为赛道玩家的核心竞争要素。

查看原始来源 ↗

arXiv (2606.25306) / TechWa...· 6月24日一手 论文

北卡罗来纳大学、Johns Hopkins、AI2 与德克萨斯大学奥斯汀联合发布 PQSG 评估体系(arXiv:2606.25306),首次系统评估 AI 视频生成模型的物理一致性,覆盖刚体动力学、流体模拟、软体变形,揭示主流视频模型的系统性物理短板。

北卡罗来纳大学、Johns Hopkins、AI2 与德克萨斯大学奥斯汀联合发布 PQSG(物理问题场景图)评估体系(arXiv:2606.25306,2026-06-24),首次系统评估 AI 视频生成模型的物理一致性,覆盖刚体动力学、流体模拟、软体变形三大场景,对 Sora 2、Veo 3 等商业主流模型进行了定量评分,揭示现有视频模型在物理场景上存在系统性不足。

了解 AI 视频工具的物理局限,是在课堂中准确设定工具边界的前提:动画、影视、游戏方向的师生在用 Sora 2、Veo 3 制作含流体或刚体运动内容时,可参考 PQSG 指出的具体失效场景,避免将模型缺陷当作设计意图;该评估方法本身也是「批判性使用 AI 工具」教学单元的优质素材。

查看原始来源 ↗

foxnan.com· 6月24日一手 模型

Sky Computing Lab 开源 FastWan-QAD 量化感知蒸馏方案,单卡 RTX 5090 端到端 1.8 秒生成 5 秒 480P 视频,较标准版显著降低硬件门槛,模型与代码已完整开源。

Sky Computing Lab 于 2026 年 6 月 24 日开源 FastWan-QAD(量化感知蒸馏)方案,针对 Wan 系列视频生成模型进行轻量化优化:在单张 RTX 5090 显卡上可实现端到端 1.8 秒生成 5 秒 480P 视频,相较标准版本大幅降低了对高端多卡配置的硬件依赖;模型权重与推理代码均已完整开源,可直接用于本地部署。

大幅压缩推理延迟与硬件门槛的开源方案,是 AI 视频生成向更低成本个人与教学环境延伸的代表性案例;对需要本地运行视频生成工作流、控制硬件成本的研究与教学场景有直接参考价值。

查看原始来源 ↗

火山引擎 / 机器之心 / 量子位 / 36氪 / A...· 6月23日一手编辑精选 模型

火山引擎在 FORCE 大会发布 Seedance 2.5,首次实现 30 秒原生单段直出和 50 个全模态素材联合生成,同步发布图像模型 Seedream 5.0 Pro 和音频模型 Seed-Audio 1.0。

火山引擎于 2026 年 6 月 23 日在 FORCE 大会(北京)发布 Seedance 2.5,核心能力包括:30 秒原生单段直出(非拼接)、同时输入最多 50 个全模态素材进行联合生成、以及画面局部一致性编辑(仅改变指定区域而不影响其余帧);ByteDance 直接从 2.0 跳号至 2.5,以版本命名强调代际差异;同步发布 Seedream 5.0 Pro 图像模型(输出可编辑分层设计图)和 Seed-Audio 1.0 音频模型(据介绍支持 0 样本多角色对白与拟音生成,具体能力以官方说明为准);4+ 中英文源同日报道。

30 秒原生直出是现阶段视频生成时长的显著突破,与图像、音频三模态同场发布代表国产生成式 AI 向统一内容创作管线方向的集中布局;Seedream 5.0 Pro 的分层设计图输出可直接接入 Figma / Photoshop 设计工作流。

查看原始来源 ↗

量子位 / 优设· 6月23日编辑精选 案例

可口可乐中国 2026 世界杯限定版 TVC 5 人 5 城场景全由 Prompt 生成(操盘方百度一镜),范志毅数字人实现 2 秒端到端实时互动,是顶级国际品牌世界杯广告预算被 AI 替代的直接落地案例。

2026 FIFA 世界杯期间,可口可乐中国限定版 TVC 全面采用 AI 生成:5 名真实演员、5 个城市场景的画面均从文字 Prompt 生成(操盘方为百度一镜,原慧播星),实现导演级运镜一致性;同步推出范志毅 AI 数字人,支持 2 秒端到端实时互动,涵盖上海话方言、当下热梗和情绪感知;据媒体转述(未独立核实),英文侧可口可乐另与 Footballco 合作、由 Jose Mourinho 数字人在 TikTok / Instagram 产出 200+ AI 生成内容,与中国案例为两条独立 AI 营销线。

国际 A 类品牌在全球最贵广告位(世界杯 TVC)上将生产流程全面切换至 AI Prompt 生成,是品牌设计和广告行业真实落地的标志性案例,直接影响广告设计、品牌营销和影视制作专业的职业预期判断。

查看原始来源 ↗

Variety / Deadline / Busine...· 6月22日编辑精选 案例

华策影视与 Utopai Studios 联合宣布《西游记:失落的五百年》,采用 Utopai 第二代 PAI 平台全流程制作,被定位为全球首部工业级全 AI 中国经典 IP 动画剧集,第一季定向全球流媒体与广播发行。

2026 年 6 月 22 日,华策影视与 Utopai Studios 正式宣布联合制作动画剧集《西游记:失落的五百年》。该项目以西游记经典 IP 为基础,采用 Utopai 第二代 PAI(Production AI)平台全流程制作,被 Variety、Deadline、Business Wire 等多家英文媒体定位为全球首部工业级全 AI 制作的中国经典 IP 动画剧集。发行层面,华策持有国内发行权,Utopai 持有海外发行权;第一季内容定向全球流媒体平台及广播渠道,后续计划拓展院线系列。

此案例将「全 AI 工业流水线」与「成熟 IP + 大型制作公司合作」两个维度首次结合落地为已宣布发行的商业项目,区别于此前多数 AI 动画的短片或概念验证性质;对影视、动画、数字媒体方向的师生而言,其制作流程与发行模式均具有较高的行业参考价值。

查看原始来源 ↗

量子位· 6月22日 模型

阿里 HappyHorse 1.1 版本升级动态表现力、9 图角色一致性、复杂场景指令、视觉质感和音频口播五个维度,同步宣布启动 Horsepower AI 影像大赛(张纪中评委)。

阿里于 2026 年 6 月 22 日发布 HappyHorse 1.1 版本更新,在五个维度进行了针对性提升:动态表现力、9 张图像角色一致性、复杂场景指令遵循、视觉质感和音频口播能力;同步宣布启动 Horsepower AI 影像大赛,邀请著名影视制作人张纪中出任评委之一。

HappyHorse 在角色一致性和复杂场景指令方向的持续升级,对关注国产视频生成模型能力演进或正在评估 AI 视频工具用于教学实验的师生有参照意义。

查看原始来源 ↗

CSDN / AI认知工坊· 6月20日一手 产品

ComfyUI v0.25.1 正式发布,核心更新为 Kling V3-Turbo 节点接入,并附入门指南,进一步扩展视频生成工作流能力。

ComfyUI 于 2026 年 6 月 20 日前后发布 v0.25.1 版本,核心更新为正式接入 Kling V3-Turbo 视频生成节点,支持在 ComfyUI 工作流内直接调用 Kling 的 Turbo 模式生成视频;发布方同步提供入门配置指南,降低接入门槛。此前 v0.23.0(6 月 1 日)已引入 NVIDIA PixelDiT 和 Microsoft Lens 支持。

Kling V3-Turbo 进入 ComfyUI 节点生态,意味着视频生成已可与图像后期处理管线深度串联,对教授完整 AI 创作工作流的课程设计具有实际参考价值。

查看原始来源 ↗

Variety / Hollywood Reporte...· 6月18日 行业

第 28 届上海国际电影节(6/12–22)设立「技术创制单元」并推出 AI Backlot 计划,全球收到 500+ 申请,4 支跨国团队在电影节开放工作室实时制作 AI 短片,标志 AI 正式进入主流电影节的创作机制。

第 28 届上海国际电影节(2026 年 6 月 12–22 日)设立「技术创制单元」,并推出 AI Backlot 计划:面向全球征集、收到 500+ 份申请,遴选出的 4 支跨国团队在电影节期间的开放工作室内实时制作 AI 短片。据 Variety、Hollywood Reporter 等报道,这一安排把生成式 AI 创作纳入主流电影节的正式机制,而非作为外围展示。

顶级电影节将 AI 创作设为正式单元,是「AI 进入主流影视生产机制」的一个机制性信号;对影视、动画与数字媒体方向的教学与研究,提供了可追踪的产业落地节点与作品样本。

查看原始来源 ↗

Runway 官方· 6月18日一手 模型

Runway 上线 Studio 内置编辑器,Gen-4.5 居文生视频基准榜首。

Runway 于 6 月 18 日推出 Studio 功能,用户可在同一界面内完成 AI 视频裁剪、拼接、重排序与导出;Gen-4.5 目前在 Artificial Analysis 文生视频基准测试中以 Elo 1247 居于榜首,近期新增 image-to-video 功能;同期 Runway API 接入 Seedance 2.0 Fast(6/5),支持关键帧控制与参考图像视频生成,4–15 秒、480p/720p 输出。

视频生成 + 内置后期整合进单一工具,缩短了影像创作工作流;Gen-4.5 当前的基准排名意味着它是综合可用性最强的文生视频工具之一。

查看原始来源 ↗

Google Workspace Blog· 6月18日一手 产品

Google Vids 升级:Veo 3.1 免费、Lyria 3 AI 配乐、AI 虚拟人扩至 53 种。

Google 宣布对 Google Vids 进行重大升级:所有 Google 账号每月可免费使用 Veo 3.1 生成 10 条视频;AI Pro/Ultra 订阅用户可用 Lyria 3 生成 30 秒至 3 分钟自定义背景音乐;AI 虚拟人预设从 23 种扩展至 53 种(含写实、3D 卡通、图形小说等风格),新增导演级场景交互控制。

Veo 3.1 免费化显著降低文生视频的使用门槛;Lyria 3 的 AI 配乐省去背景音乐单独授权,对影像 / 多媒体创作有直接价值。

查看原始来源 ↗

Figma / Runway· 6月18日一手 产品

Figma AI 设计 Agent 新增联网搜索能力,Runway Aleph 2.0 同步嵌入 Figma Weave 画布,设计师可在 Figma 内直接用文字提示编辑视频帧。

Figma 于 2026 年 6 月 18 日宣布两项 AI 功能更新:其一,Figma 设计 Agent 新增网络搜索能力,可在设计过程中实时拉取网络内容、行业最佳实践与真实素材填充设计稿,替代占位图;其二,Runway Aleph 2.0 正式集成进 Figma Weave 画布,设计师无需切换工具即可对现有视频片段进行文字提示式编辑——修改相机角度、替换背景环境、引入新角色——并支持多方向并排比较与连续迭代,视频输入上限 30 秒,支持多张参考图作为关键帧。

设计工具与视频生成管线的深度集成,是「设计即内容生产」趋势的实质推进,为视觉传达、动效设计及跨媒体创作教学的工作流整合提供了可观察的产业参照。

查看原始来源 ↗

Variety / Sixth Tone / 多源· 6月15日 产品

MiniMax 于上海国际电影节期间发布 MiniMax Hub,整合图像、视频、配音、音乐与剪辑的一站式多模态创作平台,由 Agent 拆解任务并保留人工决策节点,4 支跨国团队用于电影节 AI 短片制作。

2026 年 6 月,MiniMax 在上海国际电影节期间发布多模态 AI 创作平台 MiniMax Hub,将图像、视频、配音、音乐与剪辑整合到同一平台;平台以 Agent 自动拆解创作任务,并在流程中保留人工决策节点,强调「AI 执行、人把关」的协作方式。据 Variety 等报道,本届电影节有 4 支跨国团队实际使用该平台进行 AI 短片制作;平台经 hub.minimax.io 提供免费下载。

多模态创作从「分散的单点工具」走向「带任务编排的一体化平台」,对影视、动画与短片方向的创作教学而言,提供了一个可观察的「Agent 编排 + 人工把关」工作流样本。

查看原始来源 ↗

arXiv / CVPR 2026 / 机器之心· 6月15日一手 论文

UIUC 与 Eyeline Labs 提出 FreeOrbit4D:输入单目视频,无需额外训练即可重拍出任意相机轨迹视角;于 CVPR 2026 Workshop 展示,代码开源,单卡 A40 可运行。

arXiv 论文 2601.18993(UIUC + Eyeline Labs)提出 FreeOrbit4D 框架,核心思路是对输入单目视频中的前景做完整 4D 重建,再由视频扩散模型引导生成任意相机轨迹下的重拍结果,全流程无需针对输入视频额外训练;于 CVPR 2026 Workshop 展示,代码已开源,可在单张 A40 显卡上运行。论文提交 arXiv 时间为 2026 年 6 月 15 日,机器之心及网易等中文媒体有跟进报道。

单目视频任意运镜的无训练重拍能力,对影视后期、虚拟制片、数字媒体等专业的学生有直接的实验与创作应用价值;单卡可运行的硬件门槛也使课堂实践具有可行性。

查看原始来源 ↗

arXiv / 机器之心 / chooseAI· 6月15日一手 论文

高德 AI 团队在 arXiv 发布 DreamX-World 1.0,可生成 1 分钟长视频,支持 6 自由度相机控制与「世界记忆」机制,采用 MIT+Apache-2.0 双协议开源。

高德 AI 团队于 2026 年 6 月 15 日在 arXiv(论文编号 2606.16993)发布 DreamX-World 1.0,这是一个通用交互式世界模型,支持最长 1 分钟连续视频生成、6 自由度(6DoF)相机控制,并引入「世界记忆」机制以维持跨时间步的场景一致性;模型以 MIT+Apache-2.0 双协议开源,ComfyUI 整合包同步上线。

长视频世界模型的开源发布,为研究 AI 驱动叙事空间、交互式影像创作及沉浸体验原型的师生提供了可直接实验的开源基础设施。

查看原始来源 ↗

Runway· 6月5日 产品

Runway API 正式接入 Seedance 2.0 Fast,支持关键帧控制、参考图及参考视频生成,输出 4–15 秒视频,提供 480p/720p 两档分辨率。

Runway 于 2026 年 6 月 5 日通过 API 接入 Seedance 2.0 Fast,开发者和创作者可通过 API 调用关键帧控制、参考图生成、参考视频驱动等功能,单次生成支持 4–15 秒视频,提供 480p 和 720p 两档分辨率输出,补充了 Runway Studio 编辑器之外的程序化接入路径。

API 层接入意味着 Seedance 2.0 的视频生成能力可以嵌入自定义工具或课程平台,为有程序化批量生成需求的教学实验与创作工作流提供了新的整合入口。

查看原始来源 ↗