浅译周报
视频模型发布与 AI 水印新规
7 月 27 日至 8 月 2 日,共收录资讯 13 条。视频方向,MiniMax 发布 H3,支持 2K、15 秒视频与原生立体声,开源权重首发 ModelScope;字节跳动 Seedance 2.5 把单次生成时长提到 30 秒。Adobe Research 与约翰斯·霍普金斯大学提出视频世界模型 Wonder。8 月 2 日,EU AI Act 第 50 条生效,AI 生成的图像、视频与音频须带机器可读标记。OpenAI 预告下一代旗舰模型 Astra,Google 发布 Lyria 3.5,谷歌地球的 Nano Banana 2 生图功能上线不到 24 小时即下架。
头条MiniMax H3正式发布:全模态2K/15秒视频+原生立体声,开源权重8月首发ModelScope- 1
- 2Wonder(Adobe Research+JHU):解决控制漂移/记忆衰减/延迟膨胀的视频世界模型,单图→可游走3D一致性世界arXiv 2607.26037
- 3EU AI Act Article 50正式生效:AI生成视频须机器可读水印,多层标记义务全面启动Cloud Security Alliance
01视频生成与实时编辑
本版导读MiniMax H3 支持全模态输入,生成最高 2K、15 秒、带原生立体声的视频,开源权重首发 ModelScope。字节跳动 Seedance 2.5 单次生成时长从 10 秒提到 30 秒,支持 50 个多模态参考素材,并发布 Maya 与 Blender 插件。清华与港科大的 LiveEdit 用 4 步去噪实现 12.66 FPS 实时逐帧编辑,已被 ECCV 2026 接收。
MiniMax发布H3(Hailuo 3.0),支持全模态输入生成最高2K分辨率、15秒、原生立体声视频,API当日可调用,开源权重首发ModelScope,ComfyUI同步支持。
原文 ↗字节跳动Seedance 2.5于7月31日正式发布,单次AI视频生成时长从10秒提升至30秒,支持50个多模态参考素材(图像+视频+文字混合),新增局部编辑,发布Maya/Blender插件打通影视工业流程;已全量上线即梦AI与豆包专业版。
原文 ↗清华×港科大联合提出LiveEdit,通过三阶段渐进蒸馏将双向扩散Transformer的视频编辑能力迁移至因果流式编辑器,仅需4步去噪即可实现12.66FPS实时逐帧视频编辑;ECCV 2026接收。
原文 ↗02世界模型与研究论文
本版导读Adobe Research 与约翰斯·霍普金斯大学提出 Wonder,可从单张图像或视频生成可交互、3D 一致的分钟级世界。上交大与上海创智学院的 A²-Edit 做参考图引导的局部编辑,精细掩码和粗略框选都可用。SIGGRAPH 2026 时间检验奖授予港大 Taku Komura 团队 2016 年的角色动画论文。JarvisHub 以可编辑画布同时作为创作工作区和外部记忆。
Adobe Research与Johns Hopkins大学提出Wonder视频世界模型:将相机运动转化为像素空间视觉线索(绕过神经隐式重建);稀疏检索全保真历史帧解决记忆衰减;实时蒸馏学生模型解决延迟膨胀;可从单张图像或视频生成可交互、3D一致性、分钟级时长的沉浸式世界;6方向实时导航@16fps。
原文 ↗上交大×上海创智学院提出A²-Edit,通过混合Transformer专家路由与掩码退火训练策略,支持任意物体类别+任意精度掩码的参考图引导局部编辑;无论用精细掩码还是粗略框选都能保持参考图细节,适用于电商视觉合成、虚拟试穿、品牌局部替换等场景。
原文 ↗SIGGRAPH 2026时间检验奖授予港大Taku Komura团队2016年发表的角色运动合成与编辑深度学习框架;该论文是首次将深度学习引入角色动画合成的先驱工作,对当前AI角色动画/物理AI运动生成有持续影响,GitHub项目已达8000+Star。
原文 ↗JarvisHub(arXiv:2607.23588,7/26提交,7/28开源)是首个以「可编辑画布」同时作为Agent工作空间、外部记忆和动作空间的多模态创作框架;三层架构(画布状态→协议桥接→Agent运行时)支持持续规划、迭代生成、版本管理;用户可随时介入、引导、检查Agent创作过程,突破孤立工具调用限制,迈向可持续人机协同创作自动化。
原文 ↗03政策与平台动态
本版导读EU AI Act 第 50 条透明度义务于 8 月 2 日生效,AI 生成的图像、视频与音频须嵌入机器可读标记,视频水印子义务有 4 个月宽限期,至 12 月 2 日。OpenAI 预告下一代旗舰模型 Astra,公开其内部版本解决的十道数学难题和 249 页技术报告。谷歌地球接入 Nano Banana 2,可用文字修改地理影像,上线不到 24 小时后下架。
EU AI Act Article 50(透明度义务)于2026年8月2日正式生效,所有AI生成图像、视频与音频须嵌入机器可读标记;AI视频水印子义务设4个月宽限期至12月2日。
原文 ↗OpenAI 以非常规方式预告下一代旗舰模型 Astra:不发布产品,而是在数学博客第三段点名,随后将 Astra 内部版本解决的十道历史级数学难题(群论/算子代数/格密码/量子复杂度等)推上 GitHub,附249页技术报告及完整 Lean 4 机器可验证证明。
原文 ↗谷歌地球嵌入Nano Banana 2模型,允许用户用文字指令修改真实地理影像(支持2K/4K输出+精准文字渲染),但因用户生成逼真「灾难场景」并在社媒传播,上线不到24小时紧急下架。
原文 ↗04音乐与创作工具
本版导读Google 发布 Lyria 3.5,在 Flow 工具中加入图片转音乐,上传图像即可生成情绪匹配的原创音乐。ComfyUI v0.29.0 至 v0.29.2 原生集成 JoyImageEdit、MageFlow 4B 和 Uni3C ControlNet,并加入 MiniMax H3 合作节点。LottieFiles 发布 Lottie Creator 2.0,可按文字描述生成关键帧动画。
Google发布Lyria 3.5音乐AI模型,在Google Labs Flow工具中集成「图片转音乐」功能,上传一张图像即可生成与其情绪、色彩、主题匹配的原创音乐,音质与音乐性显著提升。
原文 ↗ComfyUI v0.29.0–0.29.2原生集成JoyImageEdit图像指令编辑、MageFlow 4B、Uni3C ControlNet(Wan系列视频精准控制),v0.29.2追加MiniMax H3与Ideogram Partner Nodes。
原文 ↗LottieFiles发布Lottie Creator 2.0:浏览器内完整运动设计工具,Motion Copilot AI可从自然语言描述直接生成关键帧动画;新增图形编辑器、State Machine可交互性系统;支持导入AI/EPS/PDF/PSD/SVG/AEP/FLA等16种格式;无需安装,导出生产级Lottie动画;定价$19.99/月。
原文 ↗05征集与赛展
- 2026 广西数智艺术与实验艺术作品展览征稿广西壮族自治区党委宣传部 + 广西文学艺术界联合会 · 截止 8月15日
- 2026-W38实时视频编辑与开源图像模型
- 2026-W37Sora 关停与剪辑软件插件
- 2026-W36GPT-6 发布与世界模型更新
- 2026-W35视频生成模型集中更新
- 2026-W34版权归因研究与图像接口关停
- 2026-W33开源音乐与视频模型
- 2026-W32视频音频模型与创意软件接入
- 2026-W30设计 Agent 与图像模型发布
- 2026-W29WAIC 多模态模型与交互视频
- 2026-W28Meta 图像功能下架与幽灵字体
- 2026-W27图像模型、版权诉讼与视频融资
(本期完)
条目均来自本站已发布资讯,链回原卡片与原始来源;导读与本版导读为编辑汇编,不含评价。全部资讯 →