浅译周报
WAIC 多模态模型与交互视频
7 月 13 日至 19 日,共收录资讯 30 条。WAIC 2026 期间,商汤发布原生 8K 输出的 SenseNova U1 Pro,MiniMax 首次公开统一图像、视频与声音生成的 H3,昆仑万维发布 Matrix-Game 3.5。实时视频方面,Xmax AI X2.0 延迟低于 300ms,PixVerse 发布 Game AI 引擎。昆仑万维天工短剧工作台上线。SIGGRAPH 2026 开幕,Autodesk、NVIDIA 发布 3D 与渲染更新。Anthropic 设计负责人 Jenny Wen 出任 Cursor 设计主管。
头条商汤SenseNova U1 Pro @ WAIC 2026:首个「交付级」多模态创作模型,原生8K直出,200位美院评审盲测六成图可直接交付客户- 1
- 2
- 3
- 01图像与多模态模型5 件
- 02交互视频与 AI 短剧6 件
- 03设计工具与人事6 件
- 04世界模型与 3D 工具5 件
- 05研究、大会与赛事8 件
- 06征集与赛展3 项
- 07SKILL4 个
01图像与多模态模型
本版导读商汤在 WAIC 2026 发布 SenseNova U1 Pro,原生 8K 输出,200 位美院学生与设计师盲评中六成作品被评为可直接交付;另开源统一检测、分割、深度与 3D 重建的 SenseNova-Vision。MiniMax 首次公开 H3,标注「Coming Soon」。月之暗面发布 2.8 万亿参数的 Kimi K3。Gemini 3.5 Pro 确认延期。
商汤在WAIC 2026发布SenseNova U1 Pro,基于NEO-unify统一架构,原生8K输出,200位美院学生与设计师盲评六成作品「可直接交付客户」,在文字精准度与东方美学维度对标GPT Image 2并部分胜出。
原文 ↗MiniMax 在 WAIC 2026 首次公开 H3 模型,定位为将图像、视频、声音生成统一进单一架构的下一代多模态生成模型,现场标注「Coming Soon」。
原文 ↗商汤科技于2026年7月13日开源SenseNova-Vision,将检测、分割、深度预测、3D重建四大视觉任务原生统一到单一多模态架构,性能超越Vision Banana,以CC BY-NC 4.0协议开放,教学环境可自由使用。
原文 ↗月之暗面发布Kimi K3,2.8万亿参数MoE架构,原生三模态(文字/图像/视频)统一,100万Token超长上下文,权重7月27日全量开源,Apache 2.0协议允许商业使用。
原文 ↗谷歌 Gemini 3.5 Pro 原定 7 月 17 日发布已确认延期,主因是编程能力仍在打磨,10 名现任和前任员工参与确认。
原文 ↗02交互视频与 AI 短剧
本版导读昆仑万维发布天工短剧工作台 SkyProduction,可在生成视频前规划角色站位与机位,3 部 AI 短剧 7 天内均破百万美元流水。Xmax AI X2.0 实现端侧实时交互视频生成,延迟低于 300ms。PixVerse 发布 Game AI 引擎。Wan-Streamer v0.2 把端到端延迟降到约 550ms。Google Vids 推出个人 AI 数字人。
昆仑万维发布天工短剧工作台 SkyProduction,Agent 智能分镜可在视频生成前规划角色站位与机位;DramaWave 平台 3 部 AI 短剧 7 天内均破百万美元流水。
原文 ↗Xmax AI发布X2.0模型,实现端侧实时交互视频生成,延迟低于300ms,是端侧推理能力在视频生成场景的重要突破。
原文 ↗PixVerse宣布完成C轮融资延伸轮并进军交互娱乐,发布Game AI引擎,支持实时视频生成驱动游戏场景与角色行为。
原文 ↗阿里通义实验室发布 Wan-Streamer v0.2,将听、看、说、演统一进单个 Transformer,端到端交互延迟约 550ms,较 v0.1 大幅改善。
原文 ↗Google Workspace 正式推出个人 AI 数字人,用户录制一次自拍和声音样本,即可在 Vids 中以本人形象出镜任意视频,并内嵌 SynthID 隐形水印。
原文 ↗上海交通大学于2026年7月13日发布WNM(World Narrative Model)世界叙事模型,支持创作者与AI协同构建可编辑、可交互的叙事时空,专门针对现有AI视频生成在叙事连贯性和创作可控性上的瓶颈,面向影视级视频媒体制作场景。
原文 ↗03设计工具与人事
本版导读Anthropic 核心设计负责人 Jenny Wen 出任 Cursor 设计主管。Canva 接入 Google Gemini 并推出 Magic Layers 图层分离,Canva Code 2.0 向全部 2.65 亿月活用户免费开放。Figma Make 可直接连接 GitHub 仓库提交代码。Claude Code Artifacts 支持 MCP 连接器。
Anthropic 核心设计负责人 Jenny Wen 官宣跳槽,出任 AI 编程工具 Cursor 设计主管;她此前在 Figma 任设计总监,在 Anthropic 期间主导 Claude 产品设计与 Cowork 智能体愿景。Cursor 母公司 Anysphere 此前已被 SpaceXAI 收购。
原文 ↗Google将Canva作为Connected App引入Workspace,@Canva指令即可调用Gemini生成品牌视觉并直接插入文档;Canva同步推出Magic Layers AI图层分离功能,每层可独立编辑。
原文 ↗Figma Make新增GitHub双向集成,设计师可在画布中直接导入Git仓库、修改界面并提交代码变更,将视觉编辑器转变为可连接真实代码仓库的开发端口。
原文 ↗Anthropic 为 Claude Code Artifacts 新增 MCP 连接器调用能力,生成的看板/仪表盘页面可连接实时数据,不同查看者按各自权限拉取不同内容,7 月 16 日上线。
原文 ↗ComfyUI发布v0.28.0版本,新增原生视频处理节点并优化整体运行性能,进一步强化其作为AI创作工作流核心枢纽的地位。
原文 ↗Canva 将 AI 代码生成功能向全部 2.65 亿月活用户(含免费账户)开放,生成速度提升 75%,从提示到上线时间压缩 30%。
原文 ↗04世界模型与 3D 工具
本版导读昆仑万维在 WAIC 发布 Matrix-Game 3.5 与机器人世界模型 Riemann-1.0。魔芯 MoWorld 3D 世界模型上线华为云,可从单张照片生成 3D 场景。Autodesk 展示 Flow Studio 的 AI 自动绑骨架。NVIDIA 宣布 DLSS 4.5 随 Blender 5.3 发布,并发布 FLUX.2 RTX 优化。
昆仑万维董事长方汉在WAIC 2026世界模型专场论坛宣布2026为「世界模型元年」;发布Matrix-Game 3.5(Patch级记忆注入、单卡实时生成)和Riemann-1.0机器人世界模型,同步升级Mureka v9.5与O3音乐模型,预判AI音乐与视频将成大众创作工具。
原文 ↗Autodesk在SIGGRAPH 2026展示Flow Studio重大更新:AI Rigging移除角色制作最复杂技术环节自动绑骨架,Wonder 3D支持文字或参考图一步生成完整3D角色,Maya新增AI辅助四足动物运动生成。
原文 ↗国家具身智能应用中试基地联合华为云、魔芯科技发布MoWorld 3D世界模型,支持从单张照片生成完整3D场景,全栈基于国产NPU(昇腾)构建,正式上线华为云向全行业开放。
原文 ↗NVIDIA 在 SIGGRAPH 2026 开幕首日宣布 DLSS 4.5(含多帧生成与 AI 超分辨率)将随 Blender 5.3「今秋」正式发布,为开源 3D 工具引入 AI 加速渲染。
原文 ↗NVIDIA与Black Forest Labs在SIGGRAPH 2026发布FLUX.2 RTX专项优化:FP8量化VRAM减少40%/性能提升40%,NVFP4量化进一步实现2.7×加速和55%显存减少,ComfyUI深度集成同步推进,让消费级RTX显卡可流畅运行FLUX.2工作流。
原文 ↗05研究、大会与赛事
本版导读SIGGRAPH 2026 最佳论文授予多伦多大学与 CMU 的 GimmBO,大会展出扩散模型装置「Diffusion TV」。蚂蚁 LingBot-Vision 以 10 亿参数在深度估计上超过 70 亿参数的 DINOv3。DeepMind 发布视频通用模型 GenCeption。同济与腾讯云的 Skill 创新应用大赛收官,26 所高校近 300 名选手参赛。
蚂蚁集团提出「掩码边界建模」预训练范式,10 亿参数 ViT-g 在深度估计基准上超越 70 亿参数 DINOv3,透明物体深度估计达 RMSE 0.010,权重已开源。
原文 ↗SIGGRAPH 2026最佳论文(洛杉矶7月19–23日,1120+投稿):GimmBO(多伦多大学/CMU/Vector Institute)——实时交互式框架,将两个或多个生成图像模型的权重集融合,通过贝叶斯优化在融合空间导航,由用户偏好点击引导。
原文 ↗DeepMind发布GenCeption,是首个在单一模型中统一视频理解与生成能力的视觉通用学习器,在多项基准上取得领先结果。
原文 ↗同济大学与腾讯云联合举办的TT设计学院Skill创新应用大赛于2026年7月13日收官,全国26所高校近300名选手参赛,选手将真实设计流程痛点封装为AI智能体(Skill)工具,7支战队获奖,AI Agent正式进入高校设计教育的实践评估体系。
原文 ↗Google 团队提出 VGGRPO,通过隐空间 4D 几何奖励进行强化学习后训练,解决视频扩散模型几何漂移与摄像机轨迹不稳定问题,已被 ECCV 2026 收录。
原文 ↗北京大学联合深势科技提出PRA自回归图像生成框架,采用16维低维中间状态与并行解码机制,135M参数规模在像素空间的表现超过1.9B参数基线,绕开传统视觉tokenizer,目前处于理论突破阶段,工程化程度待评估。
原文 ↗SIGGRAPH 2026 会前公告披露两大 AI 亮点:将扩散模型实时可视化的沉浸装置「Diffusion TV」,以及「视频生成视觉语言」专题研讨工作坊,大会 7 月 19—23 日于洛杉矶举行。
原文 ↗北邮×中科院×StepFun提出MentalThink,让多模态大模型在推理中生成SVG草图「看图思考」,MindCube三维旋转测试76分超越GPT-5的56分,仅用7B参数模型。
原文 ↗06征集与赛展
- 第 38 届百花奖 AIGC 推优单元全球征集第 38 届大众电影百花奖组委会 · 截止 7月20日
- CAADRIA 2027 第32届国际会议征稿(学术会议)亚洲计算机辅助建筑设计研究学会(CAADRIA) · 截止 7月27日
- 第20届中国好创意 ·「活路儿」地方非遗生成式 AI 专项赛中国好创意大赛组委会 × 四川师范大学 · 截止 7月27日
07SKILL
- 2026-W38实时视频编辑与开源图像模型
- 2026-W37Sora 关停与剪辑软件插件
- 2026-W36GPT-6 发布与世界模型更新
- 2026-W35视频生成模型集中更新
- 2026-W34版权归因研究与图像接口关停
- 2026-W33开源音乐与视频模型
- 2026-W32视频音频模型与创意软件接入
- 2026-W31视频模型发布与 AI 水印新规
- 2026-W30设计 Agent 与图像模型发布
- 2026-W28Meta 图像功能下架与幽灵字体
- 2026-W27图像模型、版权诉讼与视频融资
(本期完)
条目均来自本站已发布资讯,链回原卡片与原始来源;导读与本版导读为编辑汇编,不含评价。全部资讯 →