浅译快报
2026 年 7 月 13 日 — 7 月 19 日AI × 艺术设计 · 每周综述每周一出刊

浅译周报

浅译快报 · TRANSWONDER.TOP
第 7 期 292026 年第 29 周07.13 — 07.19
30件大事69个来源15件一手30条精选7天有更新
本期导读

WAIC 多模态模型与交互视频

7 月 13 日至 19 日,共收录资讯 30 条。WAIC 2026 期间,商汤发布原生 8K 输出的 SenseNova U1 Pro,MiniMax 首次公开统一图像、视频与声音生成的 H3,昆仑万维发布 Matrix-Game 3.5。实时视频方面,Xmax AI X2.0 延迟低于 300ms,PixVerse 发布 Game AI 引擎。昆仑万维天工短剧工作台上线。SIGGRAPH 2026 开幕,Autodesk、NVIDIA 发布 3D 与渲染更新。Anthropic 设计负责人 Jenny Wen 出任 Cursor 设计主管。

头条商汤SenseNova U1 Pro @ WAIC 2026:首个「交付级」多模态创作模型,原生8K直出,200位美院评审盲测六成图可直接交付客户

01图像与多模态模型

本版导读商汤在 WAIC 2026 发布 SenseNova U1 Pro,原生 8K 输出,200 位美院学生与设计师盲评中六成作品被评为可直接交付;另开源统一检测、分割、深度与 3D 重建的 SenseNova-Vision。MiniMax 首次公开 H3,标注「Coming Soon」。月之暗面发布 2.8 万亿参数的 Kimi K3。Gemini 3.5 Pro 确认延期。

新新智元07.18
商汤SenseNova U1 Pro @ WAIC 2026:首个「交付级」多模态创作模型,原生8K直出,200位美院评审盲测六成图可直接交付客户

商汤在WAIC 2026发布SenseNova U1 Pro,基于NEO-unify统一架构,原生8K输出,200位美院学生与设计师盲评六成作品「可直接交付客户」,在文字精准度与东方美学维度对标GPT Image 2并部分胜出。

原文 ↗
每每日经济新闻07.17
MiniMax H3 @ WAIC 2026:下一代多模态生成模型,统一图像/视频/声音生成

MiniMax 在 WAIC 2026 首次公开 H3 模型,定位为将图像、视频、声音生成统一进单一架构的下一代多模态生成模型,现场标注「Coming Soon」。

原文 ↗
IIT之家一手07.13
商汤开源SenseNova-Vision统一视觉大模型:目标检测、图像分割、深度预测、3D重建四大任务原生统一单一架构,超越Vision Banana

商汤科技于2026年7月13日开源SenseNova-Vision,将检测、分割、深度预测、3D重建四大视觉任务原生统一到单一多模态架构,性能超越Vision Banana,以CC BY-NC 4.0协议开放,教学环境可自由使用。

原文 ↗
MMoonshot官方一手07.17
月之暗面Kimi K3:2.8万亿参数全球最大开源多模态模型,原生文字/图像/视频三模态,权重7/27全量开源

月之暗面发布Kimi K3,2.8万亿参数MoE架构,原生三模态(文字/图像/视频)统一,100万Token超长上下文,权重7月27日全量开源,Apache 2.0协议允许商业使用。

原文 ↗
新新浪财经07.17
Gemini 3.5 Pro 确认延期:前端 UI 像素级一次生成能力仍在打磨

谷歌 Gemini 3.5 Pro 原定 7 月 17 日发布已确认延期,主因是编程能力仍在打磨,10 名现任和前任员工参与确认。

原文 ↗

02交互视频与 AI 短剧

本版导读昆仑万维发布天工短剧工作台 SkyProduction,可在生成视频前规划角色站位与机位,3 部 AI 短剧 7 天内均破百万美元流水。Xmax AI X2.0 实现端侧实时交互视频生成,延迟低于 300ms。PixVerse 发布 Game AI 引擎。Wan-Streamer v0.2 把端到端延迟降到约 550ms。Google Vids 推出个人 AI 数字人。

中中新网一手07.16
天工短剧工作台 SkyProduction:Agent 智能分镜先规划站位再生成视频,3 部 AI 短剧 7 天均破百万美元

昆仑万维发布天工短剧工作台 SkyProduction,Agent 智能分镜可在视频生成前规划角色站位与机位;DramaWave 平台 3 部 AI 短剧 7 天内均破百万美元流水。

原文 ↗
量量子位07.15
Xmax AI X2.0发布:端侧实时交互视频生成,延迟低于300ms

Xmax AI发布X2.0模型,实现端侧实时交互视频生成,延迟低于300ms,是端侧推理能力在视频生成场景的重要突破。

原文 ↗
PPixVerse官方博客一手07.15
PixVerse进军交互娱乐:Game AI引擎支持实时视频驱动游戏场景

PixVerse宣布完成C轮融资延伸轮并进军交互娱乐,发布Game AI引擎,支持实时视频生成驱动游戏场景与角色行为。

原文 ↗
IIT之家07.17
阿里通义 Wan-Streamer v0.2:端到端 AI 视频通话延迟降至 550ms,听/看/说/演统一进单一 Transformer

阿里通义实验室发布 Wan-Streamer v0.2,将听、看、说、演统一进单个 Transformer,端到端交互延迟约 550ms,较 v0.1 大幅改善。

原文 ↗
GGoogle Blog一手07.16
Google Vids 引入 Gemini Omni 视频生成与个人 AI 数字人

Google Workspace 正式推出个人 AI 数字人,用户录制一次自拍和声音样本,即可在 Vids 中以本人形象出镜任意视频,并内嵌 SynthID 隐形水印。

原文 ↗
人人民网07.13
上海交大发布WNM世界叙事模型:创作者与AI协同构建可编辑、可交互的叙事时空,针对AI视频生成「不可控」瓶颈

上海交通大学于2026年7月13日发布WNM(World Narrative Model)世界叙事模型,支持创作者与AI协同构建可编辑、可交互的叙事时空,专门针对现有AI视频生成在叙事连贯性和创作可控性上的瓶颈,面向影视级视频媒体制作场景。

原文 ↗

03设计工具与人事

本版导读Anthropic 核心设计负责人 Jenny Wen 出任 Cursor 设计主管。Canva 接入 Google Gemini 并推出 Magic Layers 图层分离,Canva Code 2.0 向全部 2.65 亿月活用户免费开放。Figma Make 可直接连接 GitHub 仓库提交代码。Claude Code Artifacts 支持 MCP 连接器。

新新智元07.15
Anthropic 核心设计负责人 Jenny Wen 跳槽 Cursor 出任设计主管

Anthropic 核心设计负责人 Jenny Wen 官宣跳槽,出任 AI 编程工具 Cursor 设计主管;她此前在 Figma 任设计总监,在 Anthropic 期间主导 Claude 产品设计与 Cowork 智能体愿景。Cursor 母公司 Anysphere 此前已被 SpaceXAI 收购。

原文 ↗
CCanva官方新闻室一手07.16
Canva深度接入Google Gemini:@Canva对话即生成品牌视觉,Magic Layers AI图层分离可独立编辑

Google将Canva作为Connected App引入Workspace,@Canva指令即可调用Gemini生成品牌视觉并直接插入文档;Canva同步推出Magic Layers AI图层分离功能,每层可独立编辑。

原文 ↗
FFigma官方帮助文档一手07.19
Figma Make正式连接GitHub仓库:设计师可直接从画布提交界面代码修改,打通设计到生产「最后一公里」

Figma Make新增GitHub双向集成,设计师可在画布中直接导入Git仓库、修改界面并提交代码变更,将视觉编辑器转变为可连接真实代码仓库的开发端口。

原文 ↗
新新智元07.18
Claude Code Artifacts 支持 MCP 连接器:生成的看板可接实时数据,不同权限看到不同内容

Anthropic 为 Claude Code Artifacts 新增 MCP 连接器调用能力,生成的看板/仪表盘页面可连接实时数据,不同查看者按各自权限拉取不同内容,7 月 16 日上线。

原文 ↗
CComfyUI官方GitHub一手07.15
ComfyUI v0.28.0发布:原生视频节点与性能优化

ComfyUI发布v0.28.0版本,新增原生视频处理节点并优化整体运行性能,进一步强化其作为AI创作工作流核心枢纽的地位。

原文 ↗
VVentureBeat07.14
Canva Code 2.0:AI 建网站能力向 2.65 亿月活用户全量免费开放,生成速度提升 75%

Canva 将 AI 代码生成功能向全部 2.65 亿月活用户(含免费账户)开放,生成速度提升 75%,从提示到上线时间压缩 30%。

原文 ↗

04世界模型与 3D 工具

本版导读昆仑万维在 WAIC 发布 Matrix-Game 3.5 与机器人世界模型 Riemann-1.0。魔芯 MoWorld 3D 世界模型上线华为云,可从单张照片生成 3D 场景。Autodesk 展示 Flow Studio 的 AI 自动绑骨架。NVIDIA 宣布 DLSS 4.5 随 Blender 5.3 发布,并发布 FLUX.2 RTX 优化。

机机器之心07.19
昆仑万维WAIC宣布「2026世界模型元年」:Matrix-Game 3.5单卡实时生成,Riemann-1.0机器人世界模型同步发布

昆仑万维董事长方汉在WAIC 2026世界模型专场论坛宣布2026为「世界模型元年」;发布Matrix-Game 3.5(Patch级记忆注入、单卡实时生成)和Riemann-1.0机器人世界模型,同步升级Mureka v9.5与O3音乐模型,预判AI音乐与视频将成大众创作工具。

原文 ↗
AAutodesk官方新闻室一手07.19
Autodesk SIGGRAPH 2026:Flow Studio新增AI自动绑骨架+神经层,Wonder 3D文本/图片一步生成3D角色,Maya AI运动全线升级

Autodesk在SIGGRAPH 2026展示Flow Studio重大更新:AI Rigging移除角色制作最复杂技术环节自动绑骨架,Wonder 3D支持文字或参考图一步生成完整3D角色,Maya新增AI辅助四足动物运动生成。

原文 ↗
量量子位07.16
魔芯科技MoWorld 3D世界模型正式上线华为云:单张照片生成完整3D场景,全栈国产NPU(昇腾),向全行业开放

国家具身智能应用中试基地联合华为云、魔芯科技发布MoWorld 3D世界模型,支持从单张照片生成完整3D场景,全栈基于国产NPU(昇腾)构建,正式上线华为云向全行业开放。

原文 ↗
NNVIDIA 官方一手07.19
NVIDIA DLSS 4.5 进驻 Blender:SIGGRAPH 2026 宣布,随 Blender 5.3「今秋」发布

NVIDIA 在 SIGGRAPH 2026 开幕首日宣布 DLSS 4.5(含多帧生成与 AI 超分辨率)将随 Blender 5.3「今秋」正式发布,为开源 3D 工具引入 AI 加速渲染。

原文 ↗
NNVIDIA官方Blog一手07.19
NVIDIA × Black Forest Labs FLUX.2 RTX优化:NVFP4量化2.7×加速+55%显存减少,SIGGRAPH同步推进ComfyUI集成

NVIDIA与Black Forest Labs在SIGGRAPH 2026发布FLUX.2 RTX专项优化:FP8量化VRAM减少40%/性能提升40%,NVFP4量化进一步实现2.7×加速和55%显存减少,ComfyUI深度集成同步推进,让消费级RTX显卡可流畅运行FLUX.2工作流。

原文 ↗

05研究、大会与赛事

本版导读SIGGRAPH 2026 最佳论文授予多伦多大学与 CMU 的 GimmBO,大会展出扩散模型装置「Diffusion TV」。蚂蚁 LingBot-Vision 以 10 亿参数在深度估计上超过 70 亿参数的 DINOv3。DeepMind 发布视频通用模型 GenCeption。同济与腾讯云的 Skill 创新应用大赛收官,26 所高校近 300 名选手参赛。

蚂蚂蚁集团07.15
蚂蚁 LingBot-Vision:边界驱动视觉预训练新范式,10 亿参数超越 70 亿参数 DINOv3,权重开源

蚂蚁集团提出「掩码边界建模」预训练范式,10 亿参数 ViT-g 在深度估计基准上超越 70 亿参数 DINOv3,透明物体深度估计达 RMSE 0.010,权重已开源。

原文 ↗
AACM SIGGRAPH Blog一手07.19
SIGGRAPH 2026最佳论文:GimmBO——贝叶斯优化引导的交互式生成模型权重融合框架(多伦多大学/CMU)

SIGGRAPH 2026最佳论文(洛杉矶7月19–23日,1120+投稿):GimmBO(多伦多大学/CMU/Vector Institute)——实时交互式框架,将两个或多个生成图像模型的权重集融合,通过贝叶斯优化在融合空间导航,由用户偏好点击引导。

原文 ↗
ggenception.github.io一手07.13
DeepMind发布GenCeption:统一视觉理解与生成的视频通用模型

DeepMind发布GenCeption,是首个在单一模型中统一视频理解与生成能力的视觉通用学习器,在多项基准上取得领先结果。

原文 ↗
中中国日报一手07.13
同济×腾讯云TT设计学院Skill创新应用大赛收官:全国26所高校近300名选手将设计痛点封装为AI智能体工具

同济大学与腾讯云联合举办的TT设计学院Skill创新应用大赛于2026年7月13日收官,全国26所高校近300名选手参赛,选手将真实设计流程痛点封装为AI智能体(Skill)工具,7支战队获奖,AI Agent正式进入高校设计教育的实践评估体系。

原文 ↗
机机器之心07.18
VGGRPO(ECCV 2026 Google):4D 隐空间几何奖励强化学习,解决视频扩散模型几何漂移

Google 团队提出 VGGRPO,通过隐空间 4D 几何奖励进行强化学习后训练,解决视频扩散模型几何漂移与摄像机轨迹不稳定问题,已被 ECCV 2026 收录。

原文 ↗
机机器之心07.13
北大+深势科技提出PRA自回归图像生成框架:16维低维中间状态+并行解码,135M参数在像素空间超越1.9B基线

北京大学联合深势科技提出PRA自回归图像生成框架,采用16维低维中间状态与并行解码机制,135M参数规模在像素空间的表现超过1.9B参数基线,绕开传统视觉tokenizer,目前处于理论突破阶段,工程化程度待评估。

原文 ↗
PPR Newswire一手07.17
SIGGRAPH 2026 开幕预告:「Diffusion TV」扩散模型沉浸装置与 AI 创作伙伴工作坊

SIGGRAPH 2026 会前公告披露两大 AI 亮点:将扩散模型实时可视化的沉浸装置「Diffusion TV」,以及「视频生成视觉语言」专题研讨工作坊,大会 7 月 19—23 日于洛杉矶举行。

原文 ↗
科科技行者07.17
MentalThink:让AI用SVG「脑补草图」做空间推理,MindCube三维测试76分超越GPT-5的56分

北邮×中科院×StepFun提出MentalThink,让多模态大模型在推理中生成SVG草图「看图思考」,MindCube三维旋转测试76分超越GPT-5的56分,仅用7B参数模型。

原文 ↗

06征集与赛展

07SKILL

往期周报

(本期完)

条目均来自本站已发布资讯,链回原卡片与原始来源;导读与本版导读为编辑汇编,不含评价。全部资讯 →