浅译周报
设计 Agent 与图像模型发布
7 月 20 日至 26 日,共收录资讯 36 条。腾讯设计 Agent 平台 Miora 国际版全量上线。图像模型方面,阿里发布 Qwen-Image-3.0,Black Forest Labs 发布统一图像、视频与音频的 FLUX 3,微软开源 Mage-Flow。WAIC 2026 期间,智象未来发布 vivago R1,Vivix 发布实时互动模型 A1 与 W1。SIGGRAPH 2026 上,NVIDIA 宣布多款创作软件支持 MCP,清华 AutoMIA 可生成镜像错觉 3D 物体。Anthropic 发布 Claude Opus 5。
头条腾讯 Miora 国际版全量上线:生图 / 视频 / 3D / UI 四子 Agent 协同,登顶 Product Hunt 日榜,新用户赠 1000 积分- 1
- 2
- 3
01创作工具 Agent 化
本版导读腾讯 Miora 国际版全量上线,生图、视频、3D、UI 四个子 Agent 在同一画布协同,首日登顶 Product Hunt 日榜。NVIDIA 在 SIGGRAPH 宣布 Adobe、Blender、Houdini、Unreal 等软件支持 MCP。万兴科技在 WAIC 展示三条 AI 视频产品线,Runway 发布 Media Router,吴恩达团队开源个人桌面 Agent。
腾讯首个设计 Agent 平台 Miora 国际版全量上线,生图 / 视频 / 3D / UI 四子 Agent 同一画布协同交付,首日登顶 Product Hunt 日榜第一。
原文 ↗NVIDIA在SIGGRAPH 2026宣布Adobe Firefly/Creative Cloud、Canva/Affinity Designer、Blender、SideFX Houdini 22、Unreal Editor等主流创作软件全面支持MCP协议,AI Agent可直接在DCC工具内执行场景检查/材质标记/版本导出等操作;同步开源Cosmos 3 Edge(4B参数,VANTAGE-Bench同参数同类第一),可在Jetson Thor/RTX PRO/GeForce RTX上本地运行。
原文 ↗吴恩达团队发布完全开源的个人桌面Agent框架,支持本地运行、隐私保护与跨浏览器及桌面应用操作,量子位、机器之心同步报道。
原文 ↗元石科技发布问小白5 Pro长内容生成引擎,通过文件沙箱与结构化记忆管理解决AI长任务前后矛盾问题,支持跨三天持续写作三万字而不发生主线漂移。
原文 ↗Runway 发布 Media Router,首个生成式媒体模型路由器,创作者设定优先级后系统自动在 Gen-4.5 / Aleph 2.0 等模型间选择最优路径。
原文 ↗量子位发布 WAIC 2026 十大趋势:83 家参展主体聚焦 AI Agent,设计工具 Agent 化从个别案例变为行业风向标,从「对话式 AI」进入「交付式 Agent」。
原文 ↗02图像与多模态生成
本版导读阿里 Qwen-Image-3.0 文字渲染精度达 10px,支持 4.5K 超长指令与 12 种语言。Black Forest Labs 发布 FLUX 3,统一图像、20 秒视频与原生音频输出,Canva 等首批接入。微软开源 4B 参数的 Mage-Flow,GenEval 0.90。Midjourney V8.2 成为默认版本。一项测试记录了四个模型 8 轮临摹蒙娜丽莎的风格漂移。
Qwen-Image-3.0 文字渲染精度达 10px 可辨级别,4.5K 超长指令支持多区域版面控制,12 语言覆盖多语言出版需求。
原文 ↗Black Forest Labs 发布 FLUX 3,首个统一图像生成、20 秒视频与原生音频输出的多模态流模型,Canva 等首批生态伙伴同步接入。
原文 ↗Mage-Flow 4B 参数原生支持 512–2048 任意宽高比文生图与指令式编辑,GenEval 0.90 为开源最优,Turbo 版 0.59 秒/张。
原文 ↗测试者用 GPT-4o/Midjourney/SD/Flux 各自完成 8 轮蒙娜丽莎临摹迭代,记录过度修正与风格漂移全过程
原文 ↗Midjourney V8.2 于 7 月 24 日正式成为默认版本,美学表现和 sref 风格板个性化一致性较 V8.1 显著提升,新增 Big Batch Draft Mode 加速风格探索。
原文 ↗033D 与图形学
本版导读清华 AutoMIA 输入两张图片,76 秒生成可 3D 打印的镜像错觉物体,已入选 CVPR 2026。NVIDIA 在 SIGGRAPH 披露 DLSS 5 的三路神经渲染模型,并发表 21 篇论文。Autodesk 让 3ds Max 支持可编辑的 3D 高斯溅射。SIGGRAPH 最佳艺术论文授予 Resonance。
清华 AutoMIA 系统可将任意两张图片自动生成镜像错觉 3D 物体,76 秒完成,支持直接 3D 打印输出,已入选 CVPR 2026
原文 ↗NVIDIA在SIGGRAPH 2026披露DLSS 5技术细节:三路独立AI模型(A/B/C)分别负责全局光照/次表面散射/材质细节等渲染环节,开发者可对场景/角色/关卡单独分配不同模型;紧凑扩散Transformer架构,单GPU实现4K/60fps/亚16ms延迟;DLSS 5秋季正式上线游戏。
原文 ↗NVIDIA在SIGGRAPH 2026发布Synthetic Video Detector NIM,22ms/帧检测速度、92%精准率,通过标准API调用,填补AI生成视频内容真实性验证空白,与Adobe Content Credentials、C2PA标准形成生态配合。
原文 ↗Tripo AI在SIGGRAPH 2026发表题为「茶壶测试:从展示走向制造」的主题演讲,阐述如何从孤立静态资产生成迈向动态环境/智能体系统/世界建模,展示Tripo全栈生成生态在游戏/3D打印/机器人仿真等工业管线中的应用。
原文 ↗Autodesk在SIGGRAPH 2026宣布:3ds Max将3D Gaussian Splats变为完全可编辑资产(支持建模/动画/场景构建);Maya MotionMaker新增BYOD(Bring Your Own Data),团队可用自家动捕/手绑动作数据训练自定义生成动作模型;Flow Production Tracking引入实时媒体审阅与协同标注。
原文 ↗NVIDIA在SIGGRAPH 2026发表21篇研究论文:MotionBricks基于35万段动作片段训练的实时动作AI可同时驱动屏幕数字角色与Unitree G1人形机器人;ArtiFixer将杂乱现实3D扫描自动转为可用虚拟场景;新雪/沙/弹性体物理求解器一并开源。
原文 ↗SIGGRAPH 2026最佳艺术论文奖授予论文Resonance,探索AI生成艺术中「共鸣感」的形式化定义与计算方法
原文 ↗04视频与语音模型
本版导读智象未来在 WAIC 发布 vivago R1,支持任意时长视频连续生成,商用可用率 85%。Vivix 发布实时互动模型 A1 与 W1,A1 首帧延迟低于 0.6 秒。南京大学全栈开源 4B 参数视频理解模型 VideoChat3。阿里发布 Qwen-Audio-3.0-TTS,覆盖 20 种中文方言。兔展与北大的 UniWorld-View 登顶 WorldScore。
智象未来(HiDream.ai)在WAIC 2026发布基于自研HD-AgentOS的vivago R1,突破行业15-30秒视频时长限制,支持任意时长视频连续连贯生成,叙事逻辑/画面风格/角色IP全程统一,商业可用率达85%,适配短剧/专题片/品牌宣传片等长周期创作场景。
原文 ↗Vivix灵动时刻A1实现AI角色全身表演与全双工实时交互,TTFF低于0.6秒;W1支持统一流式交互叙事,单卡突破10000 video tokens/s,成本0.2美元/小时。
原文 ↗南京大学联合多校发布 VideoChat3,全栈开源 4B 参数视频理解模型,统一处理短视频 / 长视频 / 流式视频三类任务,登顶 HuggingFace 趋势榜。
原文 ↗阿里发布语音合成大模型Qwen-Audio-3.0-TTS,含实时交互Flash版(首包延迟300ms级)和高质量生成Plus版;支持细粒度标签控制、freestyle指令遵循、20种中文方言及多语种,Plus版登顶全球权威榜单Artificial Analysis。
原文 ↗兔展智能联合北京大学提出UniWorld-View,在李飞飞团队WorldScore评测中登顶(国产首次),双流架构支持单图生成任意视角视频,代码权重全开源,已适配国产昇腾算力。
原文 ↗05展览、赛事与教育
本版导读「未来之境」AI 艺术沉浸大展在北京启幕,近 20 项 AI 体验,展至 12 月。港科大 SURREALITY 在香港与广州两城展出 70 多位艺术家的 50 件作品。央美教授吴小虎策展,用 AI 数字技术展示传统壁画。美图发起总规模 1 亿元的 Hatch Catch 挑战赛。Springer 一项研究分析 Midjourney 融入建筑 PBL 课程的效果。
第五届仲夏艺术季旗舰展览「未来之境」于北京启幕,融合情绪感知智能引擎与XR虚拟影像,近20项AI+艺术沉浸体验,展至2026年12月。
原文 ↗GMI Cloud联合阿里巴巴HappyHorse在WAIC 2026举办「无界造物节」全民AI创作赛事决赛收官;AI Coding赛道产出智能运营Agent和低代码工具,AI Video赛道依托HappyHorse全链路能力完成云端脚本到成片,展示MaaS平台支撑非技术用户实现完整AI视频创作的落地路径。
原文 ↗中央美术学院教授吴小虎策划展览,借助 AI 数字技术让传统壁画突破展馆局限面向大众,项目获联合国教科文组织报告背书。
原文 ↗郭靖宇、陈楸帆等创作者在 WAIC 2026 圆桌讨论认为,真实体验、情感共鸣与在场感是 AI 时代人类不可替代的核心价值。
原文 ↗Springer发表实证研究,分析Midjourney融入高校建筑设计PBL课程的效果,发现弱基础学生在AI辅助下的学习收益显著高于强基础学生,两组均报告正向体验。
原文 ↗香港科技大学与HKUST(GZ)联合呈现「SURREALITY」MR×AI数字艺术跨城展,汇集70+国际艺术家50件作品,同步在香港与广州两城举行,展期至7月31日。
原文 ↗美图发起 Meitu Hatch Catch 产品挑战赛,总规模 1 亿元,面向已上线且有种子用户的 AI 原生影像产品,聚焦 AI 影像赛道,单项最高投资 500 万元。
原文 ↗06大模型与行业动态
本版导读Figma CEO Dylan Field 称设计师需成为 Out-of-Distribution 力量,Figma Q1 营收增长 46%。Midjourney 收购天文 App Co-Star,24 名员工全部加入。Anthropic 发布 Claude Opus 5,定价约为 Fable 5 的一半。Google 发布 Gemini 3.6 Flash 等三款模型。
Figma CEO Dylan Field在Stratechery等多个访谈中阐明:AI处理分布内均值,设计师需以品味和文化洞察成为Out-of-Distribution力量;Figma Q1营收+46%至3.334亿美元印证AI扩大了设计工具市场。
原文 ↗Midjourney 全盘收购天文 App Co-Star,全部 24 名员工加入,创始人 Banu Guler 出任设计总监,信号 Midjourney 独立消费端 App 建设明显提速。
原文 ↗Google DeepMind同日发布三款新Flash模型:Gemini 3.6 Flash是主力workhorse、token成本降低17%,3.5 Flash-Lite为最低价轻量版($0.30/百万输入),3.5 Flash Cyber为安全漏洞专用精调版限政府伙伴;同步宣布Gemini 4已进入预训练阶段,Gemini 3.5 Pro仍在伙伴测试中。
原文 ↗Anthropic 正式发布 Claude Opus 5,输入 $5 / 输出 $25 每百万 Token(约为 Fable 5 半价),1M token 上下文,性能接近旗舰级。
原文 ↗Anthropic工程师Thariq Shihipar详解Claude Code为Opus 5/Fable 5删除80%系统提示词的原因:旧规则是为旧模型设计的,新模型已能根据代码自主判断
原文 ↗07征集与赛展
- CAADRIA 2027 第32届国际会议征稿(学术会议)亚洲计算机辅助建筑设计研究学会(CAADRIA) · 截止 7月27日
- 第20届中国好创意 ·「活路儿」地方非遗生成式 AI 专项赛中国好创意大赛组委会 × 四川师范大学 · 截止 7月27日
- 2026-W38实时视频编辑与开源图像模型
- 2026-W37Sora 关停与剪辑软件插件
- 2026-W36GPT-6 发布与世界模型更新
- 2026-W35视频生成模型集中更新
- 2026-W34版权归因研究与图像接口关停
- 2026-W33开源音乐与视频模型
- 2026-W32视频音频模型与创意软件接入
- 2026-W31视频模型发布与 AI 水印新规
- 2026-W29WAIC 多模态模型与交互视频
- 2026-W28Meta 图像功能下架与幽灵字体
- 2026-W27图像模型、版权诉讼与视频融资
(本期完)
条目均来自本站已发布资讯,链回原卡片与原始来源;导读与本版导读为编辑汇编,不含评价。全部资讯 →