浅译快报
2026 年 8 月 1 日 — 8 月 31 日AI × 艺术设计 · 每月盘点每月初出刊

浅译月报

浅译快报 · TRANSWONDER.TOP
第 1 期 082026 年8 月
48件大事81个来源44件一手35条精选22天有更新
本期导读

视频与音频模型集中发布

8 月 1 日至 31 日,共收录资讯 48 条,7 月为 125 条。视频模型集中发布:阿里 Wan3.0 全球上线,Google 推出 Veo 3.1 和 Gemini Omni 1.1 Flash,FLUX 3 Video 正式可用,Lightricks 开源 LTX-2.5,Runway 发布研究模型 Solaris。音频方面,MiniMax 开源 Music 3,Adobe Firefly 音频工具全量开放。图像方面,Midjourney V8.2 Edit Mode 全量开放,Google 关闭 Imagen 4 API,OpenAI 宣布关闭 DALL-E GPT。合规方面,EU AI Act 第 50 条于 8 月 2 日生效,MIT CSAIL 发表归因衰减研究。设计软件方面,Anthropic 把 Claude 接入 Adobe、Canva、Blender 等软件。

头条阿里Wan3.0全球正式发布:30秒视频、文档转视频、$0.05–$0.20/秒

01视频生成模型

本版导读阿里 Wan3.0 全球发布,单次最长 30 秒,可用文档生成视频,另有 Prime 快速变体。Gemini Omni 1.1 Flash 支持 40 秒视频和首尾帧双锁定,Veo 3.1 付费预览把时长升到 120 秒。Lightricks 开源 LTX-2.5,FLUX 3 Video 正式可用。Runway Solaris 把网页和应用界面实时渲染为视频,目前是研究 Demo。

阿阿里巴巴官方一手08.24
阿里Wan3.0全球正式发布:30秒视频、文档转视频、$0.05–$0.20/秒

阿里巴巴Wan3.0全球发布,支持最长30秒视频生成、PDF/PPT/Word文档直接转视频,定价$0.05–$0.20/秒

原文 ↗
GGoogle DeepMind官方一手08.27
Gemini Omni 1.1 Flash 发布:40秒视频、首尾帧双锁定、4K分辨率、Draft Mode $0.03/秒

Google发布Gemini Omni 1.1 Flash,支持40秒视频生成、首尾帧双重锁定、4K输出及$0.03/秒的Draft快速模式

原文 ↗
RRunway官方研究博客一手08.31
Runway Solaris:首个界面世界模型,将实时网站与应用UI转化为视频体验

Runway发布研究级模型Solaris,定义为界面世界模型(Interface World Model),可将网页和应用UI实时渲染为连续视频体验,目前为研究Demo阶段

原文 ↗
LLightricks 官方一手08.11
LTX-2.5 开源:10 秒 720p 仅需 6.8 秒,支持 4K 与同步音频,ComfyUI 当日 Day-0 支持

Lightricks 于 2026-08-11 开源 LTX-2.5(HuggingFace `Lightricks/LTX-Video-2.5`):10 秒 720p 视频生成仅需 6.8 秒(单 RTX 4090),支持 4K 输出、同步音频、原生多镜头(multi-shot)叙事;ComfyUI 发布当日 day-0 官方支持(含节点与工作流模板);商业营收 $10M ARR 以下完全免费。

原文 ↗
BBlack Forest Labs 官方一手08.05
Black Forest Labs FLUX 3 Video 正式 GA:20 秒原生音频,Draft 模式 $0.06/秒,1080p 首发

Black Forest Labs 于 2026-08-05 将 FLUX 3 Video 推送至生产可用(GA):单次最长 20 秒视频生成,内置原生音频联动输出,Draft 模式定价 $0.06/s(约 ¥0.44/s),首发 1080p(2K/4K 已在路线图);依托 FLUX API 及授权合作平台接入,ComfyUI Partner Nodes 预计跟进。

原文 ↗
GGoogle Developers Blog一手08.05
Google发布Veo 3.1:120秒4K视频+原生音频+三参考图一致性,Gemini API付费预览即开

Google Veo 3.1于2026年8月5日登陆Gemini API付费预览:视频时长从8秒升至120秒,支持4K分辨率、原生立体声音频全链路生成(对话/音效/环境音)、跨场景角色一致性、竖版9:16,最多3张参考图引导生图到视频;Veo 3.1 Lite专注高并发与快速迭代,同步上线。

原文 ↗
MMiniMax官方一手08.27
MiniMax H3 Max:fal.ai联合发布,35倍加速,Design Arena全球第一

MiniMax与fal.ai联合发布H3 Max,相比H3标准版实现35倍推理加速,在Design Arena视频质量评测中位列全球第一

原文 ↗
阿阿里巴巴官方一手08.27
阿里Wan3.0 Prime发布:$0.06–$0.30/秒的快速视频变体,支持文转视频、图转视频、音频输入

阿里Wan3.0 Prime快速变体上线,定价$0.06–$0.30/秒,支持文字转视频、图像转视频及音频驱动视频生成三类任务

原文 ↗

02版权、合规与融资

本版导读MIT CSAIL 在《Nature Communications》发表研究,称扩散模型会让训练数据的归因信号快速衰减。EU AI Act 第 50 条于 8 月 2 日生效,AI 生成内容须带机器可读标记。Anthropic 为所有 Claude 输出嵌入不可见文本水印。Stability AI 完成 7600 万美元 B 轮,三大唱片公司与 EA 参投。

MMIT CSAIL一手08.18
MIT CSAIL《Nature Communications》:AI生成图像的归因衰减使版权追责在技术层面趋于不可能

MIT CSAIL发表于《Nature Communications》的研究显示,AI图像生成的多步骤变换机制导致训练数据归因信号快速衰减,使版权追责在技术层面趋于不可能

原文 ↗
TTechCrunch一手08.25
Stability AI完成$76M B轮:环球音乐、索尼、华纳、EA联合参投

Stability AI完成$76M B轮融资,环球音乐集团、索尼音乐、华纳音乐及游戏巨头EA联合参投,此轮融资被解读为内容产业对AI公司授权路径的战略背书

原文 ↗
TThe Decoder08.11
Anthropic为Claude全平台输出嵌入隐形水印:EU AI Act合规,水印可跨编辑持续存在

Anthropic宣布为所有Claude输出嵌入不可见文本水印,水印在部分编辑后仍可持续存在,用于EU AI Act Article 50合规;标记证明「AI处理过」而非「AI完全创作」,全球用户即时生效。

原文 ↗
CCloud Security Alli...一手08.02
EU AI Act Article 50正式生效:AI生成视频须机器可读水印,多层标记义务全面启动

EU AI Act Article 50(透明度义务)于2026年8月2日正式生效,所有AI生成图像、视频与音频须嵌入机器可读标记;AI视频水印子义务设4个月宽限期至12月2日。

原文 ↗

03图像生成与编辑

本版导读Midjourney V8.2 Edit Mode 全量开放,整合 4 图参考与局部重绘。Google 关闭 Imagen 4 API,OpenAI 宣布关闭 DALL-E GPT。新模型有商汤 SenseNova U1.5、Grok Imagine Image 2.0、Qwen-Image-3.0-Pro 等。谷歌地球的 Nano Banana 2 生图功能上线不到 24 小时即下架。

MMidjourney官方一手08.31
Midjourney V8.2 Edit Mode全量开放:4图参考+Inpaint+Outpaint统一界面

Midjourney V8.2 Edit Mode正式全量开放,在单一界面整合4张参考图输入、画布内绘(inpaint)与外延(outpaint)功能

原文 ↗
GGoogle Firebase官方文档一手08.17
Google于8月17日关闭全部Imagen 4 API,Figma插件/Make/Zapier工作流静默失效,强制迁移至Nano Banana

Google于2026-08-17关闭全部Imagen 4系列API(imagen-4.0-generate-001 / ultra / fast),全线切换至Gemini 3.x图像族(Nano Banana);API调用方式从专用接口改为通用Gemini content-generation接口(modality=image);调用Imagen端点的Figma插件/Zapier/Make/n8n及大量小SaaS工具无声停摆;受影响用户须主动迁移端点+重写SDK调用逻辑。

原文 ↗
商商汤官方一手08.03
商汤SenseNova U1.5-Lite-Preview:8B-MoT架构,4K精准「指哪改哪」局部编辑,已开源,中文风格化直出

商汤发布SenseNova U1.5-Lite-Preview:8B参数MoT(Mixture of Transformers)架构,核心突破为精准局部编辑(框选区域只改该区域、边缘自然融合)+ 4K原生输出 + 中文风格化,权重已开源,S级5+源齐发。

原文 ↗
RRecraft官方一手08.26
Recraft V4 Styles:1–10张参考图驱动风格一致性图像生成

Recraft发布V4 Styles功能,支持输入1至10张参考图提取视觉风格,生成与参考图高度一致的新图像

原文 ↗
OOpenAI帮助中心一手08.04
ChatGPT官方DALL-E GPT将于8/30退役,图像生成入口统一迁往ChatGPT Images

OpenAI 宣布 8月30日关闭 ChatGPT 内的官方 DALL-E GPT,所有图像生成入口统一迁往「ChatGPT Images」(基于 gpt-image-1 和 gpt-image-1-mini)。

原文 ↗
xxAI官方一手08.07
Grok Imagine Image 2.0:最多5图参考联合输入+区域Magic Wand精准编辑+透明背景导出,Arena全球第二

xAI于8月7日正式发布Grok Imagine Image 2.0,以设计工作流为核心:最多5张参考图联合输入(一步合成免手动拼接)、区域Magic Wand精准编辑(只修目标区域)、前/背景精确分离+透明背景PNG导出;同时优化密排文字、版式、图标、游戏资产等密集布局渲染;发布日在两项主流图像Arena中排名全球第二(文生图+图像编辑双榜)。

原文 ↗
AAlibaba Qwen 官方 X一手08.05
阿里 Qwen-Image-3.0-Pro 发布:10px 文字渲染精度大幅提升,全球图像生成排名第五

阿里在 Qwen-Image-3.0(7月21日发布,已入池)基础上推出 Pro 版本,重点强化 10px 文字渲染精度(毛孔/发丝/微表情细节),注入更丰富的世界知识(地标/品牌/符号可信度),Qwen 团队自评全球排名第五。

原文 ↗
新新智元08.01
谷歌地球集成Nano Banana 2生图功能不到24小时因「灾难场景」紧急撤回

谷歌地球嵌入Nano Banana 2模型,允许用户用文字指令修改真实地理影像(支持2K/4K输出+精准文字渲染),但因用户生成逼真「灾难场景」并在社媒传播,上线不到24小时紧急下架。

原文 ↗

04音频与音乐

本版导读MiniMax 开源 Music 3,输入歌词和风格描述可生成最长 5 分钟的完整歌曲,最低 8GB 显存可本地运行。Adobe Firefly 的音乐、配音、音效三个工具于 8 月 20 日向所有用户开放,均为商业授权。Pika 推出视频配音模型,按画面语义和节奏同步生成音效、环境声与音乐。

MMiniMax官方Blog一手08.13
MiniMax Music 3开源:首个产品级AI音乐模型,凭歌词+描述独立生成5分钟完整歌曲

MiniMax于8月13-14日发布MiniMax Music 3开源权重——首个「产品级」AI音乐生成模型,给定歌词+风格描述即可输出最长5分钟结构完整的歌曲(人声+乐器+编曲);8B Global LLM(基于Qwen3-8B)把控全曲语义进程,0.6B Local LLM精修声学细节;32kHz 16bit立体声输出,最低8GB显存可本地运行,权重已上HuggingFace与GitHub;ComfyUI v0.33.1(08-13)同步集成。

原文 ↗
AAdobe官方博客一手08.20
Adobe Firefly 音频全面开放:商业授权音乐/配音/音效三合一,创意全链路扩展至有声

Adobe Firefly 音频工具(Generate Music / Generate Speech / Generate Sound Effects)2026年8月20日正式对所有用户全量开放;三工具均为商业免许可证授权,Generate Music由Firefly Music Model驱动可生成与视频时长/情绪匹配的原创音乐,Generate Speech支持ElevenLabs可选模型+情绪/语速调节,Generate Sound Effects根据视频节奏自动同步音效;同日新增Gemini Omni Flash为合作伙伴模型。

原文 ↗
PPika官方一手08.27
Pika推出场景感知视频配音模型:画面驱动全场景音效与音乐同步生成

Pika推出专属视频配音模型,分析视频画面语义和节奏后同步生成音效、环境声和音乐底层,无需手动对口型或检索素材库

原文 ↗

05设计软件与 AI 助手

本版导读Anthropic 发布 Claude for Creative Work,接入 Adobe、Canva、Blender、Autodesk 等六款以上创意软件,并在 Claude Code 推出 /design 命令预览。Adobe 在 ChatGPT 内上线免费插件,整合 70 多个工具。Figma 新增可拆卸 AI 对话面板,并向所有用户开放 Agent Skills 创作权限。

AAnthropic官方一手08.05
Anthropic发布「Claude for Creative Work」:接入Adobe/Canva/Blender/Autodesk等六款创意软件,三所艺术学校参与课堂测试

Anthropic发布「Claude for Creative Work」专项功能集,将Claude深度接入Adobe、Canva、Blender、Autodesk等六款以上创意软件,并与三所艺术学校开展课堂测试合作,标志着AI助理进入「内嵌于设计师日常工具」阶段。

原文 ↗
FFigma官方一手08.26
Figma新增可拆卸AI对话面板、矢量路径橡皮擦、区域填色三大功能

Figma推出可拆卸AI对话面板、矢量路径橡皮擦及区域智能填色三项新功能,进一步整合AI辅助能力至核心设计工作流

原文 ↗
AAnthropic官方一手08.17
Anthropic Claude Code新增/design命令研究预览版:编程会话中直接生成UI画板

Anthropic在Claude Code中推出/design命令研究预览版,开发者可在编码会话内通过自然语言描述生成UI画板并直接导入代码流

原文 ↗
FFigma官方博客一手08.13
Figma开放Agent Skills创作权限:设计师可编写自定义工作流技能,社区已发布50+技能

Figma向所有用户开放Agent Skills创作权限,设计师可编写自定义工作流技能并发布至社区,截至9月社区已积累50+可用技能

原文 ↗
AAdobe官方一手08.06
Adobe发布免费ChatGPT统一插件:Photoshop/Firefly/Premiere等70+工具,@Adobe对话中直接唤醒

Adobe在ChatGPT内上线免费统一插件,整合Photoshop/Firefly/Express/Premiere/Lightroom/Illustrator/InDesign/Acrobat/Adobe Stock共70+工具;任意ChatGPT对话中@Adobe即可调用,无需Creative Cloud订阅(免费Adobe账号即可使用Firefly文生图/文生视频);同步宣布接入Claude与Microsoft Copilot,Slack/Google Gemini列入计划。

原文 ↗
AAdobe官方一手08.08
Adobe Firefly「Interfaces」企业级批量工作流Beta:500资产一次性生成

Adobe推出Firefly Interfaces beta,提供企业级UI支持单次批量生成最多500个视觉资产,面向品牌营销和内容团队

原文 ↗
多多家科技媒体综合一手08.04
Claude Design对Figma的冲击:AI原生设计工具如何重构SaaS设计软件格局

Claude Design等AI原生设计入口对以Figma为代表的传统SaaS设计工具形成竞争冲击,引发设计工具格局重构的行业讨论

原文 ↗

06视频编辑与角色动画

本版导读Runway 发布视频调色模型 Ruby,按自然语言描述做色彩分级。BFL 的 FLUX Video Upscale 可把视频放大 1.5 至 3 倍,最高 4K。腾讯 CoinVE-Edit 单次推理完成 2–5 处局部修改。阿里 Wan-Animate-2 以 Apache 2.0 开源。清华与港科大的 LiveEdit 实现 12.66 FPS 实时编辑,已被 ECCV 2026 接收。

RRunway官方changelog一手08.31
Runway Ruby:自然语言描述驱动的专业级视频色彩分级模型

Runway发布Ruby专用视频调色模型,通过自然语言描述(如「70s胶片感」「清晨蓝调」)执行专业级色彩分级,理解光线情绪与时代氛围

原文 ↗
BBlack Forest Labs官方一手08.19
FLUX Video Upscale工具发布:视频超分1.5x–3x,原生输出至4K,双模式选择

Black Forest Labs发布FLUX Video Upscale,支持对已生成视频进行1.5x至3x超分辨率处理,最高输出4K,提供质量优先和速度优先双模式

原文 ↗
腾腾讯研究院一手08.18
腾讯CoinVE-Edit:22B参数区域感知视频编辑,单次Pass完成多处局部修改

腾讯发布CoinVE-Edit,22B参数视频编辑模型,区域感知架构支持单次推理同时完成2-5处独立局部修改

原文 ↗
OOpen Source For You08.07
阿里通义 Wan-Animate-2 开源:Apache 2.0 角色动画框架,ComfyUI 原生支持,本地跑赢可灵 MotionControl

阿里通义 Wan-Animate-2(14B Diffusion Transformer)8月7日以 Apache 2.0 协议开源:直接吃原始视频潜变量,省去骨架姿态提取,Lite 版 24fps 可实时运行;内置 ComfyUI 原生节点,开箱即用;盲测超越可灵 MotionControl,适用于时尚服装动态展示、叙事插画角色演绎、虚拟主播与 Avatar 动作捕捉迁移等场景。

原文 ↗
机机器之心一手08.01
LiveEdit(清华×港科大):4步去噪实现12.66 FPS实时逐帧视频编辑,ECCV 2026

清华×港科大联合提出LiveEdit,通过三阶段渐进蒸馏将双向扩散Transformer的视频编辑能力迁移至因果流式编辑器,仅需4步去噪即可实现12.66FPS实时逐帧视频编辑;ECCV 2026接收。

原文 ↗

07征集与赛展

(本期完)

条目均来自本站已发布资讯,链回原卡片与原始来源;导读与本版导读为编辑汇编,不含评价。全部资讯 →