浅译周报
视频音频模型与创意软件接入
8 月 3 日至 9 日,共收录资讯 13 条。FLUX 3 Video 正式可用,单次最长 20 秒并带原生音频;Google Veo 3.1 进入 Gemini API 付费预览,时长升到 120 秒。Anthropic 发布 Claude for Creative Work,接入 Adobe、Canva、Blender 等软件。OpenAI 向所有 ChatGPT 用户开放 GPT-5.6 Luna,并宣布关闭 DALL-E GPT。图像方面,商汤开源 SenseNova U1.5-Lite-Preview,xAI 发布 Grok Imagine Image 2.0。
头条Black Forest Labs FLUX 3 Video 正式 GA:20 秒原生音频,Draft 模式 $0.06/秒,1080p 首发- 1Google发布Veo 3.1:120秒4K视频+原生音频+三参考图一致性,Gemini API付费预览即开Google Developers Blog
- 2
- 3
- 01视频与音频生成4 件
- 02设计软件与 AI 助手3 件
- 03ChatGPT 平台更新3 件
- 04图像生成与编辑3 件
- 05征集与赛展2 项
01视频与音频生成
本版导读FLUX 3 Video 正式可用,单次最长 20 秒,内置原生音频。Google Veo 3.1 进入 Gemini API 付费预览,时长从 8 秒升到 120 秒,支持 4K。ComfyUI v0.30.0 原生支持 MiniMax H3 开源权重和 Grok Imagine Video。阿里 Wan-Animate-2 以 Apache 2.0 协议开源。
Black Forest Labs 于 2026-08-05 将 FLUX 3 Video 推送至生产可用(GA):单次最长 20 秒视频生成,内置原生音频联动输出,Draft 模式定价 $0.06/s(约 ¥0.44/s),首发 1080p(2K/4K 已在路线图);依托 FLUX API 及授权合作平台接入,ComfyUI Partner Nodes 预计跟进。
原文 ↗Google Veo 3.1于2026年8月5日登陆Gemini API付费预览:视频时长从8秒升至120秒,支持4K分辨率、原生立体声音频全链路生成(对话/音效/环境音)、跨场景角色一致性、竖版9:16,最多3张参考图引导生图到视频;Veo 3.1 Lite专注高并发与快速迭代,同步上线。
原文 ↗ComfyUI v0.30.0正式发布,原生支持MiniMax H3音视频联合生成(含4个新节点与6套官方工作流)以及xAI Grok Imagine Video 1.5合作节点,MiniMax H3开源权重同日可用。
原文 ↗阿里通义 Wan-Animate-2(14B Diffusion Transformer)8月7日以 Apache 2.0 协议开源:直接吃原始视频潜变量,省去骨架姿态提取,Lite 版 24fps 可实时运行;内置 ComfyUI 原生节点,开箱即用;盲测超越可灵 MotionControl,适用于时尚服装动态展示、叙事插画角色演绎、虚拟主播与 Avatar 动作捕捉迁移等场景。
原文 ↗02设计软件与 AI 助手
本版导读Anthropic 发布 Claude for Creative Work,把 Claude 接入 Adobe、Canva、Blender、Autodesk 等六款以上创意软件,并与三所艺术学校开展课堂测试。Adobe 推出 Firefly Interfaces 测试版,单次最多批量生成 500 个视觉资产。另有行业讨论梳理 Claude Design 与 Figma 的竞争。
Anthropic发布「Claude for Creative Work」专项功能集,将Claude深度接入Adobe、Canva、Blender、Autodesk等六款以上创意软件,并与三所艺术学校开展课堂测试合作,标志着AI助理进入「内嵌于设计师日常工具」阶段。
原文 ↗Adobe推出Firefly Interfaces beta,提供企业级UI支持单次批量生成最多500个视觉资产,面向品牌营销和内容团队
原文 ↗Claude Design等AI原生设计入口对以Figma为代表的传统SaaS设计工具形成竞争冲击,引发设计工具格局重构的行业讨论
原文 ↗03ChatGPT 平台更新
本版导读OpenAI 全量发布 GPT-5.6 Luna,所有 ChatGPT 用户可免费无限制使用;同时宣布 8 月 30 日关闭官方 DALL-E GPT,图像生成入口迁往 ChatGPT Images。Adobe 在 ChatGPT 内上线免费插件,整合 Photoshop、Firefly、Premiere 等 70 多个工具,对话中 @Adobe 即可调用。
OpenAI 全量发布 GPT-5.6 Luna,面向所有 ChatGPT 用户开放免费无限制使用,SOL 逻辑推理与数学问题求解能力较前版本显著提升。
原文 ↗OpenAI 宣布 8月30日关闭 ChatGPT 内的官方 DALL-E GPT,所有图像生成入口统一迁往「ChatGPT Images」(基于 gpt-image-1 和 gpt-image-1-mini)。
原文 ↗Adobe在ChatGPT内上线免费统一插件,整合Photoshop/Firefly/Express/Premiere/Lightroom/Illustrator/InDesign/Acrobat/Adobe Stock共70+工具;任意ChatGPT对话中@Adobe即可调用,无需Creative Cloud订阅(免费Adobe账号即可使用Firefly文生图/文生视频);同步宣布接入Claude与Microsoft Copilot,Slack/Google Gemini列入计划。
原文 ↗04图像生成与编辑
本版导读商汤发布 SenseNova U1.5-Lite-Preview,采用 8B 参数 MoT 架构,支持框选区域的局部编辑和 4K 原生输出,权重已开源。xAI 发布 Grok Imagine Image 2.0,最多 5 张参考图联合输入,支持区域编辑和透明背景导出。阿里推出 Qwen-Image-3.0-Pro,强化 10px 文字渲染,Qwen 团队自评全球排名第五。
商汤发布SenseNova U1.5-Lite-Preview:8B参数MoT(Mixture of Transformers)架构,核心突破为精准局部编辑(框选区域只改该区域、边缘自然融合)+ 4K原生输出 + 中文风格化,权重已开源,S级5+源齐发。
原文 ↗xAI于8月7日正式发布Grok Imagine Image 2.0,以设计工作流为核心:最多5张参考图联合输入(一步合成免手动拼接)、区域Magic Wand精准编辑(只修目标区域)、前/背景精确分离+透明背景PNG导出;同时优化密排文字、版式、图标、游戏资产等密集布局渲染;发布日在两项主流图像Arena中排名全球第二(文生图+图像编辑双榜)。
原文 ↗阿里在 Qwen-Image-3.0(7月21日发布,已入池)基础上推出 Pro 版本,重点强化 10px 文字渲染精度(毛孔/发丝/微表情细节),注入更丰富的世界知识(地标/品牌/符号可信度),Qwen 团队自评全球排名第五。
原文 ↗05征集与赛展
- 2026 广西数智艺术与实验艺术作品展览征稿广西壮族自治区党委宣传部 + 广西文学艺术界联合会 · 截止 8月15日
- 抖音 AI 创作大赛(首届)抖音(字节跳动) · 截止 8月20日
- 2026-W38实时视频编辑与开源图像模型
- 2026-W37Sora 关停与剪辑软件插件
- 2026-W36GPT-6 发布与世界模型更新
- 2026-W35视频生成模型集中更新
- 2026-W34版权归因研究与图像接口关停
- 2026-W33开源音乐与视频模型
- 2026-W31视频模型发布与 AI 水印新规
- 2026-W30设计 Agent 与图像模型发布
- 2026-W29WAIC 多模态模型与交互视频
- 2026-W28Meta 图像功能下架与幽灵字体
- 2026-W27图像模型、版权诉讼与视频融资
(本期完)
条目均来自本站已发布资讯,链回原卡片与原始来源;导读与本版导读为编辑汇编,不含评价。全部资讯 →