浅译周报
图像模型、版权诉讼与视频融资
6 月 29 日至 7 月 5 日,共收录资讯 23 条。Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash,Veo 3.1 新增 9:16 竖版输出。生数科技发布实时互动数字角色模型 Vidu S1。Midjourney 向法院申请强制迪士尼等公司披露自身 AI 使用情况。可灵 AI 完成近 30 亿美元独立融资。广电总局要求 AI 生成微短剧每集加标识,7 月 1 日起施行。Apple 更新 Creator Studio,Anthropic 发布 Claude Sonnet 5。
头条Google Nano Banana 2 Lite + Gemini Omni Flash:4 秒出图、质量反超 Pro 档,静态图一键带运镜- 1
- 2
- 3
01图像与视频模型
本版导读Nano Banana 2 Lite 约 4 秒出图,每张 1K 分辨率图约 $0.034;同日发布的 Gemini Omni Flash 可把静态图转为带运镜的视频。Vidu S1 用一张照片加实时语音生成可互动的数字角色,模型侧延迟约 200ms。Veo 3.1 新增 9:16 竖版与 4K 超分。Wan-Streamer v0.1 提出实时音视频流数字人框架。
Google DeepMind 于 2026-06-30 同步发布 Nano Banana 2 Lite 图像模型(约 4 秒出图、每张 1K 分辨率图约 $0.034)与 Gemini Omni Flash 静态图转带运镜视频模型;两款均已接入 Adobe Firefly 与 Google Stitch 生态。
原文 ↗生数科技发布 Vidu S1:一张照片 + 实时语音即可生成可持续互动的 AI 数字角色,540P/25FPS 全双工交互,AR+扩散混合架构,模型侧延迟约 200ms
原文 ↗Google Veo 3.1 新增原生 9:16 竖版视频输出、1080p-4K 超分辨率及跨场景角色一致性能力,已上线 Gemini App、YouTube Shorts、Gemini API 等平台
原文 ↗Wan-Streamer v0.1 提出端到端实时音视频流数字人生成框架,论文 arXiv:2606.25041 提前公开,覆盖音频驱动唇形同步与实时视频流输出全链路
原文 ↗02版权、监管与融资
本版导读Midjourney 以「双重标准」为由,申请法院强制迪士尼、环球、华纳兄弟披露其自身 AI 使用情况。广电总局微短剧分类分层标准 7 月 1 日施行,AI 生成的微短剧须每集加提示标识。可灵 AI 完成近 30 亿美元独立融资,腾讯、阿里、百度联合领投;VAST AI 完成超 10 亿元 A3 轮融资。
Midjourney 向法院申请强制迪士尼/环球/华纳兄弟披露其自身 AI 使用情况,以『双重标准』为由反制版权诉讼,发现权博弈将影响 AI 艺术版权判例走向
原文 ↗快手旗下可灵 AI 完成独立融资近 30 亿美元(约 196 亿元),腾讯/阿里/百度历史性联合领投,刷新全球 AI 视频模型最大单笔融资纪录
原文 ↗广电总局发布微短剧分类分层管理标准,按投资额与题材分三类实行备案与发行许可,并要求 AI 生成、制作的微短剧在每集明显位置添加提示标识,自 2026 年 7 月 1 日起施行。
原文 ↗VAST AI 完成超 10 亿元 A3 轮融资,游戏产业方参投,Tripo 3D 大模型加速游戏/影视/工业设计商业化落地
原文 ↗03生成与图形学研究
本版导读港科广、美团等开源 GenEvolve,让图像生成由 Agent 自主编排工具调用。美团开源海报生成、编辑与评判三项工作。ICML 2026 杰出论文奖由两篇扩散模型论文获得。SIGGRAPH 2026 公布技术论文最佳奖,CMU 平面映射算法获奖;Google DeepMind 的 AI 辅助油画风短片入选计算机动画节。
GenEvolve 将图像生成从『一句话提示词』升级为 Agent 自主编排工具调用轨迹,港科广+美团+港科大+新加坡国立联合开源
原文 ↗美团开源覆盖生成、编辑、评判全链路的 AIGC 海报技术体系,含 PosterCraft、PosterOmni、PosterReward 三项工作(分别入选 ICLR/CVPR 2026),并已在真实业务落地。
原文 ↗ICML 2026 两篇扩散模型论文同获杰出论文奖:清华黄高团队 JustGRPO(GSM8K 89.1%)与 MIT/耶鲁高精度采样算法;英伟达 Motive 获荣誉提名
原文 ↗从 SIGGRAPH 2026 技术论文提炼 5 大设计前沿方向:3D 空间感知、身体与情境交互、AI 产品化、虚实融合、设计工具,覆盖从感知到工具的完整链路
原文 ↗SIGGRAPH 2026 于 2026-06-30 公布技术论文最佳奖:CMU 平面映射算法获最佳论文(3D 矢量化速度提升数个数量级),慕尼黑工大时空流体仿真获荣誉提名;大会 7 月 19–23 日在洛杉矶举行(第 53 届)。
原文 ↗SIGGRAPH 2026 计算机动画节入选 Google DeepMind 团队 AI 辅助油画风动画短片,艺术家全程主导 + AI 协同创作模式获学院奖认证节展认可
原文 ↗中科大+清华+剑桥等机构联合综述 500+ 篇论文,系统分析扩散模型『生成一致性危机』,提出外部/内部/规范三类一致性框架
原文 ↗04创作工具与平台
本版导读Apple 免费更新 Creator Studio,Final Cut Pro 新增端侧 AI 自动遮罩与自动字幕。Agnes AI 发布 Pavo 平台,可把一句话拆成剧本、分镜直至成片,自研模型 API 永久免费。Google Labs 开源 DESIGN.md,为 AI 编码工具描述设计系统。ComfyUI v0.27.0 支持 Int8 量化,Runway 推出 Agent Skills。
Apple 于 2026-06-30 免费更新 Creator Studio:Final Cut Pro 新增端侧 AI 的 Auto Mask(自动分离皮肤/头发/天空等)、Generate Subtitles(自动字幕转录)、Edit Detection(从成品还原原始片段);Pixelmator Pro 与 FCP/Keynote/Pages/Numbers 跨应用实时同步编辑。
原文 ↗Agnes AI 发布 PC 端创作平台 Pavo,用智能路由把「一句话」自动拆成剧本、角色设计、分镜直至成片;其自研文本/图像/视频全模态模型 API 自 6 月起永久免费、不限量,在烧钱的 AI 短剧赛道以「免费」切入。
原文 ↗Google Labs 开源 DESIGN.md 格式规范,用 YAML 设计 token + Markdown 说明的双层结构,让 Claude Code、Cursor 等 AI 编码智能体持久、结构化地理解并遵循一套设计系统。
原文 ↗ComfyUI v0.27.0 正式支持 Int8 量化模型,VRAM 需求降低约 40%、推理速度提升约 40%,适用于 Turing 及以上 GPU 架构
原文 ↗Runway 推出 Agent Skills(7/2),支持用简单命令构建完整广告活动与商业视频,AI 代理接管从概念到成片的全流程
原文 ↗05大语言模型
本版导读Claude Fable 5 与 Mythos 5 于 7 月 1 日在全球恢复访问,此前因美国出口管制中断 19 天。Anthropic 于 6 月 30 日发布 Claude Sonnet 5,成为 Free 与 Pro 用户的默认模型,入门定价为每百万 Token $2/$10。DeepSeek 宣布 V4 将于 7 月中旬上线,并引入峰谷定价,高峰时段 API 价格翻倍。
Claude Fable 5 与 Mythos 5 于 2026-07-01 在 Claude.ai、Claude Code 及 API 全球恢复访问,此前因美国出口管制中断 19 天(6/12–7/1);配套新安全分类器拦截率 >99%,7/7 前 Pro/Max/Team 用户可用 50% 额度。
原文 ↗Anthropic 于 6 月 30 日发布 Claude Sonnet 5,定位 Agentic 场景,性能接近旗舰 Opus 级,成为 Claude Free/Pro 用户默认模型;入门定价 $2/$10 每百万 Token(至 2026 年 8 月底),与 GPT-5.6 同日形成正面竞争格局。
原文 ↗06征集与赛展
- 第二届高校 AIGC 数字艺术设计大赛中国照明学会数字艺术专业委员会 × 上海市照明学会 · 截止 7月15日
- 第 38 届百花奖 AIGC 推优单元全球征集第 38 届大众电影百花奖组委会 · 截止 7月20日
- 2026-W38实时视频编辑与开源图像模型
- 2026-W37Sora 关停与剪辑软件插件
- 2026-W36GPT-6 发布与世界模型更新
- 2026-W35视频生成模型集中更新
- 2026-W34版权归因研究与图像接口关停
- 2026-W33开源音乐与视频模型
- 2026-W32视频音频模型与创意软件接入
- 2026-W31视频模型发布与 AI 水印新规
- 2026-W30设计 Agent 与图像模型发布
- 2026-W29WAIC 多模态模型与交互视频
- 2026-W28Meta 图像功能下架与幽灵字体
(本期完)
条目均来自本站已发布资讯,链回原卡片与原始来源;导读与本版导读为编辑汇编,不含评价。全部资讯 →