深度分析
重大事件的长篇客观分析:已知事实、横向与纵向定位、待核实事项,附全部参考来源。
-
天工短剧工作台推出 Agent 智能分镜+无限画布:先排站位再生成视频,AI 短剧从'随机抽卡'走向导演式可控生产
昆仑万维旗下天工短剧工作台(SkyProduction,3 月底首发)于 7 月 16 日推出'Agent 智能分镜+无限画布'双轨创作模式:导演 Agent 将剧本拆解为上传剧本→资产提取→站位图生成→提示词模板→分镜脚本→视频生成六个可干预环节,在视频生成前先规划人物站位与机位、参考上一镜构图生成下一镜站位图;无限画布整合 720°全景、3D 导演台、多角度/打光编辑器。平台接入 Skyreels、Seedance 2.5、Kling 等模型,据官方称三部短剧上线 DramaWave 7 天均破百万美元。
-
ComfyUI v0.28.0 发布:原生 SeedVR2 视频放大、int4 量化落地、3D 保存节点上线,工作流从 2D 生成向 3D 内容管线延伸
ComfyUI v0.28.0(7 月 15 日发布)新增原生 SeedVR2 图像/视频放大节点、NVIDIA PID 1.5 像素扩散解码模型支持、convrot int4 量化(继 v0.27.0 int8 后进一步降低显存门槛),以及 Save 3D(Advanced)/Save Splat/Save Point Cloud 三组 3D 保存节点——后者标志 ComfyUI 从纯 2D 图像生成工作流向 3D 内容管线的明确延伸。
-
Xmax 发布实时交互视频模型 X2.0:毫秒级响应、单张消费级显卡 960p@24fps,把视频从『等渲染』推向『可实时玩』
Xmax 发布通用实时交互 AI 视频模型 X2.0:以毫秒级响应把视频生成从『等待渲染结果』推向『实时参与与控制』,通过注意力稀疏化+FP8 量化在单张消费级显卡上跑 960p@24fps,支持实时换人(CharX)/换装(ClothX)/换风格(VibeX),并宣称在最新 iPhone 上实现 384p@16fps 端侧实时推理。
-
PixVerse Game 上线:用实时视频驱动的『游戏引擎』,一句话生成可玩的交互原型
爱诗科技旗下 PixVerse 于 7 月 15 日上线 PixVerse Game,被称为首个『实时视频驱动的游戏引擎』:用户以自然语言描述需求,即可获得有目标、有胜负、可即时操作的交互游戏原型;系统由抽象的游戏机制引擎与 AI Agent 编排层构成,玩家的每次输入都会实时重新生成画面、音频与叙事,实现『边玩边做』。
-
Anthropic 设计负责人 Jenny Wen 加入 Cursor:一位重塑 Claude 视觉的设计师,与她「设计流程已变」的判断
曾主导 Claude.ai 视觉重塑、并定义通用智能体 Cowork 产品愿景的 Anthropic 设计负责人 Jenny Wen,于 7 月 13 日本人官宣离开 Anthropic、加入 AI 编程工具 Cursor(Anysphere)任设计负责人。她此前公开表达过『设计流程正在根本性改变、设计师用于画稿的时间大幅下降』的判断,引发设计行业讨论。
-
商汤开源 SenseNova-Vision:把检测、分割、深度、几何等视觉任务统一进一个多模态模型
商汤于 7 月 13 日发布并开源统一视觉大模型 SenseNova-Vision:不依赖任务专用结构,用自然语言指令+可选视觉提示,把目标检测、OCR、关键点、分割、深度、法向、点图、相机位姿等异构视觉任务,统一到单一多模态模型的文本与图像生成空间中。论文称单一统一模型即可媲美领先的专用系统,模型与语料均已公开。
-
「幽灵字体」的 72 小时:人眼秒懂、AI 全瞎,一句提示后 AI 反杀
开发者 Eric Lu 发布的「Ghost Font 幽灵字体」用动态噪点视频承载文字——人眼靠运动知觉一眼可读,AI 逐帧看只见雪花噪点,一夜播放破 1700 万。但仅一天后,提示工程师 Riley Goodside 用一句方向提示,就让 GPT-5.6 Sol 在约 2 分钟内读出隐藏文字,展示了这道『人类直觉壁垒』的脆弱。
-
Meta 上线不到一周撤下 Muse Image「@公开账号生成」功能:opt-out 肖像争议的标志性事件
Meta 于 7 月 10 日撤下 Muse Image 中「@提及任意公开 Instagram 账号即可参考其照片生成图像」的功能。该功能默认将成年公开账号纳入(opt-out)、且不通知被引用者,上线不到一周即遭 CAA、SAG-AFTRA 等强烈反对,成为 AI 图像生成肖像与同意权争议的标志性事件。
-
北大提出 HOI-Edit 基准与 SCPE 自纠错框架:图像编辑迈向'人-物交互理解'
北京大学团队在 ICML 2026 提出首个面向人-物交互(HOI)图像编辑的层级化评测基准 HOI-Edit 与自纠错框架 SCPE:以真实生成视频诊断失败原因、迭代纠错,L1 交互分数提升约 22%,数据集与代码已开源。
-
GPT-5.6 正式发布:Sol/Terra/Luna 全面开放,推出可跨应用产出成品的 ChatGPT Work
OpenAI 将 GPT-5.6 系列(旗舰 Sol、均衡 Terra、轻量 Luna)从此前的受限预览转为正式全面开放,覆盖 ChatGPT、Codex、API;新增 Ultra 子智能体模式、多智能体并行,并推出由 Codex+GPT-5.6 驱动、可跨应用产出成品文档/表格/PPT/网站的 ChatGPT Work。
-
Anthropic 在 Claude 内部发现自发形成的'全局工作空间'J-space,并开源解读工具 J-lens
Anthropic 论文《语言模型中的全局工作空间》报告,在 Claude 内部发现训练中自发形成的低维结构 J-space,其功能类比神经科学的全局工作空间理论;配套解读工具 J-lens 已以 Apache-2.0 开源。论文明确表示这不等于'Claude 有意识'。
-
字节发布 Seedream 5.0 Pro:把密集信息转成专业排版,主打'设计级'图像生成
字节跳动发布多模态图像模型 Seedream 5.0 Pro,主打四大能力——把数据/概念/密集文字转为专业排版信息图、基于空间语义的交互式局部精修、真实影像质感、14 语言文字直接生成无乱码,定位设计级生产场景。
-
以每分钟约 9 美元的成本,字节 Seedance 正被好莱坞独立电影人采用
字节 Seedance 系列(尤其 2.0)正被好莱坞独立电影人用于概念短片、镜头测试与制作环节,视频加音频生成成本约每分钟 9 美元、低于同类;相关 AI 短片已入选戛纳单元、AI 长片在戛纳首映,反映中国 AI 视频以成本优势进入主流影视生产。
-
Meta 发布首个自研图像模型 Muse Image:Agent 式生成,可 @ 引用 Instagram 公开照片
Meta Superintelligence Labs 发布首个自研图像模型 Muse Image,以多步推理方式生成(规划布局、联网取上下文、融合多参考),已上线 Meta AI、Instagram Stories(美国)与 WhatsApp(部分地区),可 @ 引用 Instagram 公开账号照片作参考,并将接入 Advantage+ 广告。
-
ICML 2026 奖项揭晓:扩散模型成焦点,清华团队获杰出论文,英伟达 Motive 攻'视频运动归因'
ICML 2026 公布奖项,扩散模型成焦点:清华(与阿里)团队关于扩散语言模型的论文提出极简方案 JustGRPO 获杰出论文;英伟达 Motive 首次实现视频生成的运动归因与数据筛选,人类偏好胜率 74.1%。
-
Midjourney 请求法院强制迪士尼等披露自身 AI 使用:AI 版权案进入取证博弈
在迪士尼、环球、华纳兄弟起诉 Midjourney 侵权的版权诉讼中,Midjourney 请求联邦法院强制这些制片公司披露其内部 AI 使用情况,主张对方也在用未授权版权数据训练 AI;制片方称此为'钓鱼式取证'。案件进入取证范围之争。
-
生数科技发布 Vidu S1:一张照片加实时语音,AI 视频从'生成内容'跨入'实时互动'
生数科技于 7 月 3 日发布 Vidu S1,以'照片+实时语音→可持续互动的 AI 数字角色'实现实时交互视频生成(540P/25FPS、可在消费级 GPU 运行),把 AI 视频从单向'生成内容'推向双向'实时对话'。
-
快手可灵 AI 完成约 28 亿美元融资、拆分独立:BAT 同台参投,估值 180 亿美元
快手旗下 AI 视频大模型可灵完成约 28 亿美元首轮外部独立融资、拆分为独立主体,腾讯、阿里、百度同台参投,投后估值约 180 亿美元;快手计划在 12 个月内启动其香港上市流程。
-
GenEvolve 开源:把图像生成从'一句话到像素'升级为'工具编排轨迹'的自进化 Agent
港科广、美团 AI Research 等联合开源 GenEvolve——把图像生成建模为'工具编排轨迹'的自进化 Agent 框架:AI 自主完成搜索取证、检索参考、调用生成技能并合成 prompt-reference program,再交渲染器执行,而非把文字直接映射到像素。
-
Google 发布 Nano Banana 2 Lite 与 Gemini Omni Flash:4 秒出图、速度档质量反超更贵的专业档
Google DeepMind 于 6 月 30 日发布速度档图像模型 Nano Banana 2 Lite(约 4 秒出图,每张 1K 分辨率图约 $0.034,质量略超更贵的专业档)与视频模型 Gemini Omni Flash(图/文/视频转视频),并计划接入 Adobe Firefly。
-
Apple Creator Studio 更新:Final Cut Pro 端侧 AI 遮罩/字幕/剪辑还原,Pixelmator Pro 接入生成
Apple 更新 Creator Studio:Final Cut Pro 新增端侧 AI 的自动字幕、剪辑还原(Edit Detection)与智能遮罩(Auto Mask),Pixelmator Pro 集成自然语言生图与矢量生成,主打'在本地增强既有工作'而非从零生成。
-
OpenAI 预览 GPT-5.6 系列 Sol/Terra/Luna:三档模型、新推理模式,先限可信伙伴使用
OpenAI 预览 GPT-5.6 系列,分旗舰 Sol、均衡 Terra、轻量 Luna 三档,强化软件工程、智能体与多模态理解能力;当前仅向约 20 家可信伙伴限量开放,未来数周再全面上线。
-
Agnes AI 发布 Pavo 创作平台:一句话拆剧本到成片,全模态自研模型 API 永久免费
Agnes AI 发布 PC 端创作平台 Pavo,用智能路由把'一句话'自动拆成剧本、角色设计、分镜直至成片;其自研的文本、图像、视频全模态模型 API 自 6 月起永久免费、不限量,在烧钱的 AI 短剧赛道以'免费'切入。
-
广电总局微短剧分类分层标准 7 月 1 日施行:AI 生成微短剧须每集加标识
广电总局发布微短剧分类分层管理标准,按投资额与题材分三类实行备案公示与发行许可,并要求 AI 生成、制作的微短剧在每集明显位置添加提示标识,自 2026 年 7 月 1 日起施行。
-
美团开源 AIGC 海报体系 PosterCraft/PosterOmni/PosterReward:构建'生成—编辑—评判'闭环
美团开源覆盖生成、编辑、评判全链路的 AIGC 海报技术体系,含 PosterCraft、PosterOmni、PosterReward 三项工作(分别入选 ICLR/CVPR 2026),并已在真实业务中落地,为平面设计方向的 AI 研究与教学提供了可复现的开源样本。
-
Google Labs 开源 DESIGN.md:给 AI 编码智能体一份'看得懂'的设计系统说明
Google Labs 开源 DESIGN.md 格式规范,用 YAML 设计 token 加 Markdown 说明的双层结构,让 Claude Code、Cursor 等 AI 编码智能体持久、结构化地理解并遵循一套设计系统,解决 AI 生成界面视觉一致性差的问题。
-
字节 TRAE Work 上线 Design 模式:在同一平台打通'需求→设计→代码'全链路
字节 AI 开发平台 TRAE 的 Work 产品新增 Design 模式,支持解析 Figma 设计系统、框选编辑与一键导出代码,使 Work、Design、Code 三模式在同一平台打通'需求→设计→代码'全链路。
-
Adobe 收购 Topaz Labs:把艾美奖级 AI 增强与本地运行技术并入 Creative Cloud
Adobe 宣布收购 AI 图像与视频增强公司 Topaz Labs,将其 Astra、Wonder 模型与可本地运行大模型的 Neurostream 技术并入 Firefly 与 Creative Cloud,标志其 AI 战略从'生成'扩展为'生成+增强'双轨。
-
华策联手 Utopai 推全 AI 制作《西游记:失落的五百年》:经典 IP 与工业级 AI 制作的首次正式结合
中国头部影视公司华策影视联手 Utopai Studios,以 Utopai 的 PAI 平台制作全 AI 生成动画剧集《西游记:失落的五百年》,是顶级东方经典 IP 与工业级 AI 制作平台的首次正式结合。
-
Figma Config 2026:原生动效、设计⇌代码双向同步与 MCP 设计智能体,设计工具走向全链路平台
Figma 在 Config 2026 推出原生动效时间轴 Figma Motion、设计与代码双向同步的 Code Layers,以及可连接 14+ 外部工具的 MCP 设计智能体,从静态设计工具向覆盖设计→动效→代码→多工具协作的全链路平台演进。
-
影眸 Hyper3D Rodin Gen-2.5:把'先思考再生成'带进 3D,同步完成数亿元融资
影眸科技发布 Rodin Gen-2.5,将语言模型'先思考再生成'的机制引入 3D 生成,主打千万面级几何与 12K 原生贴图,并支持自然语言局部编辑与全 DCC 生态接入;同步完成数亿元融资,是国产 3D 生成赛道的标志性节点。
-
ComfyUI v0.26.0 一次接入 Krea 2 等三大开源模型:开源生图工作流的'超市'再扩容
ComfyUI v0.26.0 在单次版本更新中接入 Krea 2、Boogu-Image、Qwen3-VL 三大开源模型,并新增 3D 与视频节点;其中 Krea 2 为开放权重图像模型、明确不使用 AI 生成图预训练,进一步降低优质开源模型的使用门槛。
-
Google DeepMind 入股 A24 并嵌入制片流程:AI 与电影制作从「供工具」转向「共研发」
谷歌 DeepMind 与 A24 建立 AI 研究合作并入股,研究员深入制片流程共同开发 AI 分镜工具,标志 AI 与创意制作机构关系从供工具升级为共研发,并伴随显著行业争议。
-
字节跳动发布 Seedance 2.5:30 秒原生单段直出,50 素材联合生成,跳号宣告代际
字节跳动在火山引擎 FORCE 大会发布视频模型 Seedance 2.5,实现 30 秒原生单段直出与 50 素材联合生成,并预告图像模型 Seedream 5.0 Pro 与音频模型 Seed-Audio 1.0,跳号至 2.5 以宣告代际差异。
-
可口可乐世界杯营销全面 AI 化:限定 TVC 由 Prompt 生成,范志毅数字人实时互动
2026 世界杯期间,可口可乐中国限定版 TVC 的 5 人 5 城场景全部由 Prompt 生成(百度一镜操盘),范志毅数字人实现 2 秒内端到端实时互动,是国际顶级品牌大型营销项目由生成式 AI 承担的直接案例。
-
AI 检测误判席卷 2026 毕业季:原作被判 AI、跨平台结果打架,评价体系现裂缝
2026 毕业季,高校普遍引入 AIGC 检测,大量手写与原创作品被误判为 AI 生成、跨平台结果差异巨大,学生被迫降重与自证;arXiv 研究指出此类误判是结构性约束,揭示 AI 时代原创性认定体系的裂缝。
-
Adobe 将 Firefly AI 助手内嵌进 Photoshop、Premiere 等全系应用:创意智能体进入专业工具的转折
Adobe 将 Firefly AI 助手以侧边栏形式内嵌进 PS/Pr/Ai/Id/Frame.io 公测,AI 从流程外的生成器转为流程内的执行体,标志创意智能体进入专业设计工具的转折。