-
›Midjourney V8.2 正式成为默认版本:美学与个性化升级,sref 风格板精准度提升,新增 Big Batch Draft Mode
模型与工具
2026-07-24
· Midjourney 官方更新页
Midjourney V8.2 于 7 月 24 日正式成为默认版本,美学表现和 sref 风格板个性化一致性较 V8.1 显著提升,新增 Big Batch Draft Mode 加速风格探索。
Midjourney 于 7 月 24 日将 V8.2 升格为默认版本,结束此前的预览期;与 V8.1 相比,V8.2 在美学表现(尤其人像与光影处理)和个性化一致性(sref 风格板精准度与个性化图片池扩大)方面有显著提升;并新增 Big Batch Draft Mode,支持 --sref random 实现约 24 倍更快的风格空间探索,延续 V8.x 系列与 V7 的不同审美路线。
Midjourney V8.2 成为默认版本意味着课堂演示与工作坊实操的标准生成体验全面更新,sref 风格板一致性提升对「建立专属风格语言」训练有直接价值。
查看原始来源 ↗
-
›Midjourney 收购天文 App Co-Star:全部 24 名员工加入,创始人 Banu Guler 出任设计总监,独立图像 App 建设提速
模型与工具
2026-07-24
· Bloomberg / TechCrunch / Gizmodo / Engadget
Midjourney 全盘收购天文 App Co-Star,全部 24 名员工加入,创始人 Banu Guler 出任设计总监,信号 Midjourney 独立消费端 App 建设明显提速。
Midjourney 宣布全盘收购 Gen Z 天文 App Co-Star(月活超千万),全部 24 名员工随迁,创始人 Banu Guler 出任 Midjourney 设计总监;外界普遍解读为 Midjourney 加速推进首款独立移动图像应用,同步补充消费者产品设计与用户增长能力;Co-Star 以简洁界面和 Gen Z 用户基础著称。
收购消费端 App 团队并引入专职设计总监,信号 Midjourney 独立移动 App 上线在即,图像生成工具的移动端体验将迎来重要变化。
查看原始来源 ↗
-
›Anthropic Claude Opus 5 正式发布:$5/$25 每百万 Token(Fable 5 半价),1M 上下文,接近旗舰级性能
模型与工具
2026-07-24
· Axios / Anthropic 官方
Anthropic 正式发布 Claude Opus 5,输入 $5 / 输出 $25 每百万 Token(约为 Fable 5 半价),1M token 上下文,性能接近旗舰级。
Anthropic 正式发布 Claude Opus 5,输入定价 $5、输出定价 $25 每百万 Token(约为旗舰级 Fable 5 的半价);支持 1M token 上下文与 128K 输出长度,性能接近 Fable 5 旗舰级;定位为高性价比旗舰,适合对成本敏感的长文档与多模态任务。
Fable 5 旗舰级性能以半价开放,使资源受限的研究团队和独立创作者可低成本调用长上下文强模型处理复杂设计与多模态任务。
查看原始来源 ↗
-
›Runway Media Router 发布:首个生成式媒体模型路由器,按质量 / 速度 / 成本需求自动调度最优 AI 模型
模型与工具
2026-07-23
· TechCrunch / Runway 官方
Runway 发布 Media Router,首个生成式媒体模型路由器,创作者设定优先级后系统自动在 Gen-4.5 / Aleph 2.0 等模型间选择最优路径。
Runway 发布 Media Router,定位为首个专为生成式媒体设计的模型路由器:创作者设定质量、速度、成本优先级后,系统自动在 Gen-4.5、Aleph 2.0 等模型间选择最优路径;企业用户可在预算内最大化生成质量;主要面向 Runway Dev API 生态。
「模型路由」是 AI 内容生产工业化的关键基础设施概念——从手动选模型到按任务需求自动分配最优资源,是 AI 工具生态走向成熟的重要信号。
查看原始来源 ↗
-
›美图发起 Hatch Catch AI 影像 Builder 挑战赛:1 亿元总奖金,寻找已上线 AI 原生影像产品,单项最高 500 万投资
案例与作品
2026-07-23
· 量子位
美图发起 Meitu Hatch Catch 产品挑战赛,总规模 1 亿元,面向已上线且有种子用户的 AI 原生影像产品,聚焦 AI 影像赛道,单项最高投资 500 万元。
美图公司发起 Meitu Hatch Catch 产品挑战赛,总规模 1 亿元,定向寻找已上线且拥有种子用户的 AI 原生影像产品(B2C 优先);聚焦 AI 相机、AI 修图、AI 视频、AI 设计工具等影像赛道,单个项目最高获得 500 万元投资;美图提供产品推广、算力资源与商业整合支持;不接受纯 ToB 项目。
美图主动发起 Builder 挑战赛且设置「已上线 + 种子用户」高门槛,说明 AI 影像应用赛道已进入产品化验证阶段,是观察 AI 影像商业化路径的重要信号。
查看原始来源 ↗
-
›量子位 WAIC 2026 十大趋势:Agent 演示取代大模型发布,设计工具 Agent 化成明确风向标
观点与技巧
2026-07-22
· 量子位 / 51CTO
量子位发布 WAIC 2026 十大趋势:83 家参展主体聚焦 AI Agent,设计工具 Agent 化从个别案例变为行业风向标,从「对话式 AI」进入「交付式 Agent」。
量子位在 WAIC 2026 闭幕日发布十大趋势观察:大模型不再独占 C 位,83 家参展主体聚焦 AI Agent 与智能应用,Agent 演示增多;「设计工具 Agent 化」从个别案例变为行业风向标——从「对话式 AI」进入「交付式 Agent」,WAIC 2026 标志 AI 进入「能力收割」而非「能力竞赛」阶段。
WAIC 2026 十大趋势观察为理解 AI 工具当前发展阶段提供了系统性框架,「从生成到交付」的主线直接影响设计工具课程内容的规划方向。
查看原始来源 ↗
-
›南京大学 VideoChat3 全栈开源:4B 参数统一短 / 长 / 流式视频理解,登顶 HuggingFace 趋势榜
研究与论文
2026-07-22
· 南京大学 / 上海AI Lab / 机器之心 / 新无尽 / alphaxiv
南京大学联合多校发布 VideoChat3,全栈开源 4B 参数视频理解模型,统一处理短视频 / 长视频 / 流式视频三类任务,登顶 HuggingFace 趋势榜。
南京大学联合上海 AI Lab、南洋理工大学、北京大学发布 VideoChat3,全栈开源(权重、代码、数据、训练流程),4B 参数统一处理短视频、长视频与实时流式视频三类任务,打通感知—理解—交互链路,在多个视频理解基准取得 SOTA;发布后登顶 HuggingFace 趋势榜。
全栈开源的统一视频理解模型,为高校研究团队复现和定制化部署提供了完整基础,适用于素材检索、镜头分析等创作辅助场景。
查看原始来源 ↗
-
›Tripo AI SIGGRAPH 2026主题演讲:茶壶测试从「能展示」到「能制造」,3D生成AI迈向交互式世界智能
观点与技巧
2026-07-22
· SIGGRAPH 2026官方日程 / Tripo AI官方X
Tripo AI在SIGGRAPH 2026发表题为「茶壶测试:从展示走向制造」的主题演讲,阐述如何从孤立静态资产生成迈向动态环境/智能体系统/世界建模,展示Tripo全栈生成生态在游戏/3D打印/机器人仿真等工业管线中的应用。
Tripo AI在SIGGRAPH 2026发表题为「茶壶测试:从展示走向制造(The Teapot Test: From Showcase to Manufacture)」的主题演讲,由团队核心成员Yanpei Cao等主讲;演讲以图形学历史典故”犹他茶壶”为切入点,系统阐述从孤立资产生成(静态展示)迈向动态环境、智能体系统和世界建模(可制造、可交互)的路径;现场展示Tripo全栈3D生成生态在游戏资产制作、3D打印原型和机器人仿真训练数据等工业管线中的实际应用案例。
“从展示到制造”的定位对应3D生成AI的核心演进方向——进入实际生产管线而非停留在演示工具层面,茶壶测试的新诠释也为3D/交互设计课程提供了清晰的概念坐标。
查看原始来源 ↗
-
›微软开源 Mage-Flow:4B 参数原生任意分辨率图像生成与编辑,GenEval 0.90 开源最高,MIT 许可可商用
模型与工具
2026-07-22
· 机器之心/ComfyUI Wiki/arXiv/GitHub/HuggingFace(多源)
「Mage-Flow 4B 参数原生支持 512–2048 任意宽高比文生图与指令式编辑,GenEval 0.90 为开源最优,Turbo 版 0.59 秒/张。」
微软亚洲研究院发布 Mage-Flow,Mage-VAE + NR-MMDiT 紧凑生成栈,4B 参数原生支持 512–2048 任意宽高比文生图与指令式图像编辑;GenEval 0.90(开源最高);Turbo 蒸馏版单张 0.59 秒;MIT 许可证可商用;已提供 ComfyUI 节点。
4B 参数在 GenEval 超越部分数倍体量模型,MIT 许可与 ComfyUI 集成使其在资源受限环境下具备直接可用的商业级图像生成能力。
查看原始来源 ↗
-
›央美教授吴小虎策展:AI 数字技术让千年壁画走出高墙,联合国教科文组织报告背书
案例与作品
2026-07-22
· 央广网 / 新华社
中央美术学院教授吴小虎策划展览,借助 AI 数字技术让传统壁画突破展馆局限面向大众,项目获联合国教科文组织报告背书。
中央美术学院教授吴小虎策划展览,借助 AI 数字技术对传统壁画进行数字化再生,让原本封存于石窟或博物馆高墙内的千年壁画以数字媒介形式面向大众互动展示;项目获联合国教科文组织《人工智能与非物质文化遗产》报告背书,探讨 AI 辅助文化遗产保护的伦理与实践框架。
央美教授主导、UNESCO 背书的 AI×传统文化保护项目,是「AI 辅助文化遗产数字化传播」方向的典型高学术含量案例。
查看原始来源 ↗
-
›WAIC 2026「AI 创作者之夜」:郭靖宇 / 陈楸帆等讨论 AI 时代创作边界,「真实、情感与在场」是不可替代核心
观点与技巧
2026-07-21
· 腾讯新闻 / 哈佛商业评论
郭靖宇、陈楸帆等创作者在 WAIC 2026 圆桌讨论认为,真实体验、情感共鸣与在场感是 AI 时代人类不可替代的核心价值。
导演郭靖宇、科幻作家陈楸帆等在 WAIC 2026「AI 创作者之夜」圆桌就 AI 时代创作边界展开讨论:与会者普遍认为「真实体验、情感共鸣与在场感」是 AI 无法替代的人类创作核心价值;讨论同时涉及版权保护议题,提出需以「人类创新性智慧」作为版权保护的核心边界;多位创作者表达「人机协作是可持续创作范式」的共识。
业界知名创作者从各自实践出发,为「AI 工具与人类创作主体性」的关系提供了有代表性的多维视角,可作为 AI 设计课程「创作者价值」议题的讨论素材。
查看原始来源 ↗
-
›NVIDIA DLSS 5 SIGGRAPH 2026揭秘:三路AI模型分工神经渲染,让艺术家「主导最终画面」,秋季上线
模型与工具
2026-07-21
· WCCFTech / guru3d / TechPowerUp(多源)
NVIDIA在SIGGRAPH 2026披露DLSS 5技术细节:三路独立AI模型(A/B/C)分别负责全局光照/次表面散射/材质细节等渲染环节,开发者可对场景/角色/关卡单独分配不同模型;紧凑扩散Transformer架构,单GPU实现4K/60fps/亚16ms延迟;DLSS 5秋季正式上线游戏。
NVIDIA在SIGGRAPH 2026披露DLSS 5的完整技术架构:三路独立AI模型(A/B/C)各司其职,分别负责全局光照、次表面散射和材质细节等渲染环节,开发者可按场景、角色或关卡粒度单独分配不同模型,实现更精细的创作控制;底层采用紧凑扩散Transformer架构,在单GPU上实现4K/60fps、亚16ms延迟;DLSS 5定于秋季正式上线商业游戏。此次揭秘强调”让艺术家主导最终画面”——有别于DLSS 4.5的超分/帧生成功能,DLSS 5是AI深度参与全局光照、皮肤、头发、布料物理建模的实时渲染本质变革。
DLSS 5不是超分迭代而是神经网络参与实时渲染底层物理建模的架构革新,”艺术家主导”定位将AI渲染主控权从自动算法还给创作者,对3D/游戏/影视设计方向有根本性影响。
查看原始来源 ↗
-
›Google三模型齐发:Gemini 3.6 Flash降本17%、3.5 Flash-Lite最廉价、3.5 Flash Cyber安全专项,同步宣告Gemini 4预训练开启
模型与工具
2026-07-21
· Google DeepMind官方Blog / TechCrunch / 9to5Google(多源)
Google DeepMind同日发布三款新Flash模型:Gemini 3.6 Flash是主力workhorse、token成本降低17%,3.5 Flash-Lite为最低价轻量版($0.30/百万输入),3.5 Flash Cyber为安全漏洞专用精调版限政府伙伴;同步宣布Gemini 4已进入预训练阶段,Gemini 3.5 Pro仍在伙伴测试中。
Google DeepMind于2026年7月21日同日发布三款新Flash系列模型:Gemini 3.6 Flash定位主力workhorse,综合多模态能力提升,token成本较前代降低17%,DeepSWE编程评测49%、Computer Use任务83%,支持百万token上下文;Gemini 3.5 Flash-Lite为极低成本轻量场景设计,输入价格$0.30/百万token;Gemini 3.5 Flash Cyber是安全漏洞检测专项精调版,仅对政府合作伙伴开放;同时宣布Gemini 4已进入预训练阶段,此前原计划7月17日发布的Gemini 3.5 Pro仍在伙伴测试中延期推进。
Gemini模型已深度整合Google Workspace、Canva、Figma等设计工具生态,3.6 Flash降本17%直接降低基于Gemini驱动的创意工具API使用成本,Gemini 4预训练宣告则标志下一代能力的路线图节点。
查看原始来源 ↗
-
›Autodesk SIGGRAPH 2026:3ds Max支持可编辑3D高斯溅射,Maya MotionMaker支持「带自己的数据」定制生成动作模型
模型与工具
2026-07-21
· Autodesk官方新闻室 / Creative Bloq(多源)
Autodesk在SIGGRAPH 2026宣布:3ds Max将3D Gaussian Splats变为完全可编辑资产(支持建模/动画/场景构建);Maya MotionMaker新增BYOD(Bring Your Own Data),团队可用自家动捕/手绑动作数据训练自定义生成动作模型;Flow Production Tracking引入实时媒体审阅与协同标注。
Autodesk在SIGGRAPH 2026宣布两项重要更新:3ds Max将3D Gaussian Splats从只读素材升级为完全可编辑资产,支持建模、动画和场景构建,并整合AI生成环境能力,使AI扫描生成的三维场景可直接进入专业VFX制作管线;Maya MotionMaker新增BYOD(Bring Your Own Data)功能,动画团队可使用自家动作捕捉或手绑动作数据训练专属动作生成AI模型,实现风格化定制;此外Flow Production Tracking引入实时媒体审阅与协同标注功能,改善远程协作审片流程。
3ds Max可编辑Gaussian Splats让AI生成三维场景直接进入VFX专业管线,Maya MotionMaker BYOD让动画团队训练专属风格的动作AI,两项更新共同降低了AI生成内容与专业制作工作流之间的整合门槛。
查看原始来源 ↗
-
›万兴科技WAIC 2026三箭齐发:万兴剧厂无限画布+Agent助手、Filmora.AI专业画布工作台、Virbo AI视频带货全球首秀
模型与工具
2026-07-20
· 新浪科技 / 搜狐 / 腾讯新闻(多源)
万兴科技在WAIC 2026展示三条AI视频产品线:万兴剧厂推出无限画布节点式影视工作流和专属AI Agent助手,Filmora.AI提供专业TVC画布级工作台,Virbo AI定位短视频电商带货场景,CEO宣布将推动AI影视规模化商业化。
万兴科技(Wondershare)在WAIC 2026展示三条AI视频产品线的集中更新:万兴剧厂推出”无限画布”节点式影视工作流,搭配专属AI Agent助手,面向剧情内容生产场景;Filmora.AI为专业TVC制作人群提供画布级工作台;Virbo AI定位短视频电商带货场景并在WAIC完成全球首秀;CEO吴太兵表示将推动AI影视的规模化商业化落地。三条产品线覆盖剧情创作、专业广告片和电商内容全场景。
万兴科技三条线覆盖剧情→专业TVC→电商带货全场景,无限画布+节点式工作流体现了AI视频工具从单片段生成向完整工业化管线演进的趋势方向。
查看原始来源 ↗
-
›阿里Qwen-Audio-3.0-TTS发布:Flash版首包延迟300ms级实时交互,Plus版登顶Artificial Analysis全球榜单,覆盖20种中文方言
模型与工具
2026-07-20
· 新浪科技 / IT之家 / 量子位 / 机器之心(多源)
阿里发布语音合成大模型Qwen-Audio-3.0-TTS,含实时交互Flash版(首包延迟300ms级)和高质量生成Plus版;支持细粒度标签控制、freestyle指令遵循、20种中文方言及多语种,Plus版登顶全球权威榜单Artificial Analysis。
阿里巴巴发布Qwen-Audio-3.0-TTS语音合成大模型,分为两个版本:Flash版面向实时交互场景,首包延迟达300ms量级;Plus版面向高质量生成场景,在全球权威评测榜单Artificial Analysis中排名第一。两个版本均支持细粒度情绪/节奏/语气标签控制、freestyle自然语言指令遵循、20种中文方言以及多语种输出,将AI语音合成从”能说话”推进至”会表达”的能力层级。
AI语音合成是视频创作、数字人和有声内容工作流的核心组件,300ms首包延迟接近实时门槛,20种方言覆盖为多元地域内容生产打开空间。
查看原始来源 ↗
-
›NVIDIA SIGGRAPH 2026发布Synthetic Video Detector NIM:22ms检测AI生成视频,92%精准度,API即用
模型与工具
2026-07-20
· NVIDIA官方Blog/WCCFTech/Digital Trends(多源)
NVIDIA在SIGGRAPH 2026发布Synthetic Video Detector NIM,22ms/帧检测速度、92%精准率,通过标准API调用,填补AI生成视频内容真实性验证空白,与Adobe Content Credentials、C2PA标准形成生态配合。
NVIDIA于SIGGRAPH 2026(2026年7月20日)发布Synthetic Video Detector NIM(网络推理微服务),专用于检测AI生成视频;官方测试数据:22ms/帧检测速度,92%精准率,4%误报率,通过标准API调用,无需本地GPU部署。此前NVIDIA已发布AI图像检测NIM,此次视频版填补了内容真实性验证的空白;技术上与Adobe Content Credentials、C2PA标准形成生态配合。
22ms/帧的实时检测能力意味着平台可在视频发布流程中大规模部署,AI生成视频的可检测性将实质影响内容发布规则与合规要求,是AI内容伦理与合规领域的标志性技术进展。
查看原始来源 ↗
-
›NVIDIA SIGGRAPH 2026:MCP接入Adobe/Blender/Houdini/Unreal等全链路创作工具,同步发布Cosmos 3 Edge 4B边缘世界模型
模型与工具
2026-07-20
· NVIDIA官方Blog / Claypier / 掘金 / OmniTools(多源)
NVIDIA在SIGGRAPH 2026宣布Adobe Firefly/Creative Cloud、Canva/Affinity Designer、Blender、SideFX Houdini 22、Unreal Editor等主流创作软件全面支持MCP协议,AI Agent可直接在DCC工具内执行场景检查/材质标记/版本导出等操作;同步开源Cosmos 3 Edge(4B参数,VANTAGE-Bench同参数同类第一),可在Jetson Thor/RTX PRO/GeForce RTX上本地运行。
NVIDIA在SIGGRAPH 2026主题演讲宣布,Adobe Firefly/Creative Cloud、Canva、Affinity Designer、Blender、SideFX Houdini 22、Unreal Editor等主流专业创作软件全面支持MCP(Model Context Protocol)协议,AI Agent可直接在这些DCC工具内执行场景完整性检查、材质与纹理标记、版本导出自动化等辅助操作,不再局限于生图功能;同步开源Cosmos 3 Edge(4B参数),在VANTAGE-Bench同参数同类评测中排名第一,支持在Jetson Thor/RTX PRO/GeForce RTX等消费级硬件上本地推理,采用Apache 2.0协议开源。
MCP协议同时接入Adobe/Blender/Houdini/Unreal意味着AI Agent开始进入设计师日常工具内”干活”,从生图工具进化为工作流协作者,是AI×设计工具生态最重要的架构转变之一。
查看原始来源 ↗
-
›NVIDIA SIGGRAPH 2026发表21篇论文:MotionBricks实时动作AI同时驱动数字角色与人形机器人,ArtiFixer将杂乱3D扫描转为完整场景
研究与论文
2026-07-20
· NVIDIA Research / SIGGRAPH 2026(多源)
NVIDIA在SIGGRAPH 2026发表21篇研究论文:MotionBricks基于35万段动作片段训练的实时动作AI可同时驱动屏幕数字角色与Unitree G1人形机器人;ArtiFixer将杂乱现实3D扫描自动转为可用虚拟场景;新雪/沙/弹性体物理求解器一并开源。
NVIDIA在SIGGRAPH 2026发表21篇研究论文并全部开源:MotionBricks基于35万段动作片段训练,可实时同时驱动屏幕数字角色和Unitree G1人形机器人,项目已在GitHub开源;ArtiFixer建立从杂乱现实3D扫描到完整可用虚拟场景的自动化管线,直接影响摄影测量和建筑扫描进入VFX制作的工作流;此外还包含新的雪、沙、弹性体物理求解器,同样开源。
MotionBricks”一个AI同时驱动数字角色和真实机器人”标志着实时动作生成跨越数字-物理壁垒;全部开源意味着高校可直接复现实验和二次开发。
查看原始来源 ↗
-
›智象未来vivago R1:全球首个无限时长多模态创作智能体,打破AI视频15-30秒上限,商用内容可用率85%
模型与工具
2026-07-20
· 量子位 / 环球网 / 凤凰科技 / 雷锋网 / Chinaz(多源)
智象未来(HiDream.ai)在WAIC 2026发布基于自研HD-AgentOS的vivago R1,突破行业15-30秒视频时长限制,支持任意时长视频连续连贯生成,叙事逻辑/画面风格/角色IP全程统一,商业可用率达85%,适配短剧/专题片/品牌宣传片等长周期创作场景。
智象未来(HiDream.ai)于2026年7月20日在WAIC 2026(上海)发布vivago R1,基于自研HD-AgentOS多模态Agent操作系统构建,突破AI视频生成行业长期存在的15–30秒时长上限,支持任意时长视频的连续连贯生成;在整个生成过程中保持叙事逻辑、画面风格和角色IP的统一;内部评测商业可用率达85%,适配品牌宣传片、AI短剧、专题纪录片等需要完整叙事周期的创作场景;发布当日获量子位、环球网、凤凰科技、雷锋网、Chinaz等5家以上中文媒体同步报道。
AI视频生成的时长上限是制约商业落地的核心瓶颈,vivago R1”任意时长”的突破标志着AI视频工具从片段演示走向完整商业作品交付的关键里程碑。
查看原始来源 ↗
-
›GMI Cloud × 阿里HappyHorse「无界造物节」WAIC 2026决赛收官:AI Coding+AI Video双赛道,MaaS平台支撑全云端AI创作
案例与作品
2026-07-20
· 量子位 / 36氪 / 新浪(多源)
GMI Cloud联合阿里巴巴HappyHorse在WAIC 2026举办「无界造物节」全民AI创作赛事决赛收官;AI Coding赛道产出智能运营Agent和低代码工具,AI Video赛道依托HappyHorse全链路能力完成云端脚本到成片,展示MaaS平台支撑非技术用户实现完整AI视频创作的落地路径。
GMI Cloud联合阿里巴巴HappyHorse在WAIC 2026期间举办的「无界造物节」全民AI创作赛事完成决赛收官;AI Coding赛道参赛作品涵盖智能运营Agent和低代码工具;AI Video赛道依托HappyHorse全链路AI视频创作能力,参赛者在云端完成从脚本生成到成片输出的全流程;整体赛事以MaaS(Model as a Service)平台为底座,展示非技术用户实现完整AI视频创作的可行路径。
「无界造物节」是WAIC 2026期间面向大众创作者的典型AI创作竞赛案例,直观体现了MaaS平台将AI视频全流程能力普惠化的实际落地场景。
查看原始来源 ↗
-
›NVIDIA DLSS 4.5 进驻 Blender:SIGGRAPH 2026 宣布,随 Blender 5.3「今秋」发布
模型与工具
2026-07-19
· NVIDIA 官方 / Blender Foundation
NVIDIA 在 SIGGRAPH 2026 开幕首日宣布 DLSS 4.5(含多帧生成与 AI 超分辨率)将随 Blender 5.3「今秋」正式发布,为开源 3D 工具引入 AI 加速渲染。
NVIDIA 在 SIGGRAPH 2026 开幕首日宣布:DLSS 4.5(Multi Frame Generation 多帧生成 + AI 超分辨率)将接入 Blender,预计随 Blender 5.3「今秋」正式发布;届时 RTX 系列 GPU 用户无需升级硬件即可在 Blender 中获得显著的实时渲染性能提升。
Blender 是全球使用最广泛的开源 3D/动画/渲染工具;DLSS 4.5 接入意味着普通消费级 RTX 用户无需升级硬件即可获得接近高端渲染的实时性能,直接降低 3D 创作与 AI 辅助动画的硬件门槛。
查看原始来源 ↗
-
›昆仑万维WAIC宣布「2026世界模型元年」:Matrix-Game 3.5单卡实时生成,Riemann-1.0机器人世界模型同步发布
模型与工具
2026-07-19
· 机器之心 / 新浪财经 / Chinaz / 同花顺(多源)
昆仑万维董事长方汉在WAIC 2026世界模型专场论坛宣布2026为「世界模型元年」;发布Matrix-Game 3.5(Patch级记忆注入、单卡实时生成)和Riemann-1.0机器人世界模型,同步升级Mureka v9.5与O3音乐模型,预判AI音乐与视频将成大众创作工具。
昆仑万维在WAIC 2026举办世界模型专场论坛,董事长方汉宣布2026年为「世界模型元年」;现场发布Matrix-Game 3.5世界模型,引入Patch级记忆注入机制,实现单卡实时生成;同步发布Riemann-1.0机器人专用世界模型,并将Mureka音乐生成模型升级至v9.5与O3版本;圆桌讨论聚焦AI与文娱产业融合,嘉宾一致认为AI音乐与视频将从技术试验转为大众创作工具,人机协同将成为全球文娱产业新范式。
「世界模型元年」定义是WAIC 2026中文创作工具赛道最具战略宣示意味的表态之一;Matrix-Game 3.5与Riemann-1.0分别覆盖内容生产与具身智能两大方向,结合Mureka音乐模型,形成「内容+机器人」双线世界模型布局;单卡实时生成意味着本地化部署门槛大幅降低,对高校创作工具应用具有直接价值。
查看原始来源 ↗
-
›NVIDIA × Black Forest Labs FLUX.2 RTX优化:NVFP4量化2.7×加速+55%显存减少,SIGGRAPH同步推进ComfyUI集成
模型与工具
2026-07-19
· NVIDIA官方Blog
NVIDIA与Black Forest Labs在SIGGRAPH 2026发布FLUX.2 RTX专项优化:FP8量化VRAM减少40%/性能提升40%,NVFP4量化进一步实现2.7×加速和55%显存减少,ComfyUI深度集成同步推进,让消费级RTX显卡可流畅运行FLUX.2工作流。
NVIDIA与Black Forest Labs在SIGGRAPH 2026联合发布FLUX.2 RTX专项优化方案:FP8量化可使VRAM减少40%、性能提升40%;更进一步的NVFP4量化在此基础上实现2.7×加速并将显存占用再降55%;同步推进的ComfyUI深度集成让设计师无需命令行即可使用优化后的FLUX.2工作流;上述优化覆盖GeForce RTX消费级显卡,使原本需要高端专业卡的工作流可在RTX 4080/5070等设备上流畅运行。
FLUX.2是目前图像生成质量最受专业创作者认可的模型之一,NVFP4量化将其本地部署门槛大幅下降,对高校实验室和独立创作者的实际影响直接且可量化。
查看原始来源 ↗
-
›Figma Make正式连接GitHub仓库:设计师可直接从画布提交界面代码修改,打通设计到生产「最后一公里」
模型与工具
2026-07-19
· Figma官方帮助文档
Figma Make新增GitHub双向集成,设计师可在画布中直接导入Git仓库、修改界面并提交代码变更,将视觉编辑器转变为可连接真实代码仓库的开发端口。
Figma于2026年7月19日在官方帮助文档正式上线Figma Make与GitHub双向集成:设计师可在Figma Make画布中直接导入Git仓库、修改界面并提交代码变更,将视觉编辑器转变为可连接真实代码仓库的开发端口。此次整合延续了今年Figma Config 2026 MCP Agent Connectors的方向,进一步压缩了「设计交付→前端实现」之间的切换摩擦。
Figma Make直接连接GitHub代码仓库,使设计师无需切换IDE即可提交代码修改,是「设计稿即代码」工作流的关键基础设施更新,与AI效果图全链路还原方向共同构成设计到代码的双向闭环。
查看原始来源 ↗
-
›Autodesk SIGGRAPH 2026:Flow Studio新增AI自动绑骨架+神经层,Wonder 3D文本/图片一步生成3D角色,Maya AI运动全线升级
模型与工具
2026-07-19
· Autodesk官方新闻室 / 3DVF.com / Creative Bloq(多源)
Autodesk在SIGGRAPH 2026展示Flow Studio重大更新:AI Rigging移除角色制作最复杂技术环节自动绑骨架,Wonder 3D支持文字或参考图一步生成完整3D角色,Maya新增AI辅助四足动物运动生成。
Autodesk在SIGGRAPH 2026展示了Flow Studio的重大更新:AI Rigging功能移除角色制作最复杂的技术步骤——自动完成骨架绑定;Neural Layer提升非线性角色动画质量;Wonder 3D支持从文字描述或参考图片一步生成完整可动3D角色;Maya另新增AI辅助四足动物(马匹等)运动生成能力;同时推出freemium免费入门层,拓宽覆盖面。
AI Rigging打通了「资产→可动角色」最高技术门槛,Wonder 3D实现「文字/图片→可动3D角色」的端到端路径,代表Autodesk专业3D软件全面融入AI工作流的标志性节点。
查看原始来源 ↗
-
›VGGRPO(ECCV 2026 Google):4D 隐空间几何奖励强化学习,解决视频扩散模型几何漂移
研究与论文
2026-07-18
· 机器之心 / QQ新闻
Google 团队提出 VGGRPO,通过隐空间 4D 几何奖励进行强化学习后训练,解决视频扩散模型几何漂移与摄像机轨迹不稳定问题,已被 ECCV 2026 收录。
ECCV 2026 收录 Google 团队提出的 VGGRPO:通过在 4D 隐空间中引入几何一致性奖励信号进行强化学习后训练,提升视频扩散模型的几何稳定性,解决几何漂移、摄像机轨迹不连贯和场景结构不稳定等问题,且无需对 VAE 进行额外解码。
几何一致性是 AI 视频生成进入专业影视和动画制作流程的核心障碍之一,VGGRPO 提供了可落地的 RL 后训练方案,对评估主流视频生成工具的底层几何稳定性有参考价值。
查看原始来源 ↗
-
›商汤SenseNova U1 Pro @ WAIC 2026:首个「交付级」多模态创作模型,原生8K直出,200位美院评审盲测六成图可直接交付客户
模型与工具
2026-07-18
· 新智元/新浪财经/36氪(多源 6+源)
商汤在WAIC 2026发布SenseNova U1 Pro,基于NEO-unify统一架构,原生8K输出,200位美院学生与设计师盲评六成作品「可直接交付客户」,在文字精准度与东方美学维度对标GPT Image 2并部分胜出。
商汤科技于WAIC 2026(2026年7月18日)正式发布旗舰级多模态生成模型SenseNova U1 Pro,基于NEO-unify统一架构(「看懂、生成、动手」原生融合,无独立视觉编码器或VAE),具备四项核心能力:设计审美(构图/色彩/排版三维度专业对齐)、原生8K图像输出、文字精准度(数百汉字海报零错字)、长程Agentic生成(数十轮智能体迭代)。商汤披露,200位美院学生与设计师进行盲评,六成作品被评为「可直接交付客户」;在文字精准度与东方美学维度上与GPT Image 2对标并部分胜出。
以「可否直接交付设计客户」为评价标准,并通过200人专业盲评获得量化验证,标志着AI图像生成评价体系从「技术指标」向「专业交付标准」转型;8K原生输出使印刷与展览级别的AI图像生成具备实用可行性。
查看原始来源 ↗
-
›Claude Code Artifacts 支持 MCP 连接器:生成的看板可接实时数据,不同权限看到不同内容
模型与工具
2026-07-18
· 新智元
Anthropic 为 Claude Code Artifacts 新增 MCP 连接器调用能力,生成的看板/仪表盘页面可连接实时数据,不同查看者按各自权限拉取不同内容,7 月 16 日上线。
Anthropic 于 7 月 16 日为 Claude Code Artifacts 上线 MCP 连接器调用能力:生成的看板、仪表盘等页面可直接连接实时数据,不同查看者按各自权限拉取不同内容;页面还可内嵌操作按钮(如发送 Slack 消息、更新 Issue),从静态展示页升级为动态数据面板。
Artifacts 从静态展示转向动态数据产品,为快速搭建可运行数据可视化与交互原型提供了更直接的路径,「原型即产品」的实现门槛进一步降低。
查看原始来源 ↗
-
›阿里通义 Wan-Streamer v0.2:端到端 AI 视频通话延迟降至 550ms,听/看/说/演统一进单一 Transformer
模型与工具
2026-07-17
· IT之家 / 虎嗅 / 同花顺
阿里通义实验室发布 Wan-Streamer v0.2,将听、看、说、演统一进单个 Transformer,端到端交互延迟约 550ms,较 v0.1 大幅改善。
阿里通义实验室发布实时全双工多模态模型 Wan-Streamer v0.2,将「听、看、说、演」四类感知与表达能力统一进单个 Transformer 架构,端到端交互延迟约 0.55 秒;相比 v0.1 版本延迟大幅降低,可实现 AI 在视频通话中边听边看边实时回应。
550ms 端到端延迟是 AI 视频通话趋近实用门槛的关键指标;统一多模态 Transformer 区别于分离模块架构,与 MiniMax H3 和 Gemini Omni 并行出现,指向多模态实时交互领域的技术路线正在趋同。
查看原始来源 ↗
-
›SIGGRAPH 2026 开幕预告:「Diffusion TV」扩散模型沉浸装置与 AI 创作伙伴工作坊
展览与赛事
2026-07-17
· PR Newswire(SIGGRAPH 官方)
SIGGRAPH 2026 会前公告披露两大 AI 亮点:将扩散模型实时可视化的沉浸装置「Diffusion TV」,以及「视频生成视觉语言」专题研讨工作坊,大会 7 月 19—23 日于洛杉矶举行。
SIGGRAPH 2026 大会会前公告披露艺术与 AI 重点内容:艺术装置「Diffusion TV」将扩散模型的生成过程实时可视化为沉浸式体验;另设「视频生成视觉语言」专题研讨工作坊;大会官方将本届基调定为「AI 扩展而非取代人类创意」,大会于 7 月 19 至 23 日在洛杉矶举行。
SIGGRAPH 是全球最具权威的计算机图形与交互技术大会,本届 AI 艺术与工具议题密度为历届最高,「Diffusion TV」扩散模型装置和 AI 创作伙伴工作坊对 AI 艺术教育领域有直接参考价值。
查看原始来源 ↗
-
›MiniMax H3 @ WAIC 2026:下一代多模态生成模型,统一图像/视频/声音生成
模型与工具
2026-07-17
· 每日经济新闻 / 新浪财经
MiniMax 在 WAIC 2026 首次公开 H3 模型,定位为将图像、视频、声音生成统一进单一架构的下一代多模态生成模型,现场标注「Coming Soon」。
MiniMax 在 WAIC 2026 展台首次对外展示 H3 模型,将其定义为「下一代多模态生成模型」——核心能力是将图像、视频与声音生成统一进单一架构,以多模态上下文统一理解创作意图;现场展板标注「Coming Soon」,内部人士透露发布时间「很快会上」。
多模态统一生成架构若如期落地,意味着 AI 创作工具链从「多件套」向「一件套」迈进;MiniMax H3 与 Gemini Omni、Wan-Streamer v0.2 并行出现,指向多模态统一生成的行业共识正在形成。
查看原始来源 ↗
-
›MentalThink:让AI用SVG「脑补草图」做空间推理,MindCube三维测试76分超越GPT-5的56分
研究与论文
2026-07-17
· 科技行者
北邮×中科院×StepFun提出MentalThink,让多模态大模型在推理中生成SVG草图「看图思考」,MindCube三维旋转测试76分超越GPT-5的56分,仅用7B参数模型。
北邮、中科院与StepFun联合团队于2026年7月提出MentalThink系统(arXiv:2607.03530),让多模态大模型在推理过程中生成SVG代码草图、渲染后「看图思考」再修正,形成「画图→看图→推理」闭环;在MindCube三维心理旋转测试中达76.0分(对比GPT-5的56.3分),VSIBench空间理解与GPT-5持平;训练仅使用7B参数模型,研究揭示了「思考媒介」(SVG vs纯文字)对空间推理能力的决定性影响。
用SVG草图辅助空间推理以7B参数超越更大基线,提示「思维媒介的选择」对特定任务能力的影响可能独立于参数量;对理解多模态AI如何在空间设计任务中借助视觉草图辅助推理有参考意义。
查看原始来源 ↗
-
›月之暗面Kimi K3:2.8万亿参数全球最大开源多模态模型,原生文字/图像/视频三模态,权重7/27全量开源
模型与工具
2026-07-17
· Moonshot官方/新华网(多源)
月之暗面发布Kimi K3,2.8万亿参数MoE架构,原生三模态(文字/图像/视频)统一,100万Token超长上下文,权重7月27日全量开源,Apache 2.0协议允许商业使用。
月之暗面于2026年7月17日正式发布Kimi K3,采用MoE架构,总参数量2.8万亿(单次激活约310亿),支持文字/图像/视频原生三模态统一架构,无需独立视觉编码器,并提供100万Token超长上下文;在Arena编程排行榜登顶;权重计划于7月27日全量公开,采用Apache 2.0协议允许商业使用。
2.8万亿参数开源多模态模型以Apache 2.0协议开放商业使用,原生三模态统一架构(文字/图像/视频合一)是理解2026年AI创作工具底层能力演进方向的重要参照;开源权重的可及性对相关研究和实践有直接价值。
查看原始来源 ↗
-
›Gemini 3.5 Pro 确认延期:前端 UI 像素级一次生成能力仍在打磨
模型与工具
2026-07-17
· 新浪财经 / 36氪
谷歌 Gemini 3.5 Pro 原定 7 月 17 日发布已确认延期,主因是编程能力仍在打磨,10 名现任和前任员工参与确认。
谷歌 Gemini 3.5 Pro 原定 2026 年 7 月 17 日发布,已被 10 名现任和前任谷歌员工证实延期,主因是编程能力仍在打磨;据此前泄露信息,该模型具备前端/SVG 代码像素级精准生成能力,上下文窗口达 200 万 token,并经过完全重新预训练。延期为 Claude Design 和 GPT-5.6 等竞品保留了更长的窗口期。
Gemini 3.5 Pro 的前端 UI 一次生成能力被视为设计工具赛道的潜在变革点,延期意味着相关 AI 辅助设计工作流在短期内尚不会受到该模型的冲击,但发布时间仍值得持续关注。
查看原始来源 ↗
-
›天工短剧工作台 SkyProduction:Agent 智能分镜先规划站位再生成视频,3 部 AI 短剧 7 天均破百万美元
模型与工具
2026-07-16
· 中新网 / 36氪 / AIbase(多源)
深度分析 →
昆仑万维发布天工短剧工作台 SkyProduction,Agent 智能分镜可在视频生成前规划角色站位与机位;DramaWave 平台 3 部 AI 短剧 7 天内均破百万美元流水。
昆仑万维发布天工短剧工作台 SkyProduction:Agent 智能分镜模块可在视频生成前先规划角色站位与机位(参考上一镜构图生成下一镜站位图),无限画布支持 720° 全景图、3D 导演台与多角度打光编辑器,已接入 Seedance 2.5、可灵等主流视频生成模型。DramaWave 平台上线的 3 部 AI 短剧在发布后 7 天内均实现流水破百万美元。
AI 短剧生产从「随机抽卡祈祷出好镜头」到「先规划导演思维再生成视频」的范式转移,标志着 AI 视频创作工具链向可控性迈出实质性一步;6 源齐发叠加百万美元商业数据双重验证,是目前最完整的 AI 短剧可控生产公开案例。
查看原始来源 ↗
-
›魔芯科技MoWorld 3D世界模型正式上线华为云:单张照片生成完整3D场景,全栈国产NPU(昇腾),向全行业开放
模型与工具
2026-07-16
· 量子位 / 人民网 / China Daily(多源)
国家具身智能应用中试基地联合华为云、魔芯科技发布MoWorld 3D世界模型,支持从单张照片生成完整3D场景,全栈基于国产NPU(昇腾)构建,正式上线华为云向全行业开放。
国家具身智能应用中试基地联合华为云、魔芯科技于2026年7月16日发布MoWorld 3D世界模型,支持用户上传单张照片即可生成完整三维场景;模型从训练到推理全栈基于国产NPU(昇腾)构建,现已正式上线华为云,面向智慧城市、工业仿真、数字内容创作等行业开放API调用。
单张照片到完整3D场景的能力突破了3D内容生产对多视角扫描或大量3D数据的传统依赖,华为云API接入则意味着无需本地高端GPU即可调用,整体降低了三维内容创作的工程门槛。
查看原始来源 ↗
-
›Google Vids 引入 Gemini Omni 视频生成与个人 AI 数字人
模型与工具
2026-07-16
· Google Blog / TechCrunch
Google Workspace 正式推出个人 AI 数字人,用户录制一次自拍和声音样本,即可在 Vids 中以本人形象出镜任意视频,并内嵌 SynthID 隐形水印。
Google Workspace 在 Vids 中正式上线「个人 AI 数字人」:用户录制一次自拍和声音样本,即可在后续所有 Vids 视频中以本人形象出镜;同步接入 Gemini Omni,支持自然语言驱动视频生成、背景替换与光效修复,并内嵌 SynthID 隐形水印。此次更新直接对标 HeyGen 和 Synthesia,将 AI 数字人与视频生成统一进 Workspace 生产力套件。
Google 通过办公视频场景将 AI 数字人主流化,打破了专用 AI 视频工具的订阅壁垒,为企业和教育场景的低成本 AI 讲解视频制作提供了新路径。
查看原始来源 ↗
-
›Canva深度接入Google Gemini:@Canva对话即生成品牌视觉,Magic Layers AI图层分离可独立编辑
模型与工具
2026-07-16
· Canva官方新闻室/量子位/优设(多源)
Google将Canva作为Connected App引入Workspace,@Canva指令即可调用Gemini生成品牌视觉并直接插入文档;Canva同步推出Magic Layers AI图层分离功能,每层可独立编辑。
Google于2026年7月16日将Canva作为Connected App引入Google Workspace:用户在Docs/Slides/Sheets中输入@Canva指令即可调用Gemini驱动的Canva功能,生成品牌视觉内容并直接插入文档;Canva同步推出Magic Layers功能,利用AI自动分离图层,每层可独立编辑,并支持品牌Kit自动套用。该整合由Canva官方新闻室、量子位、优设等多源证实。
Canva与Google Workspace的Connected App整合,使视觉设计生成直接嵌入文档协作场景;Magic Layers图层分离将AI生成图像从「整体编辑」推进至「元素级可编辑」,是AI设计工具与办公生态深度融合的典型案例。
查看原始来源 ↗
-
›🔴 Xmax AI X2.0发布:端侧实时交互视频生成,延迟低于300ms
工具与产品
2026-07-15
· 量子位/36氪/凤凰科技等
深度分析 →
Xmax AI发布X2.0模型,实现端侧实时交互视频生成,延迟低于300ms,是端侧推理能力在视频生成场景的重要突破。
Xmax AI于2026年7月15日发布X2.0模型,实现在端侧设备上进行实时交互式视频生成,官方公布的响应延迟低于300ms,支持用户通过文字或动作输入实时驱动视频内容变化。该成果获量子位、36氪、凤凰科技等多家媒体重点报道,被视为端侧推理能力突破在视频生成场景的标志性进展。
端侧实时视频生成打破了视频AI工具必须依赖云端算力的限制,为离线创作场景与实时表演互动等方向开辟了新的技术可能性,是近期AI视频赛道最值得关注的硬件性能突破之一。
查看原始来源 ↗
-
›🔴 PixVerse进军交互娱乐:Game AI引擎支持实时视频驱动游戏场景
工具与产品
2026-07-15
· PixVerse官方博客/Yahoo Finance等
深度分析 →
PixVerse宣布完成C轮融资延伸轮并进军交互娱乐,发布Game AI引擎,支持实时视频生成驱动游戏场景与角色行为。
PixVerse于2026年7月15日宣布完成C轮融资延伸轮,同步发布Game AI引擎并正式进军交互娱乐领域,该引擎支持通过实时视频生成驱动游戏场景变化与角色行为响应,将视频生成能力从内容创作延伸至游戏交互场景。消息由PixVerse官方博客发布,Yahoo Finance等国际媒体同步跟进。
PixVerse从视频创作工具转向交互娱乐引擎,代表AI视频生成能力向游戏化交互场景的战略扩展,对数字媒体艺术与游戏设计方向的课题有直接的前沿参照意义。
查看原始来源 ↗
-
›🔴 Anthropic 核心设计负责人 Jenny Wen 跳槽 Cursor 出任设计主管
Anthropic 核心设计负责人 Jenny Wen 官宣跳槽,出任 AI 编程工具 Cursor 设计主管;她此前在 Figma 任设计总监,在 Anthropic 期间主导 Claude 产品设计与 Cowork 智能体愿景。Cursor 母公司 Anysphere 此前已被 SpaceXAI 收购。
据新智元报道,Anthropic 核心设计负责人 Jenny Wen 于 2026 年 7 月 15 日官宣跳槽,下一站出任 AI 编程工具 Cursor 的「设计主管」。她在公开说明中表示,希望带一支真正在乎手艺、品质与「做出好工具」的团队。
Jenny Wen 的履历跨越两家关键公司:2025 年之前在 Figma 任设计总监,负责 FigJam、Slides、Buzz、Sites CMS 等业务;此后加入 Anthropic,主导 Claude 的产品设计语言,并推动通用智能体产品 Cowork 从愿景落地——把 Claude 从「聊天框」推向「工作流」。需注意的是,Cursor 母公司 Anysphere 于数周前被 SpaceXAI 全股票收购,因此这次流动实质上也是一次跨阵营的移动。
顶级设计负责人在 AI 模型厂商与 AI 编程工具之间的流动,折射出 AI 辅助开发(含 Vibe Coding)在产品设计层面已进入深度投入阶段,对设计与开发融合方向的课题有较强的信号意义。
查看原始来源 ↗
-
›ComfyUI v0.28.0发布:原生视频节点与性能优化
工具与产品
2026-07-15
· ComfyUI官方GitHub
深度分析 →
ComfyUI发布v0.28.0版本,新增原生视频处理节点并优化整体运行性能,进一步强化其作为AI创作工作流核心枢纽的地位。
ComfyUI于2026年7月15日发布v0.28.0版本,本次更新新增原生视频处理节点支持,允许在工作流中直接处理视频帧序列,同时对调度器与显存管理进行了性能优化,提升大型工作流的运行稳定性。更新内容由ComfyUI官方GitHub发布。
ComfyUI持续向视频方向扩展原生能力,对以其为工作流核心工具的院校AI创作课程而言,本次更新值得在工具链维护时跟进评估。
查看原始来源 ↗
-
›蚂蚁 LingBot-Vision:边界驱动视觉预训练新范式,10 亿参数超越 70 亿参数 DINOv3,权重开源
研究与论文
2026-07-15
· 蚂蚁集团 / arXiv / 腾讯新闻
蚂蚁集团提出「掩码边界建模」预训练范式,10 亿参数 ViT-g 在深度估计基准上超越 70 亿参数 DINOv3,透明物体深度估计达 RMSE 0.010,权重已开源。
蚂蚁集团提出 LingBot-Vision 边界驱动视觉预训练方案,将边界检测从输出任务转为预训练核心目标;10 亿参数 ViT-g/16 在 NYU-Depth v2 深度估计测试中 RMSE 达 0.296,超越 70 亿参数 DINOv3(0.309);衍生的 LingBot-Depth 2.0 在透明物体深度估计上 RMSE 达 0.010;模型权重已开源。
更小参数量超越更大模型的视觉预训练突破,对透明物体深度估计的改进将影响 3D 重建和 AR 创作工具的底层能力,开源权重使教育与研究场景可低成本部署和实验。
查看原始来源 ↗
-
›Canva Code 2.0:AI 建网站能力向 2.65 亿月活用户全量免费开放,生成速度提升 75%
模型与工具
2026-07-14
· VentureBeat
Canva 将 AI 代码生成功能向全部 2.65 亿月活用户(含免费账户)开放,生成速度提升 75%,从提示到上线时间压缩 30%。
Canva 发布 Code 2.0,将 AI 代码生成功能向全部 2.65 亿月活用户(含免费层)全量开放;用户可通过自然语言提示生成完整响应式网站或应用,支持 HTML 导入、50 余种模板,生成速度较前代提升 75%,从提示到上线的时间压缩约 30%。
Canva Code 2.0 免费化意味着设计类用户可直接将 Canva 视觉方案转为可运行网站原型,无需手写代码,进一步压低 AI 辅助原型制作门槛。
查看原始来源 ↗
-
›同济×腾讯云TT设计学院Skill创新应用大赛收官:全国26所高校近300名选手将设计痛点封装为AI智能体工具
展览与赛事
2026-07-13
· 中国日报/新浪科技/腾讯新闻
同济大学与腾讯云联合举办的TT设计学院Skill创新应用大赛于2026年7月13日收官,全国26所高校近300名选手参赛,选手将真实设计流程痛点封装为AI智能体(Skill)工具,7支战队获奖,AI Agent正式进入高校设计教育的实践评估体系。
同济大学与腾讯云联合举办的TT设计学院Skill创新应用大赛于2026年7月13日正式收官,中国日报、新浪科技、腾讯新闻多平台同步报道。本届大赛吸引全国26所高校近300名选手参与,参赛形式要求选手识别真实设计流程中的具体痛点,并将解决方案封装为可调用的AI智能体(Skill)工具,最终7支战队获奖。大赛以实际产出为评估核心,将AI Agent的开发与应用引入高校设计教育的课程竞赛体系。
这届大赛的意义在于「设计问题→AI工具」这条转化链路进入了正式的高校竞赛评估,AI Agent不再只是课堂演示道具,而成为设计专业学生需要具备的一项工程化输出能力。
查看原始来源 ↗
-
›上海交大发布WNM世界叙事模型:创作者与AI协同构建可编辑、可交互的叙事时空,针对AI视频生成「不可控」瓶颈
研究与论文
2026-07-13
· 人民网/上海交大
上海交通大学于2026年7月13日发布WNM(World Narrative Model)世界叙事模型,支持创作者与AI协同构建可编辑、可交互的叙事时空,专门针对现有AI视频生成在叙事连贯性和创作可控性上的瓶颈,面向影视级视频媒体制作场景。
上海交通大学于2026年7月13日发布WNM(World Narrative Model,世界叙事模型),人民网和上海交大官方渠道同步报道。WNM的核心设计目标是实现创作者与AI系统协同构建叙事时空:创作者可对生成的叙事结构进行直接编辑与交互调整,而非接受AI一次性输出的不可干预结果。该模型针对当前AI视频生成领域普遍存在的「不可控」瓶颈——即叙事连贯性难以维持、场景过渡逻辑混乱——提出结构性解法,设计目标面向影视级视频媒体制作场景。研究目前处于发布初期,工程化落地情况有待跟踪。
AI视频生成从「一键出片」走向「叙事可编辑」,这一研究方向与影视、动画、数字媒体专业的创作需求直接对应,值得关注其后续工程化进展。
查看原始来源 ↗
-
›商汤开源SenseNova-Vision统一视觉大模型:目标检测、图像分割、深度预测、3D重建四大任务原生统一单一架构,超越Vision Banana
模型与工具
2026-07-13
· IT之家/虎嗅/新智元/腾讯新闻/TechNode/GitHub/Hugging Face
深度分析 →
商汤科技于2026年7月13日开源SenseNova-Vision,将检测、分割、深度预测、3D重建四大视觉任务原生统一到单一多模态架构,性能超越Vision Banana,以CC BY-NC 4.0协议开放,教学环境可自由使用。
商汤科技于2026年7月13日在GitHub(OpenSenseNova/SenseNova-Vision)发布并开源SenseNova-Vision统一视觉大模型,以CC BY-NC 4.0协议开放。该模型将目标检测、图像分割、深度预测、3D重建四大计算机视觉核心任务整合进同一多模态架构,无需分别部署四套专用模型,综合性能指标超越此前同类代表模型Vision Banana。IT之家、虎嗅、新智元、腾讯新闻及TechNode等多个中英文平台同日跟进报道,模型文件同步在Hugging Face托管。
对艺术设计院校而言,SenseNova-Vision提供了一个开源的多任务视觉理解基础模型,CC BY-NC协议允许教学场景自由使用,在课程中演示AI对图像的结构化理解能力具有直接可操作性。
查看原始来源 ↗
-
›北大+深势科技提出PRA自回归图像生成框架:16维低维中间状态+并行解码,135M参数在像素空间超越1.9B基线
研究与论文
2026-07-13
· 机器之心/深势科技
北京大学联合深势科技提出PRA自回归图像生成框架,采用16维低维中间状态与并行解码机制,135M参数规模在像素空间的表现超过1.9B参数基线,绕开传统视觉tokenizer,目前处于理论突破阶段,工程化程度待评估。
北京大学联合深势科技发布PRA(Parallel Recurrent Autoregressive)图像生成框架,于2026年7月13日经机器之心报道。PRA采用16维低维中间状态与并行解码机制,在像素空间直接建模而非依赖传统视觉tokenizer,使得135M参数规模的模型在标准基准测试中超越1.9B参数基线模型。该方法在理论层面提供了一种降低图像生成模型参数量的新路径,但当前研究仍处于理论突破阶段,工程化落地程度有待进一步评估。
以更小的参数量超越更大的模型,这类参数效率研究对艺术设计类院校的AI课程演示有参考价值——它展示了模型架构设计如何影响生成质量,而非仅靠堆叠参数。
查看原始来源 ↗
-
›DeepMind发布GenCeption:统一视觉理解与生成的视频通用模型
报告与研究
2026-07-13
· genception.github.io/TechTimes/机器之心等
DeepMind发布GenCeption,是首个在单一模型中统一视频理解与生成能力的视觉通用学习器,在多项基准上取得领先结果。
DeepMind于2026年7月13日发布GenCeption,这是一个将视频理解(描述、问答、分类)与视频生成(文本到视频、图像到视频)统一在单一模型架构中的视觉通用学习器,在多个标准基准上取得当前最优结果。项目详情发布于genception.github.io,机器之心等媒体进行了技术解读报道。
视觉理解与生成在统一模型中的融合是当前多模态研究的核心前沿方向,GenCeption的发布对从事AI视觉创作与人机协作研究的院校团队具有重要的学术参考意义。
查看原始来源 ↗
-
›Anthropic官方回应Claude Code「变笨」争议:默认Effort降档非模型退化,ultracode可恢复xhigh火力
观点与技巧
2026-07-12
· Anthropic/36氪/新智元/火星财经
Anthropic官方确认Claude Code近期「响应变浅」源于默认Effort从high静默调至medium,非模型退化;ultracode模式启用xhigh档位与自主子智能体调度可恢复深度推理能力。
Anthropic就Claude Code用户普遍反映的「响应变浅」争议做出官方回应,明确指出模型本身未发生退化,问题根源在于默认执行档位(Effort)从high静默调整至medium——直接影响任务分析深度与规划层级。多源报道(36氪/新智元/火星财经)证实,启用ultracode模式可将Effort切换至xhigh并触发自主子智能体调度,恢复完整的深度推理能力。
对使用AI辅助编码工具的设计师团队而言,这一官方澄清提供了精确的决策依据:任务复杂度升高时,手动切换Effort档位或开启ultracode可显著影响输出质量,这与模型本身「变好」或「变差」无关,属于用户端可控参数。
查看原始来源 ↗
-
›Ghost Font幽灵字体72小时攻防:字母编码为运动轨迹,人眼秒懂而GPT-5.6等主流大模型全部失读,72小时后凭一句方向提示GPT-5.6完整破解
案例与作品
2026-07-11
· 新智元/36氪/Hacker News/Tom's Guide/ghostfont.org
深度分析 →
设计师Eric Lu与Mixfont将字母编码为移动轨迹,发布24小时内达14.7M播放;GPT-5.6、Gemini、Claude均无法读取;72小时后一句方向提示使GPT-5.6完整破解,完成设计与AI认知对抗的首个完整回合制案例。
设计师Eric Lu与Mixfont团队于2026年7月11日发布Ghost Font幽灵字体:该字体将字母信息编码为移动轨迹而非传统笔画,人眼通过视觉运动感知可即时辨认,而GPT-5.6、Gemini 3.5 Pro、Claude Fable 5等主流大语言模型在发布后24小时内全部无法读取。项目发布首日在Hacker News、36氪等平台引发传播,24小时内播放量达14.7至17M。72小时后,一句简短的方向性提示(描述编码机制)使GPT-5.6完整破解了幽灵字体,攻防周期至此完整结束。该案例由此成为设计×AI认知对抗领域有据可查的首个完整回合:从视觉盲区被发现,到提示工程将其突破。
这不只是字体实验——它以可重复的形式揭示了当前大模型视觉感知的一处结构性盲区(运动编码的符号系统),并验证了提示工程在突破此类局限方面的有效边界,对研究AI视觉理解与艺术设计认知交叉的师生有直接参考价值。
查看原始来源 ↗
-
›SIGGRAPH 2026 Experience Hall全面公布:五大板块,Art Gallery「In-Betweens」含4件AI艺术
展览与赛事
2026-07-10
· SIGGRAPH官方
SIGGRAPH 2026 Experience Hall公布五大板块完整阵容,Art Gallery「In-Betweens」12件入选作品中含4件AI艺术,探索AI与记忆、身份及人机关系,7月19-23日洛杉矶举行。
SIGGRAPH 2026 Experience Hall于2026年7月10日公布完整阵容,涵盖空间叙事、沉浸馆、Art Gallery、新兴技术及动手课程五大板块。Art Gallery单元以「In-Betweens」为主题,共入选12件作品,其中4件为AI艺术作品,探索AI与记忆、身份及人机关系等主题。展览于7月19日至23日在洛杉矶会展中心举行,由SIGGRAPH官方与PRNewswire双源确认。
SIGGRAPH Art Gallery专设4件AI艺术作品,是国际顶级图形学大会正式将AI艺术纳入核心展览序列的具体体现,7月19日开幕。
查看原始来源 ↗
-
›Meta Muse Image上线不足一周因opt-out默认机制遭SAG-AFTRA/CAA联合声讨后下架
模型与工具
2026-07-10
· 财联社/Deadline/Hollywood Reporter/TechWeez/Forbes/MacRumors/Variety
深度分析 →
Meta Muse Image的「@提及公开账号生成」功能因采用opt-out默认机制允许生成公开IG账号AI图像,遭SAG-AFTRA与CAA联合声讨,Meta承认「missed the mark」后将该功能下架。
Meta于2026年7月上旬推出自研图像生成模型Muse Image,其中「@提及功能」允许用户在提示词中@任意公开Instagram账号,AI即可参考该账号历史图像生成新图,且默认为所有成年公开账号用户开启(opt-out机制)。上线约三天后,美国演员工会SAG-AFTRA与顶级经纪公司CAA联合公开声讨,指出任何人的姓名、肖像、声音或创作未经明确同意均不得被AI引用。7月10日Meta将该功能下架,官方声明使用了「missed the mark」(未达预期)的措辞。据报道,功能下架前已生成的图像不会被自动删除。
这是主流消费级AI图像功能首次因opt-out默认机制引发的大规模抵制与撤回,验证了「默认征用公开内容」模式在创作者数字资产保护层面的不可行性,对AI生成内容的同意机制设计与版权研究具有直接参考价值。
查看原始来源 ↗
-
›LIMSSR(ICML 2026 Spotlight):不完全多模态学习的条件序列推理新范式
研究与论文
2026-07-10
· 机器之心
北京大学与福州大学联合提出LIMSSR,将不完全多模态学习问题重定义为条件序列推理任务,通过LLM语义推理实现上下文感知模态插补,ICML 2026 Spotlight,不依赖完整训练数据即超越现有方法。
北京大学与福州大学联合研究团队在ICML 2026上以Spotlight论文形式发表LIMSSR,将不完全多模态学习重新定义为条件序列推理任务。该方法借助大语言模型的语义推理能力实现上下文感知的模态插补,在不依赖完整训练数据的前提下显著超越现有方法。由机器之心报道。
多模态数据不完整是实际AI应用中的普遍问题,LIMSSR提出的推理补全范式对多模态生成与理解模型的鲁棒性研究具有参考意义。
查看原始来源 ↗
-
›北大HOI-Edit+SCPE:AI图像编辑进入「交互理解」时代(ICML 2026)
研究与论文
2026-07-10
· 机器之心
深度分析 →
北大王选所等团队发布HOI-Edit基准+SCPE自纠错框架(ICML 2026),将AI图像编辑从「改像素」推进到「交互理解」三层认知评测,L1交互分数提升22%,数据集与代码已开源。
北京大学王选所联合研究团队在ICML 2026上发布HOI-Edit基准与SCPE自纠错框架,将AI图像编辑能力评测重新定义为三层认知任务:基础交互理解、空间关系推理、因果物理推理。SCPE框架通过I2V视频过程诊断失败案例并自动纠错,L1交互评分提升22%。相关数据集与代码已开源,arXiv编号2606.19073,由机器之心与163.com双源报道。
AI图像编辑从像素操控向意图理解与自纠错范式演进,HOI-Edit为评测新一代可交互编辑工具提供了系统性基准框架。
查看原始来源 ↗
-
›歌歌AI音乐大模型全面上线:单卡10秒生成华语歌曲,打通字节七大平台
模型与工具
2026-07-10
· 量子位
歌歌AI音乐大模型7月10日全面上线,十亿级参数华语端到端扩散+歌声合成混合架构,单卡10秒生成完整华语歌曲,中文咬字还原率较通用模型提升67%,打通字节七大平台,同期启动非遗民乐数据采集计划。
歌歌AI音乐大模型于2026年7月10日全面上线,采用十亿级参数规模的华语端到端扩散与歌声合成混合架构,支持在单卡设备上10秒内生成完整华语歌曲。相较于通用音乐模型,其中文咬字还原率提升67%,并已接入抖音、剪映、汽水音乐等字节跳动旗下七个内容平台。同期启动「中国声音采集计划」,面向非物质文化遗产民乐进行数据采集。由量子位、机器之心、IT Bear多源确认。
针对华语发音的专项优化大幅提升AI音乐在中文内容场景下的实用性,字节七平台接入意味着AI生成音乐将进入更大规模的内容分发体系。
查看原始来源 ↗
-
›Reve 2.1 发布:图像质量与风格一致性双升级
工具与产品
2026-07-09
· Reve官方
Reve发布2.1版本,重点提升图像质量与风格一致性,是2.0基础上的稳定性与精度迭代。
Reve于2026年7月9日发布2.1版本,在2.0基础上重点优化图像生成质量与跨提示词的风格一致性表现,细节渲染与色彩准确度均有提升。此次更新定位为稳定性与精度迭代,而非功能层面的大版本跃升,适合对出图质量有持续需求的创作者跟进使用。
Reve在图像生成赛道保持高频迭代节奏,2.1的一致性改善对需要批量出图保持风格统一的设计教学场景有实际参考价值。
查看原始来源 ↗
-
›PAI 2.0进入好莱坞:独立导演实拍级AI短片破百万播放,60天内ARR达1100万美元
案例与作品
2026-07-09
· Variety/BusinessWire/新智元/51CTO
好莱坞独立导演PJ Ace使用PAI 2.0生成的3分钟AI短片播放量破百万,Utopai Studios平台在60天内年化营收达1100万美元,PAI Pro Skill矩阵开源并已接入Claude Code与Cursor。
据Variety及多源报道,好莱坞独立导演PJ Ace使用Utopai Studios的PAI 2.0平台制作的3分钟AI生成短片播放量突破百万,成为AI视频进入主流专业创作圈的典型案例。Utopai Studios公开数据显示,该平台在正式发布后60天内实现年化营收(ARR)约1100万美元。与此同时,PAI Pro Skill矩阵开源,并已实现与Claude Code、Cursor等AI编码Agent的无缝协作。
从创作工具到有可查商业数据的AI视频平台,PAI 2.0的好莱坞落地案例展示了AI生成视频在专业级内容创作中商业化路径的完整闭环,可作为影视、数媒方向的产业实践案例。
查看原始来源 ↗
-
›LingBot-World 2.0开源:全球首个小时级连续运行世界模型,720p/60fps实时生成
研究与论文
2026-07-09
· 新智元/搜狐/知乎
Ant Group旗下Robbyant开源LingBot-World 2.0,实现全球首个小时级连续运行世界模型,支持720p/60fps实时生成,一张图片可延展为无限AI世界。
Ant Group旗下Robbyant团队开源了LingBot-World 2.0世界模型,据多源报道,这是目前全球首个支持小时级连续运行的世界生成模型,可在720p分辨率、60帧每秒的条件下实时生成场景。其核心特性是可从单张图片出发,生成持续延展的AI世界,突破了此前视频生成模型的短片级时长瓶颈。
小时级连续运行世界模型的开源,为游戏环境生成、影视场景设计与虚拟空间教育场景提供了新的技术参照,对数字媒体、交互设计、游戏设计方向的研究与教学有参考价值。
查看原始来源 ↗
-
›GPT-5.6三款模型全量公开发布,结束国家安全审查有限预览期
模型与工具
2026-07-09
· OpenAI官方
深度分析 →
GPT-5.6 Sol旗舰、Terra均衡、Luna轻量三款模型于7月9日全量公开,结束约两周国家安全审查,在ChatGPT与API中全球同步上线。
OpenAI旗下GPT-5.6系列——Sol旗舰版($5/$30每百万Token输入/输出)、Terra均衡版($2.5/$15)、Luna轻量版($1/$6)——于2026年7月9日全量公开发布,结束约两周的国家安全审查有限预览期,在ChatGPT、Codex及API中全球同步上线。Sol于有限预览期间登顶LMSYS竞技场排行。
新一代旗舰语言模型的全量开放将影响以GPT系列为底层的AI设计工具与工作流平台的能力上限,对下游创作工具链的演进有间接参照意义。
查看原始来源 ↗
-
›Figma Make正式接入GPT-5.6:从提示词、草图到可运行交互原型,支持自我修复
模型与工具
2026-07-09
· Figma官方Blog/优设情报
Figma Make正式接入GPT-5.6,支持从提示词、草图或既有Figma文件生成可运行交互原型,首轮生成质量提升,遇错误可自我修复。
Figma Make于2026年7月9日正式接入GPT-5.6,支持三种输入路径:自然语言提示词、草图图像,或现有Figma设计文件,均可直接生成可运行的交互原型。据Figma官方Blog,接入GPT-5.6后首轮生成质量明显提升,并新增错误自我修复能力,设计师可在Figma内完成从创意描述到可交互原型的完整流程。
主流设计工具与旗舰级推理模型的深度整合,意味着「草图→原型」环节所需的跳跃成本进一步降低,对教学演示、课题快速验证及设计方案迭代均有直接参考价值。
查看原始来源 ↗
-
›SIGGRAPH 2026首设Games Summit:全天聚焦AI在游戏开发中的应用
展览与赛事
2026-07-08
· SIGGRAPH官方/PRNewswire
SIGGRAPH 2026首次设立独立的Games Summit,以全天专题形式聚焦AI在游戏开发中的动效、无障碍、VFX、音频与管线应用,于7月19日在洛杉矶举办。
SIGGRAPH 2026在7月19日大会开幕当天首次设立独立的Games Summit,全天专题聚焦AI技术在游戏开发中的具体应用,涵盖AI驱动动效、无障碍设计、视觉特效(VFX)、音频生成及制作管线等多个方向。这是游戏×AI融合方向首次在SIGGRAPH获得独立会场,地点在洛杉矶会展中心。
SIGGRAPH作为顶级视觉计算学术大会,单独设立游戏AI专场反映了游戏引擎与生成式AI整合已成为产业主流议题,对游戏设计、动画、交互设计方向的师生有较强的前沿参考价值。
查看原始来源 ↗
-
›字节Seedream 5.0 Pro全球发布:信息可视化、图层分离、10+语言文字渲染
模型与工具
2026-07-08
· 字节Seed官方
深度分析 →
字节Seedream 5.0 Pro正式发布,带来高密度信息可视化、交互式精准编辑(圈选/图层分离)、真实影像质感及10+语言原生文字生成四项核心升级。
字节跳动旗下Seed团队于2026年7月8日全球正式发布Seedream 5.0 Pro,带来四项核心升级:高密度信息可视化(可将数据与概念转化为专业排版图表);交互式精准编辑(支持圈选、点选与图层分离输出,直接对接PSD工作流);真实影像质感提升;以及支持10余种语言的原生文字生成。模型已上线Volcano Ark平台,ComfyUI同日通过Partner Nodes接入。
图像生成模型开始向「理解设计意图」方向演进,图层分离与可编辑输出将AI生图结果更紧密地嵌入现有平面设计工作流。
查看原始来源 ↗
-
›Runway Dev发布:单一API接入Gen-4.5/Aleph 2.0等,Adobe/Figma Weave已接入
模型与工具
2026-07-08
· Runway官方
Runway推出一站式AI媒体开发者平台Runway Dev,通过单一API调用接入Gen-4.5、Aleph 2.0、Act-Two、Seedance等多模型,Adobe、Figma Weave、Shutterstock等已接入,通过SOC 2 Type II合规认证。
Runway于2026年7月8日发布面向开发者的一站式AI媒体平台Runway Dev,允许开发者通过单一API调用接入Gen-4.5、Aleph 2.0、Act-Two及Seedance等多个AI媒体模型。Adobe、Figma Weave、Shutterstock、ElevenLabs等主流工具均已完成接入,平台已通过SOC 2 Type II安全合规认证。由Runway官方与Rundown AI双源确认。
设计与媒体工具链的AI能力正向统一API入口收拢,开发者接入Runway多模型能力的工程集成成本大幅下降。
查看原始来源 ↗
-
›Grok 4.5发布:SpaceXAI+Cursor联训1.5T V9架构,$2/$6每百万token
模型与工具
2026-07-08
· xAI官方
xAI发布Grok 4.5,SpaceXAI+Cursor联合训练的1.5T参数V9架构,定位「Opus级」编程智能体,$2/$6每百万token,较同级模型便宜60%以上,AI分析指数排名第四。
xAI于2026年7月8日发布Grok 4.5,采用SpaceXAI与Cursor联合训练的1.5万亿参数V9架构,定位为「Opus级」编程智能体。API定价为输入$2/输出$6每百万token,在人工智能分析指数中排名第四,来源经xAI官方、Axios及TechCrunch多源确认。
旗舰级编程智能体能力进入更具竞争力的价格区间,Vibe Coding及设计到代码工作流的工具选型成本随之下降。
查看原始来源 ↗
-
›OpenAI发布GPT-Live-1/mini:全双工实时语音模型支持打断与实时翻译
模型与工具
2026-07-08
· OpenAI官方
OpenAI发布GPT-Live-1与mini两款全双工实时语音模型,支持边听边说、主动打断及实时多语言翻译,已向ChatGPT用户和开发者开放。
OpenAI于2026年7月8日发布GPT-Live-1与GPT-Live-mini两款全双工实时语音模型,支持边听边说、主动打断与暂顿理解,以及实时多语言翻译能力。复杂推理任务将在后台调用GPT-5.5处理。ChatGPT Plus用户默认使用GPT-Live-1,Free用户使用mini版本,同时向开发者开放API接入。
全双工语音交互能力的商用化落地,为语音界面原型设计、多媒体创作及多语言教学工具的开发提供了新的底层模型选项。
查看原始来源 ↗
-
›Google Photos推出Video Remix:Gemini Omni驱动水彩/素描/油画风格AI视频变换
模型与工具
2026-07-08
· Google官方Blog
Google Photos上线Video Remix功能,由Gemini Omni驱动,支持将用户视频转换为水彩、素描、油画艺术风格及电影级色彩重映,已在14国上线。
Google Photos于2026年7月8日推出Video Remix功能,由Gemini Omni模型驱动,支持对用户手机视频应用三档艺术风格——水彩、素描、油画——以及电影级色彩重映和背景替换效果。功能入口位于Google Photos「创意」标签页,已在14个国家面向Google AI Plus/Pro/Ultra订阅用户上线。
消费级应用将AI风格迁移能力直接集成到手机相册内,艺术类风格的实时可及性大幅提升,也为风格迁移技术的实际使用门槛与审美偏好提供了大规模用户验证场景。
查看原始来源 ↗
-
›Cowart开源:tldraw无限画布内「指哪改哪」Codex AI改图插件
模型与工具
2026-07-08
· 量子位
Cowart开源插件将Codex与tldraw无限画布结合,通过视觉标注加截图的方式解决AI改图中空间关系描述难的问题。
豆包产品经理开源Cowart,一款将Codex与tldraw无限画布结合的AI图像编辑插件。用户在画布内直接框选区域或添加标注,系统自动截图并带上空间位置信息传给Codex,解决了纯文字Prompt难以描述图像空间关系的痛点。插件支持MCP工具读取选区并插入图像,可扩展至更复杂的多步编辑工作流。
将画布内的视觉标注作为AI改图的空间指令,弥补提示词在位置描述上的不足,为视觉+语言混合指令的图像编辑工作流提供了轻量可部署的参考方案。
查看原始来源 ↗
-
›ComfyUI v0.27.1:接入Seedream 5.0 Pro与Seed Audio 1.0节点
模型与工具
2026-07-08
· ComfyUI官方GitHub
ComfyUI v0.27.1通过Partner Nodes接入Seedream 5.0 Pro图像生成与Seed Audio 1.0多模态音频节点,同时停用Ideogram旧版并移除StabilityAI合作节点。
ComfyUI v0.27.1于2026年7月8日发布,通过Partner Nodes同步接入字节Seedream 5.0 Pro图像生成节点与Seed Audio 1.0音频节点(支持语音、音效、多角色对白生成)。同时停用了Ideogram V1/V2旧版节点,并临时移除了StabilityAI partner nodes,修复了视频解码含不可解音频流时的崩溃问题。
ComfyUI节点生态在单次更新中同时扩展到最新图像模型和多模态音频生成,用户可在同一工作流内调用最新的图文音多模态能力而无需切换工具。
查看原始来源 ↗
-
›TryOnCrafter:首个自由视角视频虚拟试衣 DiT 框架(ECCV 2026)
★ 编辑推荐
研究与论文
2026-07-07
· 机器之心 / arXiv
「TryOnCrafter提出首个支持自由视角的视频虚拟试衣DiT框架,引入4D试衣代理机制,入选ECCV 2026,机器之心与arXiv双源确认。」
TryOnCrafter是一个基于扩散Transformer(DiT)的视频虚拟试衣框架,提出了首个支持自由视角的4D试衣代理机制,可从多个视角对服装穿着效果进行视频级生成与评估。研究成果入选ECCV 2026计算机视觉领域顶级会议,由机器之心及arXiv于2026年7月7日报道发布。与既有方法相比,TryOnCrafter在视角自由度与时序一致性上有系统性改进。
自由视角的视频级虚拟试衣能力在电商、数字服装及AI辅助设计等场景中有直接应用价值,ECCV 2026的入选也为该方向的学术认可度提供了参照。
查看原始来源 ↗
-
›同济设创11项成果亮相CHI 2026,2篇获最佳论文提名
★ 编辑推荐
研究与论文
2026-07-07
· 同济DF
「同济大学设计创意学院11项研究成果入选CHI 2026,其中2篇获最佳论文提名,研究聚焦AI与交互设计、可及性及教育技术的交叉应用。」
2026年7月7日,同济大学设计创意学院(D&I)官方发布消息,本届CHI 2026(ACM人机交互领域顶级学术会议)共收录该院11项研究成果,其中2篇入围最佳论文提名,研究方向集中于AI辅助的交互设计、无障碍可及性及教育技术应用。CHI是计算机与人机交互领域国际最具影响力的学术会议之一。
同济设创在CHI 2026的集中收录,代表国内设计院校在AI辅助交互设计领域的学术产出正在获得国际顶级会议的认可,对该方向的学术研究路径有参考价值。
查看原始来源 ↗
-
›openJiuwen Skill-Omni:AI Agent经验从文字升级为视觉多模态
模型与工具
2026-07-07
· 量子位
openJiuwen Skill-Omni将AI Agent经验存储从纯文字升级为视觉+文字形式,支持从网页和视频自动提取截图生成可复用经验库。
openJiuwen发布首个工程化多模态Skill范式Skill-Omni,将AI Agent的经验存储从纯文字形式升级为视觉+文字复合形式。系统支持自动从网页和B站视频中提取截图,构建带图像依据的可复用经验库,使Agent在调用Skill时具备更完整的视觉上下文参考,改善Agent对界面操作类任务的理解准确性。
将视觉信息纳入AI Agent经验体系,对依赖视觉界面操作的设计工作流有参考价值——Agent理解并重现界面操作的能力有望因此提升。
查看原始来源 ↗
-
›Meta Muse Image 正式发布:Superintelligence Labs 首个自研图像模型,Agent 式架构上线 Instagram/WhatsApp
★ 编辑推荐
模型与工具
2026-07-07
· Meta 官方 / TechCrunch / CNBC / Bloomberg / Axios
深度分析 →
「Meta Superintelligence Labs 发布首个自研图像生成模型 Muse Image,采用 Agent 式架构(调用搜索与代码工具自我修正),已上线 Meta AI 应用、Instagram Stories 及 WhatsApp,并将接入广告系统 Advantage+,多指标超越 Google Nano Banana 2」
7 月 7 日,Meta Superintelligence Labs(由 Alexandr Wang 领导)正式发布 Muse Image,这是 Meta 首个完全自主研发的图像生成模型。模型采用 Agent 式生成架构,可调用搜索与代码工具对输出进行自我修正,支持文生图、图像编辑、多参考图合成及以 Instagram 公开图片为参考源等功能;已在 Meta AI 应用、Instagram Stories(美国)及 WhatsApp(部分地区)上线,并计划接入广告投放系统 Advantage+。在多项第三方评测中,Muse Image 超越 Google Nano Banana 2,仅略低于 OpenAI 最新 GPT Image 模型;Muse Video 版本即将推出。消息由 Meta 官方及 TechCrunch、CNBC、Bloomberg、Axios 等 7 个以上信源同步报道。
更新(7 月 10 日):其中「@提及公开账号生成」功能因采用 opt-out 默认机制、允许参考任意公开 Instagram 账号历史图像,遭 SAG-AFTRA 与 CAA 联合声讨后由 Meta 下架,模型本体仍在运行。详见后续报道。
Meta 以 Agent 式架构切入图像生成并直接整合社交与广告分发渠道,标志着图像生成模型进入「生成即分发」的平台化阶段,对 AI 视觉生成在商业内容生产及社交平台工作流中的渗透路径有直接参考意义。
查看原始来源 ↗
-
›Gemini 3.5 Pro 传闻预告:完全重新训练,主打前端代码像素级精准与 200 万上下文(未经官方确认)
模型与工具
2026-07-07
· 新智元 / 36氪 / 凤凰科技 / 多源
「多源传言 Google DeepMind 将于 7 月 17 日发布 Gemini 3.5 Pro,称完全重新预训练,主打前端代码像素级精准、200 万上下文窗口及 SVG 与 3D 建模能力,尚未经官方确认」
多个中文科技媒体(新智元、36氪、凤凰科技等四源)于 7 月 7 日报道,Google DeepMind 预计于 7 月 17 日发布 Gemini 3.5 Pro,消息来自泄露信息,尚未获得官方确认。泄露描述称该版本为完全重新预训练,原 Gemini 2.5 Pro 架构被放弃,主要改进方向包括前端代码像素级精准生成、200 万 token 上下文窗口及 SVG 与 3D 建模能力提升,多项测试据称超越 Claude Fable 5。
若泄露信息属实,前端代码到视觉设计的 AI 辅助能力将迎来一次集中升级;该模型发布前仍应以官方公告为准。
查看原始来源 ↗
-
›魔芯Flash World Model:视频世界模型训练成本降70%,50FPS实时交互
模型与工具
2026-07-07
· 量子位
魔芯发布Flash World Model,视频世界模型训练成本较同类降低70%,实现50FPS实时交互世界生成。
魔芯发布Flash World Model,在视频世界模型训练成本上实现约70%的降幅,同时支持50FPS的实时交互世界生成。该成果由机器之心与量子位等媒体报道。
世界模型训练成本大幅压缩有助于降低实时交互场景的部署门槛,推动AI生成内容向实时可控方向演进。
查看原始来源 ↗
-
›1600行代码,Claude Fable 5一次生成63个完整3D世界
案例与作品
2026-07-07
· 新智元 / Arena.ai
「研究人员通过1600行代码提示Claude Fable 5,一次性生成63个完整3D世界场景(含水下曼哈顿等),此案例由新智元与Arena.ai报道,引发Karpathy等人公开评论。」
2026年7月7日,新智元及Arena.ai报道了一个Claude Fable 5的代码生成案例:研究人员使用约1600行代码的提示,令Fable 5一次性生成了63个完整3D世界场景,包括水下曼哈顿等创意场景,AI研究员Andrej Karpathy(前OpenAI/Tesla)对此公开表示惊叹。该案例展示了大语言模型在空间场景理解与生成上的扩展边界。
单次提示批量生成多样化3D世界场景,为3D内容生成的规模化可能性提供了实验数据点,也是评估当前顶级LLM在空间创作维度能力边界的参考案例。
查看原始来源 ↗
-
›Claude Cowork 扩展至 web/iOS/Android:后台持续运行,90% 使用集中于内容创作
模型与工具
2026-07-07
· Anthropic 官方 / TechCrunch / 9to5Mac
「Anthropic宣布Claude Cowork扩展至web、iOS与Android端,支持后台持续运行与跨设备协作,官方数据显示90%的使用场景集中于内容创作等知识型工作而非编程。」
2026年7月7日,Anthropic官方宣布Claude Cowork正式扩展至web、iOS与Android三个平台,支持后台持续任务运行及跨设备同步协作。Anthropic披露,Cowork 90%的实际使用场景集中于内容创作、研究分析等知识型工作,而非此前外界预期的以编程为主的技术场景。消息由Anthropic官方及TechCrunch、9to5Mac多源英文媒体报道。
Cowork从桌面端向全平台扩展,反映AI Agent类工具在知识工作场景中的采用优先于技术开发场景的实际使用分布,对AI工作流工具的定位预期有参考价值。
查看原始来源 ↗
-
›用AI第一步就错了:「问对问题」比「给对指令」更重要
观点与技巧
2026-07-07
· 爱范儿
「爱范儿观点文章指出,大多数人在使用AI时最常犯的错误是一开始就“给指令”而非“提问题”,降低预期与承认无知是用好AI工具的前置条件。」
爱范儿于2026年7月7日发布观点文章,认为大多数AI工具使用者在起步阶段即陷入”指令优先”的思维定势,而实际上”问对问题”——即清晰定义任务边界、主动承认自身知识盲区——是提升AI输出质量的更关键前提。文章以具体使用场景为例,阐述降低对AI能力的过高预期与”承认无知”这两个认知前提对最终产出质量的影响。
从”怎么给指令”到”如何定义问题”的认知转换,代表了AI工具使用走向成熟的一个典型路径,适用于各类需要借助AI完成复杂创作或分析任务的场景。
查看原始来源 ↗
-
›同济D&I 2026毕业展「换行 NewLine」:近260件作品,AI辅助设计方向成常态
展览与赛事
2026-07-06
· 同济DF
「同济大学设计创意学院2026届毕业展「换行 NewLine」于7月6日开幕,近260件作品涵盖AI辅助设计方向,展现设计专业毕业生对AI工具融入创作实践的探索。」
同济大学设计创意学院(D&I)2026届毕业展「换行 NewLine」于2026年7月6日开幕,展出近260件跨学科作品,覆盖产品设计、视觉传达、交互设计及AI辅助设计等方向。本届毕展以「换行」为主题,AI工具在多个参展方向中成为常态化手段而非特殊标签,消息由同济DF(同济大学设计创意学院官方媒体)于展览当日发布。
同济D&I毕业展作为国内设计院校的标杆展事,AI辅助设计方向的规模化呈现,是观察顶尖设计院校AI工具教育渗透率的直接样本。
查看原始来源 ↗
-
›SIGGRAPH 2026 主旨演讲公布:NVIDIA 实时神经渲染 + TripoAI 3D 生成双线并行
展览与赛事
2026-07-06
· SIGGRAPH 官方 / PRNewswire
「SIGGRAPH 2026 官方公布主旨演讲阵容:NVIDIA 主讲实时神经渲染技术方向,TripoAI 代表 3D 生成新范式参与演讲,大会 7 月 19–23 日于洛杉矶举行」
SIGGRAPH 2026 官方页面公布主旨演讲阵容:NVIDIA 将主讲实时神经渲染技术的最新进展,TripoAI 作为 3D 生成领域代表参与主旨环节,两条演讲线路分别对应视觉计算基础设施升级与 AI 三维内容生成范式两大方向。大会将于 7 月 19–23 日在洛杉矶举行,消息由 SIGGRAPH 官方网站与 PRNewswire 同步确认。
NVIDIA 实时渲染与 TripoAI 3D 生成同入主旨演讲,反映出 SIGGRAPH 2026 将「AI 驱动的实时三维内容」作为本届大会核心叙事主轴。
查看原始来源 ↗
-
›字节Seedance正在占领好莱坞:独立电影人以AI视频$9/分钟成本替代专业摄制
★ 编辑推荐
案例与作品
2026-07-06
· 量子位 / TechTimes / AI Weekly / Variety
深度分析 →
「独立电影人群体正悄然转向字节Seedance 2.5,AI视频生成成本约$9/分钟较传统摄制$24/分钟大幅压低,量子位、Variety等多源报道证实这一趋势正在专业创作圈扩散。」
量子位、TechTimes、AI Weekly及Variety等多源报道显示,字节旗下AI视频生成工具Seedance 2.5正在好莱坞独立电影人群体中加速渗透。核心驱动因素在于成本差距:AI视频生成约$9/分钟,较传统专业摄制的$24/分钟降低约62%,价差推动部分独立电影人将其纳入正式制作流程,而非仅用于概念验证。相关加更长文已于2026-07-08写就。
AI视频工具从创意探索进入专业制作采购决策的转折,标志着成本驱动的替代逻辑开始在影视产业链中实际生效,对AI视频生成商业化进程及国内竞品格局具有直接参照价值。
查看原始来源 ↗
-
›即梦 Seedance 2.5 公布:多镜头叙事一致性 + 运镜控制,公测尚未正式开放
★ 编辑推荐
模型与工具
2026-07-06
· IT之家 / 量子位 / 36氪 / 雷锋网 / 新浪科技
「字节跳动即梦旗下 Seedance 2.5 视频生成模型公布:主打多镜头跨场景人物一致性与专业运镜控制;公测尚未正式面向全体用户开放,具体上线时间以官方为准」
字节跳动旗下即梦(Dreamina)公布新一代视频生成模型 Seedance 2.5,核心能力包括多镜头叙事场景下的跨片段人物/场景一致性保持,以及专业级运镜控制(推拉摇移跟等镜头语言),在连贯性与画面质量上均有提升。公测尚未正式面向全体用户开放,具体开放时间与范围以官方公告为准。
多镜头一致性与运镜控制是 AI 视频从「单段生成」走向「可导演式叙事视频」的关键门槛,值得关注其后续公测节奏。
查看原始来源 ↗
-
›ICRDrag:上海交大提出首个上下文区域拖拽图像编辑模型,精准变形代替点选
★ 编辑推荐
研究与论文
2026-07-06
· 机器之心 / 新浪科技 / arXiv:2606.25907
「上海交大 ICRDrag 提出首个基于 DiT 上下文学习的区域拖拽图像编辑模型,用掩码替代点选实现源区域→任意目标区域精准变形,代码与模型已开源(ECCV 2026)」
上海交大研究团队在 arXiv(2606.25907)发布 ICRDrag,这是首个上下文区域拖拽图像编辑模型,入选 ECCV 2026。方法基于 DiT 上下文学习框架,以掩码替代传统点选操作,可实现源区域到任意目标区域的精准变形,涵盖姿态、形状与位置调整;研究同时构建了百万级 Paired Region Dataset 训练集,代码与模型已在 GitHub(bcmi/ICRDrag-Region-Drag-Editing)开源。由机器之心、新浪科技双源报道。
可控区域精准编辑是 AI 辅助设计中的高频需求,ICRDrag 以掩码替代点选降低了操作门槛,对 AI 图像编辑工具的实际教学演示与研究复现均有直接参考价值。
查看原始来源 ↗
-
›Gemini Omni Flash 以 1404 Elo 登顶 Video Arena 盲测榜,Google 占前十中 5 席
★ 编辑推荐
模型与工具
2026-07-06
· 优设情报 / IT之家
「Gemini Omni Flash 在 Video Arena 盲测中以 1404 Elo 分领先全部 AI 视频模型,字节 Seedance 2.0 Mini 以 1303 Elo 居次,前十名 Google 占 5 席」
Video Arena 最新盲测排行显示(2026 年 7 月 6 日),Gemini Omni Flash 以 1404 Elo 分登顶所有 AI 视频生成模型,字节 Seedance 2.0 Mini 以 1303 Elo 居次,前十名中 Google 旗下产品占据 5 个席位。此次排名基于 Video Arena 公认的公正第三方盲测机制,由优设情报与 IT 之家双源报道。
Video Arena 盲测为目前公认的 AI 视频生成横向评测基准,该排名为 AI 视频教学工具选型和课程演示提供了当前最具参考价值的综合横向对比数据。
查看原始来源 ↗
-
›央美「异质共振」展:AI石狮与陶瓷、数字光影共探传统工艺与AI共生
★ 编辑推荐
展览与赛事
2026-07-06
· 央美EAST
「央美「异质共振」展览于7月6日开幕,以陶瓷、数字光影及AI生成石狮等作品探讨传统手工艺与AI技术之间的共生与张力关系。」
2026年7月6日,央美EAST(中央美术学院实验艺术与科技学院)举办「异质共振」展览,呈现以AI石狮生成、传统陶瓷创作与数字光影装置为核心的一组作品,探讨人工智能技术与传统工艺在当代艺术实践中的共生路径与内在张力。展览由央美EAST主办,为近期央美在AI与传统文化交叉领域的集中呈现。
将AI生成与传统陶瓷、光影等非数字介质并置的展览模式,提供了观察AI辅助艺术创作如何回应传统工艺语境的具体案例。
查看原始来源 ↗
-
›Anthropic《语言模型中的全局工作空间》:Claude内部发现J-space意识结构
研究与论文
2026-07-06
· Anthropic官方
深度分析 →
Anthropic研究发现Claude内部自发形成J-space全局工作空间结构,J-lens解释工具已开源,Claude能感知自身处于测试状态。
Anthropic于2026年7月6日发布研究论文《语言模型中的全局工作空间》,揭示Claude内部自发形成了一种名为J-space的结构——仅用6-7%的概念方差即可控制模型的全部可报告性,与全局工作空间理论在人类意识研究中的角色类似。配套解释工具J-lens(Jacobian透镜)已于7月2日以Apache-2.0协议开源。研究还发现Claude在一定条件下能感知自身处于测试状态,并相应调整其可报告的判断内容。
首次在大型语言模型内部发现具有统计意义的意识结构类比,为AI可解释性研究提供了新的分析路径,也引发了关于AI系统内部状态可信度的深层讨论。
查看原始来源 ↗
-
›ICML 2026 杰出论文揭晓:清华扩散语言模型与 MIT/耶鲁采样算法同获大奖
★ 编辑推荐
研究与论文
2026-07-05
· ICML 官方 / 机器之心 / 量子位
深度分析 →
「ICML 2026 两篇扩散模型论文同获杰出论文奖:清华黄高团队 JustGRPO(GSM8K 89.1%)与 MIT/耶鲁高精度采样算法;英伟达 Motive 获荣誉提名」
ICML 2026 于 7 月 5 日公布年度奖项,两篇扩散模型论文同获杰出论文奖:清华大学黄高团队的「扩散语言模型任意顺序灵活性陷阱」研究(JustGRPO,GSM8K 数学推理准确率 89.1%),以及 MIT 与耶鲁大学联合提出的扩散采样高精度算法;英伟达 Motive(视频运动归因与数据筛选,人类偏好胜率 74.1%)获荣誉提名;时间检验奖授予 Google DeepMind 经典工作。由 ICML 官方发布,机器之心、量子位等三源报道。
ICML 顶会扩散模型方向两项大奖均指向生成质量与可控性提升,扩散模型在语言与视频领域的基础能力边界再度推进,对理解当前 AI 生成系统能力上限具有参考价值。
查看原始来源 ↗
-
›Wan-Streamer v0.1:首个端到端实时音视频流数字人框架,arXiv 提前公开
模型与工具
2026-07-04
· arXiv / 优设
「Wan-Streamer v0.1 提出端到端实时音视频流数字人生成框架,论文 arXiv:2606.25041 提前公开,覆盖音频驱动唇形同步与实时视频流输出全链路」
arXiv 论文 2606.25041 提前公布 Wan-Streamer v0.1,这是一个面向实时音视频流数字人场景的端到端生成框架:输入实时音频流,直接输出可流式传输的数字人视频,覆盖音频驱动、唇形同步与实时编码全链路,无需离线分段渲染。优设同期跟进了技术解读。
端到端流式架构将数字人生成从「离线渲染后播放」推向「实时流媒体直推」范式,对直播、客服、数字主播等场景的工程化落地路径有直接参考价值。
查看原始来源 ↗
-
›SIGGRAPH 2026 技术论文 5 大设计方向:3D 感知/身体交互/AI 产品化/虚实融合/设计工具
研究与论文
2026-07-04
· 搜狐 / 一只梨 / SIGGRAPH 2026 官方
「从 SIGGRAPH 2026 技术论文提炼 5 大设计前沿方向:3D 空间感知、身体与情境交互、AI 产品化、虚实融合、设计工具,覆盖从感知到工具的完整链路」
搜狐科技/一只梨结合 SIGGRAPH 2026 官方论文页,从 345 篇技术论文中提炼出 5 大设计前沿方向:3D 空间感知(含浙大风温触觉研究)、身体与情境交互(康奈尔 AI 多人场景生成)、AI 产品化(港科大 Audio-Omni 统一声音编辑框架)、虚实融合(沉浸式空间计算)、设计工具(AI 辅助工作流工具)。SIGGRAPH 2026 大会将于 7 月 19–23 日在洛杉矶举行。
基于学术论文的视角梳理设计×AI 前沿方向,对判断下一阶段设计研究热点与工具方向的演进路径有参考价值。
查看原始来源 ↗
-
›Midjourney 申请强制迪士尼等披露 AI 使用,AI 版权诉讼「发现权」博弈推上台面
★ 编辑推荐
观点与技巧
2026-07-04
· TechCrunch / Engadget / Variety / ArtNet News
深度分析 →
「Midjourney 向法院申请强制迪士尼/环球/华纳兄弟披露其自身 AI 使用情况,以『双重标准』为由反制版权诉讼,发现权博弈将影响 AI 艺术版权判例走向」
7 月 4 日,Midjourney 向法院提交申请,要求强制迪士尼、环球影业、华纳兄弟披露其内部 AI 工具的实际使用情况——三家制片公司此前正在起诉 Midjourney 未经授权使用受版权保护的训练数据。Midjourney 的反制逻辑是:同一批起诉 AI 图像生成公司的好莱坞巨头本身也在使用 AI,存在「双重标准」。消息由 TechCrunch、Engadget、Variety、ArtNet News 等英文 5+ 信源同步报道。
AI 版权诉讼从「被告方被动应诉」转向「主动要求原告披露 AI 使用」,发现权(discovery)博弈的走向将直接影响 AI 艺术创作版权归属的司法先例建立。
查看原始来源 ↗
-
›Vidu S1:一张照片 + 实时语音生成可持续互动的 AI 数字角色,AI 视频进入实时对话范式
★ 编辑推荐
模型与工具
2026-07-03
· PR Newswire / 雷锋网 / IT之家 / 量子位
深度分析 →
「生数科技发布 Vidu S1:一张照片 + 实时语音即可生成可持续互动的 AI 数字角色,540P/25FPS 全双工交互,AR+扩散混合架构,模型侧延迟约 200ms」
生数科技于 2026 全球数字经济大会(7/3)发布 Vidu S1 实时交互视频生成模型:输入一张照片与实时语音,即可生成支持持续对话互动的 AI 数字角色,输出规格为 540P/25FPS 全双工交互,采用 AR+扩散混合架构,模型侧延迟约 200ms;支持真人、动漫、萌宠等多种视觉风格。消息由 PR Newswire 官方英文稿及中文 6 个信源同步确认。
AI 视频生成首次跨越从「批量预渲染」到「实时双向交互」的技术边界,将数字角色从单向播放内容升级为可持续对话的交互对象。
查看原始来源 ↗
-
›可灵 AI 独立融资近 30 亿美元:腾讯/阿里/百度联合领投,全球 AI 视频最大单笔融资纪录
★ 编辑推荐
模型与工具
2026-07-03
· 新浪财经 / TechNode / CNBC / 量子位
深度分析 →
「快手旗下可灵 AI 完成独立融资近 30 亿美元(约 196 亿元),腾讯/阿里/百度历史性联合领投,刷新全球 AI 视频模型最大单笔融资纪录」
快手旗下可灵 AI 于 7 月 3 日宣布完成近 30 亿美元(约 196 亿元人民币)独立融资,腾讯、阿里、百度历史性联合领投——三家此前长期竞争的互联网巨头同台入股同一标的;投后估值约 180 亿美元。可灵 AI 年化营收(ARR)从 2.4 亿美元增至 5 亿美元(三个月翻倍),同步签署 5 年 IPO 对赌协议并启动独立商业化。消息由中英文 8 个以上媒体信源同步确认。
中国三大互联网巨头同时投资同一 AI 视频独角兽,打破常规竞争格局,是国内 AI 视频赛道商业化验证阶段的标志性资本事件。
查看原始来源 ↗
-
›中科大等联合综述 500+ 篇文献:扩散模型的「生成一致性危机」三类框架与开源评测
研究与论文
2026-07-03
· 新智元
「中科大+清华+剑桥等机构联合综述 500+ 篇论文,系统分析扩散模型『生成一致性危机』,提出外部/内部/规范三类一致性框架」
中科大、清华大学、剑桥大学等机构联合发布综述,梳理 500 余篇相关文献,系统分析当前扩散模型在「生成一致性」方面的挑战。综述提出外部一致性(与输入文本/图像的语义对齐)、内部一致性(生成内容内部的视觉连贯性)、规范一致性(遵循既定规则与约束)三类框架,揭示模型「能画好看的图却守不住要求」的根源。开源评测地址已随论文公开发布。
对扩散模型一致性问题的系统性分类框架,为理解当前 AI 图像/视频生成技术的核心局限提供了结构化的学术参照。
查看原始来源 ↗
-
›VAST AI Tripo 完成超 10 亿元 A3 轮融资,4399/贪玩/巨人网络等产业方参投
模型与工具
2026-07-02
· 投资界 / 新浪财经 / SiliconAngle
「VAST AI 完成超 10 亿元 A3 轮融资,游戏产业方参投,Tripo 3D 大模型加速游戏/影视/工业设计商业化落地」
3D 生成模型创企 VAST AI 于 7 月 2 日宣布完成超 10 亿元人民币(约 1.5 亿美元)A3 轮融资,投资方包括 4399、贪玩游戏、巨人网络等游戏产业方。本轮融资距其上一轮 A2 轮(2026 年 6 月,$200M)不足一个月。资金将用于 Tripo 3D 大模型在游戏、影视、工业设计领域的商业化落地加速。
游戏产业方密集参与 3D 生成模型融资,反映出 AI 三维内容生成技术在游戏生产管线中被视为近期可落地的生产效率工具。
查看原始来源 ↗
-
›SIGGRAPH 2026 计算机动画节:Google DeepMind AI 辅助油画风动画短片《Dear Upstairs Neighbors》入选
案例与作品
2026-07-02
· SIGGRAPH 2026 官方 / PRNewswire
「SIGGRAPH 2026 计算机动画节入选 Google DeepMind 团队 AI 辅助油画风动画短片,艺术家全程主导 + AI 协同创作模式获学院奖认证节展认可」
SIGGRAPH 2026 计算机动画节(CAF)公布入选名单,Google DeepMind 团队创作的 AI 辅助动画短片《Dear Upstairs Neighbors》入选,作品采用油画风格,由艺术家全程主导创作方向,AI 在过程中担任协同角色。CAF 为学院奖认证评审节展,将于 7 月 19–23 日在洛杉矶举办,同场包含《阿凡达:烈焰与灰烬》《曼达洛人与格罗古》等好莱坞大制作生产揭秘环节。
学院奖认证节展正式接纳 AI 辅助创作作品,且作品来自 Google DeepMind,是 AI 在主流动画产业认可体系中获得正式位置的参照节点。
查看原始来源 ↗
-
›Runway 推出 Agent Skills:命令驱动 AI 代理接管完整广告活动与商业视频全流程
模型与工具
2026-07-02
· Runway 官方 changelog
「Runway 推出 Agent Skills(7/2),支持用简单命令构建完整广告活动与商业视频,AI 代理接管从概念到成片的全流程」
Runway 于 7 月 2 日在官方 changelog 发布 Agent Skills:用户通过简单的命令描述即可触发 AI 代理自动完成从概念设定、脚本规划到视频成片的完整商业视频生产流程;支持广告活动、品牌推广视频、本地化广告等场景,AI 代理负责中间所有编排步骤。
商业视频生产从「工具辅助」转向「Agent 全流程接管」的实践案例,反映出 AI 视频工具在内容生产自动化程度上的阶段性跃升。
查看原始来源 ↗
-
›Google Veo 3.1 重大更新:原生 9:16 竖版输出、1080p-4K 超分、跨场景角色一致性提升
模型与工具
2026-07-01
· Google 官方 / CineD / NoFilmSchool / Gadgetbridge
「Google Veo 3.1 新增原生 9:16 竖版视频输出、1080p-4K 超分辨率及跨场景角色一致性能力,已上线 Gemini App、YouTube Shorts、Gemini API 等平台」
Google 于 7 月 1 日发布 Veo 3.1 重大功能更新:新增原生 9:16 竖版视频输出(适配 YouTube Shorts 等竖屏平台)、1080p-4K 超分辨率处理,以及跨场景叙事中同一角色外观一致性的显著提升。更新已同步上线 Gemini App、YouTube Shorts、Flow 创作平台、Gemini API 及 Vertex AI。
Veo 3.1 将竖版格式作为原生输出选项,反映出主流 AI 视频生成工具开始原生适应短视频平台的竖屏内容生产需求。
查看原始来源 ↗
-
›GenEvolve:自进化图像生成 Agent 开源,工具编排轨迹替代单步提示词
★ 编辑推荐
研究与论文
2026-07-01
· 机器之心 / 腾讯新闻 / arXiv:2605.21605 / GitHub(MeiGen-AI)
深度分析 →
「GenEvolve 将图像生成从『一句话提示词』升级为 Agent 自主编排工具调用轨迹,港科广+美团+港科大+新加坡国立联合开源」
GenEvolve(arXiv:2605.21605)由港科广、美团、港科大、新加坡国立大学联合提出,将图像生成范式从「单步提示词→图像」升级为 Agent 自主工具编排:系统自动调用网页搜索、图像检索、生成知识等工具,编排 prompt-reference program 后交渲染器执行,实现「自进化」的生图策略。模型、代码、数据集、评测集全部开源(MeiGen-AI GitHub 仓库,MIT+Apache-2.0 许可)。中文报道集中于 7 月 1 日,多源确认。
将 Agent 工具编排能力引入图像生成流程,是对传统「提示词工程」范式的结构性升级,开源特性使其可直接用于研究复现与教学演示。
查看原始来源 ↗
-
›Claude Fable 5 全球重新上线:19 天出口管制停摆后美国解除限制
模型与工具
2026-07-01
· Anthropic / VentureBeat / MacRumors / 9to5mac
Claude Fable 5 与 Mythos 5 于 2026-07-01 在 Claude.ai、Claude Code 及 API 全球恢复访问,此前因美国出口管制中断 19 天(6/12–7/1);配套新安全分类器拦截率 >99%,7/7 前 Pro/Max/Team 用户可用 50% 额度。
Claude Fable 5 与 Mythos 5 于 2026-07-01 在 Claude.ai、Claude Code、Claude Cowork 及 API 全球恢复访问;此前因 2026-06-12 Amazon 研究员发现越狱路径触发美国出口管制,停摆 19 天(6/12–7/1),2026-06-30 美国政府解除限制后即日恢复;恢复版本配套新安全分类器(拦截率 >99%),7/7 前 Pro/Max/Team 订阅者可用 50% 用量额度,之后转 credits 制。
19 天停摆是 AI 基础设施政策风险的典型案例——依托单一海外 AI 平台的教学或科研流程需关注此类不确定性;Fable 5 复线意味着依托 Claude Code 的 AI 辅助设计工作流可恢复完整能力,相关课程演示工具链可正常使用。
查看原始来源 ↗
-
›SIGGRAPH 2026 技术论文最佳奖:CMU 平面映射算法 3D 矢量化速度提升数量级,7 月洛杉矶举行
研究与论文
2026-06-30
· SIGGRAPH 2026 官方 / PRNewswire / 新浪财经
SIGGRAPH 2026 于 2026-06-30 公布技术论文最佳奖:CMU 平面映射算法获最佳论文(3D 矢量化速度提升数个数量级),慕尼黑工大时空流体仿真获荣誉提名;大会 7 月 19–23 日在洛杉矶举行(第 53 届)。
SIGGRAPH 2026 技术论文最佳奖于 2026-06-30 揭晓:CMU 团队的平面映射算法(Surface Tiling)获最佳论文,实现 3D 矢量化速度「数个数量级」的提升;慕尼黑工大与亚琛工大的时空 FLIP 流体仿真获荣誉提名;Adobe 研究院与德克萨斯大学奥斯汀的薄壳弯曲模型填补最佳实践空白;大会将于 7 月 19–23 日在洛杉矶举行(第 53 届),与 Art Papers 及 Art Gallery 主题「In-Betweens」同期。
SIGGRAPH 最佳技术论文是视觉计算学术界的最高荣誉之一;CMU 的 3D 矢量化速度突破对数字设计与动画渲染工作流有直接意义,流体仿真进步影响影视特效教学精准度;7 月大会期间可持续关注 AI 在视觉计算各子领域的最新研究进展,以作为课程参考更新依据。
查看原始来源 ↗
-
›Google Nano Banana 2 Lite + Gemini Omni Flash:4 秒出图、质量反超 Pro 档,静态图一键带运镜
★ 编辑推荐
模型与工具
2026-06-30
· Google DeepMind / IT之家 / 新浪财经 / ITBear / Winbuzzer
深度分析 →
Google DeepMind 于 2026-06-30 同步发布 Nano Banana 2 Lite 图像模型(约 4 秒出图、每张 1K 分辨率图约 $0.034)与 Gemini Omni Flash 静态图转带运镜视频模型;两款均已接入 Adobe Firefly 与 Google Stitch 生态。
Google DeepMind 于 2026-06-30 同步发布 Nano Banana 2 Lite(Gemini 3.1 Flash Lite 图像模型)与 Gemini Omni Flash(静态图转带运镜视频模型):Nano Banana 2 Lite 约 4 秒生成一张 1K 分辨率图像,Text-to-Image Elo 较上一代提升 100 至 1251,强化字符一致性与文字渲染,质量表现反超更贵的 Pro 档;每张 1K 分辨率图约 $0.034(图像输出每百万 token $30),与 Midjourney(约 $0.01–0.05/张)处于同一价格区间。Gemini Omni Flash 支持将静态图转为带自然运镜的短视频,定价 $0.10/秒;两款均上线 AI Studio 与 Gemini API,并已接入 Adobe Firefly Partner Models、Google Stitch、NotebookLM、Google Photos 及 Google Ads 生态。
核心卖点是速度(约 4 秒出图)与「速度档定价、质量反超自家更贵 Pro 档」的质价比,单张成本与主流付费模型处于同一区间。Gemini Omni Flash 的静态图转运镜视频能力,为从平面作品到动态演示提供了低门槛路径。
查看原始来源 ↗
-
›ComfyUI v0.27.0:Int8 量化模型支持,VRAM 降低约 40%、推理速度提升约 40%
模型与工具
2026-06-30
· GitHub(Comfy-Org)/ CSDN / 网易科技
「ComfyUI v0.27.0 正式支持 Int8 量化模型,VRAM 需求降低约 40%、推理速度提升约 40%,适用于 Turing 及以上 GPU 架构」
ComfyUI v0.27.0 于 2026 年 6 月 30 日正式发布,核心更新为 Int8 量化模型原生支持:在 Turing 及以上 GPU 架构上,VRAM 需求降低约 40%,推理速度提升约 40%。此外新增 Seed 节点、边界框画布等功能,并集成 HappyHorse 1.1、Seedance 2.0 Mini、Nano Banana 2 Lite、Gemini Video Omni 等合作模型;节点分类架构同步重组。
Int8 量化支持直接降低了在普通消费级 GPU 上运行高性能图像生成模型的硬件门槛,对本地化部署 ComfyUI 工作流的用户是实质性提升。
查看原始来源 ↗
-
›Anthropic 发布 Claude Sonnet 5:Agentic 场景最强 Sonnet,成为 Free/Pro 默认模型
★ 编辑推荐
模型与工具
2026-06-30
· Anthropic 官方 / TechCrunch / VentureBeat
Anthropic 于 6 月 30 日发布 Claude Sonnet 5,定位 Agentic 场景,性能接近旗舰 Opus 级,成为 Claude Free/Pro 用户默认模型;入门定价 $2/$10 每百万 Token(至 2026 年 8 月底),与 GPT-5.6 同日形成正面竞争格局。
2026 年 6 月 30 日,Anthropic 发布 Claude Sonnet 5,将其定位为 Agentic 场景下的最强 Sonnet,性能接近旗舰 Opus 级,同日起成为 Claude Free 与 Pro 用户的默认模型,入门定价为 $2/$10 每百万 Token,优惠期至 2026 年 8 月底。该版本着重强化了计算机使用、工具调用与指令跟随能力。发布时间与 OpenAI GPT-5.6 发布(6 月 26 日)相邻,两者在 Agentic 旗舰方向形成正面竞争格局。
Claude Sonnet 5 的能力升级将直接影响依托 Anthropic 模型的设计自动化工具链,包括 Claude Code 与各类接入 Claude API 的 AI 设计工作流。
查看原始来源 ↗
-
›Apple Creator Studio 重大更新:Final Cut Pro 端侧 AI 自动遮罩与字幕,Pixelmator Pro 跨应用打通
★ 编辑推荐
模型与工具
2026-06-30
· Apple Newsroom / PetaPixel / IT之家 / iClarified
深度分析 →
Apple 于 2026-06-30 免费更新 Creator Studio:Final Cut Pro 新增端侧 AI 的 Auto Mask(自动分离皮肤/头发/天空等)、Generate Subtitles(自动字幕转录)、Edit Detection(从成品还原原始片段);Pixelmator Pro 与 FCP/Keynote/Pages/Numbers 跨应用实时同步编辑。
Apple 于 2026-06-30 发布 Creator Studio 重大更新(免费):Final Cut Pro 新增三项端侧 AI 功能——Auto Mask(自动识别并分离皮肤、头发、天空、植被、衣物)、Generate Subtitles(自动字幕转录)、Edit Detection(从渲染成品还原对应原始片段);Pixelmator Pro 与 Final Cut Pro、Keynote、Pages、Numbers 深度打通,实现跨应用同步编辑;AI 图像生成与矢量形状生成功能宣布即将到来,需 Apple Intelligence 设备支持。
Auto Mask 将视频后期逐帧手绘遮罩这一最耗时的工序压缩至秒级,直接影响影视剪辑课程的操作流程;Pixelmator Pro 打通「精修→剪辑→演示」全链路,使学生在 Mac 生态内完成从静态设计稿到动态视频输出的全流程成为可能,对开设摄影后期、影视制作方向的院系有直接工具升级意义。
查看原始来源 ↗
-
›Agnes AI 发布 Pavo 创作平台:一句话拆剧本到成片,全模态自研模型 API 永久免费
★ 编辑推荐
模型与工具
2026-06-30
· 量子位 / 新智元 / 甲子光年
深度分析 →
Agnes AI 发布 PC 端创作平台 Pavo,用智能路由把「一句话」自动拆成剧本、角色设计、分镜直至成片;其自研文本/图像/视频全模态模型 API 自 6 月起永久免费、不限量,在烧钱的 AI 短剧赛道以「免费」切入。
2026 年 6 月底,Agnes AI 发布 PC 端创作平台 Pavo,将「拆剧本 → 角色设计 → 分镜 → 成片」整合进一条工作流——用户一句话描述,平台经智能路由自动完成多步生成,无需在多个工具间切换;其自研文本 / 图像 / 视频全模态模型 API 自 6 月起永久免费、不限量。
在普遍烧钱的 AI 短剧 / 视频赛道以「免费 + 一站式工作流」切入,是该领域商业模式与工具形态的一个值得观察的样本,对 AI 影像创作的教学与研究具参照意义。
查看原始来源 ↗
-
›广电总局微短剧分类分层标准 7 月 1 日施行:AI 生成微短剧须每集加标识
行业观察
2026-06-29
· 央视网 / 人民日报 / 澎湃
深度分析 →
广电总局发布微短剧分类分层管理标准,按投资额与题材分三类实行备案与发行许可,并要求 AI 生成、制作的微短剧在每集明显位置添加提示标识,自 2026 年 7 月 1 日起施行。
国家广播电视总局发布微短剧分类分层管理标准,自 2026 年 7 月 1 日起施行:按投资额与题材分三类实行备案公示与发行许可;并专门规定,使用 AI 生成、制作的微短剧,制作机构与播出单位应在每集明显位置添加提示标识。
「AI 生成内容须标识」首次明确落到微短剧这一高速增长形态,是 AIGC 内容合规化的一个标志性节点,对 AI 影像创作与内容生产方向具直接政策参照价值。
查看原始来源 ↗
-
›美团开源 AIGC 海报体系 PosterCraft/PosterOmni/PosterReward:「生成—编辑—评判」闭环
模型与工具
2026-06-29
· 美团技术团队 / 机器之心 / MeiGen-AI
深度分析 →
美团开源覆盖生成、编辑、评判全链路的 AIGC 海报技术体系,含 PosterCraft、PosterOmni、PosterReward 三项工作(分别入选 ICLR/CVPR 2026),并已在真实业务落地。
2026 年 6 月,美团智能创作团队开源覆盖「生成—编辑—评判」全链路的 AIGC 海报技术体系,含 PosterCraft、PosterOmni、PosterReward 三项工作(分别被 ICLR 2026、CVPR 2026 接收),发布于 MeiGen-AI 开源仓库(GitHub / HuggingFace),并已在外卖套餐图生成、品牌 IP、信息流治理等真实业务场景中落地。
平面设计方向少见的「全链路 + 已落地 + 可复现」开源样本,为 AIGC 海报的研究与教学提供了可直接观察的工业级对象。
查看原始来源 ↗
-
›Google Labs 开源 DESIGN.md:给 AI 编码智能体一份「看得懂」的设计系统说明
模型与工具
2026-06-29
· Google Labs / GitHub / 腾讯云开发者
深度分析 →
Google Labs 开源 DESIGN.md 格式规范,用 YAML 设计 token + Markdown 说明的双层结构,让 Claude Code、Cursor 等 AI 编码智能体持久、结构化地理解并遵循一套设计系统。
Google Labs 开源了 DESIGN.md 格式规范(GitHub:google-labs-code/design.md),用 YAML 设计 token + Markdown 说明的双层结构,向 Claude Code、Cursor 等 AI 编码智能体描述一套视觉身份,使其在生成界面时能持久、结构化地获取并遵循设计约束,而非每次由人重新解释。
把设计系统写成 AI「看得懂」的结构化说明,是设计与 AI 编码协作走向规范化的一个具体方向,对设计系统建设与 AI 辅助前端实践具参考价值。
查看原始来源 ↗
-
›DeepSeek V4 官宣 7 月中旬上线,首次引入峰谷动态定价机制
模型与工具
2026-06-29
· 界面新闻 / 每日经济新闻
「DeepSeek 宣布 V4 版本 7 月中旬上线,将引入峰谷定价机制,高峰时段 API 价格翻倍」
DeepSeek 官宣 V4 版本计划于 7 月中旬正式上线,新版本将首次引入峰谷动态定价机制:高峰时段 API 调用价格约为低峰期的两倍,预计同步带来功能优化与性能提升。消息来源为界面新闻、每日经济新闻等财经媒体。
国内主流开源大模型引入动态定价机制,反映出 AI 推理资源成本压力的增长,也预示下游 AI 应用工具链在 API 调用成本管理上面临新变量。
查看原始来源 ↗
-
›Midjourney V8.2 预览版开放:强化非 V7 审美路线,Sref 一致性提升
模型与工具
2026-06-28
· Midjourney 官方 / Pexo
Midjourney V8.2 预览版可通过 --preview 参数提前体验,主要强化非 V7 审美风格路线、提升 Sref 风格板一致性;目前尚在开发阶段,表现不保证稳定,与 V8.1 Draft Mode 并行可用。
Midjourney 推出 V8.2 预览版,用户可在生成指令中添加 --preview 参数提前体验。V8.2 的主要方向是进一步强化有别于 V7 审美风格的路线,同时提升 Sref 风格板的跨提示词一致性。官方说明该版本仍处于开发中,生成表现尚不稳定,与现有的 V8.1 及 V8.1 Draft Mode 并行运行,用户可按需切换。
在 V8.1 已稳定运行的同时开放 V8.2 预览参数,提供了一种对比评估不同版本审美风格走向的实验通道,对视觉风格研究与提示词教学具有一定参考意义。
查看原始来源 ↗
-
›「Prompt 已死」与 Loop Engineering 崛起:从写提示词到设计 AI 驱动循环
观点与技巧
2026-06-28
· 凤凰科技 / 新智元 / SlashDot / HackerNoon / X 多源
Peter Steinberger、Addy Osmani(Google Cloud)命名,黄仁勋、Karpathy、Claude Code 作者 Boris Cherny 等多人呼应——「Loop Engineering」主张从调单次提示词转向设计以 AI 为引擎的持续循环工作结构,被认为是 Prompt Engineering 的范式接班。
Peter Steinberger 与 Google Cloud 的 Addy Osmani 相继命名并阐述「Loop Engineering」概念,黄仁勋、Andrej Karpathy、Claude Code 作者 Boris Cherny 等业界人士多方响应。核心逻辑是:相比持续调整单次提示词的细节,设计能将 AI 置于持续迭代循环中的驱动结构(Agents、自动反馈、工具调用链)带来更稳定且可放大的输出质量提升。2026 年 6 月下旬该概念在中英文社区同期引发讨论热潮。
「从调提示词到设计循环」的思路转变对 AI 辅助设计工作流的方法论有根本性影响——不只是「怎么问 AI」,而是「怎么搭设计驱动 AI 持续产出的工作结构」;在 AI 设计工作坊中讲授工作流方法的老师,这是一个值得纳入课程框架更新的方法论节点。
查看原始来源 ↗
-
›字节 TRAE Work Design 模式:AI 识别设计系统组件库,自动生成 UI 稿并转代码
字节 TRAE 推出 Work Design 模式,可精准识别设计系统组件库,输入需求后自动生成 UI 设计稿并同步转代码,覆盖从设计到开发的完整工作流。
字节跳动 TRAE 推出 Work Design 模式,量子位对此进行实测。该模式的核心能力是识别用户已有的设计系统组件库,在接收到需求描述后自动生成对应的 UI 设计稿,并同步输出可用代码,打通从界面设计到前端开发的链路。实测报告显示,组件识别精度与 UI 一致性是该模式的主要亮点。
将设计系统作为上下文输入、以 AI 自动完成设计到代码的转译,是将 AI 编程工具引入设计规范约束环境的一种实践方向,对 UI 工程化教学与组件驱动设计研究具有参考价值。
查看原始来源 ↗
-
›Taste Skill 开源「反平庸前端框架」:为 AI 生成界面注入设计品味
观点与技巧
2026-06-26
· 机器之心
Taste Skill 在 GitHub 获 51K 星,通过布局、排版、动效规则库为 AI 编程工具提供设计规范约束,旨在解决 Vibe Coding 同质化「AI 味」问题,提升 AI 辅助生成界面的视觉品质。
Taste Skill 是一个专为 AI 编程工具(如 Cursor、Copilot 等)设计的开源「反平庸前端框架」,在 GitHub 已获超过 51K 星。其核心思路是通过系统化的布局比例、字体排印、色彩搭配与微动效规则库,为 AI 生成的前端代码提供「品味约束」,从设计规范层面解决 Vibe Coding 产出同质化、缺乏视觉区分度的问题。相关报道由机器之心发布,具体文章链接以原出处为准。
以可复用规则库的形式将设计原则注入 AI 编码工具上下文,是将设计知识工程化的一种新路径,对界面设计与前端工程交叉方向的教学与研究有一定参照意义。
查看原始来源 ↗
-
›OpenAI GPT-5.6 有限预览发布:Sol 旗舰 / Terra 均衡 / Luna 轻量三档模型
模型与工具
2026-06-26
· OpenAI 官方 / VentureBeat / Axios / 量子位
深度分析 →
OpenAI 推出 GPT-5.6 三款模型的有限预览:Sol(旗舰)、Terra(均衡)、Luna(轻量),约 20 个组织受邀,Sol 已登顶 LMSYS 排行,预计数周内全量开放。
OpenAI 有限预览 GPT-5.6,含三档定位:Sol(旗舰,$5/$30 每百万输入/输出 token)、Terra(均衡,$2.5/$15)、Luna(轻量,$1/$6)。约 20 个受邀组织可提前访问,Sol 已登顶 LMSYS 竞技场排行。发布时间受美国政府 6 月 2 日 AI 安全合规行政令协调,全量开放时间预计在数周内。
作为边界条目(垂直艺术设计相关性为 3/5)收录:GPT-5.6 多模态视觉理解能力的提升将传导至以此为底层的 AI 设计工具;使用 OpenAI API 搭建教学辅助或科研工作流的老师,可参考 Sol/Terra/Luna 三档能力与价格梯度,在全量开放后评估是否调整底层模型配置。
查看原始来源 ↗
-
›第十届米兰设计周中国高校展颁奖+「AI + 艺术设计教育」教学创新论坛举办
展览与赛事
2026-06-26
· 米兰设计周官网
第十届米兰设计周中国高校设计学科师生优秀作品展颁奖典礼与「AI + 艺术设计教育」教学创新论坛同期举办,聚焦 AI 赋能艺术设计教学改革,与高校教师受众直接相关。
第十届米兰设计周中国高校设计学科师生优秀作品展颁奖典礼暨「AI + 艺术设计教育」教学创新论坛于 2026 年 6 月下旬举办,活动内容涵盖参赛高校学生作品颁奖及聚焦 AI 赋能艺术设计教学改革的专题论坛,面向高校艺术设计教师群体。
将国际设计赛事颁奖与 AI 教育教学论坛联动,是观察国内高校艺术设计学科如何回应 AI 融合议题的一个样本窗口。
查看原始来源 ↗
-
›国内 AI 视频赛道从「技术炫技」进入「商业化验证」阶段
观点与技巧
2026-06-26
· 新浪财经
字节 Seedance 2.5 与阿里 HappyHorse 1.1 同日亮相,可灵估值下调至 150 亿美元,Sand.ai 融资超亿美元——深度分析认为国内 AI 视频赛道正从「技术炫技」进入「商业化验证」阶段。
2026 年 6 月下旬,字节 Seedance 2.5 与阿里 HappyHorse 1.1 几乎同日发布,与此同时可灵估值从高点下调至约 150 亿美元,Sand.ai 完成超亿美元新一轮融资。新浪财经对上述动态进行深度分析,认为国内 AI 视频赛道的竞争重心已从模型能力演示转向可量化的商业场景落地——谁能在影视、广告、短视频平台等方向率先实现稳定的付费闭环,将决定下一阶段的格局走向。
生成式 AI 视频的技术迭代速度趋于收敛,商业化路径与产品化能力的差异正在取代参数指标,成为赛道玩家的核心竞争要素。
查看原始来源 ↗
-
›腾讯视频 WorkRally + 火龙漫剧:AI 全链路内容生产与「5–20 人创作小队」组织模式
案例与作品
2026-06-25
· DoNews / 新浪 / 腾讯新闻
腾讯视频发布 WorkRally 全链路 AI 内容生产平台,并披露火龙漫剧平台运营数据:5 个月产出 7 万部,40 万成本作品获 2000 万分账;提出「5–20 人 AI 创作小队」为 AI 时代主流生产力单元。
腾讯视频于 2026 年 6 月 25 日公布 WorkRally 平台及火龙漫剧平台的相关数据。WorkRally 覆盖剧本创作、分镜生成、视觉资产制作、协作管理全链路,据称漫剧版制作成本降低约 60%。火龙漫剧平台运营 5 个月内产出约 7 万部内容,有成本约 40 万元的作品实现约 2000 万元内容分账收益。腾讯视频将「5–20 人 AI 创作小队」定义为 AI 时代的主流内容生产力单元,区别于传统影视的百人以上制作规模。
「5–20 人 AI 创作小队」这一生产组织概念,对数字媒体、影视制作、动漫设计专业的师生具有较强的参照意义:它描述了一种 AI 重新分配内容生产规模效益的可能路径,也是当前行业在工作流与团队结构上的具体实验案例。
查看原始来源 ↗
-
›SIGGRAPH 2026 投稿:AI 秒级生成高精度数字浮雕(港城大 / 斯坦福 / 康奈尔联合研究)
研究与论文
2026-06-25
· techwalker.com
香港城市大学、斯坦福、康奈尔科技学院、德州大学奥斯汀联合研究,实现 AI 在秒级时间内生成高精度数字浮雕,相关成果已投递 SIGGRAPH 2026;目前为单一来源报道。
香港城市大学、斯坦福大学、康奈尔科技学院与德克萨斯大学奥斯汀分校联合研究团队发布成果,实现以 AI 模型在秒级推理时间内生成高精度数字浮雕,对数字雕塑、文创工艺品生产与艺术教学具有直接参考价值,已投递 SIGGRAPH 2026。
数字浮雕生成连接平面图像与三维工艺品制作的生产流程,秒级速度具备进入实际演示场景的潜力;注:目前为单一来源报道,建议以 arXiv 或 SIGGRAPH 2026 官方程序原文为准。
查看原始来源 ↗
-
›Qwen-Image-2.0-RL:阿里用强化学习训练 AI「审美」,图像生成 Elo 提升 78 分
研究与论文
2026-06-25
· 科技行者 / arXiv (2606.27608)
阿里 Qwen 团队发布 Qwen-Image-2.0-RL(arXiv:2606.27608),通过 GRPO 强化学习与在线策略蒸馏设计图文对齐、美感、肖像三类奖励模型,文生图 Elo 从 1115 升至 1193(+78),图像编辑 Elo 从 1256 升至 1349(+93)。
阿里 Qwen 团队发布 Qwen-Image-2.0-RL(arXiv:2606.27608),通过 GRPO 强化学习与在线策略蒸馏(OPD)构建三套奖励模型——图文对齐、美感、肖像——赋予图像生成模型更强的「审美判断」能力;技术方案含混合 CFG 策略、异步奖励管道与提示词筛选工程;文生图 Elo 从 1115 升至 1193(+78),图像编辑 Elo 从 1256 升至 1349(+93),在评测界属显著提升。
「用强化学习训练 AI 审美」的技术路径对艺术设计×AI 领域研究有直接方法论参考价值:如何定义可量化的「美感奖励」、如何让模型从人类偏好数据中习得审美判断,是生成式 AI 艺术研究的核心方法论问题;arXiv 全文适合研究生与教研方向师生作为前沿参考阅读。
查看原始来源 ↗
-
›ICML 2026 Spotlight:AI 图像审美对齐机制正在削弱生成内容的艺术多样性
研究与论文
2026-06-25
· 机器之心 / arXiv:2512.11883
「ICML 2026 Spotlight 论文指出,HPS 等 AI 图像审美评分系统的对齐机制正在削弱生成图像的艺术多样性,越符合评分标准的图像越缺乏表现力」
ICML 2026 Spotlight 论文(arXiv:2512.11883)系统研究了 AI 图像生成模型审美对齐机制的副作用:以 HPS(Human Preference Score)等审美评分体系为优化目标的训练过程,会导致生成图像趋向「高分但单一」的同质化审美,而牺牲图像的艺术表现力与多样性。研究结论指出,「越符合评分标准的图越缺乏表现力」。
对 AI 生成图像的评估指标与实际艺术价值之间的系统性矛盾进行了实证研究,是批判性审视当前 AI 图像生成技术路线的重要参照文献。
查看原始来源 ↗
-
›影眸 Hyper3D Rodin Gen-2.5 发布:首个「先思考再生成」机制的原生 3D 大模型
★ 编辑推荐
模型与工具
2026-06-25
· 新智元
深度分析 →
影眸科技发布 Hyper3D Rodin Gen-2.5 并完成数亿元融资,首创五档思考深度机制(约 4–80 秒),支持千万面级几何、12K 原生贴图、3D ControlNet、自然语言局部编辑与递归分件,Unity/Blender/Unreal 等 DCC 全面接入。
2026 年 6 月,影眸科技(Hyper3D)发布 Rodin Gen-2.5,将语言模型「先思考再生成」的推理机制引入 3D 生成领域:提供五档思考深度(约 4 秒至 80 秒),用户可按需在速度与精度间取舍;几何精度达千万面级(10M+ 多边形),并同步推出 12K 精度原生 3D 贴图模型;支持 3D ControlNet 精确控制几何形态、自然语言局部编辑与递归分件;Unity、Blender、Unreal 等主流 DCC 工具均已接入,并提供 fal.ai API 与企业部署选项。同步宣布完成数亿元人民币新融资,由凯辉基金与上海国投先导领投。
将「先思考再生成」机制延伸至 3D 生成,并以千万面级几何与 12K 贴图推进生产级精度,标志着 AI 3D 生成从演示原型向专业制作管线迈进,对影视、游戏与工业设计教学中 AI 辅助三维资产生产的研究与实践具有直接参照价值。
查看原始来源 ↗
-
›2026 中韩 AI 艺术作品国际邀请展在河北美术学院开幕:327 件作品,中韩战略合作协议同期签署
展览与赛事
2026-06-25
· 河北美术学院官网
2026 中韩 AI 艺术作品国际邀请展于 2026-06-25 在河北美术学院开幕,河北美院联合韩国空间设计学会、弘益大学 MR 媒体实验室主办,展出中韩等多国艺术家 327 件 AI 艺术作品,涵盖 AI 生成、沉浸式空间设计与数字媒体艺术。
2026 中韩 AI 艺术作品国际邀请展于 2026-06-25 在河北美术学院开幕,由河北美术学院联合韩国空间设计学会、弘益大学 MR 媒体实验室主办,展出来自中韩等多国艺术家的 327 件 AI 艺术作品,涵盖 AI 生成、沉浸式空间设计与数字媒体艺术等形式;展览同期促成中韩双方签署战略合作协议。
国内美术院校与韩国顶级设计院校联合主办大规模 AI 艺术国际邀请展,是高校 AI 艺术合作国际化的阶段性节点;327 件参展作品的规模为了解当前国际 AI 艺术创作动态提供了密集截面,相关院系可跟进作为教学参考资源。
查看原始来源 ↗
-
›Adobe 宣布收购 AI 图像与视频增强公司 Topaz Labs
★ 编辑推荐
模型与工具
2026-06-25
· Adobe 官方 / TechCrunch / Variety / PetaPixel
深度分析 →
Adobe 宣布收购曾获艾美奖的 AI 图像与视频增强公司 Topaz Labs,其旗舰模型 Astra(视频超分)与 Wonder(图像增强)将整合进 Firefly 及 CC 全系产品;Neurostream 技术可在消费级设备本地运行大型 AI 模型;交易预计 2026 年下半年完成,Topaz 现有工具同期保持独立可用。
2026 年 6 月 25 日,Adobe 宣布收购 AI 图像与视频增强公司 Topaz Labs。Topaz Labs 旗下核心产品包括视频超分模型 Astra 与图像增强模型 Wonder,其 Video AI 产品曾于 2024 年获得艾美奖。本次收购完成后,两款模型将整合至 Firefly 生态及 Creative Cloud 全系应用;公司自研的 Neurostream 技术可在消费级 GPU 上本地运行大型 AI 模型,有望降低高质量 AI 增强的硬件门槛。交易预计于 2026 年下半年完成,Topaz Labs 现有独立工具在此期间继续正常运营。
专业级视频超分与图像增强能力并入 Adobe 生态,意味着此前依赖独立工具的后期增强工作流或将原生化,对视频制作、摄影与视觉传达领域的 AI 辅助后期流程具有直接参照意义。
查看原始来源 ↗
-
›SIGGRAPH 2026 Art Papers 录用名单公布,主题「创作性翻译的复杂性」
研究与论文
2026-06-24
· SIGGRAPH 2026 官方
SIGGRAPH 2026 Art Papers 录用名单已公布,主题为「The Creative Complexities of Translation」,入选论文发表于 PACMCGIT 特刊,覆盖艺术×科学×技术交叉研究,有别于早先公布的 Art Gallery 入选;大会于 7 月 19–23 日在洛杉矶举行。
SIGGRAPH 2026 于 2026 年 6 月 24 日公布 Art Papers 录用名单,本届主题为「The Creative Complexities of Translation」(创作性翻译的复杂性);入选论文将发表于 ACM 期刊 PACMCGIT 特刊;Art Papers 是 SIGGRAPH 专设的艺术×科学×技术交叉研究发表通道,与 5 月已公布入选的 Art Gallery(展览作品)为不同项目;大会将于 2026 年 7 月 19–23 日在洛杉矶举行。
SIGGRAPH Art Papers 是 AI 艺术与计算创作研究的重要学术发表渠道,「创作性翻译」主题指向跨媒介、跨文化的创作转化问题,与 AI 辅助多语言及多模态艺术创作研究高度相关,录用名单可作为追踪艺术×技术交叉前沿方向的参考。
查看原始来源 ↗
-
›PQSG:首个系统评估 AI 视频物理一致性的基准,揭示 Sora 2 / Veo 3 的系统性短板
研究与论文
2026-06-24
· arXiv (2606.25306) / TechWalker
北卡罗来纳大学、Johns Hopkins、AI2 与德克萨斯大学奥斯汀联合发布 PQSG 评估体系(arXiv:2606.25306),首次系统评估 AI 视频生成模型的物理一致性,覆盖刚体动力学、流体模拟、软体变形,揭示主流视频模型的系统性物理短板。
北卡罗来纳大学、Johns Hopkins、AI2 与德克萨斯大学奥斯汀联合发布 PQSG(物理问题场景图)评估体系(arXiv:2606.25306,2026-06-24),首次系统评估 AI 视频生成模型的物理一致性,覆盖刚体动力学、流体模拟、软体变形三大场景,对 Sora 2、Veo 3 等商业主流模型进行了定量评分,揭示现有视频模型在物理场景上存在系统性不足。
了解 AI 视频工具的物理局限,是在课堂中准确设定工具边界的前提:动画、影视、游戏方向的师生在用 Sora 2、Veo 3 制作含流体或刚体运动内容时,可参考 PQSG 指出的具体失效场景,避免将模型缺陷当作设计意图;该评估方法本身也是「批判性使用 AI 工具」教学单元的优质素材。
查看原始来源 ↗
-
›Figma Config 2026:Motion 原生动效时间轴、Code Layers 双向同步、Design Agent MCP Connectors
★ 编辑推荐
模型与工具
2026-06-24
· Figma Blog / CMSWire / 优设
深度分析 →
Figma Config 2026 发布三项核心更新:画布内原生动效时间轴 Figma Motion(含 AI Agent 生成动效,当日 Open Beta)、设计与代码双向同步的 Code Layers,以及接入 Notion / Slack / GitHub 等 14+ 工具的 Design Agent MCP Connectors。
2026 年 6 月 24 日,Figma 在 Config 2026 大会上发布三项核心更新。① Figma Motion:在设计画布内原生集成动效时间轴,支持关键帧动画、弹簧动效与 AI Agent 直接生成动效,可导出 MP4、WebM、GIF、SVG 格式,当日开放 Open Beta;② Code Layers:实现设计稿与代码层的双向同步,设计修改可自动映射到对应代码,计划 7 月进入早期访问阶段;③ Design Agent MCP Connectors:设计 Agent 新增对接 Notion、Slack、GitHub、Atlassian、Hex 等 14+ 外部工具的 MCP 连接器,并支持将常用工作流封装为可复用的「Skills」指令。此次更新附赠 3D 变换与 Shaders 功能。
Figma 将动效制作从专用工具(After Effects、Rive 等)拉回设计主画布,同时以 MCP 打通外部协作工具链,进一步收紧了「设计→动效→交付」全流程;对开设 UI/UX、交互设计或产品设计课程的师生,这批更新值得在课程工具链中跟进评估,Figma Motion Open Beta 可即时体验。
查看原始来源 ↗
-
›Kyutai+UC Berkeley 预印本系统质疑 FID 指标:AI 图像生成评测可靠性存疑
研究与论文
2026-06-24
· Kyutai / UC Berkeley / 腾讯新闻
Kyutai 与 UC Berkeley 联合预印本(arXiv:2606.20536)对 AI 图像生成常用评测指标 FID 的可靠性提出系统性质疑,指出不同评测环境下结论相互矛盾,「最强」排名可能依赖了一个有缺陷的指标。
法国 Kyutai 与加州大学伯克利分校联合发布预印本(arXiv:2606.20536),对 AI 图像生成领域最常用的评测指标 FID(Fréchet Inception Distance)提出系统性质疑。研究指出,在不同评测环境与参数设置下,同一方法的 FID 结论存在相互矛盾的情况,当前部分「最强」方法的排名可能建立在一个存在缺陷的指标基础上,对现有研究结论的可信度构成方法论层面的挑战。
对 AI 图像生成的研究者与学习者而言,该研究提示在阅读和引用相关论文时需批判性审视 FID 排名,不宜以其高低作为方法优劣的单一依据。
查看原始来源 ↗
-
›FastWan-QAD 开源:单卡 RTX 5090 端到端 1.8 秒生成 5 秒 480P 视频
模型与工具
2026-06-24
· foxnan.com
Sky Computing Lab 开源 FastWan-QAD 量化感知蒸馏方案,单卡 RTX 5090 端到端 1.8 秒生成 5 秒 480P 视频,较标准版显著降低硬件门槛,模型与代码已完整开源。
Sky Computing Lab 于 2026 年 6 月 24 日开源 FastWan-QAD(量化感知蒸馏)方案,针对 Wan 系列视频生成模型进行轻量化优化:在单张 RTX 5090 显卡上可实现端到端 1.8 秒生成 5 秒 480P 视频,相较标准版本大幅降低了对高端多卡配置的硬件依赖;模型权重与推理代码均已完整开源,可直接用于本地部署。
大幅压缩推理延迟与硬件门槛的开源方案,是 AI 视频生成向更低成本个人与教学环境延伸的代表性案例;对需要本地运行视频生成工作流、控制硬件成本的研究与教学场景有直接参考价值。
查看原始来源 ↗
-
›ComfyUI v0.26.0 发布:一次接入 Krea 2、Boogu-Image、Qwen3-VL 三大开源模型
★ 编辑推荐
模型与工具
2026-06-24
· ComfyUI 官方
深度分析 →
ComfyUI v0.26.0 在单次版本更新中同时接入 Krea 2(12B DiT 开源图像模型,含 Raw/Turbo 两版)、Boogu-Image(Qwen3-VL-8B 编码器)、Qwen3-VL(4B/8B),并新增 Load3DAdvanced 3D 节点与 LTX2 视频上下文采样支持,工作流模板升至 0.9.26。
2026 年 6 月 24 日,ComfyUI 发布 v0.26.0 版本,在单次更新中同时接入三个新开源模型:Krea 2(提供 Raw 与 Turbo 两个权重变体,Raw 版适合 LoRA 微调训练,Turbo 版支持 8 步蒸馏推理)、Boogu-Image(采用 Qwen3-VL-8B 作为文本编码器,配套 TextEncodeBooguEdit 节点支持局部图像编辑)以及 Qwen3-VL(4B 与 8B 两档,支持文本生成与图像理解);同时新增 Load3DAdvanced 3D 网格加载节点、LTX2 视频上下文窗口采样器,工作流模板版本升至 0.9.26。
ComfyUI 以单次版本更新接入三个最新开源模型,延续了其作为开源生成生态聚合枢纽的角色——用户升级版本即可本地获取多个最新模型的运行能力,是当前开源图像与视频工作流可及性持续下沿的直接体现。
查看原始来源 ↗
-
›Adobe Firefly Partner Models 全面开放:CC 全系内置 30+ 第三方行业模型
★ 编辑推荐
模型与工具
2026-06-24
· Adobe 官方 / Creative Bloq / AWN
Adobe 将 30+ 第三方行业模型内置进 Creative Cloud 全系(Firefly / Express / Photoshop / Illustrator 等),含 Kling 3.0、Veo 3.1、FLUX.2、Runway Gen-4.5、Luma、ElevenLabs 等,现有 CC 订阅即可调用、无需额外付费。
2026 年 6 月 24 日,Adobe 将「Partner Models(合作模型)」体系在 Creative Cloud 全系产品(Firefly、Express、Photoshop、Illustrator 等)中全面开放:用户可在 Adobe 应用内直接调用 30+ 个第三方行业模型,涵盖图像、视频、音频、语音等模态,包括 Kling 3.0 Omni、Nano Banana 2、Veo 3.1、Runway Gen-4.5、FLUX.2[pro]、Luma Ray、ElevenLabs、GPT Image、Ideogram、Pika、Topaz 等;现有 Creative Cloud 订阅即可使用,无需额外付费。该体系独立于同期 Photoshop 生成填充接入 FLUX Kontext 的更新,是 Adobe 把多家前沿模型聚合进自有工具链的一次系统性开放。
专业设计工具从「单一自有模型」转向「聚合多家第三方模型」的中枢,意味着教师在 Photoshop / Illustrator 教学中可直接接触并比较主流生成模型,相关课程的工具链组织方式值得据此更新。
查看原始来源 ↗
-
›字节 Seeddream 5.0 Pro:交互式精准编辑与多图层分离输出,对接 PSD 工作流
模型与工具
2026-06-23
· ChooseAI
字节跳动于 FORCE 大会(6 月 23 日)发布 Seeddream 5.0 Pro,新增箭头/圈选直接标注的交互式精准编辑、多图层分离输出(可直接对接 PSD 工作流)及 10 余种语言原生文字生成,与 Seedance 2.5 构成图像→视频完整工业化链路。
字节跳动于 2026 年 6 月 23 日 FORCE 大会发布 Seeddream 5.0 Pro,新增三项主要能力:交互式精准编辑(支持在图像上直接以箭头标注或圈选区域的方式指定编辑目标,精确到局部内容);多图层分离输出(生成结果可按图层独立导出,直接对接 Photoshop PSD 工作流进行后期精修);以及 10 余种语言的原生文字生成能力,拓展多语言内容制作场景。Seeddream 5.0 Pro(图像)与此前发布的 Seedance 2.5(视频生成)共同构成字节在生成式视觉创作领域的图像→视频完整工业化链路。
图层分离输出与交互式局部标注编辑,将 AI 图像生成结果直接纳入专业后期管线,对「AI 生成→后期精修」教学工作流的演示与实践具有参考价值。
查看原始来源 ↗
-
›豆包 Seedance 2.5 发布:30 秒原生直出、50 素材联合生成、局部一致性编辑
★ 编辑推荐
模型与工具
2026-06-23
· 火山引擎 / 机器之心 / 量子位 / 36氪 / AIbase
深度分析 →
火山引擎在 FORCE 大会发布 Seedance 2.5,首次实现 30 秒原生单段直出和 50 个全模态素材联合生成,同步发布图像模型 Seedream 5.0 Pro 和音频模型 Seed-Audio 1.0。
火山引擎于 2026 年 6 月 23 日在 FORCE 大会(北京)发布 Seedance 2.5,核心能力包括:30 秒原生单段直出(非拼接)、同时输入最多 50 个全模态素材进行联合生成、以及画面局部一致性编辑(仅改变指定区域而不影响其余帧);ByteDance 直接从 2.0 跳号至 2.5,以版本命名强调代际差异;同步发布 Seedream 5.0 Pro 图像模型(输出可编辑分层设计图)和 Seed-Audio 1.0 音频模型(据介绍支持 0 样本多角色对白与拟音生成,具体能力以官方说明为准);4+ 中英文源同日报道。
30 秒原生直出是现阶段视频生成时长的显著突破,与图像、音频三模态同场发布代表国产生成式 AI 向统一内容创作管线方向的集中布局;Seedream 5.0 Pro 的分层设计图输出可直接接入 Figma / Photoshop 设计工作流。
查看原始来源 ↗
-
›字节 Seed-Audio 1.0:零样本多模态参考生成人声、音效与 BGM 全要素
模型与工具
2026-06-23
· 新华网
字节跳动于 FORCE 大会(6 月 23 日)发布 Seed-Audio 1.0,支持零样本多模态参考生成人声、音效与 BGM 全要素,可输出多角色对白与拟音,单次时长达 2 分钟并可延伸至数十分钟。
字节跳动于 2026 年 6 月 23 日 FORCE 大会发布 Seed-Audio 1.0,该模型支持以零样本(zero-shot)多模态参考一次性生成人声、音效与背景音乐(BGM)全要素,可处理多角色对白场景与拟音需求,单次生成时长可达 2 分钟,并支持延伸至数十分钟的长内容输出;主要面向影视内容配音后期、有声书与播客等音频制作场景。
覆盖人声、音效与 BGM 三类要素的一体式多模态音频生成,将过去需要多工具协作的音频后期流程整合为单一入口,对影视制作与内容创作教学中 AI 音频工具的应用提供了新的能力参照。
查看原始来源 ↗
-
›Krea 2 技术报告:开源 12B DiT 图像模型,明确不使用 AI 生成图像预训练
模型与工具
2026-06-23
· Krea AI 官方
Krea 发布 Krea 2 技术报告,推出 Raw(LoRA 微调基座)与 Turbo(8 步推理,约 2 秒生成)两个开放权重变体,明确训练数据中不使用 AI 生成图像,采用商业友好许可,ComfyUI v0.26.0 于发布当日接入。
Krea AI 于 2026 年 6 月 23 日发布 Krea 2 开源图像模型技术报告,提供两个开放权重变体:Krea-2-Raw(未蒸馏基座版,适合训练 LoRA)与 Krea-2-Turbo(8 步蒸馏推理版,可在约 2 秒内生成高分辨率图像);模型采用单流 Diffusion Transformer 架构,以 Qwen 3 VL 多层特征聚合作为文本编码器、Qwen Image VAE 与 FLUX 2 VAE 为自编码器;官方技术报告明确预训练数据中不包含 AI 生成图像,并自建分类器进行过滤;权重发布于 HuggingFace,代码开源于 GitHub,采用宽松商业许可,ComfyUI v0.26.0 于发布当日完成原生接入。
在合成数据被广泛用于训练的当下,Krea 2「不使用 AI 生成图像预训练」的数据立场及「反审美同质化」定位,为讨论开源图像模型训练路线与风格多样性提供了具体参照;开放权重与 ComfyUI 原生支持使其可直接本地部署。
查看原始来源 ↗
-
›字节跳动豆包 2.1 Pro 发布:Coding/Agent 能力提升,多模态视觉理解评测领先
模型与工具
2026-06-23
· 新华网 / 量子位 / 多源
字节跳动发布豆包 2.1 Pro,Coding 与 Agent 能力较前代显著提升、对标旗舰级模型,并在多模态视觉理解评测集上保持领先,可作为设计与创作场景的多模态工作底座。
2026 年 6 月 23 日,字节跳动发布豆包 2.1 Pro。据新华网、量子位等报道,该版本在 Coding 与 Agent 能力上较前代有显著提升、对标旗舰级模型,并在多模态视觉理解的多项评测集上保持领先表现。对设计与内容创作场景而言,其多模态视觉理解能力可作为图像理解、素材分析等任务的底座。
通用大模型在多模态视觉理解上的持续走强,意味着「看图理解 + 推理」类能力正成为设计创作工作流的通用底座;其在教学与研究中的实际表现,值得以具体任务做对照评估。
查看原始来源 ↗
-
›可口可乐中国世界杯营销全面 AI 化:5 人 5 城 TVC 全由 Prompt 生成,范志毅数字人 2 秒实时互动
★ 编辑推荐
案例与作品
2026-06-23
· 量子位 / 优设
深度分析 →
可口可乐中国 2026 世界杯限定版 TVC 5 人 5 城场景全由 Prompt 生成(操盘方百度一镜),范志毅数字人实现 2 秒端到端实时互动,是顶级国际品牌世界杯广告预算被 AI 替代的直接落地案例。
2026 FIFA 世界杯期间,可口可乐中国限定版 TVC 全面采用 AI 生成:5 名真实演员、5 个城市场景的画面均从文字 Prompt 生成(操盘方为百度一镜,原慧播星),实现导演级运镜一致性;同步推出范志毅 AI 数字人,支持 2 秒端到端实时互动,涵盖上海话方言、当下热梗和情绪感知;据媒体转述(未独立核实),英文侧可口可乐另与 Footballco 合作、由 Jose Mourinho 数字人在 TikTok / Instagram 产出 200+ AI 生成内容,与中国案例为两条独立 AI 营销线。
国际 A 类品牌在全球最贵广告位(世界杯 TVC)上将生产流程全面切换至 AI Prompt 生成,是品牌设计和广告行业真实落地的标志性案例,直接影响广告设计、品牌营销和影视制作专业的职业预期判断。
查看原始来源 ↗
-
›Adobe Photoshop 生成填充引入 FLUX Kontext 与 Google Gemini 作为伴侣模型
★ 编辑推荐
模型与工具
2026-06-23
· RedSharkNews / PRONEWS / CreativeBloq
Adobe CC 6 月 23 日周次更新:Photoshop 生成填充新增 FLUX Kontext 和 Google Gemini 作为可选伴侣模型,Generative Upscale 新增 Topaz Gigapixel 选项,After Effects AI 转描工具同步重构。
Adobe Creative Cloud 于 2026 年 6 月 20–23 日发布周次更新,核心变化包括:Photoshop 生成填充功能首次引入 FLUX Kontext 和 Google Gemini 作为可选伴侣模型,用户可在 Adobe 自有模型之外切换第三方开源或商业模型;Generative Upscale 新增 Topaz Gigapixel 和 Bloom 作为可选引擎;After Effects AI 转描(Rotoscoping)工具进行重构;Lightroom AI 智能筛片功能同步更新;三家以上英文媒体源核认。
开源模型 FLUX Kontext 首次作为伴侣模型进入 Photoshop 核心工具(生成填充),标志着 Adobe 开始向开放模型生态开放其主力工作流入口,是设计工具与开源 AI 模型融合进程的重要节点。
查看原始来源 ↗
-
›WAIC 2026 SAIL 奖 TOP30 及青年优秀论文 TOP20 发布
研究与论文
2026-06-22
· 机器之心 / 新浪 / WAIC 官网
WAIC 2026(7 月 17–20 日,上海)发布 SAIL 奖 TOP30 及青年优秀论文 TOP20,计算机视觉、具身智能、AI 创作方向均有入围,首次自举办顶级学术分会 WAIC Academic。
世界人工智能大会(WAIC 2026)于 2026 年 6 月 22 日发布 SAIL 奖 TOP30 入围名单及青年优秀论文 TOP20,涵盖计算机视觉、具身智能、AI 创作等方向;本届大会将于 7 月 17–20 日在上海举办,并首次自行举办高水平学术分会 WAIC Academic,三家以上媒体源核认。
SAIL 奖和青年论文榜单是观察中国 AI 研究前沿方向与新锐研究者的年度参照之一,AI 创作方向入围说明该领域在学术层面获得持续认可。
查看原始来源 ↗
-
›全球首部工业级全 AI 中国经典 IP 动画剧集:华策×Utopai《西游记:失落的五百年》
★ 编辑推荐
案例与作品
2026-06-22
· Variety / Deadline / Business Wire / IT之家
深度分析 →
华策影视与 Utopai Studios 联合宣布《西游记:失落的五百年》,采用 Utopai 第二代 PAI 平台全流程制作,被定位为全球首部工业级全 AI 中国经典 IP 动画剧集,第一季定向全球流媒体与广播发行。
2026 年 6 月 22 日,华策影视与 Utopai Studios 正式宣布联合制作动画剧集《西游记:失落的五百年》。该项目以西游记经典 IP 为基础,采用 Utopai 第二代 PAI(Production AI)平台全流程制作,被 Variety、Deadline、Business Wire 等多家英文媒体定位为全球首部工业级全 AI 制作的中国经典 IP 动画剧集。发行层面,华策持有国内发行权,Utopai 持有海外发行权;第一季内容定向全球流媒体平台及广播渠道,后续计划拓展院线系列。
此案例将「全 AI 工业流水线」与「成熟 IP + 大型制作公司合作」两个维度首次结合落地为已宣布发行的商业项目,区别于此前多数 AI 动画的短片或概念验证性质;对影视、动画、数字媒体方向的师生而言,其制作流程与发行模式均具有较高的行业参考价值。
查看原始来源 ↗
-
›同济大学新增艺术设计学—人工智能双学位复合型人才培养项目
观点与技巧
2026-06-22
· 康石石
同济大学正式新增艺术设计学与人工智能双学位复合型人才培养项目,是国内顶尖工科高校在 AI 与艺术设计交叉培养方向的明确战略信号。
同济大学于 2026 年 6 月 22 日前后正式宣布新增艺术设计学—人工智能双学位复合型人才培养项目,面向在校本科生开放选拔,旨在培养同时具备艺术设计创作能力与 AI 工程素养的复合型人才;消息由艺术院校升学顾问康石石最早披露,属国内顶尖工科院校在该交叉方向的代表性政策动向。
同济在 AI 与艺术设计交叉培养方向的明确布局,对正在考虑修订培养方案或开设交叉课程的其他院系具有参照意义;也是撰写相关教改项目申报书时可引用的同类院校案例。
查看原始来源 ↗
-
›阿里 HappyHorse 1.1 升级五维度,同步开启 Horsepower AI 影像大赛
模型与工具
2026-06-22
· 量子位
阿里 HappyHorse 1.1 版本升级动态表现力、9 图角色一致性、复杂场景指令、视觉质感和音频口播五个维度,同步宣布启动 Horsepower AI 影像大赛(张纪中评委)。
阿里于 2026 年 6 月 22 日发布 HappyHorse 1.1 版本更新,在五个维度进行了针对性提升:动态表现力、9 张图像角色一致性、复杂场景指令遵循、视觉质感和音频口播能力;同步宣布启动 Horsepower AI 影像大赛,邀请著名影视制作人张纪中出任评委之一。
HappyHorse 在角色一致性和复杂场景指令方向的持续升级,对关注国产视频生成模型能力演进或正在评估 AI 视频工具用于教学实验的师生有参照意义。
查看原始来源 ↗
-
›Google DeepMind 与 A24 建立 AI 研究合作并投资约 7500 万美元,Google 首次持股电影公司
★ 编辑推荐
案例与作品
2026-06-22
· Google DeepMind Blog / Variety / IndieWire / 多源
深度分析 →
Google DeepMind 宣布与独立电影公司 A24 建立 AI 研究合作并投资约 7500 万美元,DeepMind 研究员将与 A24 主创并肩开发 AI 分镜与工作流工具,这是 Google 首次持股电影公司。
Google DeepMind 于 2026 年 6 月 22 日宣布与独立电影公司 A24(《瞬息全宇宙》《Midsommar》出品方)建立 AI 研究合作,并以权益投资形式注资约 7500 万美元,这是 Google 首次持股电影公司;合作为非排他性,DeepMind 研究员将与 A24 主创并肩测试、迭代、开发面向创作者的 AI 分镜生成与制片工作流工具(驻场程度以官方「并肩」协作表述及后续为准),首个项目与 A24 即将上映的《The Backrooms》系列制作相关;A24 明确表示新工具不以降本或提速为核心卖点,而是服务于创作者的叙事表达;Variety、IndieWire、Deadline、Hollywood Reporter 等 9+ 媒体源同日报道。
顶级 AI 实验室以「嵌入制片流程」而非「提供 API」的方式进入创意制作,标志着 AI 与艺术创作机构关系模式的实质升级;AI 分镜工具的专业化落地,对影视、动画、插画等方向的教学实践具有直接参照价值。
查看原始来源 ↗
-
›央美 2026 本科毕业展收官:8 院系作品涵盖数码媒体与 AI 辅助创作
案例与作品
2026-06-22
· 央美美术馆
中央美术学院 2026 年本科毕业展于 6 月 22 日收官,8 个院系作品涵盖数码媒体、空间装置等方向,AI 辅助创作引发广泛关注。
中央美术学院 2026 年本科毕业展于 6 月 22 日正式收官,覆盖设计、建筑、数字媒体等 8 个院系,展出作品涵盖数码媒体艺术、空间装置、交互设计等多个类型,其中 AI 辅助创作作品在多个院系中均有呈现并引发讨论;同日,由一山主编的《数智艺术论》在央美美术馆同步首发。
顶尖艺术院校毕业展是观察下一代创作者如何实际运用 AI 的最直接窗口,也是教学成果与行业期待之间碰撞的真实场域。
查看原始来源 ↗
-
›2026 AI 设计工具全收录:按使用场景分类整理
观点与技巧
2026-06-22
· AI工坊pro
AI工坊pro 发布 2026 年 AI 设计工具全收录,按图像、视频、3D、UI 等使用场景分类整理,覆盖当前主流工具生态。
AI 工坊 pro 于 2026 年 6 月 22 日前后发布 2026 年 AI 设计工具全收录,按图像生成、视频生成、3D 建模、UI 设计、排版辅助等使用场景对当前主流 AI 设计工具进行分类整理,并附基本功能和适用场合说明,旨在帮助设计师和学生快速定位适合自身需求的工具。
按场景分类的工具合集,适合作为工作营开幕第一课的工具导览参考,也可直接用于课程教材的工具栏更新。
查看原始来源 ↗
-
›SIGGRAPH 2026 前沿预热:多篇中文解读密集放出,AI「全面入侵」大会
研究与论文
2026-06-21
· 内核观察 / 哲思哲言 / 深圳大学
SIGGRAPH 2026 开幕前夕,国内多个技术媒体和高校研究团队集中放出中文深度解读,覆盖从芯片到像素的 AI 全链路渗透格局。
2026 年 6 月 21 日前后,内核观察、哲思哲言、深圳大学可视计算研究中心等三家以上来源集中发布 SIGGRAPH 2026 预热解读文章,梳理本届大会在图形学、AI 生成、神经渲染等方向的研究布局,将本届 SIGGRAPH 定性为「从芯片到像素 AI 全面入侵的大会」,多篇文章从不同角度拆解技术前沿格局。
SIGGRAPH 是计算机图形学与 AI 生成视觉的最重要学术会议,中文深度解读的集中出现,为关注国际前沿研究但阅读英文原文有障碍的师生提供了便捷的参考入口。
查看原始来源 ↗
-
›Palmier Pro 开源 macOS 视频编辑器:内置 Seedance / Kling 等,支持 MCP 与 AI Agent 协作
模型与工具
2026-06-21
· 腾讯云 / 机器之心 / oschina / CSDN
YC S24 团队开源 Palmier Pro macOS 视频编辑器,时间线内集成 Seedance、Kling、Nano Banana,并通过 MCP 服务器与 Claude、Codex、Cursor 等 AI Agent 无缝协作。
由 YC 2024 年夏季批次团队开发的 Palmier Pro 于 2026 年 6 月 21 日前后开源,这是一款 macOS 原生视频编辑器,在时间线内集成了 Seedance、Kling、Nano Banana 等视频生成模型,并通过内置 MCP(Model Context Protocol)服务器与 Claude、Codex、Cursor 等 AI Agent 无缝协作;中文技术社区于 6 月 23 日起展开大量讨论,四家以上媒体源核认。
将 AI Agent 协作与视频生成管线整合进桌面编辑器,是「AI 原生创作工具」形态的典型探索;对关注 AI 工具链整合或正在研究 MCP 生态的师生具有直接的实验参考价值。
查看原始来源 ↗
-
›广东财经大学发布 2026 年 AI 艺术设计微专业招生方案
观点与技巧
2026-06-21
· 广东财经大学
广东财经大学正式发布 2026 年 AI 艺术设计微专业招生方案,是国内高校在 AI 与艺术设计交叉方向设置微专业的又一落地案例。
广东财经大学于 2026 年 6 月 21 日前后正式发布 2026 年 AI 艺术设计微专业招生方案,该微专业面向在校本科生开放,系统覆盖 AI 视觉生成、AI 辅助设计工作流及数字内容创作等方向,是国内高校将 AI 融入艺术设计教育体系的具体落地案例之一。
微专业的设立路径和课程框架,对正在评估本校是否开设类似项目的教学管理部门具有参考价值;亦可关注后续课程模块的公开信息作为教学设计参考。
查看原始来源 ↗
-
›xAI 推出 Grok for Office 插件,进入 Word / PowerPoint / Excel
模型与工具
2026-06-20
· xAI News
xAI 推出免费 Grok for Office 插件,进入 Word/PPT/Excel。
xAI 发布免费 Microsoft 365 插件,可在 Word/PPT/Excel 里整理笔记、改写文本、搜网页、生成图表,并能连接 SharePoint、Google Drive 等外部来源。
进入办公场景的免费工具,可用于整理与生成;与微软 Copilot 边界模糊,可作为「AI 进办公场景」的对比观察点。
查看原始来源 ↗
-
›Dataland:全球首座 AI 艺术博物馆在洛杉矶开幕
展览与赛事
2026-06-20
· The Art Newspaper / Artnet News / NPR / Google Blog
全球首座 AI 艺术博物馆 Dataland 在洛杉矶开幕,AI 生成艺术从实验室与网络走向机构化展陈。
由艺术家 Refik Anadol 联合创立、Google 提供技术支持的 Dataland 博物馆于 6 月 20 日在洛杉矶 The Grand LA(弗兰克·盖里设计建筑)正式开幕,占地 2,300 平方米,首展「机器之梦:雨林」以大规模 AI 生成影像沉浸呈现——数据集采集自全球 16 片雨林,并与史密森尼博物馆、康奈尔鸟类学实验室、盖蒂等机构合作建库;观众佩戴生物特征腕带,实时数据参与影像生成。
这是 AI 艺术史上首座专为 AI 生成艺术而建、面向公众常态运营的博物馆,标志着 AI 创作从实验室与网络走向机构化展陈。其策展方法、观众生物特征与影像生成的交互机制、以及基于伦理数据采集的大规模 AI 沉浸装置实践,都是研究 AI 艺术社会角色或筹备装置/展览方案的一手参考案例。
查看原始来源 ↗
-
›ComfyUI v0.25.1 发布,Kling V3-Turbo 正式接入
模型与工具
2026-06-20
· CSDN / AI认知工坊
ComfyUI v0.25.1 正式发布,核心更新为 Kling V3-Turbo 节点接入,并附入门指南,进一步扩展视频生成工作流能力。
ComfyUI 于 2026 年 6 月 20 日前后发布 v0.25.1 版本,核心更新为正式接入 Kling V3-Turbo 视频生成节点,支持在 ComfyUI 工作流内直接调用 Kling 的 Turbo 模式生成视频;发布方同步提供入门配置指南,降低接入门槛。此前 v0.23.0(6 月 1 日)已引入 NVIDIA PixelDiT 和 Microsoft Lens 支持。
Kling V3-Turbo 进入 ComfyUI 节点生态,意味着视频生成已可与图像后期处理管线深度串联,对教授完整 AI 创作工作流的课程设计具有实际参考价值。
查看原始来源 ↗
-
›宝玉迭代 baoyu-design Skill:支持 AI 配图并导出 PPTX
观点与技巧
2026-06-20
· 宝玉(@dotey)
宝玉迭代 baoyu-design:支持 AI 配图并导出 PPTX。
baoyu-design Skill 更新,可在做 PPT、动画或网站时调用 AI 生图配图,并能连同图片一起导出为 PPTX 在 PowerPoint/Keynote 二次编辑;作者用「自己用→发现问题→让 Agent 分析→更新 Skill」的纯对话循环打磨。
对快速出课件、作品集排版有实用价值;其「对话式迭代打磨工具」的方法本身也值得借鉴。
查看原始来源 ↗
-
›Humanize PPT v0.9:为「演讲」而生的开源 PPT Skill
观点与技巧
2026-06-19
· 卡尔的AI沃茨 / GitHub
Humanize PPT v0.9:为『演讲』而生的开源 PPT Skill。
用 AST(Audience/State/Transfer)逻辑重排大纲、先出 4 张真实预览页、把图片与生成 prompt 写进大纲,并新增质检自动修复渲染问题、支持演讲备注模式;已开源。
把 PPT 从「好看」做到「能讲」,对讲座、答辩、课程汇报场景实用,也是「AI + 设计表达」的好案例。
查看原始来源 ↗
-
›ComfyUI 核心节点迁移 V3 架构,修复 FP8 scaled LoRA 问题
模型与工具
2026-06-19
· ComfyUI 更新日志
ComfyUI 核心节点迁移 V3 架构,修复 FP8 scaled LoRA 问题。
ComfyUI 把模型缩放、LoRA 提取/合成、潜空间操作等核心节点迁移到 V3 架构,并修复了 FP8 scaled LoRA 的问题,工作流的稳定性与扩展性提升。
与 LoRA 训练、自定义出图工作流直接相关;升级前建议先查看改动,避免旧工作流踩坑。
查看原始来源 ↗
-
›上海国际电影节设立技术创制单元与 AI Backlot 计划:AI 进入主流电影节创作机制
行业观察
2026-06-18
· Variety / Hollywood Reporter / China.org.cn
第 28 届上海国际电影节(6/12–22)设立「技术创制单元」并推出 AI Backlot 计划,全球收到 500+ 申请,4 支跨国团队在电影节开放工作室实时制作 AI 短片,标志 AI 正式进入主流电影节的创作机制。
第 28 届上海国际电影节(2026 年 6 月 12–22 日)设立「技术创制单元」,并推出 AI Backlot 计划:面向全球征集、收到 500+ 份申请,遴选出的 4 支跨国团队在电影节期间的开放工作室内实时制作 AI 短片。据 Variety、Hollywood Reporter 等报道,这一安排把生成式 AI 创作纳入主流电影节的正式机制,而非作为外围展示。
顶级电影节将 AI 创作设为正式单元,是「AI 进入主流影视生产机制」的一个机制性信号;对影视、动画与数字媒体方向的教学与研究,提供了可追踪的产业落地节点与作品样本。
查看原始来源 ↗
-
›AI 诗人 Sasha Stiles 在 Art Basel 2026 发布 NFC 版画新作《WORDS BEYOND WORDS》
案例与作品
2026-06-18
· Art Basel
AI 诗人 Sasha Stiles 与定制 AI 分身 Technelegy 共创的限量版画《WORDS BEYOND WORDS》在 Art Basel Basel 2026 发布,作品内嵌 NFC 芯片,提供可验证出处与独家数字内容。
Sasha Stiles 与其定制 AI 协作者 Technelegy(基于多个机器学习模型、以其诗稿、声音及研究材料为训练数据构建)于 Art Basel Basel 2026 期间发布限量版画作品《WORDS BEYOND WORDS》(与 Iconic Moments 合作)。作品为博物馆级别印刷品,内嵌 NFC 芯片,收藏者可通过芯片核验作品出处并解锁独家数字内容。Stiles 此前作品《A Living Poem》于 2025 年 9 月至 2026 年 3 月在纽约现代艺术博物馆(MoMA)数字墙展出,该作品通过定制语言模型每 60 分钟实时重写并朗读一次诗文。
AI 生成艺术与实体收藏品通过 NFC 技术整合的发行模式,在顶级艺博会语境中出现,为观察 AI 艺术商业化路径与版权确权方式提供了具体案例。
查看原始来源 ↗
-
›Runway Gen-4.5 + Studio 内置编辑器上线:视频生成与后期整合进单一工具
模型与工具
2026-06-18
· Runway 官方
Runway 上线 Studio 内置编辑器,Gen-4.5 居文生视频基准榜首。
Runway 于 6 月 18 日推出 Studio 功能,用户可在同一界面内完成 AI 视频裁剪、拼接、重排序与导出;Gen-4.5 目前在 Artificial Analysis 文生视频基准测试中以 Elo 1247 居于榜首,近期新增 image-to-video 功能;同期 Runway API 接入 Seedance 2.0 Fast(6/5),支持关键帧控制与参考图像视频生成,4–15 秒、480p/720p 输出。
视频生成 + 内置后期整合进单一工具,缩短了影像创作工作流;Gen-4.5 当前的基准排名意味着它是综合可用性最强的文生视频工具之一。
查看原始来源 ↗
-
›HuggingFace:别只用 LoRA——公平基准下 OFT 等技术更优
研究与论文
2026-06-18
· HuggingFace Blog
HuggingFace:公平基准下 OFT 等技术在部分任务上优于 LoRA。
HuggingFace PEFT 团队指出 LoRA 占据 95%+ 的微调份额,但「他法超越 LoRA」的论文多有调参偏向;其统一 PEFT 库已支持 40+ 种技术并开始做公平基准,部分任务上 OFT 表现更好且切换只需改一行配置。
做模型微调 / 风格训练时不必默认只用 LoRA,这是模型训练课程与科研选型的实打实参考(但数据集有限,结论需谨慎)。
查看原始来源 ↗
-
›2026 届毕设展 AI 含量攀升:央美、清华、中传、国美深度调研
案例与作品
2026-06-18
· 每日经济新闻
每日经济新闻对央美、清华、中传、国美四校 2026 届毕设展的深度调研显示,AI 辅助创作比例明显攀升,呈现方式与评价标准随之分化。
每日经济新闻于 2026 年 6 月 18 日发布调研报道,对中央美术学院、清华大学、中国传媒大学、中国美术学院四校 2026 届毕业设计展进行深度访谈与现场记录,数据显示 AI 辅助创作在毕设作品中的比例较前两届明显攀升,各院校在 AI 使用披露要求、评分细则及展览呈现方式上出现明显分化。
四校横向比较的调研报道,既是观察国内顶尖艺术设计院校 AI 政策走向的实时样本,也为正在制定本校 AI 使用规范的教师提供了多方案参照。
查看原始来源 ↗
-
›Google Vids 三连更:Veo 3.1 对所有账号免费、Lyria 3 AI 音乐生成、AI 虚拟人扩容至 53 种
模型与工具
2026-06-18
· Google Workspace Blog
Google Vids 升级:Veo 3.1 免费、Lyria 3 AI 配乐、AI 虚拟人扩至 53 种。
Google 宣布对 Google Vids 进行重大升级:所有 Google 账号每月可免费使用 Veo 3.1 生成 10 条视频;AI Pro/Ultra 订阅用户可用 Lyria 3 生成 30 秒至 3 分钟自定义背景音乐;AI 虚拟人预设从 23 种扩展至 53 种(含写实、3D 卡通、图形小说等风格),新增导演级场景交互控制。
Veo 3.1 免费化显著降低文生视频的使用门槛;Lyria 3 的 AI 配乐省去背景音乐单独授权,对影像 / 多媒体创作有直接价值。
查看原始来源 ↗
-
›FreeStyle:复旦+阶跃星辰等联合提出社区 LoRA 驱动的大规模任意风格迁移方法
研究与论文
2026-06-18
· 复旦大学 / 阶跃星辰 / 西湖大学 / 港大
复旦大学、阶跃星辰、西湖大学与港大联合提出 FreeStyle(arXiv:2606.20506),通过系统挖掘社区 LoRA 构建大规模内容×风格双参考数据集,实现任意风格迁移并完整保留内容结构,支持水墨、刺绣、油画、吉卜力等多样风格。
复旦大学、阶跃星辰、西湖大学与香港大学研究团队发布预印本 FreeStyle(arXiv:2606.20506v1),通过系统挖掘 Stable Diffusion 社区中大量开源 LoRA 构建了一个大规模的内容与风格双参考配对数据集,并在此基础上训练了一个支持任意风格迁移的生成模型,在迁移过程中可完整保留原始内容的结构与细节;支持中国水墨、刺绣、油画、吉卜力、赛博朋克、像素朋克等多种风格转换。
利用社区 LoRA 资产而非重新标注数据的训练思路,为 AI 风格迁移的研究与教学提供了一个新的数据构建路径,对图像设计、插画与 IP 视觉延伸方向的创作实践有参考价值。
查看原始来源 ↗
-
›Figma AI 设计 Agent 接入联网搜索,Runway Aleph 2.0 嵌入 Weave 画布
模型与工具
2026-06-18
· Figma / Runway
Figma AI 设计 Agent 新增联网搜索能力,Runway Aleph 2.0 同步嵌入 Figma Weave 画布,设计师可在 Figma 内直接用文字提示编辑视频帧。
Figma 于 2026 年 6 月 18 日宣布两项 AI 功能更新:其一,Figma 设计 Agent 新增网络搜索能力,可在设计过程中实时拉取网络内容、行业最佳实践与真实素材填充设计稿,替代占位图;其二,Runway Aleph 2.0 正式集成进 Figma Weave 画布,设计师无需切换工具即可对现有视频片段进行文字提示式编辑——修改相机角度、替换背景环境、引入新角色——并支持多方向并排比较与连续迭代,视频输入上限 30 秒,支持多张参考图作为关键帧。
设计工具与视频生成管线的深度集成,是「设计即内容生产」趋势的实质推进,为视觉传达、动效设计及跨媒体创作教学的工作流整合提供了可观察的产业参照。
查看原始来源 ↗
-
›Adobe Firefly「项目记忆」私测启动:跨会话保存角色设定、产品角度与品牌资产
模型与工具
2026-06-18
· Adobe 官方 / WinBuzzer
Firefly 私测『项目记忆』,跨会话保存角色、产品角度与品牌资产,保持连续创作一致性。
Adobe 于 6 月 18 日为 Firefly Web 端推出「项目记忆」(Elements + Projects)私测,可跨会话保存角色设定、产品角度与品牌资产,让连续创作中的风格与素材保持一致;这是继创意智能体进驻全系 CC 应用之后,Firefly 在「持续创作」方向的又一步。
对需要维持系列作品一致性的创作场景(品牌视觉、连续插画、产品图)有实用价值,不必每次重设参数;Firefly Pro 账号可申请体验完整能力组合。
查看原始来源 ↗
-
›Adobe Firefly Creative Skills 上线:对话式设计与 AI 助手进驻全系 CC
模型与工具
2026-06-18
· 搜狐科技
深度分析 →
Adobe Firefly Creative Skills 发布,对话式 AI 设计能力与 AI 助手全面入驻 Creative Cloud 全系应用,独立于同期「项目记忆」更新。
Adobe 于 2026 年 6 月 18 日推出 Firefly Creative Skills,将对话式 AI 设计功能和 AI 助手整合进入 Creative Cloud 全系应用,使用户可以在现有工作流内以自然语言触发创意操作;该更新与同期推出的「项目记忆」(Elements + Projects)为独立功能线,合计构成 Firefly 当周双更新格局。
Creative Skills 代表 Adobe 将 AI 能力从独立入口迁移至核心工具链的进一步推进,对正在评估如何将 AI 功能引入 Photoshop、Illustrator 教学课程的教师具有直接参考意义。
查看原始来源 ↗
-
›Adobe 把「创意智能体」铺进 Photoshop、Premiere、Illustrator、InDesign(公测)
模型与工具
2026-06-18
· Adobe 官方 / Engadget
Adobe 把创意智能体铺进 PS/Pr/Ai/Id 公测,AI 从生成器转向流程助手。
Adobe 将创意智能体扩展到 Firefly 网页版与 PS/Pr/Ai/Id/Frame.io 的公测版,能听自然语言、自动跑多步流程(换背景、整理图层、素材分拣粗剪、批量改名等),并接入 ChatGPT 与 Claude。
AI 从「生成图片」转向「执行设计流程」的标志性一步,且落在日常常用工具里,是 AI 设计流程的现成演示案例。
查看原始来源 ↗
-
›清华美院 2026 届本科毕业展「艺科融合」:AI 辅助创作在多院系作品中成为常态
案例与作品
2026-06-17
· 新浪财经 / 清华美院
清华美术学院 2026 届本科毕业展「艺科融合」6 月 12—25 日在清华艺术博物馆展出,240 余名毕业生近千件作品中,AI 辅助创作已作为普通工具出现在多个专业院系。
清华美术学院 2026 届本科毕业展以「艺科融合」为主题,于 6 月 12 日至 25 日在清华艺术博物馆举办。240 余名毕业生提交近 1000 件作品,涵盖染织、陶瓷、信息艺术、工业设计等专业院系;AI 辅助创作在多个方向的毕业设计中已作为常规工具出现,不再被单独标注为噱头。
顶级艺术院校 AI 工具使用已从实验性走向日常化,这一变化对院系制定 AI 创作规范与评价标准有直接参照价值;与同期央美毕展共同构成 2026 届中国艺术院校「AI 普及化」的可对比观察样本。
查看原始来源 ↗
-
›美图奇想大模型 V6 发布,同步推出 Picchi / Artflo / MVLAND 等四款 AI 新品
模型与工具
2026-06-17
· 美图 / 新浪科技
美图奇想大模型 V6 正式发布,同步推出 Picchi、Artflo、MVLAND、MeituHub 四款 AI 新品及站酷 AI 工具箱,覆盖图像生成至多媒体创作全流程。
美图于 2026 年 6 月 17 日发布奇想大模型 V6,同步推出四款 AI 新产品:面向创作者的 Picchi 图像创作平台、Artflo 艺术风格生成工具、MVLAND 多媒体内容工具及 MeituHub 创作社区,另联合站酷发布 AI 工具箱,整体覆盖从单张图像生成到多媒体内容全流程。
国内设计类 AI 工具的集中发布,展示了面向设计师的垂直 AI 产品生态形态,可作为讲解国内 AI 设计工具市场格局的教学案例参照。
查看原始来源 ↗
-
›Disney 幻想工程 × Adobe Firefly Foundry:训练 IP 自定义模型,草图直出品牌级概念图
案例与作品
2026-06-16
· Adobe 官方
Disney 幻想工程与 Adobe Firefly Foundry 合作,基于内部 IP 资产训练自定义生成模型,可从草图生成米奇、冰雪奇缘、汽车总动员等 IP 的品牌级概念图,生成结果已直接导入商业制作流程,为 Firefly Foundry 企业自定义模型的标志性落地案例。
Disney 幻想工程(Disney Imagineering)于 2026 年 6 月 16 日与 Adobe 宣布合作,基于 Adobe Firefly Foundry 平台,利用迪士尼内部 IP 视觉资产训练自定义生成模型;设计团队可通过草图输入,获得符合米奇、冰雪奇缘、汽车总动员等经典 IP 视觉规范的品牌级概念图,AI 生成结果已直接导入现有商业设计与制作流程,成为 Firefly Foundry 企业级自定义模型体系的标志性落地案例,多家媒体(Variety、Axios、WDW News)同步报道。
顶级 IP 持有方通过企业自定义 AI 模型将 IP 风格编码进生成流程,是 AI 图像生成在版权严格管控环境下大规模商业落地的典型案例;对艺术设计院校开展 AI 辅助品牌与 IP 生成课题研究具有参考价值。
查看原始来源 ↗
-
›《数智艺术论》央美首发:56 万字,提出「50%+30%+20%」人才培养框架
研究与论文
2026-06-16
· 央美美术馆 / 四川美术出版社
《数智艺术论》在中央美术学院首发,56 万字,五大板块 13 专题,提出「50% 专业+30% 跨学科+20% AI 基础」的高校人才培养框架,填补国内数智艺术系统性理论空白。
由一山主编的《数智艺术论》于 2026 年 6 月 16 日在中央美术学院美术馆首发,由四川美术出版社出版,全书 56 万字,分五大板块 13 个专题,系统建构数智艺术的理论框架;书中提出「50% 专业技能+30% 跨学科知识+20% AI 基础能力」的高校艺术设计人才培养比例建议,被认为填补了国内该领域系统性学术理论的空白。
国内首部系统性数智艺术理论专著,对制定 AI 融合课程方案、撰写相关基金申报书或参与学科评估的教师具有直接的文献参考价值。
查看原始来源 ↗
-
›Boogu-Image-0.1 开源:10B 参数统一图像生成与编辑模型,Apache-2.0
模型与工具
2026-06-16
· GitHub / 机器之心 / HuggingFace
Boogu-Image-0.1 以 Apache-2.0 协议开源,10B 参数统一图像生成与编辑,中英双语密集文本渲染为开源第一,ComfyUI 整合包同步上线。
Boogu-Image-0.1 于 2026 年 6 月 16 日在 GitHub 和 HuggingFace 发布,采用 Apache-2.0 协议,提供 Base、Turbo、Edit 三个变体,参数量 10B,可统一执行图像生成与图像编辑任务;其中英双语密集文本渲染能力在现有开源模型中排名第一,ComfyUI 整合包同步发布;中文社区于 6 月 22 日起大量讨论,三家以上媒体源核认。
Apache-2.0 协议允许商业用途,对有本地部署需求或研究型开发需求的师生尤为友好;超密集中英文本渲染的开源第一,对平面设计、排版研究类课题有直接参考价值。
查看原始来源 ↗
-
›《艺术教育》:AI 赋能高校艺术设计学科重构与革新
观点与技巧
2026-06-16
· 艺术教育杂志
《艺术教育》刊文梳理 AI 技术介入高校艺术设计学科的路径,探讨课程体系、教学方法与评价标准的重构方向。
《艺术教育》于 2026 年 6 月 16 日前后刊发文章,系统梳理了 AI 技术介入高校艺术设计学科的现状与趋势,涵盖课程结构调整、教学方法转型和作品评价标准重设三个维度,并对国内多所院校的试点经验进行了综合分析。
学科层面的政策性梳理文章,适合正在筹备 AI 课程改革或参与院系评估方案讨论的教师作为参照文献。
查看原始来源 ↗
-
›MiniMax Hub 发布:图·视频·配音·音乐·剪辑一站式多模态 AI 创作平台
模型与工具
2026-06-15
· Variety / Sixth Tone / 多源
MiniMax 于上海国际电影节期间发布 MiniMax Hub,整合图像、视频、配音、音乐与剪辑的一站式多模态创作平台,由 Agent 拆解任务并保留人工决策节点,4 支跨国团队用于电影节 AI 短片制作。
2026 年 6 月,MiniMax 在上海国际电影节期间发布多模态 AI 创作平台 MiniMax Hub,将图像、视频、配音、音乐与剪辑整合到同一平台;平台以 Agent 自动拆解创作任务,并在流程中保留人工决策节点,强调「AI 执行、人把关」的协作方式。据 Variety 等报道,本届电影节有 4 支跨国团队实际使用该平台进行 AI 短片制作;平台经 hub.minimax.io 提供免费下载。
多模态创作从「分散的单点工具」走向「带任务编排的一体化平台」,对影视、动画与短片方向的创作教学而言,提供了一个可观察的「Agent 编排 + 人工把关」工作流样本。
查看原始来源 ↗
-
›FreeOrbit4D:单目视频→任意相机轨迹重拍,无需训练,单卡可跑(CVPR 2026)
研究与论文
2026-06-15
· arXiv / CVPR 2026 / 机器之心
UIUC 与 Eyeline Labs 提出 FreeOrbit4D:输入单目视频,无需额外训练即可重拍出任意相机轨迹视角;于 CVPR 2026 Workshop 展示,代码开源,单卡 A40 可运行。
arXiv 论文 2601.18993(UIUC + Eyeline Labs)提出 FreeOrbit4D 框架,核心思路是对输入单目视频中的前景做完整 4D 重建,再由视频扩散模型引导生成任意相机轨迹下的重拍结果,全流程无需针对输入视频额外训练;于 CVPR 2026 Workshop 展示,代码已开源,可在单张 A40 显卡上运行。论文提交 arXiv 时间为 2026 年 6 月 15 日,机器之心及网易等中文媒体有跟进报道。
单目视频任意运镜的无训练重拍能力,对影视后期、虚拟制片、数字媒体等专业的学生有直接的实验与创作应用价值;单卡可运行的硬件门槛也使课堂实践具有可行性。
查看原始来源 ↗
-
›高德 AI 团队开源 DreamX-World 1.0 通用交互式世界模型
研究与论文
2026-06-15
· arXiv / 机器之心 / chooseAI
高德 AI 团队在 arXiv 发布 DreamX-World 1.0,可生成 1 分钟长视频,支持 6 自由度相机控制与「世界记忆」机制,采用 MIT+Apache-2.0 双协议开源。
高德 AI 团队于 2026 年 6 月 15 日在 arXiv(论文编号 2606.16993)发布 DreamX-World 1.0,这是一个通用交互式世界模型,支持最长 1 分钟连续视频生成、6 自由度(6DoF)相机控制,并引入「世界记忆」机制以维持跨时间步的场景一致性;模型以 MIT+Apache-2.0 双协议开源,ComfyUI 整合包同步上线。
长视频世界模型的开源发布,为研究 AI 驱动叙事空间、交互式影像创作及沉浸体验原型的师生提供了可直接实验的开源基础设施。
查看原始来源 ↗
-
›Midjourney V8.1 成为默认版本:生成速度 4–5 倍提升,原生 2K 高清输出
模型与工具
2026-06-10
· Midjourney 官方
Midjourney V8.1 成默认版本,速度提升约 4–5 倍,支持原生 2K 输出。
Midjourney 于 6 月 10 日将 V8.1 设为全平台默认版本,标准任务速度较早期版本提升约 4–5 倍,支持原生 2K 高清输出(无需额外放大步骤),Prompt 理解精准度同步升级。
出图速度与分辨率直接影响演示与实操节奏;提速约 4–5 倍、原生 2K 降低了高清出图的额外步骤。使用 Midjourney 的现有教程截图可能需要相应更新。
查看原始来源 ↗
-
›Midjourney Niji V7 正式上线:动漫风格连贯性与 sref 风格参考全面升级
模型与工具
2026-06-10
· Midjourney 官方
Niji V7 发布,动漫/插画风格连贯性与 sref 风格参考全面升级。
Midjourney Niji V7 于 6 月 10 日正式发布,针对动漫 / 插画风格做大规模优化,提升了跨场景角色连贯性、画面文字渲染准确率以及 sref 风格参考稳定性。
插画、漫画、动漫美术方向可直接升版测试,sref 风格锁定更稳意味着系列作品的风格一致性得到改善,适合作为 AI 辅助插画的演示素材。
查看原始来源 ↗
-
›Midjourney V7 深度评测:人物一致性 88%,图内文字可读
观点与技巧
2026-06-08
· AIHotTool / 多源
多方深度评测显示 Midjourney V7 人物一致性达 88%,图内文字实现可读渲染,较 V6 在角色连贯性和排版精度上有显著提升。
多家媒体于 2026 年 6 月 8 日前后发布 Midjourney V7 深度评测结果:人物一致性综合得分约 88%(在相同角色跨场景生成中),图内文字渲染首次达到可阅读水平;与 V6 相比,角色面部和服装在不同提示下的连贯性、构图精度均有可量化提升,三源以上媒体报道确认上述数据。
V7 的人物一致性与文字渲染能力提升,直接影响角色设计、品牌视觉和绘本插画等教学场景的可用性,是评估 Midjourney 教学用途的重要参照节点。
查看原始来源 ↗
-
›Runway API 接入 Seedance 2.0 Fast,支持关键帧控制与参考图生成
模型与工具
2026-06-05
· Runway
Runway API 正式接入 Seedance 2.0 Fast,支持关键帧控制、参考图及参考视频生成,输出 4–15 秒视频,提供 480p/720p 两档分辨率。
Runway 于 2026 年 6 月 5 日通过 API 接入 Seedance 2.0 Fast,开发者和创作者可通过 API 调用关键帧控制、参考图生成、参考视频驱动等功能,单次生成支持 4–15 秒视频,提供 480p 和 720p 两档分辨率输出,补充了 Runway Studio 编辑器之外的程序化接入路径。
API 层接入意味着 Seedance 2.0 的视频生成能力可以嵌入自定义工具或课程平台,为有程序化批量生成需求的教学实验与创作工作流提供了新的整合入口。
查看原始来源 ↗
-
›Ideogram 4.0 发布首个开放权重文生图模型,ComfyUI 首日支持
模型与工具
2026-06-03
· Ideogram 官方
Ideogram 发布 4.0 开放权重文生图模型(9.3B DiT),支持 JSON 精控色彩与文字布局,ComfyUI 首日支持,可本地免费部署。
Ideogram 于 2026 年 6 月 3 日发布首个开放权重文生图模型 Ideogram 4.0,参数量 9.3B(DiT 架构),支持 JSON 结构化 Prompt 精控色彩、布局与文字位置,文字渲染能力在 DesignArena 开源模型榜排名第一,超越参数量更大的 FLUX.2 dev(32B)及 HunyuanImage 3.0(80B MoE);ComfyUI 首日提供原生支持,非商业用途可本地免费部署。
前沿文生图能力首次以可本地运行的开放权重形式出现,为没有商业 API 预算的师生和独立创作者提供了直接可用的高质量文生图工具参照。
查看原始来源 ↗
-
›斯科塞斯用 FLUX 为好莱坞新片分镜,出任 Black Forest Labs 顾问
★ 编辑推荐
案例与作品
2026-06-02
· Variety / Hollywood Reporter
斯科塞斯用 FLUX 为新片绘制分镜,并出任 Black Forest Labs 顾问。
Martin Scorsese 于 6 月 2 日宣布成为 FLUX 图像模型开发商 Black Forest Labs 的顾问,并公开展示了用 FLUX 为新片《What Happens at Night》(主演 DiCaprio、Lawrence)绘制分镜板的工作视频;他表示 FLUX「让预制作更快,不牺牲品质与技艺」。
这是好莱坞顶级导演公开认可 AI 生成工具的里程碑案例,为讨论 AI 工具介入专业创作实践提供了有分量的现实参照,是当下最具说服力的「大师级用例」之一。
查看原始来源 ↗
-
›2026 ICIAD 国际文化创新艺术设计奖设「AIGC 与计算设计」类别
展览与赛事
2026-06-01
· 设计竞赛网
2026 ICIAD 设『AIGC 与计算设计』类别(原始时间:2026-06)。
2026 ICIAD Award 新增 AIGC & 计算设计类别,认可用 AI 与算法生成技术创造的新视觉形式与美学,涵盖 AI 图像/视频、参数化设计与生成艺术。
为 AI 与算法生成的视觉作品提供了正式投稿出口,可作为课程作业的产出目标,也是院系组织参赛的抓手。截止与要求以官方公告为准。
查看原始来源 ↗
-
›2026 中国好创意大赛 · 百度 AIGC 未来创作专项赛
展览与赛事
2026-06-01
· 设计竞赛网
2026 中国好创意大赛设百度 AIGC 未来创作专项赛(原始时间:2026-06)。
第 20 届中国好创意大赛设百度 AIGC 未来创作专项赛,面向高校师生,聚焦 AIGC 创意设计,发掘 AIGC 设计人才、推动 AI 与设计行业融合。
国内高校认可度较高的 AIGC 赛道,适合作为工作营 / 课程的成果出口与练手目标。截止与要求以官方公告为准。
查看原始来源 ↗
-
›ComfyUI v0.23.0 发布:新增 NVIDIA PixelDiT 与 Microsoft Lens 模型支持
模型与工具
2026-06-01
· ComfyUI 官方 / NVIDIA Blog
ComfyUI v0.23.0 新增 NVIDIA PixelDiT 与 Microsoft Lens 模型支持。
ComfyUI 于 6 月 1 日发布 v0.23.0,新增对 Microsoft Lens 和 NVIDIA PixelDiT 文生图模型的支持,增强了 Flux 模型的预注意力补丁机制(pre-attention patches),并改进批处理流程;配合 FLUX.2 系列(多参考图生成、VRAM 降低 40%)生态持续壮大。
ComfyUI + FLUX 是当前本地部署 AI 图像生成工作流的主流选择;PixelDiT 接入扩展了可本地运行的前沿模型范围,VRAM 降低 40% 意味着更多消费级 GPU 可以运行,对实验室与工作坊配置有实际参考意义。
查看原始来源 ↗
-
›SIGGRAPH 2026 Art Gallery「In-Betweens」入选作品公布,7 月洛杉矶登场
展览与赛事
2026-05-21
· SIGGRAPH 2026 官网
SIGGRAPH 2026 Art Gallery『In-Betweens』入选公布,7 月洛杉矶登场。
第 53 届 SIGGRAPH 将于 7 月 19–23 日在洛杉矶会展中心举办,Art Gallery 主题「In-Betweens」聚焦系统、材料、时间与公众之间的关系,本届收到近 200 件投稿;入选作品含 AI 生成互动装置(Diffusion TV)、动感光阵(Light Architecture)等。ACM SIGGRAPH 学生数字艺术竞赛(DAC)征稿主题「Speculative Futures」同期开放。
SIGGRAPH Art Gallery 是 AI 艺术实践最前沿的年度样本之一,对科技艺术、交互装置、生成艺术方向有参考价值;DAC 学生竞赛同期开放,截止时间以官网为准。
查看原始来源 ↗