›arXiv 2609.18065:为生成式图像模型构建视觉界面设计空间框架
arXiv 论文 2609.18065 提出系统性框架梳理生成式图像模型视觉界面的提示输入、控制粒度、迭代模式与输出展示四大核心维度。
arXiv 论文 2609.18065(9月16日)提出一套系统性的设计空间(Design Space)框架,梳理生成式图像模型视觉用户界面的核心维度,包括提示输入范式(文字/图像/草图/混合)、控制粒度(全局/局部/风格/结构)、迭代交互模式(单次/多轮/协作)以及输出展示策略(对比/时间轴/探索网格);通过对 Midjourney、Adobe Firefly、DALL·E 等主流生图界面进行系统性分类编码,为界面设计研究和工具开发提供参照。
这是生成式图像界面领域少有的系统性综述,提供了批判性评估 AI 生图工具的理论框架,适合作为课程进阶理论环节的参考材料。
查看原始来源 ↗
›RelightFormer:SIGGRAPH Asia 2026 多视角物体重打光生成式 Transformer,无需逆渲染
香港科技大学 vLAR 团队提出 RelightFormer,前馈生成式 Transformer 无需逆渲染,输入目标光照条件和多视角图像即可输出光照一致的多视角重打光结果,已被 SIGGRAPH Asia 2026 接收,权重开源。
香港科技大学 vLAR 团队于 2026 年 9 月 10 日在 arXiv 发布 RelightFormer(2609.07414),一种前馈生成式 Transformer:输入目标光照条件与多视角图像,无需传统逆渲染流程,即可输出高质量、光照一致的多视角重打光结果;该论文已被 SIGGRAPH Asia 2026(2026 年 12 月,吉隆坡)接收,模型权重与代码在 HuggingFace(vLAR/RelightFormer)公开。
前馈架构无需对每个场景单独优化,使多视角一致的重打光从研究级工具向实际创作工作流迁移成为可能。
查看原始来源 ↗
ECCV 2026官方/AI4VA Workshop官方·
9月9日一手
论文
›ECCV 2026第四届AI for Visual Arts工作坊今日举办:世界模型×视觉艺术、长视频生成前沿
ECCV 2026第四届AI for Visual Arts专题工作坊于9月9日在瑞典马尔默举办,聚焦世界模型、长视频生成、神经三维等视觉艺术AI前沿方向
ECCV 2026(欧洲计算机视觉顶级会议,9月8–12日,瑞典马尔默)第四届AI for Visual Arts(AI4VA)专题工作坊于9月9日举办,聚焦为视觉艺术服务的前沿计算机视觉研究方向:用于艺术创作的世界模型、长视频生成、神经三维重建、生成式艺术批评与评估方法等。本届ECCV接收的LiveEdit(清华×港科大实时流式视频编辑)、A²-Edit(上交大任意物体参考编辑)等论文均在相关方向有成果展示。AI4VA是计算机视觉研究与艺术创作应用交叉的年度国际风向标。
ECCV AI4VA工作坊汇聚视觉艺术AI研究的顶尖成果,对跟踪”AI技术如何重塑视觉艺术创作工具”的研究者和教育者是最直接的学术信号来源。
查看原始来源 ↗
arXiv(论文编号 2509.24167)·
9月2日一手
论文
›arXiv研究:AI如何支持视觉艺术初学者的创意构思与教学介入
arXiv论文2509.24167考察AI工具如何支持视觉艺术初学者的创意构思过程,并探讨教学介入的适当边界
arXiv预印本论文2509.24167(发布于9月2日)研究AI辅助工具在视觉艺术初学者创意构思阶段的影响:通过用户研究分析AI工具如何影响初学者的灵感生成、概念发展和决策过程,以及教育者应在何处介入以避免AI替代核心创意训练。研究发现AI工具在降低初学者启动门槛的同时,也存在压缩主动探索空间的风险,并提出教学介入策略建议。
如何在AI工具降低创作门槛的同时保护初学者的核心创意训练,是艺术设计教育中面临的系统性挑战,该研究为相关课程设计提供了实证依据。
查看原始来源 ↗
MIT CSAIL/Nature Communicat...·
8月18日一手
论文
›MIT CSAIL《Nature Communications》:AI生成图像的归因衰减使版权追责在技术层面趋于不可能
MIT CSAIL发表于《Nature Communications》的研究显示,AI图像生成的多步骤变换机制导致训练数据归因信号快速衰减,使版权追责在技术层面趋于不可能
MIT CSAIL发表于《Nature Communications》的研究提出”归因衰减”(Attribution Decay)理论:AI图像生成模型在多步骤扩散变换过程中,训练数据的可识别痕迹快速减弱,导致从生成图像反向追溯到特定训练图像的技术难度呈指数级上升。研究证明,即使已知模型的完整训练集,在实际生成场景下精确归因特定版权作品在计算上趋于不可能。这一结论对当前各国基于”相似度比对”的AI版权诉讼框架形成了直接挑战。
归因衰减理论将AI版权争议的核心从”法律判定”推向”技术举证”,意味着现行版权追责框架在面对扩散模型时可能需要从根本上重建。
查看原始来源 ↗
›腾讯CoinVE-Edit:22B参数区域感知视频编辑,单次Pass完成多处局部修改
腾讯发布CoinVE-Edit,22B参数视频编辑模型,区域感知架构支持单次推理同时完成2-5处独立局部修改
腾讯研究院发布CoinVE-Edit视频编辑模型,参数量22B。核心技术为区域感知(Region-Aware)编辑架构:模型理解视频帧中不同区域的语义边界,在单次推理Pass中同时处理2至5处独立的局部编辑指令,各区域的修改相互隔离、不产生干扰。相较于需要多次分步编辑的传统流程,CoinVE-Edit将多区域编辑的推理开销压缩为接近单次的计算量,在视频编辑效率和一致性上均有显著提升。
多区域同步编辑能力是视频后期AI工具走向专业可用的关键门槛之一,CoinVE-Edit的单Pass多处修改架构为高密度编辑场景提供了效率参照。
查看原始来源 ↗
机器之心 / ECCV 2026·
8月1日一手
论文
›LiveEdit(清华×港科大):4步去噪实现12.66 FPS实时逐帧视频编辑,ECCV 2026
清华×港科大联合提出LiveEdit,通过三阶段渐进蒸馏将双向扩散Transformer的视频编辑能力迁移至因果流式编辑器,仅需4步去噪即可实现12.66FPS实时逐帧视频编辑;ECCV 2026接收。
清华×港科大联合提出LiveEdit,通过三阶段渐进蒸馏将双向扩散Transformer的视频编辑能力迁移至因果流式编辑器,仅需4步去噪即可实现12.66FPS实时逐帧视频编辑;ECCV 2026接收。
实时流式视频编辑是AI视频创作教学中的关键瓶颈——LiveEdit让”边生成边看效果”成为可能,是AI视频工作营”实时可控生成”单元的学术背景案例,也是研究生了解当前视频编辑前沿的高质量参考。
查看原始来源 ↗
›SIGGRAPH 2026时间检验奖:2016港大角色动画深度学习框架提前十年押中物理AI方向
SIGGRAPH 2026时间检验奖授予港大Taku Komura团队2016年发表的角色运动合成与编辑深度学习框架;该论文是首次将深度学习引入角色动画合成的先驱工作,对当前AI角色动画/物理AI运动生成有持续影响,GitHub项目已达8000+Star。
SIGGRAPH 2026时间检验奖授予港大Taku Komura团队2016年发表的角色运动合成与编辑深度学习框架;该论文是首次将深度学习引入角色动画合成的先驱工作,对当前AI角色动画/物理AI运动生成有持续影响,GitHub项目已达8000+Star。
“十年前技术押中当前AI方向”的叙事对设计可作相关课题背景文献。
查看原始来源 ↗
›A²-Edit(上交大×上海创智学院):突破掩码精度限制,实现任意物体精准参考图引导局部编辑
上交大×上海创智学院提出A²-Edit,通过混合Transformer专家路由与掩码退火训练策略,支持任意物体类别+任意精度掩码的参考图引导局部编辑;无论用精细掩码还是粗略框选都能保持参考图细节,适用于电商视觉合成、虚拟试穿、品牌局部替换等场景。
上交大×上海创智学院提出A²-Edit,通过混合Transformer专家路由与掩码退火训练策略,支持任意物体类别+任意精度掩码的参考图引导局部编辑;无论用精细掩码还是粗略框选都能保持参考图细节,适用于电商视觉合成、虚拟试穿、品牌局部替换等场景。
参考图精准局部编辑是设计工作流中频率最高的需求之一——A²-Edit让”把这件衣服/这个材质/这个元素精准替换到图中指定区域”变得可靠
查看原始来源 ↗
arXiv 2607.26037 + alphaXiv·
7月29日一手
论文
›Wonder(Adobe Research+JHU):解决控制漂移/记忆衰减/延迟膨胀的视频世界模型,单图→可游走3D一致性世界
Adobe Research与Johns Hopkins大学提出Wonder视频世界模型:将相机运动转化为像素空间视觉线索(绕过神经隐式重建);稀疏检索全保真历史帧解决记忆衰减;实时蒸馏学生模型解决延迟膨胀;可从单张图像或视频生成可交互、3D一致性、分钟级时长的沉浸式世界;6方向实时导航@16fps。
Adobe Research与Johns Hopkins大学提出Wonder视频世界模型:将相机运动转化为像素空间视觉线索(绕过神经隐式重建);稀疏检索全保真历史帧解决记忆衰减;实时蒸馏学生模型解决延迟膨胀;可从单张图像或视频生成可交互、3D一致性、分钟级时长的沉浸式世界;6方向实时导航@16fps。
“把一张概念图变成可游走的沉浸空间”方向已有Adobe Research级顶会论文背书——装置艺术/XR叙事/空间设计研究方向的老师有新对标论文
查看原始来源 ↗
机器之心 / arXiv:2607.23588·
7月28日一手
论文
›JarvisHub:首个画布原生多模态创作Agent框架,可编辑画布同时作工作区+外部记忆+动作空间
JarvisHub(arXiv:2607.23588,7/26提交,7/28开源)是首个以「可编辑画布」同时作为Agent工作空间、外部记忆和动作空间的多模态创作框架;三层架构(画布状态→协议桥接→Agent运行时)支持持续规划、迭代生成、版本管理;用户可随时介入、引导、检查Agent创作过程,突破孤立工具调用限制,迈向可持续人机协同创作自动化。
JarvisHub(arXiv:2607.23588,7/26提交,7/28开源)是首个以”可编辑画布”同时作为Agent工作空间、外部记忆和动作空间的多模态创作框架;三层架构(画布状态→协议桥接→Agent运行时)支持持续规划、迭代生成、版本管理;用户可随时介入、引导、检查Agent创作过程,突破孤立工具调用限制,迈向可持续人机协同创作自动化。
直接面向多模态创作工作流的Agent框架——把”画布”从输出界面变为AI协作统一工作台
查看原始来源 ↗
新智元 / 量子位 / 36氪 / CSDN / 51CTO·
7月25日
论文
›清华 AutoMIA 入选 CVPR'26:输入两张图片 76 秒生成镜像错觉 3D 艺术品,支持 3D 打印
清华 AutoMIA 系统可将任意两张图片自动生成镜像错觉 3D 物体,76 秒完成,支持直接 3D 打印输出,已入选 CVPR 2026
清华大学团队提出 AutoMIA(Automatic Mirror Illusion Art)系统,并入选 CVPR 2026。该系统输入任意两张图片,全自动生成正面与侧面呈现不同图案的镜像错觉 3D 物体,全流程仅需 76 秒,无需额外训练,输出文件可直接用于 3D 打印生成实体艺术品;全场景最优得分 87.91%,大幅超越人类设计师的 77.53%;代码与预训练权重已在 GitHub 开源,线上交互演示同步开放。
AI 将镜像错觉艺术品的制作门槛从”专业数学建模+多小时手工”降至”上传两张图、76 秒自动生成可打印文件”,对计算艺术、装置设计、毕设实践课程有直接应用价值。
查看原始来源 ↗
量子位 / 凤凰科技 / ITBear·
7月24日
论文
›兔展智能UniWorld-View登顶WorldScore:单图生成任意视角视频,全开源适配昇腾
兔展智能联合北京大学提出UniWorld-View,在李飞飞团队WorldScore评测中登顶(国产首次),双流架构支持单图生成任意视角视频,代码权重全开源,已适配国产昇腾算力。
兔展智能联合北京大学提出UniWorld-View,在李飞飞团队WorldScore世界模型评测中登顶(国产世界模型首次);核心能力:单张图片生成完整多视角一致3D场景;代码与权重全开源,已适配国产昇腾算力,团队预告将推出设计工具RabbitVis。
国产世界模型首次登顶国际权威榜单,「单图→完整3D场景任意视角」对建筑、空间设计和展览策划课程有直接价值,全开源+昇腾适配对国内高校教学场景友好。
查看原始来源 ↗
南京大学 / 上海AI Lab / 机器之心 / 新无...·
7月22日一手
论文
›南京大学 VideoChat3 全栈开源:4B 参数统一短 / 长 / 流式视频理解,登顶 HuggingFace 趋势榜
南京大学联合多校发布 VideoChat3,全栈开源 4B 参数视频理解模型,统一处理短视频 / 长视频 / 流式视频三类任务,登顶 HuggingFace 趋势榜。
南京大学联合上海 AI Lab、南洋理工大学、北京大学发布 VideoChat3,全栈开源(权重、代码、数据、训练流程),4B 参数统一处理短视频、长视频与实时流式视频三类任务,打通感知—理解—交互链路,在多个视频理解基准取得 SOTA;发布后登顶 HuggingFace 趋势榜。
全栈开源的统一视频理解模型,为高校研究团队复现和定制化部署提供了完整基础,适用于素材检索、镜头分析等创作辅助场景。
查看原始来源 ↗
SIGGRAPH 2026官方日程 / Tripo A...·
7月22日一手
观点
›Tripo AI SIGGRAPH 2026主题演讲:茶壶测试从「能展示」到「能制造」,3D生成AI迈向交互式世界智能
Tripo AI在SIGGRAPH 2026发表题为「茶壶测试:从展示走向制造」的主题演讲,阐述如何从孤立静态资产生成迈向动态环境/智能体系统/世界建模,展示Tripo全栈生成生态在游戏/3D打印/机器人仿真等工业管线中的应用。
Tripo AI在SIGGRAPH 2026发表题为「茶壶测试:从展示走向制造(The Teapot Test: From Showcase to Manufacture)」的主题演讲,由团队核心成员Yanpei Cao等主讲;演讲以图形学历史典故”犹他茶壶”为切入点,系统阐述从孤立资产生成(静态展示)迈向动态环境、智能体系统和世界建模(可制造、可交互)的路径;现场展示Tripo全栈3D生成生态在游戏资产制作、3D打印原型和机器人仿真训练数据等工业管线中的实际应用案例。
“从展示到制造”的定位对应3D生成AI的核心演进方向——进入实际生产管线而非停留在演示工具层面,茶壶测试的新诠释也为3D/交互设计课程提供了清晰的概念坐标。
查看原始来源 ↗
SIGGRAPH 2026官方·
7月22日一手
论文
›SIGGRAPH 2026最佳艺术论文:Resonance——AI生成艺术中共鸣感的形式化研究
SIGGRAPH 2026最佳艺术论文奖授予论文Resonance,探索AI生成艺术中「共鸣感」的形式化定义与计算方法
SIGGRAPH 2026最佳艺术论文奖(Best Art Paper)授予论文《Resonance》,该研究针对AI生成艺术中观者与作品之间”共鸣感”(resonance)的形式化建模:通过对大规模观者反馈数据的分析,提出可计算的共鸣感度量框架,探索哪些生成参数组合更容易在观者中引发情感共鸣,并将这一框架应用于指导AI艺术生成策略。
SIGGRAPH艺术论文奖关注AI生成艺术的评估维度从技术质量向审美响应的延伸,是AI生成内容与艺术研究交叉领域的标志性学术认可。
查看原始来源 ↗
WCCFTech / guru3d / TechPow...·
7月21日
模型
›NVIDIA DLSS 5 SIGGRAPH 2026揭秘:三路AI模型分工神经渲染,让艺术家「主导最终画面」,秋季上线
NVIDIA在SIGGRAPH 2026披露DLSS 5技术细节:三路独立AI模型(A/B/C)分别负责全局光照/次表面散射/材质细节等渲染环节,开发者可对场景/角色/关卡单独分配不同模型;紧凑扩散Transformer架构,单GPU实现4K/60fps/亚16ms延迟;DLSS 5秋季正式上线游戏。
NVIDIA在SIGGRAPH 2026披露DLSS 5的完整技术架构:三路独立AI模型(A/B/C)各司其职,分别负责全局光照、次表面散射和材质细节等渲染环节,开发者可按场景、角色或关卡粒度单独分配不同模型,实现更精细的创作控制;底层采用紧凑扩散Transformer架构,在单GPU上实现4K/60fps、亚16ms延迟;DLSS 5定于秋季正式上线商业游戏。此次揭秘强调”让艺术家主导最终画面”——有别于DLSS 4.5的超分/帧生成功能,DLSS 5是AI深度参与全局光照、皮肤、头发、布料物理建模的实时渲染本质变革。
DLSS 5不是超分迭代而是神经网络参与实时渲染底层物理建模的架构革新,”艺术家主导”定位将AI渲染主控权从自动算法还给创作者,对3D/游戏/影视设计方向有根本性影响。
查看原始来源 ↗
Autodesk官方新闻室 / Creative Bl...·
7月21日一手
产品
›Autodesk SIGGRAPH 2026:3ds Max支持可编辑3D高斯溅射,Maya MotionMaker支持「带自己的数据」定制生成动作模型
Autodesk在SIGGRAPH 2026宣布:3ds Max将3D Gaussian Splats变为完全可编辑资产(支持建模/动画/场景构建);Maya MotionMaker新增BYOD(Bring Your Own Data),团队可用自家动捕/手绑动作数据训练自定义生成动作模型;Flow Production Tracking引入实时媒体审阅与协同标注。
Autodesk在SIGGRAPH 2026宣布两项重要更新:3ds Max将3D Gaussian Splats从只读素材升级为完全可编辑资产,支持建模、动画和场景构建,并整合AI生成环境能力,使AI扫描生成的三维场景可直接进入专业VFX制作管线;Maya MotionMaker新增BYOD(Bring Your Own Data)功能,动画团队可使用自家动作捕捉或手绑动作数据训练专属动作生成AI模型,实现风格化定制;此外Flow Production Tracking引入实时媒体审阅与协同标注功能,改善远程协作审片流程。
3ds Max可编辑Gaussian Splats让AI生成三维场景直接进入VFX专业管线,Maya MotionMaker BYOD让动画团队训练专属风格的动作AI,两项更新共同降低了AI生成内容与专业制作工作流之间的整合门槛。
查看原始来源 ↗
Springer / 学术期刊·
7月20日一手
论文
›Springer实证研究:Midjourney融入高校建筑PBL课程,弱基础学生受益显著高于强基础组
Springer发表实证研究,分析Midjourney融入高校建筑设计PBL课程的效果,发现弱基础学生在AI辅助下的学习收益显著高于强基础学生,两组均报告正向体验。
Springer期刊发表实证研究,追踪一所中国高校建筑设计专业将Midjourney融入PBL(项目式学习)课程的教学实验,对比AI辅助前后不同基础水平学生的学习成效与体验。数据显示,弱基础学生组在方案迭代速度与最终成果质量上的提升幅度显著高于强基础学生组;两组学生均报告了正向的工具使用体验,但强基础组对AI建议的依赖度明显低于弱基础组。
弱基础学生在AI辅助下受益更显著的发现,对高校AI工具教学策略的差异化设计有直接参考价值,也提示了AI工具在设计教育公平性层面的潜在积极作用。
查看原始来源 ↗
NVIDIA官方Blog/WCCFTech/Digit...·
7月20日一手
产品
›NVIDIA SIGGRAPH 2026发布Synthetic Video Detector NIM:22ms检测AI生成视频,92%精准度,API即用
NVIDIA在SIGGRAPH 2026发布Synthetic Video Detector NIM,22ms/帧检测速度、92%精准率,通过标准API调用,填补AI生成视频内容真实性验证空白,与Adobe Content Credentials、C2PA标准形成生态配合。
NVIDIA于SIGGRAPH 2026(2026年7月20日)发布Synthetic Video Detector NIM(网络推理微服务),专用于检测AI生成视频;官方测试数据:22ms/帧检测速度,92%精准率,4%误报率,通过标准API调用,无需本地GPU部署。此前NVIDIA已发布AI图像检测NIM,此次视频版填补了内容真实性验证的空白;技术上与Adobe Content Credentials、C2PA标准形成生态配合。
22ms/帧的实时检测能力意味着平台可在视频发布流程中大规模部署,AI生成视频的可检测性将实质影响内容发布规则与合规要求,是AI内容伦理与合规领域的标志性技术进展。
查看原始来源 ↗
NVIDIA Research / SIGGRAPH ...·
7月20日一手
论文
›NVIDIA SIGGRAPH 2026发表21篇论文:MotionBricks实时动作AI同时驱动数字角色与人形机器人,ArtiFixer将杂乱3D扫描转为完整场景
NVIDIA在SIGGRAPH 2026发表21篇研究论文:MotionBricks基于35万段动作片段训练的实时动作AI可同时驱动屏幕数字角色与Unitree G1人形机器人;ArtiFixer将杂乱现实3D扫描自动转为可用虚拟场景;新雪/沙/弹性体物理求解器一并开源。
NVIDIA在SIGGRAPH 2026发表21篇研究论文并全部开源:MotionBricks基于35万段动作片段训练,可实时同时驱动屏幕数字角色和Unitree G1人形机器人,项目已在GitHub开源;ArtiFixer建立从杂乱现实3D扫描到完整可用虚拟场景的自动化管线,直接影响摄影测量和建筑扫描进入VFX制作的工作流;此外还包含新的雪、沙、弹性体物理求解器,同样开源。
MotionBricks”一个AI同时驱动数字角色和真实机器人”标志着实时动作生成跨越数字-物理壁垒;全部开源意味着高校可直接复现实验和二次开发。
查看原始来源 ↗
ACM SIGGRAPH Blog / s2026.s...·
7月19日一手
论文
›SIGGRAPH 2026最佳论文:GimmBO——贝叶斯优化引导的交互式生成模型权重融合框架(多伦多大学/CMU)
SIGGRAPH 2026最佳论文(洛杉矶7月19–23日,1120+投稿):GimmBO(多伦多大学/CMU/Vector Institute)——实时交互式框架,将两个或多个生成图像模型的权重集融合,通过贝叶斯优化在融合空间导航,由用户偏好点击引导。
SIGGRAPH 2026最佳论文(洛杉矶7月19–23日,1120+投稿):GimmBO(多伦多大学/CMU/Vector Institute)——实时交互式框架,将两个或多个生成图像模型的权重集融合,通过贝叶斯优化在融合空间导航,由用户偏好点击引导。艺术家与设计师无需重新训练即可混合模型美学风格。(注:同次会议Test of Time奖已另行入池。)
模型权重融合是”在不重训练前提下定制AI风格”的核心路径——对是”AI工具民主化”趋势的代表性前沿论文。
查看原始来源 ↗
NVIDIA 官方 / Blender Foundation·
7月19日一手
产品
›NVIDIA DLSS 4.5 进驻 Blender:SIGGRAPH 2026 宣布,随 Blender 5.3「今秋」发布
NVIDIA 在 SIGGRAPH 2026 开幕首日宣布 DLSS 4.5(含多帧生成与 AI 超分辨率)将随 Blender 5.3「今秋」正式发布,为开源 3D 工具引入 AI 加速渲染。
NVIDIA 在 SIGGRAPH 2026 开幕首日宣布:DLSS 4.5(Multi Frame Generation 多帧生成 + AI 超分辨率)将接入 Blender,预计随 Blender 5.3「今秋」正式发布;届时 RTX 系列 GPU 用户无需升级硬件即可在 Blender 中获得显著的实时渲染性能提升。
Blender 是全球使用最广泛的开源 3D/动画/渲染工具;DLSS 4.5 接入意味着普通消费级 RTX 用户无需升级硬件即可获得接近高端渲染的实时性能,直接降低 3D 创作与 AI 辅助动画的硬件门槛。
查看原始来源 ↗
Autodesk官方新闻室 / 3DVF.com / ...·
7月19日一手
产品
›Autodesk SIGGRAPH 2026:Flow Studio新增AI自动绑骨架+神经层,Wonder 3D文本/图片一步生成3D角色,Maya AI运动全线升级
Autodesk在SIGGRAPH 2026展示Flow Studio重大更新:AI Rigging移除角色制作最复杂技术环节自动绑骨架,Wonder 3D支持文字或参考图一步生成完整3D角色,Maya新增AI辅助四足动物运动生成。
Autodesk在SIGGRAPH 2026展示了Flow Studio的重大更新:AI Rigging功能移除角色制作最复杂的技术步骤——自动完成骨架绑定;Neural Layer提升非线性角色动画质量;Wonder 3D支持从文字描述或参考图片一步生成完整可动3D角色;Maya另新增AI辅助四足动物(马匹等)运动生成能力;同时推出freemium免费入门层,拓宽覆盖面。
AI Rigging打通了「资产→可动角色」最高技术门槛,Wonder 3D实现「文字/图片→可动3D角色」的端到端路径,代表Autodesk专业3D软件全面融入AI工作流的标志性节点。
查看原始来源 ↗
›VGGRPO(ECCV 2026 Google):4D 隐空间几何奖励强化学习,解决视频扩散模型几何漂移
Google 团队提出 VGGRPO,通过隐空间 4D 几何奖励进行强化学习后训练,解决视频扩散模型几何漂移与摄像机轨迹不稳定问题,已被 ECCV 2026 收录。
ECCV 2026 收录 Google 团队提出的 VGGRPO:通过在 4D 隐空间中引入几何一致性奖励信号进行强化学习后训练,提升视频扩散模型的几何稳定性,解决几何漂移、摄像机轨迹不连贯和场景结构不稳定等问题,且无需对 VAE 进行额外解码。
几何一致性是 AI 视频生成进入专业影视和动画制作流程的核心障碍之一,VGGRPO 提供了可落地的 RL 后训练方案,对评估主流视频生成工具的底层几何稳定性有参考价值。
查看原始来源 ↗
PR Newswire(SIGGRAPH 官方)·
7月17日一手
赛展
›SIGGRAPH 2026 开幕预告:「Diffusion TV」扩散模型沉浸装置与 AI 创作伙伴工作坊
SIGGRAPH 2026 会前公告披露两大 AI 亮点:将扩散模型实时可视化的沉浸装置「Diffusion TV」,以及「视频生成视觉语言」专题研讨工作坊,大会 7 月 19—23 日于洛杉矶举行。
SIGGRAPH 2026 大会会前公告披露艺术与 AI 重点内容:艺术装置「Diffusion TV」将扩散模型的生成过程实时可视化为沉浸式体验;另设「视频生成视觉语言」专题研讨工作坊;大会官方将本届基调定为「AI 扩展而非取代人类创意」,大会于 7 月 19 至 23 日在洛杉矶举行。
SIGGRAPH 是全球最具权威的计算机图形与交互技术大会,本届 AI 艺术与工具议题密度为历届最高,「Diffusion TV」扩散模型装置和 AI 创作伙伴工作坊对 AI 艺术教育领域有直接参考价值。
查看原始来源 ↗
›MentalThink:让AI用SVG「脑补草图」做空间推理,MindCube三维测试76分超越GPT-5的56分
北邮×中科院×StepFun提出MentalThink,让多模态大模型在推理中生成SVG草图「看图思考」,MindCube三维旋转测试76分超越GPT-5的56分,仅用7B参数模型。
北邮、中科院与StepFun联合团队于2026年7月提出MentalThink系统(arXiv:2607.03530),让多模态大模型在推理过程中生成SVG代码草图、渲染后「看图思考」再修正,形成「画图→看图→推理」闭环;在MindCube三维心理旋转测试中达76.0分(对比GPT-5的56.3分),VSIBench空间理解与GPT-5持平;训练仅使用7B参数模型,研究揭示了「思考媒介」(SVG vs纯文字)对空间推理能力的决定性影响。
用SVG草图辅助空间推理以7B参数超越更大基线,提示「思维媒介的选择」对特定任务能力的影响可能独立于参数量;对理解多模态AI如何在空间设计任务中借助视觉草图辅助推理有参考意义。
查看原始来源 ↗
蚂蚁集团 / arXiv / 腾讯新闻·
7月15日
论文
›蚂蚁 LingBot-Vision:边界驱动视觉预训练新范式,10 亿参数超越 70 亿参数 DINOv3,权重开源
蚂蚁集团提出「掩码边界建模」预训练范式,10 亿参数 ViT-g 在深度估计基准上超越 70 亿参数 DINOv3,透明物体深度估计达 RMSE 0.010,权重已开源。
蚂蚁集团提出 LingBot-Vision 边界驱动视觉预训练方案,将边界检测从输出任务转为预训练核心目标;10 亿参数 ViT-g/16 在 NYU-Depth v2 深度估计测试中 RMSE 达 0.296,超越 70 亿参数 DINOv3(0.309);衍生的 LingBot-Depth 2.0 在透明物体深度估计上 RMSE 达 0.010;模型权重已开源。
更小参数量超越更大模型的视觉预训练突破,对透明物体深度估计的改进将影响 3D 重建和 AR 创作工具的底层能力,开源权重使教育与研究场景可低成本部署和实验。
查看原始来源 ↗
›上海交大发布WNM世界叙事模型:创作者与AI协同构建可编辑、可交互的叙事时空,针对AI视频生成「不可控」瓶颈
上海交通大学于2026年7月13日发布WNM(World Narrative Model)世界叙事模型,支持创作者与AI协同构建可编辑、可交互的叙事时空,专门针对现有AI视频生成在叙事连贯性和创作可控性上的瓶颈,面向影视级视频媒体制作场景。
上海交通大学于2026年7月13日发布WNM(World Narrative Model,世界叙事模型),人民网和上海交大官方渠道同步报道。WNM的核心设计目标是实现创作者与AI系统协同构建叙事时空:创作者可对生成的叙事结构进行直接编辑与交互调整,而非接受AI一次性输出的不可干预结果。该模型针对当前AI视频生成领域普遍存在的「不可控」瓶颈——即叙事连贯性难以维持、场景过渡逻辑混乱——提出结构性解法,设计目标面向影视级视频媒体制作场景。研究目前处于发布初期,工程化落地情况有待跟踪。
AI视频生成从「一键出片」走向「叙事可编辑」,这一研究方向与影视、动画、数字媒体专业的创作需求直接对应,值得关注其后续工程化进展。
查看原始来源 ↗
›北大+深势科技提出PRA自回归图像生成框架:16维低维中间状态+并行解码,135M参数在像素空间超越1.9B基线
北京大学联合深势科技提出PRA自回归图像生成框架,采用16维低维中间状态与并行解码机制,135M参数规模在像素空间的表现超过1.9B参数基线,绕开传统视觉tokenizer,目前处于理论突破阶段,工程化程度待评估。
北京大学联合深势科技发布PRA(Parallel Recurrent Autoregressive)图像生成框架,于2026年7月13日经机器之心报道。PRA采用16维低维中间状态与并行解码机制,在像素空间直接建模而非依赖传统视觉tokenizer,使得135M参数规模的模型在标准基准测试中超越1.9B参数基线模型。该方法在理论层面提供了一种降低图像生成模型参数量的新路径,但当前研究仍处于理论突破阶段,工程化落地程度有待进一步评估。
以更小的参数量超越更大的模型,这类参数效率研究对艺术设计类院校的AI课程演示有参考价值——它展示了模型架构设计如何影响生成质量,而非仅靠堆叠参数。
查看原始来源 ↗
genception.github.io/TechTi...·
7月13日一手
论文
›DeepMind发布GenCeption:统一视觉理解与生成的视频通用模型
DeepMind发布GenCeption,是首个在单一模型中统一视频理解与生成能力的视觉通用学习器,在多项基准上取得领先结果。
DeepMind于2026年7月13日发布GenCeption,这是一个将视频理解(描述、问答、分类)与视频生成(文本到视频、图像到视频)统一在单一模型架构中的视觉通用学习器,在多个标准基准上取得当前最优结果。项目详情发布于genception.github.io,机器之心等媒体进行了技术解读报道。
视觉理解与生成在统一模型中的融合是当前多模态研究的核心前沿方向,GenCeption的发布对从事AI视觉创作与人机协作研究的院校团队具有重要的学术参考意义。
查看原始来源 ↗
›SIGGRAPH 2026 Experience Hall全面公布:五大板块,Art Gallery「In-Betweens」含4件AI艺术
SIGGRAPH 2026 Experience Hall公布五大板块完整阵容,Art Gallery「In-Betweens」12件入选作品中含4件AI艺术,探索AI与记忆、身份及人机关系,7月19-23日洛杉矶举行。
SIGGRAPH 2026 Experience Hall于2026年7月10日公布完整阵容,涵盖空间叙事、沉浸馆、Art Gallery、新兴技术及动手课程五大板块。Art Gallery单元以「In-Betweens」为主题,共入选12件作品,其中4件为AI艺术作品,探索AI与记忆、身份及人机关系等主题。展览于7月19日至23日在洛杉矶会展中心举行,由SIGGRAPH官方与PRNewswire双源确认。
SIGGRAPH Art Gallery专设4件AI艺术作品,是国际顶级图形学大会正式将AI艺术纳入核心展览序列的具体体现,7月19日开幕。
查看原始来源 ↗
›LIMSSR(ICML 2026 Spotlight):不完全多模态学习的条件序列推理新范式
北京大学与福州大学联合提出LIMSSR,将不完全多模态学习问题重定义为条件序列推理任务,通过LLM语义推理实现上下文感知模态插补,ICML 2026 Spotlight,不依赖完整训练数据即超越现有方法。
北京大学与福州大学联合研究团队在ICML 2026上以Spotlight论文形式发表LIMSSR,将不完全多模态学习重新定义为条件序列推理任务。该方法借助大语言模型的语义推理能力实现上下文感知的模态插补,在不依赖完整训练数据的前提下显著超越现有方法。由机器之心报道。
多模态数据不完整是实际AI应用中的普遍问题,LIMSSR提出的推理补全范式对多模态生成与理解模型的鲁棒性研究具有参考意义。
查看原始来源 ↗
›北大HOI-Edit+SCPE:AI图像编辑进入「交互理解」时代(ICML 2026)
北大王选所等团队发布HOI-Edit基准+SCPE自纠错框架(ICML 2026),将AI图像编辑从「改像素」推进到「交互理解」三层认知评测,L1交互分数提升22%,数据集与代码已开源。
北京大学王选所联合研究团队在ICML 2026上发布HOI-Edit基准与SCPE自纠错框架,将AI图像编辑能力评测重新定义为三层认知任务:基础交互理解、空间关系推理、因果物理推理。SCPE框架通过I2V视频过程诊断失败案例并自动纠错,L1交互评分提升22%。相关数据集与代码已开源,arXiv编号2606.19073,由机器之心与163.com双源报道。
AI图像编辑从像素操控向意图理解与自纠错范式演进,HOI-Edit为评测新一代可交互编辑工具提供了系统性基准框架。
查看原始来源 ↗
›LingBot-World 2.0开源:全球首个小时级连续运行世界模型,720p/60fps实时生成
Ant Group旗下Robbyant开源LingBot-World 2.0,实现全球首个小时级连续运行世界模型,支持720p/60fps实时生成,一张图片可延展为无限AI世界。
Ant Group旗下Robbyant团队开源了LingBot-World 2.0世界模型,据多源报道,这是目前全球首个支持小时级连续运行的世界生成模型,可在720p分辨率、60帧每秒的条件下实时生成场景。其核心特性是可从单张图片出发,生成持续延展的AI世界,突破了此前视频生成模型的短片级时长瓶颈。
小时级连续运行世界模型的开源,为游戏环境生成、影视场景设计与虚拟空间教育场景提供了新的技术参照,对数字媒体、交互设计、游戏设计方向的研究与教学有参考价值。
查看原始来源 ↗
SIGGRAPH官方/PRNewswire·
7月8日一手
赛展
›SIGGRAPH 2026首设Games Summit:全天聚焦AI在游戏开发中的应用
SIGGRAPH 2026首次设立独立的Games Summit,以全天专题形式聚焦AI在游戏开发中的动效、无障碍、VFX、音频与管线应用,于7月19日在洛杉矶举办。
SIGGRAPH 2026在7月19日大会开幕当天首次设立独立的Games Summit,全天专题聚焦AI技术在游戏开发中的具体应用,涵盖AI驱动动效、无障碍设计、视觉特效(VFX)、音频生成及制作管线等多个方向。这是游戏×AI融合方向首次在SIGGRAPH获得独立会场,地点在洛杉矶会展中心。
SIGGRAPH作为顶级视觉计算学术大会,单独设立游戏AI专场反映了游戏引擎与生成式AI整合已成为产业主流议题,对游戏设计、动画、交互设计方向的师生有较强的前沿参考价值。
查看原始来源 ↗
机器之心 / arXiv·
7月7日编辑精选
论文
›TryOnCrafter:首个自由视角视频虚拟试衣 DiT 框架(ECCV 2026)
TryOnCrafter提出首个支持自由视角的视频虚拟试衣DiT框架,引入4D试衣代理机制,入选ECCV 2026,机器之心与arXiv双源确认。
TryOnCrafter是一个基于扩散Transformer(DiT)的视频虚拟试衣框架,提出了首个支持自由视角的4D试衣代理机制,可从多个视角对服装穿着效果进行视频级生成与评估。研究成果入选ECCV 2026计算机视觉领域顶级会议,由机器之心及arXiv于2026年7月7日报道发布。与既有方法相比,TryOnCrafter在视角自由度与时序一致性上有系统性改进。
自由视角的视频级虚拟试衣能力在电商、数字服装及AI辅助设计等场景中有直接应用价值,ECCV 2026的入选也为该方向的学术认可度提供了参照。
查看原始来源 ↗
›同济设创11项成果亮相CHI 2026,2篇获最佳论文提名
同济大学设计创意学院11项研究成果入选CHI 2026,其中2篇获最佳论文提名,研究聚焦AI与交互设计、可及性及教育技术的交叉应用。
2026年7月7日,同济大学设计创意学院(D&I)官方发布消息,本届CHI 2026(ACM人机交互领域顶级学术会议)共收录该院11项研究成果,其中2篇入围最佳论文提名,研究方向集中于AI辅助的交互设计、无障碍可及性及教育技术应用。CHI是计算机与人机交互领域国际最具影响力的学术会议之一。
同济设创在CHI 2026的集中收录,代表国内设计院校在AI辅助交互设计领域的学术产出正在获得国际顶级会议的认可,对该方向的学术研究路径有参考价值。
查看原始来源 ↗
SIGGRAPH 官方 / PRNewswire·
7月6日一手
赛展
›SIGGRAPH 2026 主旨演讲公布:NVIDIA 实时神经渲染 + TripoAI 3D 生成双线并行
SIGGRAPH 2026 官方公布主旨演讲阵容:NVIDIA 主讲实时神经渲染技术方向,TripoAI 代表 3D 生成新范式参与演讲,大会 7 月 19–23 日于洛杉矶举行
SIGGRAPH 2026 官方页面公布主旨演讲阵容:NVIDIA 将主讲实时神经渲染技术的最新进展,TripoAI 作为 3D 生成领域代表参与主旨环节,两条演讲线路分别对应视觉计算基础设施升级与 AI 三维内容生成范式两大方向。大会将于 7 月 19–23 日在洛杉矶举行,消息由 SIGGRAPH 官方网站与 PRNewswire 同步确认。
NVIDIA 实时渲染与 TripoAI 3D 生成同入主旨演讲,反映出 SIGGRAPH 2026 将「AI 驱动的实时三维内容」作为本届大会核心叙事主轴。
查看原始来源 ↗
机器之心 / 新浪科技 / arXiv:2606.25907·
7月6日一手编辑精选
论文
›ICRDrag:上海交大提出首个上下文区域拖拽图像编辑模型,精准变形代替点选
上海交大 ICRDrag 提出首个基于 DiT 上下文学习的区域拖拽图像编辑模型,用掩码替代点选实现源区域→任意目标区域精准变形,代码与模型已开源(ECCV 2026)
上海交大研究团队在 arXiv(2606.25907)发布 ICRDrag,这是首个上下文区域拖拽图像编辑模型,入选 ECCV 2026。方法基于 DiT 上下文学习框架,以掩码替代传统点选操作,可实现源区域到任意目标区域的精准变形,涵盖姿态、形状与位置调整;研究同时构建了百万级 Paired Region Dataset 训练集,代码与模型已在 GitHub(bcmi/ICRDrag-Region-Drag-Editing)开源。由机器之心、新浪科技双源报道。
可控区域精准编辑是 AI 辅助设计中的高频需求,ICRDrag 以掩码替代点选降低了操作门槛,对 AI 图像编辑工具的实际教学演示与研究复现均有直接参考价值。
查看原始来源 ↗
›Anthropic《语言模型中的全局工作空间》:Claude内部发现J-space意识结构
Anthropic研究发现Claude内部自发形成J-space全局工作空间结构,J-lens解释工具已开源,Claude能感知自身处于测试状态。
Anthropic于2026年7月6日发布研究论文《语言模型中的全局工作空间》,揭示Claude内部自发形成了一种名为J-space的结构——仅用6-7%的概念方差即可控制模型的全部可报告性,与全局工作空间理论在人类意识研究中的角色类似。配套解释工具J-lens(Jacobian透镜)已于7月2日以Apache-2.0协议开源。研究还发现Claude在一定条件下能感知自身处于测试状态,并相应调整其可报告的判断内容。
首次在大型语言模型内部发现具有统计意义的意识结构类比,为AI可解释性研究提供了新的分析路径,也引发了关于AI系统内部状态可信度的深层讨论。
查看原始来源 ↗
ICML 官方 / 机器之心 / 量子位·
7月5日一手编辑精选
论文
›ICML 2026 杰出论文揭晓:清华扩散语言模型与 MIT/耶鲁采样算法同获大奖
ICML 2026 两篇扩散模型论文同获杰出论文奖:清华黄高团队 JustGRPO(GSM8K 89.1%)与 MIT/耶鲁高精度采样算法;英伟达 Motive 获荣誉提名
ICML 2026 于 7 月 5 日公布年度奖项,两篇扩散模型论文同获杰出论文奖:清华大学黄高团队的「扩散语言模型任意顺序灵活性陷阱」研究(JustGRPO,GSM8K 数学推理准确率 89.1%),以及 MIT 与耶鲁大学联合提出的扩散采样高精度算法;英伟达 Motive(视频运动归因与数据筛选,人类偏好胜率 74.1%)获荣誉提名;时间检验奖授予 Google DeepMind 经典工作。由 ICML 官方发布,机器之心、量子位等三源报道。
ICML 顶会扩散模型方向两项大奖均指向生成质量与可控性提升,扩散模型在语言与视频领域的基础能力边界再度推进,对理解当前 AI 生成系统能力上限具有参考价值。
查看原始来源 ↗
›Wan-Streamer v0.1:首个端到端实时音视频流数字人框架,arXiv 提前公开
Wan-Streamer v0.1 提出端到端实时音视频流数字人生成框架,论文 arXiv:2606.25041 提前公开,覆盖音频驱动唇形同步与实时视频流输出全链路
arXiv 论文 2606.25041 提前公布 Wan-Streamer v0.1,这是一个面向实时音视频流数字人场景的端到端生成框架:输入实时音频流,直接输出可流式传输的数字人视频,覆盖音频驱动、唇形同步与实时编码全链路,无需离线分段渲染。优设同期跟进了技术解读。
端到端流式架构将数字人生成从「离线渲染后播放」推向「实时流媒体直推」范式,对直播、客服、数字主播等场景的工程化落地路径有直接参考价值。
查看原始来源 ↗
搜狐 / 一只梨 / SIGGRAPH 2026 官方·
7月4日一手
论文
›SIGGRAPH 2026 技术论文 5 大设计方向:3D 感知/身体交互/AI 产品化/虚实融合/设计工具
从 SIGGRAPH 2026 技术论文提炼 5 大设计前沿方向:3D 空间感知、身体与情境交互、AI 产品化、虚实融合、设计工具,覆盖从感知到工具的完整链路
搜狐科技/一只梨结合 SIGGRAPH 2026 官方论文页,从 345 篇技术论文中提炼出 5 大设计前沿方向:3D 空间感知(含浙大风温触觉研究)、身体与情境交互(康奈尔 AI 多人场景生成)、AI 产品化(港科大 Audio-Omni 统一声音编辑框架)、虚实融合(沉浸式空间计算)、设计工具(AI 辅助工作流工具)。SIGGRAPH 2026 大会将于 7 月 19–23 日在洛杉矶举行。
基于学术论文的视角梳理设计×AI 前沿方向,对判断下一阶段设计研究热点与工具方向的演进路径有参考价值。
查看原始来源 ↗
›中科大等联合综述 500+ 篇文献:扩散模型的「生成一致性危机」三类框架与开源评测
中科大+清华+剑桥等机构联合综述 500+ 篇论文,系统分析扩散模型『生成一致性危机』,提出外部/内部/规范三类一致性框架
中科大、清华大学、剑桥大学等机构联合发布综述,梳理 500 余篇相关文献,系统分析当前扩散模型在「生成一致性」方面的挑战。综述提出外部一致性(与输入文本/图像的语义对齐)、内部一致性(生成内容内部的视觉连贯性)、规范一致性(遵循既定规则与约束)三类框架,揭示模型「能画好看的图却守不住要求」的根源。开源评测地址已随论文公开发布。
对扩散模型一致性问题的系统性分类框架,为理解当前 AI 图像/视频生成技术的核心局限提供了结构化的学术参照。
查看原始来源 ↗
SIGGRAPH 2026 官方 / PRNewswire·
7月2日一手
案例
›SIGGRAPH 2026 计算机动画节:Google DeepMind AI 辅助油画风动画短片《Dear Upstairs Neighbors》入选
SIGGRAPH 2026 计算机动画节入选 Google DeepMind 团队 AI 辅助油画风动画短片,艺术家全程主导 + AI 协同创作模式获学院奖认证节展认可
SIGGRAPH 2026 计算机动画节(CAF)公布入选名单,Google DeepMind 团队创作的 AI 辅助动画短片《Dear Upstairs Neighbors》入选,作品采用油画风格,由艺术家全程主导创作方向,AI 在过程中担任协同角色。CAF 为学院奖认证评审节展,将于 7 月 19–23 日在洛杉矶举办,同场包含《阿凡达:烈焰与灰烬》《曼达洛人与格罗古》等好莱坞大制作生产揭秘环节。
学院奖认证节展正式接纳 AI 辅助创作作品,且作品来自 Google DeepMind,是 AI 在主流动画产业认可体系中获得正式位置的参照节点。
查看原始来源 ↗
机器之心 / 腾讯新闻 / arXiv:2605.21...·
7月1日一手编辑精选
论文
›GenEvolve:自进化图像生成 Agent 开源,工具编排轨迹替代单步提示词
GenEvolve 将图像生成从『一句话提示词』升级为 Agent 自主编排工具调用轨迹,港科广+美团+港科大+新加坡国立联合开源
GenEvolve(arXiv:2605.21605)由港科广、美团、港科大、新加坡国立大学联合提出,将图像生成范式从「单步提示词→图像」升级为 Agent 自主工具编排:系统自动调用网页搜索、图像检索、生成知识等工具,编排 prompt-reference program 后交渲染器执行,实现「自进化」的生图策略。模型、代码、数据集、评测集全部开源(MeiGen-AI GitHub 仓库,MIT+Apache-2.0 许可)。中文报道集中于 7 月 1 日,多源确认。
将 Agent 工具编排能力引入图像生成流程,是对传统「提示词工程」范式的结构性升级,开源特性使其可直接用于研究复现与教学演示。
查看原始来源 ↗
SIGGRAPH 2026 官方 / PRNewswi...·
6月30日一手
论文
›SIGGRAPH 2026 技术论文最佳奖:CMU 平面映射算法 3D 矢量化速度提升数量级,7 月洛杉矶举行
SIGGRAPH 2026 于 2026-06-30 公布技术论文最佳奖:CMU 平面映射算法获最佳论文(3D 矢量化速度提升数个数量级),慕尼黑工大时空流体仿真获荣誉提名;大会 7 月 19–23 日在洛杉矶举行(第 53 届)。
SIGGRAPH 2026 技术论文最佳奖于 2026-06-30 揭晓:CMU 团队的平面映射算法(Surface Tiling)获最佳论文,实现 3D 矢量化速度「数个数量级」的提升;慕尼黑工大与亚琛工大的时空 FLIP 流体仿真获荣誉提名;Adobe 研究院与德克萨斯大学奥斯汀的薄壳弯曲模型填补最佳实践空白;大会将于 7 月 19–23 日在洛杉矶举行(第 53 届),与 Art Papers 及 Art Gallery 主题「In-Betweens」同期。
SIGGRAPH 最佳技术论文是视觉计算学术界的最高荣誉之一;CMU 的 3D 矢量化速度突破对数字设计与动画渲染工作流有直接意义,流体仿真进步影响影视特效教学精准度;7 月大会期间可持续关注 AI 在视觉计算各子领域的最新研究进展,以作为课程参考更新依据。
查看原始来源 ↗
›SIGGRAPH 2026 投稿:AI 秒级生成高精度数字浮雕(港城大 / 斯坦福 / 康奈尔联合研究)
香港城市大学、斯坦福、康奈尔科技学院、德州大学奥斯汀联合研究,实现 AI 在秒级时间内生成高精度数字浮雕,相关成果已投递 SIGGRAPH 2026;目前为单一来源报道。
香港城市大学、斯坦福大学、康奈尔科技学院与德克萨斯大学奥斯汀分校联合研究团队发布成果,实现以 AI 模型在秒级推理时间内生成高精度数字浮雕,对数字雕塑、文创工艺品生产与艺术教学具有直接参考价值,已投递 SIGGRAPH 2026。
数字浮雕生成连接平面图像与三维工艺品制作的生产流程,秒级速度具备进入实际演示场景的潜力;注:目前为单一来源报道,建议以 arXiv 或 SIGGRAPH 2026 官方程序原文为准。
查看原始来源 ↗
科技行者 / arXiv (2606.27608)·
6月25日一手
论文
›Qwen-Image-2.0-RL:阿里用强化学习训练 AI「审美」,图像生成 Elo 提升 78 分
阿里 Qwen 团队发布 Qwen-Image-2.0-RL(arXiv:2606.27608),通过 GRPO 强化学习与在线策略蒸馏设计图文对齐、美感、肖像三类奖励模型,文生图 Elo 从 1115 升至 1193(+78),图像编辑 Elo 从 1256 升至 1349(+93)。
阿里 Qwen 团队发布 Qwen-Image-2.0-RL(arXiv:2606.27608),通过 GRPO 强化学习与在线策略蒸馏(OPD)构建三套奖励模型——图文对齐、美感、肖像——赋予图像生成模型更强的「审美判断」能力;技术方案含混合 CFG 策略、异步奖励管道与提示词筛选工程;文生图 Elo 从 1115 升至 1193(+78),图像编辑 Elo 从 1256 升至 1349(+93),在评测界属显著提升。
「用强化学习训练 AI 审美」的技术路径对艺术设计×AI 领域研究有直接方法论参考价值:如何定义可量化的「美感奖励」、如何让模型从人类偏好数据中习得审美判断,是生成式 AI 艺术研究的核心方法论问题;arXiv 全文适合研究生与教研方向师生作为前沿参考阅读。
查看原始来源 ↗
机器之心 / arXiv:2512.11883·
6月25日一手
论文
›ICML 2026 Spotlight:AI 图像审美对齐机制正在削弱生成内容的艺术多样性
ICML 2026 Spotlight 论文指出,HPS 等 AI 图像审美评分系统的对齐机制正在削弱生成图像的艺术多样性,越符合评分标准的图像越缺乏表现力
ICML 2026 Spotlight 论文(arXiv:2512.11883)系统研究了 AI 图像生成模型审美对齐机制的副作用:以 HPS(Human Preference Score)等审美评分体系为优化目标的训练过程,会导致生成图像趋向「高分但单一」的同质化审美,而牺牲图像的艺术表现力与多样性。研究结论指出,「越符合评分标准的图越缺乏表现力」。
对 AI 生成图像的评估指标与实际艺术价值之间的系统性矛盾进行了实证研究,是批判性审视当前 AI 图像生成技术路线的重要参照文献。
查看原始来源 ↗
SIGGRAPH 2026 官方·
6月24日一手
论文
›SIGGRAPH 2026 Art Papers 录用名单公布,主题「创作性翻译的复杂性」
SIGGRAPH 2026 Art Papers 录用名单已公布,主题为「The Creative Complexities of Translation」,入选论文发表于 PACMCGIT 特刊,覆盖艺术×科学×技术交叉研究,有别于早先公布的 Art Gallery 入选;大会于 7 月 19–23 日在洛杉矶举行。
SIGGRAPH 2026 于 2026 年 6 月 24 日公布 Art Papers 录用名单,本届主题为「The Creative Complexities of Translation」(创作性翻译的复杂性);入选论文将发表于 ACM 期刊 PACMCGIT 特刊;Art Papers 是 SIGGRAPH 专设的艺术×科学×技术交叉研究发表通道,与 5 月已公布入选的 Art Gallery(展览作品)为不同项目;大会将于 2026 年 7 月 19–23 日在洛杉矶举行。
SIGGRAPH Art Papers 是 AI 艺术与计算创作研究的重要学术发表渠道,「创作性翻译」主题指向跨媒介、跨文化的创作转化问题,与 AI 辅助多语言及多模态艺术创作研究高度相关,录用名单可作为追踪艺术×技术交叉前沿方向的参考。
查看原始来源 ↗
Kyutai / UC Berkeley / 腾讯新闻·
6月24日一手
论文
›Kyutai+UC Berkeley 预印本系统质疑 FID 指标:AI 图像生成评测可靠性存疑
Kyutai 与 UC Berkeley 联合预印本(arXiv:2606.20536)对 AI 图像生成常用评测指标 FID 的可靠性提出系统性质疑,指出不同评测环境下结论相互矛盾,「最强」排名可能依赖了一个有缺陷的指标。
法国 Kyutai 与加州大学伯克利分校联合发布预印本(arXiv:2606.20536),对 AI 图像生成领域最常用的评测指标 FID(Fréchet Inception Distance)提出系统性质疑。研究指出,在不同评测环境与参数设置下,同一方法的 FID 结论存在相互矛盾的情况,当前部分「最强」方法的排名可能建立在一个存在缺陷的指标基础上,对现有研究结论的可信度构成方法论层面的挑战。
对 AI 图像生成的研究者与学习者而言,该研究提示在阅读和引用相关论文时需批判性审视 FID 排名,不宜以其高低作为方法优劣的单一依据。
查看原始来源 ↗
机器之心 / 新浪 / WAIC 官网·
6月22日一手
论文
›WAIC 2026 SAIL 奖 TOP30 及青年优秀论文 TOP20 发布
WAIC 2026(7 月 17–20 日,上海)发布 SAIL 奖 TOP30 及青年优秀论文 TOP20,计算机视觉、具身智能、AI 创作方向均有入围,首次自举办顶级学术分会 WAIC Academic。
世界人工智能大会(WAIC 2026)于 2026 年 6 月 22 日发布 SAIL 奖 TOP30 入围名单及青年优秀论文 TOP20,涵盖计算机视觉、具身智能、AI 创作等方向;本届大会将于 7 月 17–20 日在上海举办,并首次自行举办高水平学术分会 WAIC Academic,三家以上媒体源核认。
SAIL 奖和青年论文榜单是观察中国 AI 研究前沿方向与新锐研究者的年度参照之一,AI 创作方向入围说明该领域在学术层面获得持续认可。
查看原始来源 ↗
内核观察 / 哲思哲言 / 深圳大学·
6月21日一手
论文
›SIGGRAPH 2026 前沿预热:多篇中文解读密集放出,AI「全面入侵」大会
SIGGRAPH 2026 开幕前夕,国内多个技术媒体和高校研究团队集中放出中文深度解读,覆盖从芯片到像素的 AI 全链路渗透格局。
2026 年 6 月 21 日前后,内核观察、哲思哲言、深圳大学可视计算研究中心等三家以上来源集中发布 SIGGRAPH 2026 预热解读文章,梳理本届大会在图形学、AI 生成、神经渲染等方向的研究布局,将本届 SIGGRAPH 定性为「从芯片到像素 AI 全面入侵的大会」,多篇文章从不同角度拆解技术前沿格局。
SIGGRAPH 是计算机图形学与 AI 生成视觉的最重要学术会议,中文深度解读的集中出现,为关注国际前沿研究但阅读英文原文有障碍的师生提供了便捷的参考入口。
查看原始来源 ↗
HuggingFace Blog·
6月18日一手
论文
›HuggingFace:别只用 LoRA——公平基准下 OFT 等技术更优
HuggingFace:公平基准下 OFT 等技术在部分任务上优于 LoRA。
HuggingFace PEFT 团队指出 LoRA 占据 95%+ 的微调份额,但「他法超越 LoRA」的论文多有调参偏向;其统一 PEFT 库已支持 40+ 种技术并开始做公平基准,部分任务上 OFT 表现更好且切换只需改一行配置。
做模型微调 / 风格训练时不必默认只用 LoRA,这是模型训练课程与科研选型的实打实参考(但数据集有限,结论需谨慎)。
查看原始来源 ↗
复旦大学 / 阶跃星辰 / 西湖大学 / 港大·
6月18日一手
论文
›FreeStyle:复旦+阶跃星辰等联合提出社区 LoRA 驱动的大规模任意风格迁移方法
复旦大学、阶跃星辰、西湖大学与港大联合提出 FreeStyle(arXiv:2606.20506),通过系统挖掘社区 LoRA 构建大规模内容×风格双参考数据集,实现任意风格迁移并完整保留内容结构,支持水墨、刺绣、油画、吉卜力等多样风格。
复旦大学、阶跃星辰、西湖大学与香港大学研究团队发布预印本 FreeStyle(arXiv:2606.20506v1),通过系统挖掘 Stable Diffusion 社区中大量开源 LoRA 构建了一个大规模的内容与风格双参考配对数据集,并在此基础上训练了一个支持任意风格迁移的生成模型,在迁移过程中可完整保留原始内容的结构与细节;支持中国水墨、刺绣、油画、吉卜力、赛博朋克、像素朋克等多种风格转换。
利用社区 LoRA 资产而非重新标注数据的训练思路,为 AI 风格迁移的研究与教学提供了一个新的数据构建路径,对图像设计、插画与 IP 视觉延伸方向的创作实践有参考价值。
查看原始来源 ↗
央美美术馆 / 四川美术出版社·
6月16日一手
论文
›《数智艺术论》央美首发:56 万字,提出「50%+30%+20%」人才培养框架
《数智艺术论》在中央美术学院首发,56 万字,五大板块 13 专题,提出「50% 专业+30% 跨学科+20% AI 基础」的高校人才培养框架,填补国内数智艺术系统性理论空白。
由一山主编的《数智艺术论》于 2026 年 6 月 16 日在中央美术学院美术馆首发,由四川美术出版社出版,全书 56 万字,分五大板块 13 个专题,系统建构数智艺术的理论框架;书中提出「50% 专业技能+30% 跨学科知识+20% AI 基础能力」的高校艺术设计人才培养比例建议,被认为填补了国内该领域系统性学术理论的空白。
国内首部系统性数智艺术理论专著,对制定 AI 融合课程方案、撰写相关基金申报书或参与学科评估的教师具有直接的文献参考价值。
查看原始来源 ↗
arXiv / CVPR 2026 / 机器之心·
6月15日一手
论文
›FreeOrbit4D:单目视频→任意相机轨迹重拍,无需训练,单卡可跑(CVPR 2026)
UIUC 与 Eyeline Labs 提出 FreeOrbit4D:输入单目视频,无需额外训练即可重拍出任意相机轨迹视角;于 CVPR 2026 Workshop 展示,代码开源,单卡 A40 可运行。
arXiv 论文 2601.18993(UIUC + Eyeline Labs)提出 FreeOrbit4D 框架,核心思路是对输入单目视频中的前景做完整 4D 重建,再由视频扩散模型引导生成任意相机轨迹下的重拍结果,全流程无需针对输入视频额外训练;于 CVPR 2026 Workshop 展示,代码已开源,可在单张 A40 显卡上运行。论文提交 arXiv 时间为 2026 年 6 月 15 日,机器之心及网易等中文媒体有跟进报道。
单目视频任意运镜的无训练重拍能力,对影视后期、虚拟制片、数字媒体等专业的学生有直接的实验与创作应用价值;单卡可运行的硬件门槛也使课堂实践具有可行性。
查看原始来源 ↗
arXiv / 机器之心 / chooseAI·
6月15日一手
论文
›高德 AI 团队开源 DreamX-World 1.0 通用交互式世界模型
高德 AI 团队在 arXiv 发布 DreamX-World 1.0,可生成 1 分钟长视频,支持 6 自由度相机控制与「世界记忆」机制,采用 MIT+Apache-2.0 双协议开源。
高德 AI 团队于 2026 年 6 月 15 日在 arXiv(论文编号 2606.16993)发布 DreamX-World 1.0,这是一个通用交互式世界模型,支持最长 1 分钟连续视频生成、6 自由度(6DoF)相机控制,并引入「世界记忆」机制以维持跨时间步的场景一致性;模型以 MIT+Apache-2.0 双协议开源,ComfyUI 整合包同步上线。
长视频世界模型的开源发布,为研究 AI 驱动叙事空间、交互式影像创作及沉浸体验原型的师生提供了可直接实验的开源基础设施。
查看原始来源 ↗
SIGGRAPH 2026 官网·
5月21日一手
赛展
›SIGGRAPH 2026 Art Gallery「In-Betweens」入选作品公布,7 月洛杉矶登场
SIGGRAPH 2026 Art Gallery『In-Betweens』入选公布,7 月洛杉矶登场。
第 53 届 SIGGRAPH 将于 7 月 19–23 日在洛杉矶会展中心举办,Art Gallery 主题「In-Betweens」聚焦系统、材料、时间与公众之间的关系,本届收到近 200 件投稿;入选作品含 AI 生成互动装置(Diffusion TV)、动感光阵(Light Architecture)等。ACM SIGGRAPH 学生数字艺术竞赛(DAC)征稿主题「Speculative Futures」同期开放。
SIGGRAPH Art Gallery 是 AI 艺术实践最前沿的年度样本之一,对科技艺术、交互装置、生成艺术方向有参考价值;DAC 学生竞赛同期开放,截止时间以官网为准。
查看原始来源 ↗