ECCV 2026官方/AI4VA Workshop官方·
9月9日一手
论文
›ECCV 2026第四届AI for Visual Arts工作坊今日举办:世界模型×视觉艺术、长视频生成前沿
ECCV 2026第四届AI for Visual Arts专题工作坊于9月9日在瑞典马尔默举办,聚焦世界模型、长视频生成、神经三维等视觉艺术AI前沿方向
ECCV 2026(欧洲计算机视觉顶级会议,9月8–12日,瑞典马尔默)第四届AI for Visual Arts(AI4VA)专题工作坊于9月9日举办,聚焦为视觉艺术服务的前沿计算机视觉研究方向:用于艺术创作的世界模型、长视频生成、神经三维重建、生成式艺术批评与评估方法等。本届ECCV接收的LiveEdit(清华×港科大实时流式视频编辑)、A²-Edit(上交大任意物体参考编辑)等论文均在相关方向有成果展示。AI4VA是计算机视觉研究与艺术创作应用交叉的年度国际风向标。
ECCV AI4VA工作坊汇聚视觉艺术AI研究的顶尖成果,对跟踪”AI技术如何重塑视觉艺术创作工具”的研究者和教育者是最直接的学术信号来源。
查看原始来源 ↗
ComfyUI 官方 / ai-tldr.dev·
9月9日一手
产品
›ComfyUI v0.35.0:Comfy Compiler 加速与七个前沿模型官方合作节点一键接入
ComfyUI v0.35.0 引入 Comfy Compiler 内存加速,并新增 GPT-6、GPT Image 2.5、Claude Fable 5.1、Gemini Omni 1.1 等 7 个官方合作模型节点,同时扩展 3D 管线。
ComfyUI v0.35.0 于 2026 年 9 月 9 日发布,引入 Comfy Compiler 核心优化,削减 CUDA 内存分配开销、降低 VRAM 浪费,加速高负载工作流。本版新增 7 个官方合作模型节点:OpenAI GPT-6 Astra / GPT Image 2.5、Anthropic Claude Fable 5.1、Google Gemini Omni 1.1、MiniMax H3 Max Turbo、Recraft V4 Styles Pro、Meta Muse Image;3D 管线新增 Pixal3D Multi-View(清华×腾讯)和 SenseNova U1.5 多参考编辑(最多 10 张参考图),以及 VideoTrim / VideoCrop 新增编辑控件。
一个版本同时接入七个前沿生成模型,使 ComfyUI 工作流可在单一界面内对多个商业 API 和开源模型进行并排对比与链式调用。
查看原始来源 ↗
›Runway GWM Worlds 2:全球首个实时可操控AI世界模型,720p/24fps持续生成并响应文字指令
Runway发布通用世界模型第二代GWM Worlds 2,持续生成720p/24fps视频并响应用户实时文字操控指令,世界从当前状态延续而非重置
Runway于9月3日发布通用世界模型第二代GWM Worlds 2,核心特性为持续生成720p/24fps视频与48,000Hz原生音频,并在不重置世界状态的前提下响应用户实时文字操控指令。与此前AI视频”提示词→固定片段”的生成模式不同,GWM Worlds 2的世界在用户每次输入操控指令后从当前状态延续,支持自由文本动作指令寻址角色或场景整体,以及持续的摄像机运动控制。官方定位覆盖互动娱乐、虚拟角色、机器人训练与具身Agent仿真,目前为研究预览阶段。
GWM Worlds 2标志着AI视频生成从”内容输出”向”可实时导演的连续世界”的范式跃迁,持续响应式世界模型为互动叙事和AI驱动场景仿真开辟了新的可能。
查看原始来源 ↗
OpenAI官方/Fortune/CNBC·
9月3日一手
模型
›OpenAI发布GPT-6(Project Astra):Computer Use能力正式上线,可操控3D/CAD软件
OpenAI正式发布GPT-6(Project Astra),新增Computer Use能力,官方演示包括操控3D建模软件和CAD程序执行多步骤设计任务
OpenAI于9月3日正式发布GPT-6(内部代号Project Astra),核心新能力为Computer Use(计算机操控):模型可理解屏幕内容、控制浏览器和桌面应用、执行多步骤操作任务。官方演示场景包括操控3D建模软件和CAD程序,将AI能力从”内容生成”扩展至”工具操控”。GPT-6在多模态指令遵循和长上下文任务链方面有显著提升,沿用GPT-5.6架构基础进行工程优化。
Computer Use能力标志着AI从”生成助手”向”操控代理”的功能延伸,在设计和工程领域,AI直接操控专业软件执行任务的可能性正在从研究阶段走向产品落地。
查看原始来源 ↗
›Runway Solaris:首个界面世界模型,将实时网站与应用UI转化为视频体验
Runway发布研究级模型Solaris,定义为界面世界模型(Interface World Model),可将网页和应用UI实时渲染为连续视频体验,目前为研究Demo阶段
Runway于8月31日发布研究级模型Solaris,将其定义为”界面世界模型”(Interface World Model):模型接收网页截图或实时屏幕流作为输入,理解数字界面的交互逻辑,并生成连续的视觉导航体验——将静态网站或应用UI转化为视频式沉浸呈现。Solaris在推理阶段响应用户操控指令,生成界面的动态视频叙事,而非静态截图。目前处于研究Demo阶段,未开放商用API。
界面世界模型代表AI视频生成向”交互媒介”延伸的新方向,将数字界面本身作为可生成、可导演的视觉材料,对UI设计与数字艺术创作的工具链形成潜在影响。
查看原始来源 ↗
ComfyUI官方GitHub·
8月24日一手
产品
›ComfyUI v0.33.4:Wan 3.0 30秒原生节点+Meshy-7 Ultra 3D生成+ByteDance vCube 8K视频增强
ComfyUI v0.33.4 发布,新增阿里 Wan 3.0 原生工作流节点(30秒/1080p视频+多模态输入)、Meshy-7 Ultra 3D生成节点、字节跳动 vCube 视频增强节点(至8K超分+帧率增强),同时修复若干UI稳定性问题。
ComfyUI v0.33.4 于 8 月 24 日发布,主要更新:阿里 Wan 3.0 原生工作流节点,支持 30 秒/1080p 视频生成及多模态输入(文档/PPT/PDF 转视频);Meshy-7 Ultra 节点集成,最新 3D 生成模型直通 ComfyUI 工作流;字节跳动 vCube 视频增强节点,支持至 8K 超分+帧率增强;修复若干 UI 稳定性问题。
三项新增节点分别覆盖视频生成(Wan 3.0)、3D 资产(Meshy-7 Ultra)、视频后期(vCube 8K),合力将本地工作流的输出标准推向专业交付级别。
查看原始来源 ↗
arXiv 2607.26037 + alphaXiv·
7月29日一手
论文
›Wonder(Adobe Research+JHU):解决控制漂移/记忆衰减/延迟膨胀的视频世界模型,单图→可游走3D一致性世界
Adobe Research与Johns Hopkins大学提出Wonder视频世界模型:将相机运动转化为像素空间视觉线索(绕过神经隐式重建);稀疏检索全保真历史帧解决记忆衰减;实时蒸馏学生模型解决延迟膨胀;可从单张图像或视频生成可交互、3D一致性、分钟级时长的沉浸式世界;6方向实时导航@16fps。
Adobe Research与Johns Hopkins大学提出Wonder视频世界模型:将相机运动转化为像素空间视觉线索(绕过神经隐式重建);稀疏检索全保真历史帧解决记忆衰减;实时蒸馏学生模型解决延迟膨胀;可从单张图像或视频生成可交互、3D一致性、分钟级时长的沉浸式世界;6方向实时导航@16fps。
“把一张概念图变成可游走的沉浸空间”方向已有Adobe Research级顶会论文背书——装置艺术/XR叙事/空间设计研究方向的老师有新对标论文
查看原始来源 ↗
新智元 / 量子位 / 36氪 / CSDN / 51CTO·
7月25日
论文
›清华 AutoMIA 入选 CVPR'26:输入两张图片 76 秒生成镜像错觉 3D 艺术品,支持 3D 打印
清华 AutoMIA 系统可将任意两张图片自动生成镜像错觉 3D 物体,76 秒完成,支持直接 3D 打印输出,已入选 CVPR 2026
清华大学团队提出 AutoMIA(Automatic Mirror Illusion Art)系统,并入选 CVPR 2026。该系统输入任意两张图片,全自动生成正面与侧面呈现不同图案的镜像错觉 3D 物体,全流程仅需 76 秒,无需额外训练,输出文件可直接用于 3D 打印生成实体艺术品;全场景最优得分 87.91%,大幅超越人类设计师的 77.53%;代码与预训练权重已在 GitHub 开源,线上交互演示同步开放。
AI 将镜像错觉艺术品的制作门槛从”专业数学建模+多小时手工”降至”上传两张图、76 秒自动生成可打印文件”,对计算艺术、装置设计、毕设实践课程有直接应用价值。
查看原始来源 ↗
量子位 / 凤凰科技 / ITBear·
7月24日
论文
›兔展智能UniWorld-View登顶WorldScore:单图生成任意视角视频,全开源适配昇腾
兔展智能联合北京大学提出UniWorld-View,在李飞飞团队WorldScore评测中登顶(国产首次),双流架构支持单图生成任意视角视频,代码权重全开源,已适配国产昇腾算力。
兔展智能联合北京大学提出UniWorld-View,在李飞飞团队WorldScore世界模型评测中登顶(国产世界模型首次);核心能力:单张图片生成完整多视角一致3D场景;代码与权重全开源,已适配国产昇腾算力,团队预告将推出设计工具RabbitVis。
国产世界模型首次登顶国际权威榜单,「单图→完整3D场景任意视角」对建筑、空间设计和展览策划课程有直接价值,全开源+昇腾适配对国内高校教学场景友好。
查看原始来源 ↗
SIGGRAPH 2026官方日程 / Tripo A...·
7月22日一手
观点
›Tripo AI SIGGRAPH 2026主题演讲:茶壶测试从「能展示」到「能制造」,3D生成AI迈向交互式世界智能
Tripo AI在SIGGRAPH 2026发表题为「茶壶测试:从展示走向制造」的主题演讲,阐述如何从孤立静态资产生成迈向动态环境/智能体系统/世界建模,展示Tripo全栈生成生态在游戏/3D打印/机器人仿真等工业管线中的应用。
Tripo AI在SIGGRAPH 2026发表题为「茶壶测试:从展示走向制造(The Teapot Test: From Showcase to Manufacture)」的主题演讲,由团队核心成员Yanpei Cao等主讲;演讲以图形学历史典故”犹他茶壶”为切入点,系统阐述从孤立资产生成(静态展示)迈向动态环境、智能体系统和世界建模(可制造、可交互)的路径;现场展示Tripo全栈3D生成生态在游戏资产制作、3D打印原型和机器人仿真训练数据等工业管线中的实际应用案例。
“从展示到制造”的定位对应3D生成AI的核心演进方向——进入实际生产管线而非停留在演示工具层面,茶壶测试的新诠释也为3D/交互设计课程提供了清晰的概念坐标。
查看原始来源 ↗
量子位 / 腾讯新闻 / 虎嗅 / 新浪财经 / 数字...·
7月22日
产品
›腾讯 Miora 国际版全量上线:生图 / 视频 / 3D / UI 四子 Agent 协同,登顶 Product Hunt 日榜,新用户赠 1000 积分
腾讯首个设计 Agent 平台 Miora 国际版全量上线,生图 / 视频 / 3D / UI 四子 Agent 同一画布协同交付,首日登顶 Product Hunt 日榜第一。
腾讯首个设计 Agent 平台 Miora 国际版正式全量上线,覆盖品牌设计、影视创意、电商广告、网页应用四大场景;平台内置生图、视频、3D、UI 四个子 Agent,可在同一画布内协同拆解任务、输出风格一致的完整视觉方案;开放 Skill 生态;新用户注册赠 1000 积分;发布首日登顶 Product Hunt 日榜第一;英文端多家媒体同步确认。
首个国产全栈设计 Agent 平台全量商用,标志 AI 设计从单点生成工具进入「多 Agent 协同一次交付整套视觉方案」阶段。
查看原始来源 ↗
WCCFTech / guru3d / TechPow...·
7月21日
模型
›NVIDIA DLSS 5 SIGGRAPH 2026揭秘:三路AI模型分工神经渲染,让艺术家「主导最终画面」,秋季上线
NVIDIA在SIGGRAPH 2026披露DLSS 5技术细节:三路独立AI模型(A/B/C)分别负责全局光照/次表面散射/材质细节等渲染环节,开发者可对场景/角色/关卡单独分配不同模型;紧凑扩散Transformer架构,单GPU实现4K/60fps/亚16ms延迟;DLSS 5秋季正式上线游戏。
NVIDIA在SIGGRAPH 2026披露DLSS 5的完整技术架构:三路独立AI模型(A/B/C)各司其职,分别负责全局光照、次表面散射和材质细节等渲染环节,开发者可按场景、角色或关卡粒度单独分配不同模型,实现更精细的创作控制;底层采用紧凑扩散Transformer架构,在单GPU上实现4K/60fps、亚16ms延迟;DLSS 5定于秋季正式上线商业游戏。此次揭秘强调”让艺术家主导最终画面”——有别于DLSS 4.5的超分/帧生成功能,DLSS 5是AI深度参与全局光照、皮肤、头发、布料物理建模的实时渲染本质变革。
DLSS 5不是超分迭代而是神经网络参与实时渲染底层物理建模的架构革新,”艺术家主导”定位将AI渲染主控权从自动算法还给创作者,对3D/游戏/影视设计方向有根本性影响。
查看原始来源 ↗
Autodesk官方新闻室 / Creative Bl...·
7月21日一手
产品
›Autodesk SIGGRAPH 2026:3ds Max支持可编辑3D高斯溅射,Maya MotionMaker支持「带自己的数据」定制生成动作模型
Autodesk在SIGGRAPH 2026宣布:3ds Max将3D Gaussian Splats变为完全可编辑资产(支持建模/动画/场景构建);Maya MotionMaker新增BYOD(Bring Your Own Data),团队可用自家动捕/手绑动作数据训练自定义生成动作模型;Flow Production Tracking引入实时媒体审阅与协同标注。
Autodesk在SIGGRAPH 2026宣布两项重要更新:3ds Max将3D Gaussian Splats从只读素材升级为完全可编辑资产,支持建模、动画和场景构建,并整合AI生成环境能力,使AI扫描生成的三维场景可直接进入专业VFX制作管线;Maya MotionMaker新增BYOD(Bring Your Own Data)功能,动画团队可使用自家动作捕捉或手绑动作数据训练专属动作生成AI模型,实现风格化定制;此外Flow Production Tracking引入实时媒体审阅与协同标注功能,改善远程协作审片流程。
3ds Max可编辑Gaussian Splats让AI生成三维场景直接进入VFX专业管线,Maya MotionMaker BYOD让动画团队训练专属风格的动作AI,两项更新共同降低了AI生成内容与专业制作工作流之间的整合门槛。
查看原始来源 ↗
NVIDIA官方Blog / Claypier / 掘...·
7月20日一手
产品
›NVIDIA SIGGRAPH 2026:MCP接入Adobe/Blender/Houdini/Unreal等全链路创作工具,同步发布Cosmos 3 Edge 4B边缘世界模型
NVIDIA在SIGGRAPH 2026宣布Adobe Firefly/Creative Cloud、Canva/Affinity Designer、Blender、SideFX Houdini 22、Unreal Editor等主流创作软件全面支持MCP协议,AI Agent可直接在DCC工具内执行场景检查/材质标记/版本导出等操作;同步开源Cosmos 3 Edge(4B参数,VANTAGE-Bench同参数同类第一),可在Jetson Thor/RTX PRO/GeForce RTX上本地运行。
NVIDIA在SIGGRAPH 2026主题演讲宣布,Adobe Firefly/Creative Cloud、Canva、Affinity Designer、Blender、SideFX Houdini 22、Unreal Editor等主流专业创作软件全面支持MCP(Model Context Protocol)协议,AI Agent可直接在这些DCC工具内执行场景完整性检查、材质与纹理标记、版本导出自动化等辅助操作,不再局限于生图功能;同步开源Cosmos 3 Edge(4B参数),在VANTAGE-Bench同参数同类评测中排名第一,支持在Jetson Thor/RTX PRO/GeForce RTX等消费级硬件上本地推理,采用Apache 2.0协议开源。
MCP协议同时接入Adobe/Blender/Houdini/Unreal意味着AI Agent开始进入设计师日常工具内”干活”,从生图工具进化为工作流协作者,是AI×设计工具生态最重要的架构转变之一。
查看原始来源 ↗
NVIDIA Research / SIGGRAPH ...·
7月20日一手
论文
›NVIDIA SIGGRAPH 2026发表21篇论文:MotionBricks实时动作AI同时驱动数字角色与人形机器人,ArtiFixer将杂乱3D扫描转为完整场景
NVIDIA在SIGGRAPH 2026发表21篇研究论文:MotionBricks基于35万段动作片段训练的实时动作AI可同时驱动屏幕数字角色与Unitree G1人形机器人;ArtiFixer将杂乱现实3D扫描自动转为可用虚拟场景;新雪/沙/弹性体物理求解器一并开源。
NVIDIA在SIGGRAPH 2026发表21篇研究论文并全部开源:MotionBricks基于35万段动作片段训练,可实时同时驱动屏幕数字角色和Unitree G1人形机器人,项目已在GitHub开源;ArtiFixer建立从杂乱现实3D扫描到完整可用虚拟场景的自动化管线,直接影响摄影测量和建筑扫描进入VFX制作的工作流;此外还包含新的雪、沙、弹性体物理求解器,同样开源。
MotionBricks”一个AI同时驱动数字角色和真实机器人”标志着实时动作生成跨越数字-物理壁垒;全部开源意味着高校可直接复现实验和二次开发。
查看原始来源 ↗
机器之心 / 新浪财经 / Chinaz / 同花顺(多源)·
7月19日
行业
›昆仑万维WAIC宣布「2026世界模型元年」:Matrix-Game 3.5单卡实时生成,Riemann-1.0机器人世界模型同步发布
昆仑万维董事长方汉在WAIC 2026世界模型专场论坛宣布2026为「世界模型元年」;发布Matrix-Game 3.5(Patch级记忆注入、单卡实时生成)和Riemann-1.0机器人世界模型,同步升级Mureka v9.5与O3音乐模型,预判AI音乐与视频将成大众创作工具。
昆仑万维在WAIC 2026举办世界模型专场论坛,董事长方汉宣布2026年为「世界模型元年」;现场发布Matrix-Game 3.5世界模型,引入Patch级记忆注入机制,实现单卡实时生成;同步发布Riemann-1.0机器人专用世界模型,并将Mureka音乐生成模型升级至v9.5与O3版本;圆桌讨论聚焦AI与文娱产业融合,嘉宾一致认为AI音乐与视频将从技术试验转为大众创作工具,人机协同将成为全球文娱产业新范式。
「世界模型元年」定义是WAIC 2026中文创作工具赛道最具战略宣示意味的表态之一;Matrix-Game 3.5与Riemann-1.0分别覆盖内容生产与具身智能两大方向,结合Mureka音乐模型,形成「内容+机器人」双线世界模型布局;单卡实时生成意味着本地化部署门槛大幅降低,对高校创作工具应用具有直接价值。
查看原始来源 ↗
Autodesk官方新闻室 / 3DVF.com / ...·
7月19日一手
产品
›Autodesk SIGGRAPH 2026:Flow Studio新增AI自动绑骨架+神经层,Wonder 3D文本/图片一步生成3D角色,Maya AI运动全线升级
Autodesk在SIGGRAPH 2026展示Flow Studio重大更新:AI Rigging移除角色制作最复杂技术环节自动绑骨架,Wonder 3D支持文字或参考图一步生成完整3D角色,Maya新增AI辅助四足动物运动生成。
Autodesk在SIGGRAPH 2026展示了Flow Studio的重大更新:AI Rigging功能移除角色制作最复杂的技术步骤——自动完成骨架绑定;Neural Layer提升非线性角色动画质量;Wonder 3D支持从文字描述或参考图片一步生成完整可动3D角色;Maya另新增AI辅助四足动物(马匹等)运动生成能力;同时推出freemium免费入门层,拓宽覆盖面。
AI Rigging打通了「资产→可动角色」最高技术门槛,Wonder 3D实现「文字/图片→可动3D角色」的端到端路径,代表Autodesk专业3D软件全面融入AI工作流的标志性节点。
查看原始来源 ↗
›MentalThink:让AI用SVG「脑补草图」做空间推理,MindCube三维测试76分超越GPT-5的56分
北邮×中科院×StepFun提出MentalThink,让多模态大模型在推理中生成SVG草图「看图思考」,MindCube三维旋转测试76分超越GPT-5的56分,仅用7B参数模型。
北邮、中科院与StepFun联合团队于2026年7月提出MentalThink系统(arXiv:2607.03530),让多模态大模型在推理过程中生成SVG代码草图、渲染后「看图思考」再修正,形成「画图→看图→推理」闭环;在MindCube三维心理旋转测试中达76.0分(对比GPT-5的56.3分),VSIBench空间理解与GPT-5持平;训练仅使用7B参数模型,研究揭示了「思考媒介」(SVG vs纯文字)对空间推理能力的决定性影响。
用SVG草图辅助空间推理以7B参数超越更大基线,提示「思维媒介的选择」对特定任务能力的影响可能独立于参数量;对理解多模态AI如何在空间设计任务中借助视觉草图辅助推理有参考意义。
查看原始来源 ↗
量子位 / 人民网 / China Daily(多源)·
7月16日
模型
›魔芯科技MoWorld 3D世界模型正式上线华为云:单张照片生成完整3D场景,全栈国产NPU(昇腾),向全行业开放
国家具身智能应用中试基地联合华为云、魔芯科技发布MoWorld 3D世界模型,支持从单张照片生成完整3D场景,全栈基于国产NPU(昇腾)构建,正式上线华为云向全行业开放。
国家具身智能应用中试基地联合华为云、魔芯科技于2026年7月16日发布MoWorld 3D世界模型,支持用户上传单张照片即可生成完整三维场景;模型从训练到推理全栈基于国产NPU(昇腾)构建,现已正式上线华为云,面向智慧城市、工业仿真、数字内容创作等行业开放API调用。
单张照片到完整3D场景的能力突破了3D内容生产对多视角扫描或大量3D数据的传统依赖,华为云API接入则意味着无需本地高端GPU即可调用,整体降低了三维内容创作的工程门槛。
查看原始来源 ↗
›上海交大发布WNM世界叙事模型:创作者与AI协同构建可编辑、可交互的叙事时空,针对AI视频生成「不可控」瓶颈
上海交通大学于2026年7月13日发布WNM(World Narrative Model)世界叙事模型,支持创作者与AI协同构建可编辑、可交互的叙事时空,专门针对现有AI视频生成在叙事连贯性和创作可控性上的瓶颈,面向影视级视频媒体制作场景。
上海交通大学于2026年7月13日发布WNM(World Narrative Model,世界叙事模型),人民网和上海交大官方渠道同步报道。WNM的核心设计目标是实现创作者与AI系统协同构建叙事时空:创作者可对生成的叙事结构进行直接编辑与交互调整,而非接受AI一次性输出的不可干预结果。该模型针对当前AI视频生成领域普遍存在的「不可控」瓶颈——即叙事连贯性难以维持、场景过渡逻辑混乱——提出结构性解法,设计目标面向影视级视频媒体制作场景。研究目前处于发布初期,工程化落地情况有待跟踪。
AI视频生成从「一键出片」走向「叙事可编辑」,这一研究方向与影视、动画、数字媒体专业的创作需求直接对应,值得关注其后续工程化进展。
查看原始来源 ↗
IT之家/虎嗅/新智元/腾讯新闻/TechNode/G...·
7月13日一手
模型
›商汤开源SenseNova-Vision统一视觉大模型:目标检测、图像分割、深度预测、3D重建四大任务原生统一单一架构,超越Vision Banana
商汤科技于2026年7月13日开源SenseNova-Vision,将检测、分割、深度预测、3D重建四大视觉任务原生统一到单一多模态架构,性能超越Vision Banana,以CC BY-NC 4.0协议开放,教学环境可自由使用。
商汤科技于2026年7月13日在GitHub(OpenSenseNova/SenseNova-Vision)发布并开源SenseNova-Vision统一视觉大模型,以CC BY-NC 4.0协议开放。该模型将目标检测、图像分割、深度预测、3D重建四大计算机视觉核心任务整合进同一多模态架构,无需分别部署四套专用模型,综合性能指标超越此前同类代表模型Vision Banana。IT之家、虎嗅、新智元、腾讯新闻及TechNode等多个中英文平台同日跟进报道,模型文件同步在Hugging Face托管。
对艺术设计院校而言,SenseNova-Vision提供了一个开源的多任务视觉理解基础模型,CC BY-NC协议允许教学场景自由使用,在课程中演示AI对图像的结构化理解能力具有直接可操作性。
查看原始来源 ↗
›LingBot-World 2.0开源:全球首个小时级连续运行世界模型,720p/60fps实时生成
Ant Group旗下Robbyant开源LingBot-World 2.0,实现全球首个小时级连续运行世界模型,支持720p/60fps实时生成,一张图片可延展为无限AI世界。
Ant Group旗下Robbyant团队开源了LingBot-World 2.0世界模型,据多源报道,这是目前全球首个支持小时级连续运行的世界生成模型,可在720p分辨率、60帧每秒的条件下实时生成场景。其核心特性是可从单张图片出发,生成持续延展的AI世界,突破了此前视频生成模型的短片级时长瓶颈。
小时级连续运行世界模型的开源,为游戏环境生成、影视场景设计与虚拟空间教育场景提供了新的技术参照,对数字媒体、交互设计、游戏设计方向的研究与教学有参考价值。
查看原始来源 ↗
›魔芯Flash World Model:视频世界模型训练成本降70%,50FPS实时交互
魔芯发布Flash World Model,视频世界模型训练成本较同类降低70%,实现50FPS实时交互世界生成。
魔芯发布Flash World Model,在视频世界模型训练成本上实现约70%的降幅,同时支持50FPS的实时交互世界生成。该成果由机器之心与量子位等媒体报道。
世界模型训练成本大幅压缩有助于降低实时交互场景的部署门槛,推动AI生成内容向实时可控方向演进。
查看原始来源 ↗
›1600行代码,Claude Fable 5一次生成63个完整3D世界
研究人员通过1600行代码提示Claude Fable 5,一次性生成63个完整3D世界场景(含水下曼哈顿等),此案例由新智元与Arena.ai报道,引发Karpathy等人公开评论。
2026年7月7日,新智元及Arena.ai报道了一个Claude Fable 5的代码生成案例:研究人员使用约1600行代码的提示,令Fable 5一次性生成了63个完整3D世界场景,包括水下曼哈顿等创意场景,AI研究员Andrej Karpathy(前OpenAI/Tesla)对此公开表示惊叹。该案例展示了大语言模型在空间场景理解与生成上的扩展边界。
单次提示批量生成多样化3D世界场景,为3D内容生成的规模化可能性提供了实验数据点,也是评估当前顶级LLM在空间创作维度能力边界的参考案例。
查看原始来源 ↗
SIGGRAPH 官方 / PRNewswire·
7月6日一手
赛展
›SIGGRAPH 2026 主旨演讲公布:NVIDIA 实时神经渲染 + TripoAI 3D 生成双线并行
SIGGRAPH 2026 官方公布主旨演讲阵容:NVIDIA 主讲实时神经渲染技术方向,TripoAI 代表 3D 生成新范式参与演讲,大会 7 月 19–23 日于洛杉矶举行
SIGGRAPH 2026 官方页面公布主旨演讲阵容:NVIDIA 将主讲实时神经渲染技术的最新进展,TripoAI 作为 3D 生成领域代表参与主旨环节,两条演讲线路分别对应视觉计算基础设施升级与 AI 三维内容生成范式两大方向。大会将于 7 月 19–23 日在洛杉矶举行,消息由 SIGGRAPH 官方网站与 PRNewswire 同步确认。
NVIDIA 实时渲染与 TripoAI 3D 生成同入主旨演讲,反映出 SIGGRAPH 2026 将「AI 驱动的实时三维内容」作为本届大会核心叙事主轴。
查看原始来源 ↗
搜狐 / 一只梨 / SIGGRAPH 2026 官方·
7月4日一手
论文
›SIGGRAPH 2026 技术论文 5 大设计方向:3D 感知/身体交互/AI 产品化/虚实融合/设计工具
从 SIGGRAPH 2026 技术论文提炼 5 大设计前沿方向:3D 空间感知、身体与情境交互、AI 产品化、虚实融合、设计工具,覆盖从感知到工具的完整链路
搜狐科技/一只梨结合 SIGGRAPH 2026 官方论文页,从 345 篇技术论文中提炼出 5 大设计前沿方向:3D 空间感知(含浙大风温触觉研究)、身体与情境交互(康奈尔 AI 多人场景生成)、AI 产品化(港科大 Audio-Omni 统一声音编辑框架)、虚实融合(沉浸式空间计算)、设计工具(AI 辅助工作流工具)。SIGGRAPH 2026 大会将于 7 月 19–23 日在洛杉矶举行。
基于学术论文的视角梳理设计×AI 前沿方向,对判断下一阶段设计研究热点与工具方向的演进路径有参考价值。
查看原始来源 ↗
投资界 / 新浪财经 / SiliconAngle·
7月2日
行业
›VAST AI Tripo 完成超 10 亿元 A3 轮融资,4399/贪玩/巨人网络等产业方参投
VAST AI 完成超 10 亿元 A3 轮融资,游戏产业方参投,Tripo 3D 大模型加速游戏/影视/工业设计商业化落地
3D 生成模型创企 VAST AI 于 7 月 2 日宣布完成超 10 亿元人民币(约 1.5 亿美元)A3 轮融资,投资方包括 4399、贪玩游戏、巨人网络等游戏产业方。本轮融资距其上一轮 A2 轮(2026 年 6 月,$200M)不足一个月。资金将用于 Tripo 3D 大模型在游戏、影视、工业设计领域的商业化落地加速。
游戏产业方密集参与 3D 生成模型融资,反映出 AI 三维内容生成技术在游戏生产管线中被视为近期可落地的生产效率工具。
查看原始来源 ↗
SIGGRAPH 2026 官方 / PRNewswi...·
6月30日一手
论文
›SIGGRAPH 2026 技术论文最佳奖:CMU 平面映射算法 3D 矢量化速度提升数量级,7 月洛杉矶举行
SIGGRAPH 2026 于 2026-06-30 公布技术论文最佳奖:CMU 平面映射算法获最佳论文(3D 矢量化速度提升数个数量级),慕尼黑工大时空流体仿真获荣誉提名;大会 7 月 19–23 日在洛杉矶举行(第 53 届)。
SIGGRAPH 2026 技术论文最佳奖于 2026-06-30 揭晓:CMU 团队的平面映射算法(Surface Tiling)获最佳论文,实现 3D 矢量化速度「数个数量级」的提升;慕尼黑工大与亚琛工大的时空 FLIP 流体仿真获荣誉提名;Adobe 研究院与德克萨斯大学奥斯汀的薄壳弯曲模型填补最佳实践空白;大会将于 7 月 19–23 日在洛杉矶举行(第 53 届),与 Art Papers 及 Art Gallery 主题「In-Betweens」同期。
SIGGRAPH 最佳技术论文是视觉计算学术界的最高荣誉之一;CMU 的 3D 矢量化速度突破对数字设计与动画渲染工作流有直接意义,流体仿真进步影响影视特效教学精准度;7 月大会期间可持续关注 AI 在视觉计算各子领域的最新研究进展,以作为课程参考更新依据。
查看原始来源 ↗
›SIGGRAPH 2026 投稿:AI 秒级生成高精度数字浮雕(港城大 / 斯坦福 / 康奈尔联合研究)
香港城市大学、斯坦福、康奈尔科技学院、德州大学奥斯汀联合研究,实现 AI 在秒级时间内生成高精度数字浮雕,相关成果已投递 SIGGRAPH 2026;目前为单一来源报道。
香港城市大学、斯坦福大学、康奈尔科技学院与德克萨斯大学奥斯汀分校联合研究团队发布成果,实现以 AI 模型在秒级推理时间内生成高精度数字浮雕,对数字雕塑、文创工艺品生产与艺术教学具有直接参考价值,已投递 SIGGRAPH 2026。
数字浮雕生成连接平面图像与三维工艺品制作的生产流程,秒级速度具备进入实际演示场景的潜力;注:目前为单一来源报道,建议以 arXiv 或 SIGGRAPH 2026 官方程序原文为准。
查看原始来源 ↗
›影眸 Hyper3D Rodin Gen-2.5 发布:首个「先思考再生成」机制的原生 3D 大模型
影眸科技发布 Hyper3D Rodin Gen-2.5 并完成数亿元融资,首创五档思考深度机制(约 4–80 秒),支持千万面级几何、12K 原生贴图、3D ControlNet、自然语言局部编辑与递归分件,Unity/Blender/Unreal 等 DCC 全面接入。
2026 年 6 月,影眸科技(Hyper3D)发布 Rodin Gen-2.5,将语言模型「先思考再生成」的推理机制引入 3D 生成领域:提供五档思考深度(约 4 秒至 80 秒),用户可按需在速度与精度间取舍;几何精度达千万面级(10M+ 多边形),并同步推出 12K 精度原生 3D 贴图模型;支持 3D ControlNet 精确控制几何形态、自然语言局部编辑与递归分件;Unity、Blender、Unreal 等主流 DCC 工具均已接入,并提供 fal.ai API 与企业部署选项。同步宣布完成数亿元人民币新融资,由凯辉基金与上海国投先导领投。
将「先思考再生成」机制延伸至 3D 生成,并以千万面级几何与 12K 贴图推进生产级精度,标志着 AI 3D 生成从演示原型向专业制作管线迈进,对影视、游戏与工业设计教学中 AI 辅助三维资产生产的研究与实践具有直接参照价值。
查看原始来源 ↗
arXiv / 机器之心 / chooseAI·
6月15日一手
论文
›高德 AI 团队开源 DreamX-World 1.0 通用交互式世界模型
高德 AI 团队在 arXiv 发布 DreamX-World 1.0,可生成 1 分钟长视频,支持 6 自由度相机控制与「世界记忆」机制,采用 MIT+Apache-2.0 双协议开源。
高德 AI 团队于 2026 年 6 月 15 日在 arXiv(论文编号 2606.16993)发布 DreamX-World 1.0,这是一个通用交互式世界模型,支持最长 1 分钟连续视频生成、6 自由度(6DoF)相机控制,并引入「世界记忆」机制以维持跨时间步的场景一致性;模型以 MIT+Apache-2.0 双协议开源,ComfyUI 整合包同步上线。
长视频世界模型的开源发布,为研究 AI 驱动叙事空间、交互式影像创作及沉浸体验原型的师生提供了可直接实验的开源基础设施。
查看原始来源 ↗