浅译快报

智能体与工作流

「智能体与工作流」方向的资讯,按发布日倒序。

Figma 官方博客(release-notes)· 9月16日一手 产品

Figma 推出 Weave 节点支持将 Design 画框拖入 AI 工作流、Shaders 开放测试版通过提示词生成动效着色器,并上线 Weave 社区工具发布功能。

Figma 于9月16至17日推出三项功能更新:Weave 节点允许将 Design 画框直接拖入 Weave AI 工作流作为节点输入,支持批量生成品牌一致的营销素材;Shaders 开放测试版可通过 AI 提示词生成火焰、扭曲、动效等视觉特效着色器,并提供代码查看器供进一步定制,无需编程背景;Weave 社区工具发布功能允许创作者将自建 AI 工作流工具发布至 Figma 社区,共享节点资产。

Weave 节点将静态设计直接接入 AI 规模化生产链路,Shaders 开测版则让无编程背景的设计学生也能实验 AI 生成动态视觉特效。

查看原始来源 ↗

ElevenLabs 官方博客· 9月15日一手 产品

ElevenLabs 将 MCP 连接器从纯语音扩展至多模态全链路,单次 OAuth 安装接入 50 余个语音、音乐、图像与视频生成模型。

ElevenLabs 于9月15日将 MCP 连接器从纯语音扩展至多模态创作全链路:单次 OAuth 安装即可接入语音、音乐、图像与视频生成共 50 余个模型;托管服务端位于 api.elevenlabs.io/v1/mcp;支持 Claude、ChatGPT、Cursor、Grokbot、Hermes 等主流 AI 客户端;用户在同一对话线程内可依次完成剧本、配音、配乐、音效到视频的完整创意流程,无需切换工具。

单一 MCP 连接器覆盖声音、图像到视频的完整创作链路,标志 MCP 生态从代码辅助向创意生产管线全面延伸。

查看原始来源 ↗

CreativePro· 9月9日一手 赛展

CreativePro主办的Design + AI Summit 2026定于2026年9月17日线上举办,聚焦平面、UI和出版设计师的AI工具实战工作流

CreativePro主办的Design + AI Summit 2026定于2026年9月17日线上举办,面向中高级平面、UI及出版设计专业人士。峰会内容涵盖Adobe Firefly/InDesign/Photoshop AI工作流、AI辅助排版与品牌资产自动化、设计师AI提效实战经验分享等主题,采用线上参与形式,无地域限制。

Design + AI Summit为设计专业教育者提供了跟踪行业AI工作流最新实践的参考资源,线上形式也便于推荐给有兴趣的合作院校教师参考。

查看原始来源 ↗

ComfyUI 官方 / ai-tldr.dev· 9月9日一手 产品

ComfyUI v0.35.0 引入 Comfy Compiler 内存加速,并新增 GPT-6、GPT Image 2.5、Claude Fable 5.1、Gemini Omni 1.1 等 7 个官方合作模型节点,同时扩展 3D 管线。

ComfyUI v0.35.0 于 2026 年 9 月 9 日发布,引入 Comfy Compiler 核心优化,削减 CUDA 内存分配开销、降低 VRAM 浪费,加速高负载工作流。本版新增 7 个官方合作模型节点:OpenAI GPT-6 Astra / GPT Image 2.5、Anthropic Claude Fable 5.1、Google Gemini Omni 1.1、MiniMax H3 Max Turbo、Recraft V4 Styles Pro、Meta Muse Image;3D 管线新增 Pixal3D Multi-View(清华×腾讯)和 SenseNova U1.5 多参考编辑(最多 10 张参考图),以及 VideoTrim / VideoCrop 新增编辑控件。

一个版本同时接入七个前沿生成模型,使 ComfyUI 工作流可在单一界面内对多个商业 API 和开源模型进行并排对比与链式调用。

查看原始来源 ↗

alphasignal.ai· 9月3日一手 产品

Krea 发布 Agents,单条自然语言指令驱动整套图像 / 视频生成工作流,内置 MCP 工具调用与跨会话长期记忆,面向 Krea Pro 订阅用户开放。

Krea 于 2026 年 9 月 3 日发布 Krea Agents,以单条自然语言指令驱动完整的图像 / 视频生成工作流;内置 MCP(Model Context Protocol)工具调用与跨会话长期记忆,用户无需手动连接节点,Agent 自动规划并执行多步创作任务;目前面向 Krea Pro 订阅用户开放。

将 ComfyUI 式节点工作流的编排能力打包为对话界面,是 AI 创作工具从图形化配置向自然语言驱动转型的代表性案例。

查看原始来源 ↗

Adobe官方· 9月3日一手 产品

Adobe推出Firefly for Slack集成,用户在Slack对话中可直接调用文生图、图生图和重新着色功能生成商业可用视觉资产,无需切换应用

Adobe于9月3日推出Slack原生集成,用户可在Slack对话界面和工作流中直接调用Adobe Firefly的文生图、图生图和重新着色功能,生成具备商业授权的视觉资产,无需切换至Adobe Creative Cloud应用。生成内容自动携带Firefly商业授权标注,并与Adobe Creative Cloud生态打通,支持直接导入后续处理。该集成面向在Slack中进行日常协作的设计和营销团队。

AI生图能力嵌入即时通讯协作工具,改变了”设计需求→设计师处理→交付”的传统工作动线,团队成员在讨论语境中即可生成可用素材。

查看原始来源 ↗

Figma官方博客· 8月13日一手 产品

Figma向所有用户开放Agent Skills创作权限,设计师可编写自定义工作流技能并发布至社区,截至9月社区已积累50+可用技能

Figma于8月13日开放Agent Skills创作权限,所有用户可使用技能编辑器编写自定义工作流技能并发布至Figma社区。截至9月,社区已积累超过50项可用技能,覆盖批量图层重命名、设计规范检测、品牌资产同步、AI组件生成等设计工作场景。Figma从单纯的设计工具演进为”可编程设计平台”,设计师的角色延伸至工作流开发者。

设计工具进入”技能市场化”阶段,与AI Native设计工具(Lovable、v0)的”App Store化”路径并行,反映设计工具生态的平台化重构趋势。

查看原始来源 ↗

Adobe官方· 8月8日一手 产品

Adobe推出Firefly Interfaces beta,提供企业级UI支持单次批量生成最多500个视觉资产,面向品牌营销和内容团队

Adobe推出Firefly “Interfaces” beta版本,这是一个专为企业内容团队设计的批量视觉资产生成工作流界面。核心功能是支持单次任务批量生成最多500个资产,用户可设置统一的品牌参数(色彩规范、风格引用、版权要求),系统自动生成符合规范的多尺寸、多变体资产输出。Interfaces与Adobe Creative Cloud生态打通,生成内容自动带Firefly商业授权标注,面向有大规模图像需求的营销、零售和媒体企业。

企业级批量生成工作流将AI图像生成从”单次创作辅助”推向”规模化内容生产流水线”,对理解AI工具在商业内容产业中的角色转变有参考价值。

查看原始来源 ↗

ComfyUI官方/ComfyUI Wiki/Kombitz· 8月3日一手 产品

ComfyUI v0.30.0正式发布,原生支持MiniMax H3音视频联合生成(含4个新节点与6套官方工作流)以及xAI Grok Imagine Video 1.5合作节点,MiniMax H3开源权重同日可用。

ComfyUI v0.30.0于8月3日正式发布,原生支持MiniMax H3音视频联合生成(包含4个新节点与6套官方工作流)、PrunaVAED加速LTX 2.3解码,以及xAI Grok Imagine Video 1.5合作伙伴节点;MiniMax H3开源权重同日发布,本地运行即时可用。

ComfyUI与MiniMax H3同日完成开源对接,使2K原生音视频联合生成能力在本地工作流中即时可用,大幅缩短了新模型能力进入实操场景的周期。

查看原始来源 ↗

OpenAI官博 + The Decoder + Bl...· 8月1日一手 模型

OpenAI 以非常规方式预告下一代旗舰模型 Astra:不发布产品,而是在数学博客第三段点名,随后将 Astra 内部版本解决的十道历史级数学难题(群论/算子代数/格密码/量子复杂度等)推上 GitHub,附249页技术报告及完整 Lean 4 机器可验证证明。

OpenAI 以非常规方式预告下一代旗舰模型 Astra:不发布产品,而是在数学博客第三段点名,随后将 Astra 内部版本解决的十道历史级数学难题(群论/算子代数/格密码/量子复杂度等)推上 GitHub,附249页技术报告及完整 Lean 4 机器可验证证明。Astra 定位为”多智能体协同运行数小时甚至数天的深度研究助手”,是 ChatGPT 之后的下一代 OpenAI 模型家族,目前未公开发布,需先通过美国政府审查。

对高校教师和科研团队的重要信号:OpenAI 明确将 Astra 定义为”能攻克极难长期研究问题的深度助手”,与日常对话式工具有质的差异

查看原始来源 ↗

机器之心 / arXiv:2607.23588· 7月28日一手 论文

JarvisHub(arXiv:2607.23588,7/26提交,7/28开源)是首个以「可编辑画布」同时作为Agent工作空间、外部记忆和动作空间的多模态创作框架;三层架构(画布状态→协议桥接→Agent运行时)支持持续规划、迭代生成、版本管理;用户可随时介入、引导、检查Agent创作过程,突破孤立工具调用限制,迈向可持续人机协同创作自动化。

JarvisHub(arXiv:2607.23588,7/26提交,7/28开源)是首个以”可编辑画布”同时作为Agent工作空间、外部记忆和动作空间的多模态创作框架;三层架构(画布状态→协议桥接→Agent运行时)支持持续规划、迭代生成、版本管理;用户可随时介入、引导、检查Agent创作过程,突破孤立工具调用限制,迈向可持续人机协同创作自动化。

直接面向多模态创作工作流的Agent框架——把”画布”从输出界面变为AI协作统一工作台

查看原始来源 ↗

量子位/机器之心· 7月26日 产品

吴恩达团队发布完全开源的个人桌面Agent框架,支持本地运行、隐私保护与跨浏览器及桌面应用操作,量子位、机器之心同步报道。

吴恩达团队发布完全开源的个人桌面Agent框架,支持本地运行与隐私保护,可跨浏览器、文件系统与桌面应用完成复合操作任务;基于视觉与动作模型,无需额外API集成,以MIT许可证发布。

完全本地化的开源桌面Agent降低了AI自动化工作流在隐私敏感环境中部署的门槛,为高校实验室提供了可自托管的AI操作工具选项。

查看原始来源 ↗

Anthropic工程师· 7月25日 观点

Anthropic工程师Thariq Shihipar详解Claude Code为Opus 5/Fable 5删除80%系统提示词的原因:旧规则是为旧模型设计的,新模型已能根据代码自主判断

Anthropic工程师Thariq Shihipar详解Claude Code为Opus 5/Fable 5删除80%系统提示词的原因:旧规则是为旧模型设计的,新模型已能根据代码自主判断;上下文工程从”堆规则”转向”交代产品环境与目标”,按需加载Skills/工具/资料;范式级转变:以前给AI喂规则,现在给AI塑造认知语境。- reason素材: Claude Code删80%系统提示词的工程决策,直接揭示了”上下文工程”范式的演进——对用AI辅助设计工作流的人来说,这意味着写Prompt的方式需要根本性转变;工作坊可用来讲”如何给AI配置工作环境而非堆砌规则”。- tags: [Claude Code, 上下文工程, 系统提示词, Anthropic, Prompt工程, AI工作流]- 三维分: 4/4/5=13- 采集日: 2026-08-01

Claude Code删80%系统提示词的工程决策,直接揭示了”上下文工程”范式的演进——对用AI辅助设计工作流的人来说,这意味着写Prompt的方式需要根本性转变;工作坊可用来讲”如何给AI配置工作环境而非堆砌规则”。- tags: [Claude Code, 上下文工程, 系统提示词, Anthropic, Prompt工程, AI工作流]- 三维分: 4/4/5=13- 采集日: 2026-08-01

查看原始来源 ↗

量子位 / 51CTO· 7月22日 观点

量子位发布 WAIC 2026 十大趋势:83 家参展主体聚焦 AI Agent,设计工具 Agent 化从个别案例变为行业风向标,从「对话式 AI」进入「交付式 Agent」。

量子位在 WAIC 2026 闭幕日发布十大趋势观察:大模型不再独占 C 位,83 家参展主体聚焦 AI Agent 与智能应用,Agent 演示增多;「设计工具 Agent 化」从个别案例变为行业风向标——从「对话式 AI」进入「交付式 Agent」,WAIC 2026 标志 AI 进入「能力收割」而非「能力竞赛」阶段。

WAIC 2026 十大趋势观察为理解 AI 工具当前发展阶段提供了系统性框架,「从生成到交付」的主线直接影响设计工具课程内容的规划方向。

查看原始来源 ↗

新浪科技 / 搜狐 / 腾讯新闻(多源)· 7月20日 产品

万兴科技在WAIC 2026展示三条AI视频产品线:万兴剧厂推出无限画布节点式影视工作流和专属AI Agent助手,Filmora.AI提供专业TVC画布级工作台,Virbo AI定位短视频电商带货场景,CEO宣布将推动AI影视规模化商业化。

万兴科技(Wondershare)在WAIC 2026展示三条AI视频产品线的集中更新:万兴剧厂推出”无限画布”节点式影视工作流,搭配专属AI Agent助手,面向剧情内容生产场景;Filmora.AI为专业TVC制作人群提供画布级工作台;Virbo AI定位短视频电商带货场景并在WAIC完成全球首秀;CEO吴太兵表示将推动AI影视的规模化商业化落地。三条产品线覆盖剧情创作、专业广告片和电商内容全场景。

万兴科技三条线覆盖剧情→专业TVC→电商带货全场景,无限画布+节点式工作流体现了AI视频工具从单片段生成向完整工业化管线演进的趋势方向。

查看原始来源 ↗

NVIDIA官方Blog / Claypier / 掘...· 7月20日一手 产品

NVIDIA在SIGGRAPH 2026宣布Adobe Firefly/Creative Cloud、Canva/Affinity Designer、Blender、SideFX Houdini 22、Unreal Editor等主流创作软件全面支持MCP协议,AI Agent可直接在DCC工具内执行场景检查/材质标记/版本导出等操作;同步开源Cosmos 3 Edge(4B参数,VANTAGE-Bench同参数同类第一),可在Jetson Thor/RTX PRO/GeForce RTX上本地运行。

NVIDIA在SIGGRAPH 2026主题演讲宣布,Adobe Firefly/Creative Cloud、Canva、Affinity Designer、Blender、SideFX Houdini 22、Unreal Editor等主流专业创作软件全面支持MCP(Model Context Protocol)协议,AI Agent可直接在这些DCC工具内执行场景完整性检查、材质与纹理标记、版本导出自动化等辅助操作,不再局限于生图功能;同步开源Cosmos 3 Edge(4B参数),在VANTAGE-Bench同参数同类评测中排名第一,支持在Jetson Thor/RTX PRO/GeForce RTX等消费级硬件上本地推理,采用Apache 2.0协议开源。

MCP协议同时接入Adobe/Blender/Houdini/Unreal意味着AI Agent开始进入设计师日常工具内”干活”,从生图工具进化为工作流协作者,是AI×设计工具生态最重要的架构转变之一。

查看原始来源 ↗

量子位 / 环球网 / 凤凰科技 / 雷锋网 / Ch...· 7月20日 产品

智象未来(HiDream.ai)在WAIC 2026发布基于自研HD-AgentOS的vivago R1,突破行业15-30秒视频时长限制,支持任意时长视频连续连贯生成,叙事逻辑/画面风格/角色IP全程统一,商业可用率达85%,适配短剧/专题片/品牌宣传片等长周期创作场景。

智象未来(HiDream.ai)于2026年7月20日在WAIC 2026(上海)发布vivago R1,基于自研HD-AgentOS多模态Agent操作系统构建,突破AI视频生成行业长期存在的15–30秒时长上限,支持任意时长视频的连续连贯生成;在整个生成过程中保持叙事逻辑、画面风格和角色IP的统一;内部评测商业可用率达85%,适配品牌宣传片、AI短剧、专题纪录片等需要完整叙事周期的创作场景;发布当日获量子位、环球网、凤凰科技、雷锋网、Chinaz等5家以上中文媒体同步报道。

AI视频生成的时长上限是制约商业落地的核心瓶颈,vivago R1”任意时长”的突破标志着AI视频工具从片段演示走向完整商业作品交付的关键里程碑。

查看原始来源 ↗

Figma官方帮助文档· 7月19日一手 产品

Figma Make新增GitHub双向集成,设计师可在画布中直接导入Git仓库、修改界面并提交代码变更,将视觉编辑器转变为可连接真实代码仓库的开发端口。

Figma于2026年7月19日在官方帮助文档正式上线Figma Make与GitHub双向集成:设计师可在Figma Make画布中直接导入Git仓库、修改界面并提交代码变更,将视觉编辑器转变为可连接真实代码仓库的开发端口。此次整合延续了今年Figma Config 2026 MCP Agent Connectors的方向,进一步压缩了「设计交付→前端实现」之间的切换摩擦。

Figma Make直接连接GitHub代码仓库,使设计师无需切换IDE即可提交代码修改,是「设计稿即代码」工作流的关键基础设施更新,与AI效果图全链路还原方向共同构成设计到代码的双向闭环。

查看原始来源 ↗

新智元· 7月18日 产品

Anthropic 为 Claude Code Artifacts 新增 MCP 连接器调用能力,生成的看板/仪表盘页面可连接实时数据,不同查看者按各自权限拉取不同内容,7 月 16 日上线。

Anthropic 于 7 月 16 日为 Claude Code Artifacts 上线 MCP 连接器调用能力:生成的看板、仪表盘等页面可直接连接实时数据,不同查看者按各自权限拉取不同内容;页面还可内嵌操作按钮(如发送 Slack 消息、更新 Issue),从静态展示页升级为动态数据面板。

Artifacts 从静态展示转向动态数据产品,为快速搭建可运行数据可视化与交互原型提供了更直接的路径,「原型即产品」的实现门槛进一步降低。

查看原始来源 ↗

中新网 / 36氪 / AIbase(多源)· 7月16日一手 产品

昆仑万维发布天工短剧工作台 SkyProduction,Agent 智能分镜可在视频生成前规划角色站位与机位;DramaWave 平台 3 部 AI 短剧 7 天内均破百万美元流水。

昆仑万维发布天工短剧工作台 SkyProduction:Agent 智能分镜模块可在视频生成前先规划角色站位与机位(参考上一镜构图生成下一镜站位图),无限画布支持 720° 全景图、3D 导演台与多角度打光编辑器,已接入 Seedance 2.5、可灵等主流视频生成模型。DramaWave 平台上线的 3 部 AI 短剧在发布后 7 天内均实现流水破百万美元。

AI 短剧生产从「随机抽卡祈祷出好镜头」到「先规划导演思维再生成视频」的范式转移,标志着 AI 视频创作工具链向可控性迈出实质性一步;6 源齐发叠加百万美元商业数据双重验证,是目前最完整的 AI 短剧可控生产公开案例。

查看原始来源 ↗

ComfyUI官方GitHub· 7月15日一手 产品

ComfyUI发布v0.28.0版本,新增原生视频处理节点并优化整体运行性能,进一步强化其作为AI创作工作流核心枢纽的地位。

ComfyUI于2026年7月15日发布v0.28.0版本,本次更新新增原生视频处理节点支持,允许在工作流中直接处理视频帧序列,同时对调度器与显存管理进行了性能优化,提升大型工作流的运行稳定性。更新内容由ComfyUI官方GitHub发布。

ComfyUI持续向视频方向扩展原生能力,对以其为工作流核心工具的院校AI创作课程而言,本次更新值得在工具链维护时跟进评估。

查看原始来源 ↗

中国日报/新浪科技/腾讯新闻· 7月13日一手 赛展

同济大学与腾讯云联合举办的TT设计学院Skill创新应用大赛于2026年7月13日收官,全国26所高校近300名选手参赛,选手将真实设计流程痛点封装为AI智能体(Skill)工具,7支战队获奖,AI Agent正式进入高校设计教育的实践评估体系。

同济大学与腾讯云联合举办的TT设计学院Skill创新应用大赛于2026年7月13日正式收官,中国日报、新浪科技、腾讯新闻多平台同步报道。本届大赛吸引全国26所高校近300名选手参与,参赛形式要求选手识别真实设计流程中的具体痛点,并将解决方案封装为可调用的AI智能体(Skill)工具,最终7支战队获奖。大赛以实际产出为评估核心,将AI Agent的开发与应用引入高校设计教育的课程竞赛体系。

这届大赛的意义在于「设计问题→AI工具」这条转化链路进入了正式的高校竞赛评估,AI Agent不再只是课堂演示道具,而成为设计专业学生需要具备的一项工程化输出能力。

查看原始来源 ↗

量子位· 7月7日 产品

openJiuwen Skill-Omni将AI Agent经验存储从纯文字升级为视觉+文字形式,支持从网页和视频自动提取截图生成可复用经验库。

openJiuwen发布首个工程化多模态Skill范式Skill-Omni,将AI Agent的经验存储从纯文字形式升级为视觉+文字复合形式。系统支持自动从网页和B站视频中提取截图,构建带图像依据的可复用经验库,使Agent在调用Skill时具备更完整的视觉上下文参考,改善Agent对界面操作类任务的理解准确性。

将视觉信息纳入AI Agent经验体系,对依赖视觉界面操作的设计工作流有参考价值——Agent理解并重现界面操作的能力有望因此提升。

查看原始来源 ↗

Meta 官方 / TechCrunch / CNBC...· 7月7日一手编辑精选 模型

Meta Superintelligence Labs 发布首个自研图像生成模型 Muse Image,采用 Agent 式架构(调用搜索与代码工具自我修正),已上线 Meta AI 应用、Instagram Stories 及 WhatsApp,并将接入广告系统 Advantage+,多指标超越 Google Nano Banana 2

7 月 7 日,Meta Superintelligence Labs(由 Alexandr Wang 领导)正式发布 Muse Image,这是 Meta 首个完全自主研发的图像生成模型。模型采用 Agent 式生成架构,可调用搜索与代码工具对输出进行自我修正,支持文生图、图像编辑、多参考图合成及以 Instagram 公开图片为参考源等功能;已在 Meta AI 应用、Instagram Stories(美国)及 WhatsApp(部分地区)上线,并计划接入广告投放系统 Advantage+。在多项第三方评测中,Muse Image 超越 Google Nano Banana 2,仅略低于 OpenAI 最新 GPT Image 模型;Muse Video 版本即将推出。消息由 Meta 官方及 TechCrunch、CNBC、Bloomberg、Axios 等 7 个以上信源同步报道。

更新(7 月 10 日):其中「@提及公开账号生成」功能因采用 opt-out 默认机制、允许参考任意公开 Instagram 账号历史图像,遭 SAG-AFTRA 与 CAA 联合声讨后由 Meta 下架,模型本体仍在运行。详见后续报道。

Meta 以 Agent 式架构切入图像生成并直接整合社交与广告分发渠道,标志着图像生成模型进入「生成即分发」的平台化阶段,对 AI 视觉生成在商业内容生产及社交平台工作流中的渗透路径有直接参考意义。

查看原始来源 ↗

爱范儿· 7月7日 教程

爱范儿观点文章指出,大多数人在使用AI时最常犯的错误是一开始就“给指令”而非“提问题”,降低预期与承认无知是用好AI工具的前置条件。

爱范儿于2026年7月7日发布观点文章,认为大多数AI工具使用者在起步阶段即陷入”指令优先”的思维定势,而实际上”问对问题”——即清晰定义任务边界、主动承认自身知识盲区——是提升AI输出质量的更关键前提。文章以具体使用场景为例,阐述降低对AI能力的过高预期与”承认无知”这两个认知前提对最终产出质量的影响。

从”怎么给指令”到”如何定义问题”的认知转换,代表了AI工具使用走向成熟的一个典型路径,适用于各类需要借助AI完成复杂创作或分析任务的场景。

查看原始来源 ↗

Runway 官方 changelog· 7月2日一手 产品

Runway 推出 Agent Skills(7/2),支持用简单命令构建完整广告活动与商业视频,AI 代理接管从概念到成片的全流程

Runway 于 7 月 2 日在官方 changelog 发布 Agent Skills:用户通过简单的命令描述即可触发 AI 代理自动完成从概念设定、脚本规划到视频成片的完整商业视频生产流程;支持广告活动、品牌推广视频、本地化广告等场景,AI 代理负责中间所有编排步骤。

商业视频生产从「工具辅助」转向「Agent 全流程接管」的实践案例,反映出 AI 视频工具在内容生产自动化程度上的阶段性跃升。

查看原始来源 ↗

机器之心 / 腾讯新闻 / arXiv:2605.21...· 7月1日一手编辑精选 论文

GenEvolve 将图像生成从『一句话提示词』升级为 Agent 自主编排工具调用轨迹,港科广+美团+港科大+新加坡国立联合开源

GenEvolve(arXiv:2605.21605)由港科广、美团、港科大、新加坡国立大学联合提出,将图像生成范式从「单步提示词→图像」升级为 Agent 自主工具编排:系统自动调用网页搜索、图像检索、生成知识等工具,编排 prompt-reference program 后交渲染器执行,实现「自进化」的生图策略。模型、代码、数据集、评测集全部开源(MeiGen-AI GitHub 仓库,MIT+Apache-2.0 许可)。中文报道集中于 7 月 1 日,多源确认。

将 Agent 工具编排能力引入图像生成流程,是对传统「提示词工程」范式的结构性升级,开源特性使其可直接用于研究复现与教学演示。

查看原始来源 ↗

Anthropic 官方 / TechCrunch /...· 6月30日一手编辑精选 模型

Anthropic 于 6 月 30 日发布 Claude Sonnet 5,定位 Agentic 场景,性能接近旗舰 Opus 级,成为 Claude Free/Pro 用户默认模型;入门定价 $2/$10 每百万 Token(至 2026 年 8 月底),与 GPT-5.6 同日形成正面竞争格局。

2026 年 6 月 30 日,Anthropic 发布 Claude Sonnet 5,将其定位为 Agentic 场景下的最强 Sonnet,性能接近旗舰 Opus 级,同日起成为 Claude Free 与 Pro 用户的默认模型,入门定价为 $2/$10 每百万 Token,优惠期至 2026 年 8 月底。该版本着重强化了计算机使用、工具调用与指令跟随能力。发布时间与 OpenAI GPT-5.6 发布(6 月 26 日)相邻,两者在 Agentic 旗舰方向形成正面竞争格局。

Claude Sonnet 5 的能力升级将直接影响依托 Anthropic 模型的设计自动化工具链,包括 Claude Code 与各类接入 Claude API 的 AI 设计工作流。

查看原始来源 ↗

Google Labs / GitHub / 腾讯云开发者· 6月29日一手 产品

Google Labs 开源 DESIGN.md 格式规范,用 YAML 设计 token + Markdown 说明的双层结构,让 Claude Code、Cursor 等 AI 编码智能体持久、结构化地理解并遵循一套设计系统。

Google Labs 开源了 DESIGN.md 格式规范(GitHub:google-labs-code/design.md),用 YAML 设计 token + Markdown 说明的双层结构,向 Claude Code、Cursor 等 AI 编码智能体描述一套视觉身份,使其在生成界面时能持久、结构化地获取并遵循设计约束,而非每次由人重新解释。

把设计系统写成 AI「看得懂」的结构化说明,是设计与 AI 编码协作走向规范化的一个具体方向,对设计系统建设与 AI 辅助前端实践具参考价值。

查看原始来源 ↗

凤凰科技 / 新智元 / SlashDot / Hac...· 6月28日 观点

Peter Steinberger、Addy Osmani(Google Cloud)命名,黄仁勋、Karpathy、Claude Code 作者 Boris Cherny 等多人呼应——「Loop Engineering」主张从调单次提示词转向设计以 AI 为引擎的持续循环工作结构,被认为是 Prompt Engineering 的范式接班。

Peter Steinberger 与 Google Cloud 的 Addy Osmani 相继命名并阐述「Loop Engineering」概念,黄仁勋、Andrej Karpathy、Claude Code 作者 Boris Cherny 等业界人士多方响应。核心逻辑是:相比持续调整单次提示词的细节,设计能将 AI 置于持续迭代循环中的驱动结构(Agents、自动反馈、工具调用链)带来更稳定且可放大的输出质量提升。2026 年 6 月下旬该概念在中英文社区同期引发讨论热潮。

「从调提示词到设计循环」的思路转变对 AI 辅助设计工作流的方法论有根本性影响——不只是「怎么问 AI」,而是「怎么搭设计驱动 AI 持续产出的工作结构」;在 AI 设计工作坊中讲授工作流方法的老师,这是一个值得纳入课程框架更新的方法论节点。

查看原始来源 ↗

量子位· 6月26日 产品

字节 TRAE 推出 Work Design 模式,可精准识别设计系统组件库,输入需求后自动生成 UI 设计稿并同步转代码,覆盖从设计到开发的完整工作流。

字节跳动 TRAE 推出 Work Design 模式,量子位对此进行实测。该模式的核心能力是识别用户已有的设计系统组件库,在接收到需求描述后自动生成对应的 UI 设计稿,并同步输出可用代码,打通从界面设计到前端开发的链路。实测报告显示,组件识别精度与 UI 一致性是该模式的主要亮点。

将设计系统作为上下文输入、以 AI 自动完成设计到代码的转译,是将 AI 编程工具引入设计规范约束环境的一种实践方向,对 UI 工程化教学与组件驱动设计研究具有参考价值。

查看原始来源 ↗

机器之心· 6月26日 产品

Taste Skill 在 GitHub 获 51K 星,通过布局、排版、动效规则库为 AI 编程工具提供设计规范约束,旨在解决 Vibe Coding 同质化「AI 味」问题,提升 AI 辅助生成界面的视觉品质。

Taste Skill 是一个专为 AI 编程工具(如 Cursor、Copilot 等)设计的开源「反平庸前端框架」,在 GitHub 已获超过 51K 星。其核心思路是通过系统化的布局比例、字体排印、色彩搭配与微动效规则库,为 AI 生成的前端代码提供「品味约束」,从设计规范层面解决 Vibe Coding 产出同质化、缺乏视觉区分度的问题。相关报道由机器之心发布,具体文章链接以原出处为准。

以可复用规则库的形式将设计原则注入 AI 编码工具上下文,是将设计知识工程化的一种新路径,对界面设计与前端工程交叉方向的教学与研究有一定参照意义。

查看原始来源 ↗

Figma Blog / CMSWire / 优设· 6月24日一手编辑精选 产品

Figma Config 2026 发布三项核心更新:画布内原生动效时间轴 Figma Motion(含 AI Agent 生成动效,当日 Open Beta)、设计与代码双向同步的 Code Layers,以及接入 Notion / Slack / GitHub 等 14+ 工具的 Design Agent MCP Connectors。

2026 年 6 月 24 日,Figma 在 Config 2026 大会上发布三项核心更新。① Figma Motion:在设计画布内原生集成动效时间轴,支持关键帧动画、弹簧动效与 AI Agent 直接生成动效,可导出 MP4、WebM、GIF、SVG 格式,当日开放 Open Beta;② Code Layers:实现设计稿与代码层的双向同步,设计修改可自动映射到对应代码,计划 7 月进入早期访问阶段;③ Design Agent MCP Connectors:设计 Agent 新增对接 Notion、Slack、GitHub、Atlassian、Hex 等 14+ 外部工具的 MCP 连接器,并支持将常用工作流封装为可复用的「Skills」指令。此次更新附赠 3D 变换与 Shaders 功能。

Figma 将动效制作从专用工具(After Effects、Rive 等)拉回设计主画布,同时以 MCP 打通外部协作工具链,进一步收紧了「设计→动效→交付」全流程;对开设 UI/UX、交互设计或产品设计课程的师生,这批更新值得在课程工具链中跟进评估,Figma Motion Open Beta 可即时体验。

查看原始来源 ↗

ChooseAI· 6月23日一手 模型

字节跳动于 FORCE 大会(6 月 23 日)发布 Seeddream 5.0 Pro,新增箭头/圈选直接标注的交互式精准编辑、多图层分离输出(可直接对接 PSD 工作流)及 10 余种语言原生文字生成,与 Seedance 2.5 构成图像→视频完整工业化链路。

字节跳动于 2026 年 6 月 23 日 FORCE 大会发布 Seeddream 5.0 Pro,新增三项主要能力:交互式精准编辑(支持在图像上直接以箭头标注或圈选区域的方式指定编辑目标,精确到局部内容);多图层分离输出(生成结果可按图层独立导出,直接对接 Photoshop PSD 工作流进行后期精修);以及 10 余种语言的原生文字生成能力,拓展多语言内容制作场景。Seeddream 5.0 Pro(图像)与此前发布的 Seedance 2.5(视频生成)共同构成字节在生成式视觉创作领域的图像→视频完整工业化链路。

图层分离输出与交互式局部标注编辑,将 AI 图像生成结果直接纳入专业后期管线,对「AI 生成→后期精修」教学工作流的演示与实践具有参考价值。

查看原始来源 ↗

新华网 / 量子位 / 多源· 6月23日 模型

字节跳动发布豆包 2.1 Pro,Coding 与 Agent 能力较前代显著提升、对标旗舰级模型,并在多模态视觉理解评测集上保持领先,可作为设计与创作场景的多模态工作底座。

2026 年 6 月 23 日,字节跳动发布豆包 2.1 Pro。据新华网、量子位等报道,该版本在 Coding 与 Agent 能力上较前代有显著提升、对标旗舰级模型,并在多模态视觉理解的多项评测集上保持领先表现。对设计与内容创作场景而言,其多模态视觉理解能力可作为图像理解、素材分析等任务的底座。

通用大模型在多模态视觉理解上的持续走强,意味着「看图理解 + 推理」类能力正成为设计创作工作流的通用底座;其在教学与研究中的实际表现,值得以具体任务做对照评估。

查看原始来源 ↗

AI工坊pro· 6月22日 教程

AI工坊pro 发布 2026 年 AI 设计工具全收录,按图像、视频、3D、UI 等使用场景分类整理,覆盖当前主流工具生态。

AI 工坊 pro 于 2026 年 6 月 22 日前后发布 2026 年 AI 设计工具全收录,按图像生成、视频生成、3D 建模、UI 设计、排版辅助等使用场景对当前主流 AI 设计工具进行分类整理,并附基本功能和适用场合说明,旨在帮助设计师和学生快速定位适合自身需求的工具。

按场景分类的工具合集,适合作为工作营开幕第一课的工具导览参考,也可直接用于课程教材的工具栏更新。

查看原始来源 ↗

腾讯云 / 机器之心 / oschina / CSDN· 6月21日一手 产品

YC S24 团队开源 Palmier Pro macOS 视频编辑器,时间线内集成 Seedance、Kling、Nano Banana,并通过 MCP 服务器与 Claude、Codex、Cursor 等 AI Agent 无缝协作。

由 YC 2024 年夏季批次团队开发的 Palmier Pro 于 2026 年 6 月 21 日前后开源,这是一款 macOS 原生视频编辑器,在时间线内集成了 Seedance、Kling、Nano Banana 等视频生成模型,并通过内置 MCP(Model Context Protocol)服务器与 Claude、Codex、Cursor 等 AI Agent 无缝协作;中文技术社区于 6 月 23 日起展开大量讨论,四家以上媒体源核认。

将 AI Agent 协作与视频生成管线整合进桌面编辑器,是「AI 原生创作工具」形态的典型探索;对关注 AI 工具链整合或正在研究 MCP 生态的师生具有直接的实验参考价值。

查看原始来源 ↗

宝玉(@dotey)· 6月20日 产品

宝玉迭代 baoyu-design:支持 AI 配图并导出 PPTX。

baoyu-design Skill 更新,可在做 PPT、动画或网站时调用 AI 生图配图,并能连同图片一起导出为 PPTX 在 PowerPoint/Keynote 二次编辑;作者用「自己用→发现问题→让 Agent 分析→更新 Skill」的纯对话循环打磨。

对快速出课件、作品集排版有实用价值;其「对话式迭代打磨工具」的方法本身也值得借鉴。

查看原始来源 ↗

卡尔的AI沃茨 / GitHub· 6月19日一手 产品

Humanize PPT v0.9:为『演讲』而生的开源 PPT Skill。

用 AST(Audience/State/Transfer)逻辑重排大纲、先出 4 张真实预览页、把图片与生成 prompt 写进大纲,并新增质检自动修复渲染问题、支持演讲备注模式;已开源。

把 PPT 从「好看」做到「能讲」,对讲座、答辩、课程汇报场景实用,也是「AI + 设计表达」的好案例。

查看原始来源 ↗

ComfyUI 更新日志· 6月19日一手 产品

ComfyUI 核心节点迁移 V3 架构,修复 FP8 scaled LoRA 问题。

ComfyUI 把模型缩放、LoRA 提取/合成、潜空间操作等核心节点迁移到 V3 架构,并修复了 FP8 scaled LoRA 的问题,工作流的稳定性与扩展性提升。

与 LoRA 训练、自定义出图工作流直接相关;升级前建议先查看改动,避免旧工作流踩坑。

查看原始来源 ↗

搜狐科技· 6月18日 产品

Adobe Firefly Creative Skills 发布,对话式 AI 设计能力与 AI 助手全面入驻 Creative Cloud 全系应用,独立于同期「项目记忆」更新。

Adobe 于 2026 年 6 月 18 日推出 Firefly Creative Skills,将对话式 AI 设计功能和 AI 助手整合进入 Creative Cloud 全系应用,使用户可以在现有工作流内以自然语言触发创意操作;该更新与同期推出的「项目记忆」(Elements + Projects)为独立功能线,合计构成 Firefly 当周双更新格局。

Creative Skills 代表 Adobe 将 AI 能力从独立入口迁移至核心工具链的进一步推进,对正在评估如何将 AI 功能引入 Photoshop、Illustrator 教学课程的教师具有直接参考意义。

查看原始来源 ↗

Adobe 官方 / Engadget· 6月18日一手 产品

Adobe 把创意智能体铺进 PS/Pr/Ai/Id 公测,AI 从生成器转向流程助手。

Adobe 将创意智能体扩展到 Firefly 网页版与 PS/Pr/Ai/Id/Frame.io 的公测版,能听自然语言、自动跑多步流程(换背景、整理图层、素材分拣粗剪、批量改名等),并接入 ChatGPT 与 Claude。

AI 从「生成图片」转向「执行设计流程」的标志性一步,且落在日常常用工具里,是 AI 设计流程的现成演示案例。

查看原始来源 ↗

ComfyUI 官方 / NVIDIA Blog· 6月1日一手 产品

ComfyUI v0.23.0 新增 NVIDIA PixelDiT 与 Microsoft Lens 模型支持。

ComfyUI 于 6 月 1 日发布 v0.23.0,新增对 Microsoft Lens 和 NVIDIA PixelDiT 文生图模型的支持,增强了 Flux 模型的预注意力补丁机制(pre-attention patches),并改进批处理流程;配合 FLUX.2 系列(多参考图生成、VRAM 降低 40%)生态持续壮大。

ComfyUI + FLUX 是当前本地部署 AI 图像生成工作流的主流选择;PixelDiT 接入扩展了可本地运行的前沿模型范围,VRAM 降低 40% 意味着更多消费级 GPU 可以运行,对实验室与工作坊配置有实际参考意义。

查看原始来源 ↗