浅译快报

热点榜

近 14 天资讯按热度排序:报道同一事件的独立来源越多、越新,热度越高;编辑评定的重要事件额外加权。每次站点更新时重新计算。

  1. 1
    arXiv(arXiv:2609.11638)+ 生数...· 9月15日一手 模型

    生数科技发布 Vidu S2,包含实时 720p 数字人生成与无中断流式视频风格编辑两个子模型,在线演示同步开放。

    生数科技(Shengshu Technology)于9月15日发布 Vidu S2,包含两个子模型:Vidu S2-Avatar 支持实时生成 720p 数字人,可在对话中动态替换参考图、跟随舞蹈等复杂肢体指令;Vidu S2-Editing 实现流式实时视频风格编辑,包括风格渲染、换装、换人、换背景,整个过程无需中断视频流。论文同时展示了 VR 空间中的实时视频生成与编辑能力,配套在线演示已开放(vidu.com/vidu-stream),对应论文为 arXiv:2609.11638。

    实时流式视频编辑能力让换装、换背景等操作接近「直播即生成」,对影视、时尚设计与数字人方向的创作工具链影响直接,VR 空间扩展亦值得关注。

    查看原始来源 ↗

  2. 2
    ComfyUI 官方· 9月21日一手 产品

    ComfyUI v0.37.0/v0.37.1 原生集成 Qwen-Image 2.1 三种生成模式节点,并接入 MoGe 3 单目几何估计与 HY Image 3.5 Preview 五参考图 2K 输出。

    ComfyUI v0.37.0 于 9 月 21 日发布,原生集成阿里 Qwen-Image 2.1,提供三个即用模板:文生图、图像编辑和背景移除,其中背景移除节点支持 alpha 通道输出;同日接入微软研究院 MoGe 3,在 ViT-L/ViT-G 骨干基础上增加稀疏体素精修,实现更精确的单目几何估计;Qwen3.5/3.8 文本编码器引入推测解码与 DeltaNet 内核加速;NVMe 快速磁盘加载降低本地多模型切换开销。次日发布 v0.37.1,合作节点新增 HunyuanVideo Image 3.5 Preview,支持最多 5 张参考图输入与原生 2K 输出。

    ComfyUI v0.37 将 Qwen-Image 2.1 的图像编辑与背景移除能力直接引入节点工作流,对教学中的设计稿处理与品牌一致性演示具有直接适用价值;MoGe 3 几何估计节点对建筑与三维课程的 AI 辅助深度分析有实质性补充。

    查看原始来源 ↗

  3. 3
    GitHub (comfyanonymous/Comf...· 9月15日一手 产品

    ComfyUI v0.36.0 新增 FastH3 8步蒸馏视频、BFL FLUX 视频编辑、YuE2 音乐生成与 Tripo P2 3D 等多项节点,单一工作流覆盖文字到视频配乐完整链路。

    ComfyUI 于9月15日发布 v0.36.0,新增多项重量级节点:FastVideo FastH3(8步蒸馏 MiniMax H3,支持文生视频、图生视频与原生音频同步)、BFL FLUX Video Edit($0.03/秒视频编辑 API,保留原片运动轨迹与音频)、YuE2 音乐生成模型、Tripo P2(文字/图像/多视角→3D)、Marigold V2(深度/法线/反照率估计)以及 Generic Loops 与 Video Concatenate 节点;H3 ControlNet 获 Comfy Compiler 完整兼容支持;配套发布 ComfyUI Desktop v1.6.0,支持 Apple Silicon 全原生 MPS 加速。

    单一 ComfyUI 工作流现已覆盖文字到视频再到配乐的完整链路,FastH3 仅需 8 步即可生成带原生音频的视频,BFL FLUX Video Edit 的低单价亦使学生作业级实操具备可行性。

    查看原始来源 ↗

  4. 4
    Qwen 官方博客 + GitHub + TechNo...· 9月20日一手 模型

    阿里开源 Qwen-Image-2.1,7B 参数统一图像生成与编辑模型,首次原生支持 RGBA 透明通道,最多 10 张参考图输入,发布首日可通过 ComfyUI、Diffusers、vLLM 调用。

    阿里巴巴于2026年9月20日开源 Qwen-Image-2.1,一个7B参数的统一图像生成与编辑模型。核心能力包括原生 RGBA 透明通道支持,可直接产出带透明度的 PNG 设计素材;最多10张参考图像同时输入,提升主题与风格一致性;发布首日同步支持 ComfyUI 节点、Diffusers 和 vLLM 推理框架;统一架构覆盖文生图、图像编辑、图像理解三类任务。模型权重、代码与数据全部开源,支持商用。

    开源7B图像生成模型首次原生支持 RGBA 透明通道,使排版、品牌素材与 UI 元素生成可直接输出可合成的 PNG;10图参考的一致性控制为 IP 和角色设计课题提供工程层面的精确控制手段,高校服务器可直接部署。

    查看原始来源 ↗

  5. 5
    Semafor(独家)/ AlphaSignal· 9月17日 产品

    Pika 将产品从单一视频生成工具重构为多模型创意工作室,集成 7 个 AI 模型并新增逐镜头清单生成、重打光与换装工具套件。

    Pika 于9月17日宣布将产品从单一视频生成工具重构为多模型创意工作室,集成 Seedance 2.5、Veo 3.1、GPT Image 2.5、MiniMax H3、Grok Imagine 等 7 个 AI 模型,并推出独立应用套件(Video Studio、Color Grade、Extend Video、Edit Image、Character Studio、Product Shot);核心新特性包括:输入基本描述后自动生成可编辑逐镜头清单、重打光工具、角色与服装替换工具套件;平台自动路由至最优模型,同时支持手动指定。

    Pika 的转型说明 AI 视频工具的竞争焦点已从单一模型质量转向多模型整合平台体验,逐镜头清单生成对短片创作和教学视频制作有实用价值。

    查看原始来源 ↗

  6. 6
    TechCrunch + Anthropic 官方· 9月16日一手 产品

    Anthropic 将 Claude.ai 聊天与 Cowork 工作空间合并至单一窗口,并推出 Claude Design 支持跨项目品牌一致性管理。

    Anthropic 于9月16日正式推出 Claude 统一界面,将 Claude.ai 聊天功能和 Cowork(项目/工作空间)合并至单一窗口,系统自动将用户请求路由至最合适的模式;同步推出 Claude Design 功能,支持跨项目保持品牌一致性,可与 Claude Code 协同工作,提供画布式编辑界面及更多工具连接。

    Claude Design 的品牌一致性功能与设计工作流直接相关,统一界面进一步降低了非技术类高校用户的上手门槛。

    查看原始来源 ↗

  7. 7
    GlobeNewswire + PR Newswire· 9月15日一手 产品

    CorelDRAW Graphics Suite September 2026 Update 新增 Text-to-Vector AI,支持从文字描述直接生成可商用、可编辑矢量图形路径,并将 PowerTRACE 速度提升 4 倍。

    Corel 于9月15日发布 CorelDRAW Graphics Suite September 2026 Update,核心新功能为 Text-to-Vector AI:用户输入文字描述,Vector Craft(创意探索模式)和 Vector Master(精准输出模式)可直接生成可商用的可编辑矢量图形路径,消除手工描摹步骤;同步升级 PowerTRACE 4.0(位图转矢量处理速度提升 4 倍)及 Print & Cut 工作流对多色醋酸薄膜、透明箔纸等特种材料的支持。

    传统矢量设计工具内嵌 AI 文字生成能力,让学生可以直接获得可编辑矢量素材原型,是 AI 进入矢量工作流的一个典型节点。

    查看原始来源 ↗

  8. 8
    Black Forest Labs 官方文档 + Co...· 9月15日一手 模型

    Black Forest Labs 推出 FLUX Video Edit API,$0.03/秒输出,可按文字描述精准修改视频中指定元素,同时完整保留原片运动轨迹与音频。

    Black Forest Labs 于9月15日推出 FLUX Video Edit API,计费标准为 $0.03/秒输出。该 API 接受源视频与文字描述,可精准修改视频中指定元素(换服装、替换背景、改变材质等),同时完整保留原片运动轨迹与音频;已通过 ComfyUI v0.36.0 原生节点接入,亦支持直接调用 BFL API,底层能力与 FLUX 图像模型家族共用。

    「改元素不改运动」解决了 AI 视频二次编辑中时序一致性的核心痛点,$0.03/秒的低单价使教学实操场景的成本具体可控。

    查看原始来源 ↗

  9. 9
    arXiv.org· 9月16日一手 论文

    arXiv 论文 2609.18065 提出系统性框架梳理生成式图像模型视觉界面的提示输入、控制粒度、迭代模式与输出展示四大核心维度。

    arXiv 论文 2609.18065(9月16日)提出一套系统性的设计空间(Design Space)框架,梳理生成式图像模型视觉用户界面的核心维度,包括提示输入范式(文字/图像/草图/混合)、控制粒度(全局/局部/风格/结构)、迭代交互模式(单次/多轮/协作)以及输出展示策略(对比/时间轴/探索网格);通过对 Midjourney、Adobe Firefly、DALL·E 等主流生图界面进行系统性分类编码,为界面设计研究和工具开发提供参照。

    这是生成式图像界面领域少有的系统性综述,提供了批判性评估 AI 生图工具的理论框架,适合作为课程进阶理论环节的参考材料。

    查看原始来源 ↗

  10. 10
    Figma 官方博客(release-notes)· 9月16日一手 产品

    Figma 推出 Weave 节点支持将 Design 画框拖入 AI 工作流、Shaders 开放测试版通过提示词生成动效着色器,并上线 Weave 社区工具发布功能。

    Figma 于9月16至17日推出三项功能更新:Weave 节点允许将 Design 画框直接拖入 Weave AI 工作流作为节点输入,支持批量生成品牌一致的营销素材;Shaders 开放测试版可通过 AI 提示词生成火焰、扭曲、动效等视觉特效着色器,并提供代码查看器供进一步定制,无需编程背景;Weave 社区工具发布功能允许创作者将自建 AI 工作流工具发布至 Figma 社区,共享节点资产。

    Weave 节点将静态设计直接接入 AI 规模化生产链路,Shaders 开测版则让无编程背景的设计学生也能实验 AI 生成动态视觉特效。

    查看原始来源 ↗

  11. 11
    Midjourney 官方更新日志(官方单源)· 9月16日一手 产品

    Midjourney Alpha 9/16 更新:新增韩文语言界面支持

    Midjourney Alpha 9/16 更新:新增韩文语言界面支持;V8.2 编辑器改进——图片附件提示词输入框进入提示词栏(图文混合提示更流畅)、Draft 批次显示来源网格与悬停预览、Enhance 按钮替代原 Upscale 按钮;移动端与平板端布局重新适配,触控体验优化。

    该动态揭示了 AI 视觉生成与多模态工具领域的最新进展,对艺术设计研究与实践具有参考价值。

    查看原始来源 ↗

  12. 12
    ElevenLabs 官方博客· 9月15日一手 产品

    ElevenLabs 将 MCP 连接器从纯语音扩展至多模态全链路,单次 OAuth 安装接入 50 余个语音、音乐、图像与视频生成模型。

    ElevenLabs 于9月15日将 MCP 连接器从纯语音扩展至多模态创作全链路:单次 OAuth 安装即可接入语音、音乐、图像与视频生成共 50 余个模型;托管服务端位于 api.elevenlabs.io/v1/mcp;支持 Claude、ChatGPT、Cursor、Grokbot、Hermes 等主流 AI 客户端;用户在同一对话线程内可依次完成剧本、配音、配乐、音效到视频的完整创意流程,无需切换工具。

    单一 MCP 连接器覆盖声音、图像到视频的完整创作链路,标志 MCP 生态从代码辅助向创意生产管线全面延伸。

    查看原始来源 ↗