浅译快报

阿里巴巴

与 阿里巴巴 相关的资讯,按发布日倒序。

ComfyUI 官方· 9月21日一手 产品

ComfyUI v0.37.0/v0.37.1 原生集成 Qwen-Image 2.1 三种生成模式节点,并接入 MoGe 3 单目几何估计与 HY Image 3.5 Preview 五参考图 2K 输出。

ComfyUI v0.37.0 于 9 月 21 日发布,原生集成阿里 Qwen-Image 2.1,提供三个即用模板:文生图、图像编辑和背景移除,其中背景移除节点支持 alpha 通道输出;同日接入微软研究院 MoGe 3,在 ViT-L/ViT-G 骨干基础上增加稀疏体素精修,实现更精确的单目几何估计;Qwen3.5/3.8 文本编码器引入推测解码与 DeltaNet 内核加速;NVMe 快速磁盘加载降低本地多模型切换开销。次日发布 v0.37.1,合作节点新增 HunyuanVideo Image 3.5 Preview,支持最多 5 张参考图输入与原生 2K 输出。

ComfyUI v0.37 将 Qwen-Image 2.1 的图像编辑与背景移除能力直接引入节点工作流,对教学中的设计稿处理与品牌一致性演示具有直接适用价值;MoGe 3 几何估计节点对建筑与三维课程的 AI 辅助深度分析有实质性补充。

查看原始来源 ↗

Qwen 官方博客 + GitHub + TechNo...· 9月20日一手 模型

阿里开源 Qwen-Image-2.1,7B 参数统一图像生成与编辑模型,首次原生支持 RGBA 透明通道,最多 10 张参考图输入,发布首日可通过 ComfyUI、Diffusers、vLLM 调用。

阿里巴巴于2026年9月20日开源 Qwen-Image-2.1,一个7B参数的统一图像生成与编辑模型。核心能力包括原生 RGBA 透明通道支持,可直接产出带透明度的 PNG 设计素材;最多10张参考图像同时输入,提升主题与风格一致性;发布首日同步支持 ComfyUI 节点、Diffusers 和 vLLM 推理框架;统一架构覆盖文生图、图像编辑、图像理解三类任务。模型权重、代码与数据全部开源,支持商用。

开源7B图像生成模型首次原生支持 RGBA 透明通道,使排版、品牌素材与 UI 元素生成可直接输出可合成的 PNG;10图参考的一致性控制为 IP 和角色设计课题提供工程层面的精确控制手段,高校服务器可直接部署。

查看原始来源 ↗

阿里巴巴官方· 8月27日一手 模型

阿里Wan3.0 Prime快速变体上线,定价$0.06–$0.30/秒,支持文字转视频、图像转视频及音频驱动视频生成三类任务

阿里巴巴推出Wan3.0 Prime,作为Wan3.0全功能版的快速变体,在生成速度和成本之间做出权衡:API定价$0.06至$0.30/秒(根据分辨率和输出质量)。Wan3.0 Prime支持三类输入模式:文字描述直接转视频、静态图像转动态视频、以及音频驱动的视频生成(音乐或语音节奏同步生成视觉内容)。快速变体定位于高频调用和批量生产场景,与Wan3.0旗舰版形成差异化产品矩阵。

Prime快速变体与旗舰版并行的产品策略,反映了AI视频生成商业化中”质量-速度-成本”三角的精细化运营思路,也是平台满足不同用户群体需求的标配模式。

查看原始来源 ↗

ComfyUI官方GitHub/ComfyUI Wiki· 8月26日一手 产品

ComfyUI v0.34系列版本集成Pixal3D+TRELLIS2原生3D管线、Recraft V4风格生成、Gemini Omni 1.1 Flash视频及Wan3.0 Prime快速变体

ComfyUI v0.34系列更新(8月25日至26日)集中整合多个新模型:新增Pixal3D与TRELLIS2节点,支持从文本或图像直接生成三维网格和场景,构建本地3D生成管线;集成Recraft V4 Styles节点,支持1–10张参考图驱动的风格一致性图像生成;新增Gemini Omni 1.1 Flash视频生成节点(含4K和Draft Mode);以及Wan3.0 Prime快速变体节点($0.06–$0.30/秒定价)。单一版本系列内同时覆盖了图像生成、视频生成和3D生成三条核心创作管线。

ComfyUI v0.34系列的密集集成将平台定位从”图像生成工作流”进一步扩展为”多模态生成中枢”,3D管线的原生化是本轮更新的核心质变。

查看原始来源 ↗

ComfyUI官方GitHub· 8月24日一手 产品

ComfyUI v0.33.4 发布,新增阿里 Wan 3.0 原生工作流节点(30秒/1080p视频+多模态输入)、Meshy-7 Ultra 3D生成节点、字节跳动 vCube 视频增强节点(至8K超分+帧率增强),同时修复若干UI稳定性问题。

ComfyUI v0.33.4 于 8 月 24 日发布,主要更新:阿里 Wan 3.0 原生工作流节点,支持 30 秒/1080p 视频生成及多模态输入(文档/PPT/PDF 转视频);Meshy-7 Ultra 节点集成,最新 3D 生成模型直通 ComfyUI 工作流;字节跳动 vCube 视频增强节点,支持至 8K 超分+帧率增强;修复若干 UI 稳定性问题。

三项新增节点分别覆盖视频生成(Wan 3.0)、3D 资产(Meshy-7 Ultra)、视频后期(vCube 8K),合力将本地工作流的输出标准推向专业交付级别。

查看原始来源 ↗

阿里巴巴官方/TechCrunch· 8月24日一手 模型

阿里巴巴Wan3.0全球发布,支持最长30秒视频生成、PDF/PPT/Word文档直接转视频,定价$0.05–$0.20/秒

阿里巴巴于8月24日正式向全球发布Wan3.0视频生成模型,主要规格:最长单次生成30秒,较上一代翻倍;新增多模态文档输入支持,用户可直接上传PDF、PPT或Word文件,模型将文档内容转化为视频叙事;API定价区间为$0.05至$0.20/秒,根据分辨率和质量档位浮动。Wan3.0同步开放了ComfyUI原生节点,支持与现有工作流无缝集成。与Seedance 2.5、Kling 3.5共同构成2026年国产AI视频模型的主流选项。

Wan3.0将文档作为原生视频输入格式,是AI视频生成从”纯创意工具”向”学术与工作场景实用工具”延伸的代表性进展。

查看原始来源 ↗

ComfyUI官方GitHub / ComfyUI Wiki· 8月13日一手 产品

ComfyUI在8月7至13日连续发布三个版本:v0.31.0(8/7)原生支持Wan-Animate2(姿态+参考控制)、SeeDance 2.5/Seedream 5.0 Layer Separation伙伴节点、PSD风格分层合成(混合模式+图层状态);v0.32.0(8/11)原生LTX 2.5 Partner Nodes + PyTorch 2.7最低要求;v0.33.1(8/13)原生支持MiniMax Music 3开源权重(歌词文本编码+音频生成)、Bria伙伴节点、修复MiniMax H3/LTX/KSamplerAdvanced已知问题。

ComfyUI在8月7至13日连续发布三个版本:v0.31.0(8/7)原生支持Wan-Animate2(姿态+参考控制)、SeeDance 2.5/Seedream 5.0 Layer Separation伙伴节点、PSD风格分层合成(混合模式+图层状态);v0.32.0(8/11)原生LTX 2.5 Partner Nodes + PyTorch 2.7最低要求;v0.33.1(8/13)原生支持MiniMax Music 3开源权重(歌词文本编码+音频生成)、Bria伙伴节点、修复MiniMax H3/LTX/KSamplerAdvanced已知问题。

ComfyUI三连更意味着8月发布的三款重要模型(Wan-Animate2/LTX-2.5/MiniMax Music 3)均已可在本地工作流直接调用

查看原始来源 ↗

TechNode Global / Alizila· 8月10日 模型

阿里通义实验室Wan 3.0于8月6日开公测、8月10日杭州发布活动正式上线:单镜30秒(Wan 2.7为15秒上限);全模态输入——PDF、PPT、Excel、网页均可作为输入源,生成文档转视频;API计价¥0.30–1.20/秒(480P–1080P)。

阿里通义实验室Wan 3.0于8月6日开公测、8月10日杭州发布活动正式上线:单镜30秒(Wan 2.7为15秒上限);全模态输入——PDF、PPT、Excel、网页均可作为输入源,生成文档转视频;API计价¥0.30–1.20/秒(480P–1080P)。暂无开权重。

中文API定价、全文档输入、国产生态,直接对应对影视与建筑动画方向的学员价值显著。

查看原始来源 ↗

Open Source For You / Comfy...· 8月7日 模型

阿里通义 Wan-Animate-2(14B Diffusion Transformer)8月7日以 Apache 2.0 协议开源:直接吃原始视频潜变量,省去骨架姿态提取,Lite 版 24fps 可实时运行;内置 ComfyUI 原生节点,开箱即用;盲测超越可灵 MotionControl,适用于时尚服装动态展示、叙事插画角色演绎、虚拟主播与 Avatar 动作捕捉迁移等场景。

阿里通义 Wan-Animate-2(14B Diffusion Transformer)8月7日以 Apache 2.0 协议开源:直接吃原始视频潜变量,省去骨架姿态提取,Lite 版 24fps 可实时运行;内置 ComfyUI 原生节点,开箱即用;盲测超越可灵 MotionControl,适用于时尚服装动态展示、叙事插画角色演绎、虚拟主播与 Avatar 动作捕捉迁移等场景。

Apache 2.0+本地运行+ComfyUI 即插即用,是本年度对高校工作营最友好的开源角色动画里程碑——学生无需调 API、不受商业配额限制,下周就能在实验……

查看原始来源 ↗

Alibaba Qwen 官方 X / Alibaba...· 8月5日一手 模型

阿里在 Qwen-Image-3.0(7月21日发布,已入池)基础上推出 Pro 版本,重点强化 10px 文字渲染精度(毛孔/发丝/微表情细节),注入更丰富的世界知识(地标/品牌/符号可信度),Qwen 团队自评全球排名第五。

阿里在 Qwen-Image-3.0(7月21日发布,已入池)基础上推出 Pro 版本,重点强化 10px 文字渲染精度(毛孔/发丝/微表情细节),注入更丰富的世界知识(地标/品牌/符号可信度),Qwen 团队自评全球排名第五。已上线阿里云灵积 API 平台与 OpenRouter,无公开权重/基准测试报告。

Qwen-Image 系列已是设计流程中排名靠前的可用图像模型

查看原始来源 ↗

AIHub/量子位/网易/无界AI/aitop100/...· 7月21日一手 模型

Qwen-Image-3.0 文字渲染精度达 10px 可辨级别,4.5K 超长指令支持多区域版面控制,12 语言覆盖多语言出版需求。

阿里通义万象第三代图像生成模型 Qwen-Image-3.0 正式发布;核心突破:4.5K token 超长指令输入支持复杂多区域版面、10px 小字清晰可辨(文字渲染精度显著提升)、12 国语言原生渲染(含中文)、100+ 种艺术风格一键切换;多家媒体已实测与 GPT-Image-2 的全面对比。

Qwen-Image-3.0 的文字渲染精度与超长指令支持,使其具备处理信息图表、品牌物料等真实设计交付需求的能力,推动 AI 图像生成进入生产力交付阶段。

查看原始来源 ↗

新浪科技 / IT之家 / 量子位 / 机器之心(多源)· 7月20日 模型

阿里发布语音合成大模型Qwen-Audio-3.0-TTS,含实时交互Flash版(首包延迟300ms级)和高质量生成Plus版;支持细粒度标签控制、freestyle指令遵循、20种中文方言及多语种,Plus版登顶全球权威榜单Artificial Analysis。

阿里巴巴发布Qwen-Audio-3.0-TTS语音合成大模型,分为两个版本:Flash版面向实时交互场景,首包延迟达300ms量级;Plus版面向高质量生成场景,在全球权威评测榜单Artificial Analysis中排名第一。两个版本均支持细粒度情绪/节奏/语气标签控制、freestyle自然语言指令遵循、20种中文方言以及多语种输出,将AI语音合成从”能说话”推进至”会表达”的能力层级。

AI语音合成是视频创作、数字人和有声内容工作流的核心组件,300ms首包延迟接近实时门槛,20种方言覆盖为多元地域内容生产打开空间。

查看原始来源 ↗

量子位 / 36氪 / 新浪(多源)· 7月20日 案例

GMI Cloud联合阿里巴巴HappyHorse在WAIC 2026举办「无界造物节」全民AI创作赛事决赛收官;AI Coding赛道产出智能运营Agent和低代码工具,AI Video赛道依托HappyHorse全链路能力完成云端脚本到成片,展示MaaS平台支撑非技术用户实现完整AI视频创作的落地路径。

GMI Cloud联合阿里巴巴HappyHorse在WAIC 2026期间举办的「无界造物节」全民AI创作赛事完成决赛收官;AI Coding赛道参赛作品涵盖智能运营Agent和低代码工具;AI Video赛道依托HappyHorse全链路AI视频创作能力,参赛者在云端完成从脚本生成到成片输出的全流程;整体赛事以MaaS(Model as a Service)平台为底座,展示非技术用户实现完整AI视频创作的可行路径。

「无界造物节」是WAIC 2026期间面向大众创作者的典型AI创作竞赛案例,直观体现了MaaS平台将AI视频全流程能力普惠化的实际落地场景。

查看原始来源 ↗

IT之家 / 虎嗅 / 同花顺· 7月17日 模型

阿里通义实验室发布 Wan-Streamer v0.2,将听、看、说、演统一进单个 Transformer,端到端交互延迟约 550ms,较 v0.1 大幅改善。

阿里通义实验室发布实时全双工多模态模型 Wan-Streamer v0.2,将「听、看、说、演」四类感知与表达能力统一进单个 Transformer 架构,端到端交互延迟约 0.55 秒;相比 v0.1 版本延迟大幅降低,可实现 AI 在视频通话中边听边看边实时回应。

550ms 端到端延迟是 AI 视频通话趋近实用门槛的关键指标;统一多模态 Transformer 区别于分离模块架构,与 MiniMax H3 和 Gemini Omni 并行出现,指向多模态实时交互领域的技术路线正在趋同。

查看原始来源 ↗

arXiv / 优设· 7月4日一手 模型

Wan-Streamer v0.1 提出端到端实时音视频流数字人生成框架,论文 arXiv:2606.25041 提前公开,覆盖音频驱动唇形同步与实时视频流输出全链路

arXiv 论文 2606.25041 提前公布 Wan-Streamer v0.1,这是一个面向实时音视频流数字人场景的端到端生成框架:输入实时音频流,直接输出可流式传输的数字人视频,覆盖音频驱动、唇形同步与实时编码全链路,无需离线分段渲染。优设同期跟进了技术解读。

端到端流式架构将数字人生成从「离线渲染后播放」推向「实时流媒体直推」范式,对直播、客服、数字主播等场景的工程化落地路径有直接参考价值。

查看原始来源 ↗

新浪财经 / TechNode / CNBC / 量子位· 7月3日编辑精选 行业

快手旗下可灵 AI 完成独立融资近 30 亿美元(约 196 亿元),腾讯/阿里/百度历史性联合领投,刷新全球 AI 视频模型最大单笔融资纪录

快手旗下可灵 AI 于 7 月 3 日宣布完成近 30 亿美元(约 196 亿元人民币)独立融资,腾讯、阿里、百度历史性联合领投——三家此前长期竞争的互联网巨头同台入股同一标的;投后估值约 180 亿美元。可灵 AI 年化营收(ARR)从 2.4 亿美元增至 5 亿美元(三个月翻倍),同步签署 5 年 IPO 对赌协议并启动独立商业化。消息由中英文 8 个以上媒体信源同步确认。

中国三大互联网巨头同时投资同一 AI 视频独角兽,打破常规竞争格局,是国内 AI 视频赛道商业化验证阶段的标志性资本事件。

查看原始来源 ↗

科技行者 / arXiv (2606.27608)· 6月25日一手 论文

阿里 Qwen 团队发布 Qwen-Image-2.0-RL(arXiv:2606.27608),通过 GRPO 强化学习与在线策略蒸馏设计图文对齐、美感、肖像三类奖励模型,文生图 Elo 从 1115 升至 1193(+78),图像编辑 Elo 从 1256 升至 1349(+93)。

阿里 Qwen 团队发布 Qwen-Image-2.0-RL(arXiv:2606.27608),通过 GRPO 强化学习与在线策略蒸馏(OPD)构建三套奖励模型——图文对齐、美感、肖像——赋予图像生成模型更强的「审美判断」能力;技术方案含混合 CFG 策略、异步奖励管道与提示词筛选工程;文生图 Elo 从 1115 升至 1193(+78),图像编辑 Elo 从 1256 升至 1349(+93),在评测界属显著提升。

「用强化学习训练 AI 审美」的技术路径对艺术设计×AI 领域研究有直接方法论参考价值:如何定义可量化的「美感奖励」、如何让模型从人类偏好数据中习得审美判断,是生成式 AI 艺术研究的核心方法论问题;arXiv 全文适合研究生与教研方向师生作为前沿参考阅读。

查看原始来源 ↗

foxnan.com· 6月24日一手 模型

Sky Computing Lab 开源 FastWan-QAD 量化感知蒸馏方案,单卡 RTX 5090 端到端 1.8 秒生成 5 秒 480P 视频,较标准版显著降低硬件门槛,模型与代码已完整开源。

Sky Computing Lab 于 2026 年 6 月 24 日开源 FastWan-QAD(量化感知蒸馏)方案,针对 Wan 系列视频生成模型进行轻量化优化:在单张 RTX 5090 显卡上可实现端到端 1.8 秒生成 5 秒 480P 视频,相较标准版本大幅降低了对高端多卡配置的硬件依赖;模型权重与推理代码均已完整开源,可直接用于本地部署。

大幅压缩推理延迟与硬件门槛的开源方案,是 AI 视频生成向更低成本个人与教学环境延伸的代表性案例;对需要本地运行视频生成工作流、控制硬件成本的研究与教学场景有直接参考价值。

查看原始来源 ↗

ComfyUI 官方· 6月24日一手编辑精选 产品

ComfyUI v0.26.0 在单次版本更新中同时接入 Krea 2(12B DiT 开源图像模型,含 Raw/Turbo 两版)、Boogu-Image(Qwen3-VL-8B 编码器)、Qwen3-VL(4B/8B),并新增 Load3DAdvanced 3D 节点与 LTX2 视频上下文采样支持,工作流模板升至 0.9.26。

2026 年 6 月 24 日,ComfyUI 发布 v0.26.0 版本,在单次更新中同时接入三个新开源模型:Krea 2(提供 Raw 与 Turbo 两个权重变体,Raw 版适合 LoRA 微调训练,Turbo 版支持 8 步蒸馏推理)、Boogu-Image(采用 Qwen3-VL-8B 作为文本编码器,配套 TextEncodeBooguEdit 节点支持局部图像编辑)以及 Qwen3-VL(4B 与 8B 两档,支持文本生成与图像理解);同时新增 Load3DAdvanced 3D 网格加载节点、LTX2 视频上下文窗口采样器,工作流模板版本升至 0.9.26。

ComfyUI 以单次版本更新接入三个最新开源模型,延续了其作为开源生成生态聚合枢纽的角色——用户升级版本即可本地获取多个最新模型的运行能力,是当前开源图像与视频工作流可及性持续下沿的直接体现。

查看原始来源 ↗

量子位· 6月22日 模型

阿里 HappyHorse 1.1 版本升级动态表现力、9 图角色一致性、复杂场景指令、视觉质感和音频口播五个维度,同步宣布启动 Horsepower AI 影像大赛(张纪中评委)。

阿里于 2026 年 6 月 22 日发布 HappyHorse 1.1 版本更新,在五个维度进行了针对性提升:动态表现力、9 张图像角色一致性、复杂场景指令遵循、视觉质感和音频口播能力;同步宣布启动 Horsepower AI 影像大赛,邀请著名影视制作人张纪中出任评委之一。

HappyHorse 在角色一致性和复杂场景指令方向的持续升级,对关注国产视频生成模型能力演进或正在评估 AI 视频工具用于教学实验的师生有参照意义。

查看原始来源 ↗