ElevenLabs 官方博客·
9月15日一手
产品
›ElevenLabs MCP 多模态扩展:语音+音乐+图像+视频 50+ 模型单次 OAuth 接入
ElevenLabs 将 MCP 连接器从纯语音扩展至多模态全链路,单次 OAuth 安装接入 50 余个语音、音乐、图像与视频生成模型。
ElevenLabs 于9月15日将 MCP 连接器从纯语音扩展至多模态创作全链路:单次 OAuth 安装即可接入语音、音乐、图像与视频生成共 50 余个模型;托管服务端位于 api.elevenlabs.io/v1/mcp;支持 Claude、ChatGPT、Cursor、Grokbot、Hermes 等主流 AI 客户端;用户在同一对话线程内可依次完成剧本、配音、配乐、音效到视频的完整创意流程,无需切换工具。
单一 MCP 连接器覆盖声音、图像到视频的完整创作链路,标志 MCP 生态从代码辅助向创意生产管线全面延伸。
查看原始来源 ↗
Black Forest Labs 官方文档 + Co...·
9月15日一手
模型
›BFL FLUX Video Edit API:$0.03/秒保留原片运动与音频的精准视频编辑端点
Black Forest Labs 推出 FLUX Video Edit API,$0.03/秒输出,可按文字描述精准修改视频中指定元素,同时完整保留原片运动轨迹与音频。
Black Forest Labs 于9月15日推出 FLUX Video Edit API,计费标准为 $0.03/秒输出。该 API 接受源视频与文字描述,可精准修改视频中指定元素(换服装、替换背景、改变材质等),同时完整保留原片运动轨迹与音频;已通过 ComfyUI v0.36.0 原生节点接入,亦支持直接调用 BFL API,底层能力与 FLUX 图像模型家族共用。
「改元素不改运动」解决了 AI 视频二次编辑中时序一致性的核心痛点,$0.03/秒的低单价使教学实操场景的成本具体可控。
查看原始来源 ↗
›Suno正式实施下载限制:免费账户终身仅可下载7次,引发AI音乐版权争议
Suno正式对免费账户实施终身7次下载上限,被普遍解读为回应版权诉讼压力的商业政策调整
AI音乐生成平台Suno于9月3日正式实施下载限制政策:免费账户的音乐下载次数上限为终身累计7次,已超出限额的用户需升级付费计划方可继续下载生成内容。Suno此举被普遍解读为应对唱片公司版权诉讼压力的商业政策调整——限制免费用户的实际获益,同时将合规风险集中于可追溯的付费账户群体。Suno正面临来自环球音乐、索尼音乐等主要唱片公司的集体诉讼,指控其未经授权使用版权音乐训练模型。
Suno的下载限制政策是AI创作工具在版权压力下收紧免费使用权限的代表性案例,折射出生成式AI音乐平台在商业可持续性与用户开放性之间的结构性张力。
查看原始来源 ↗
›Pika推出场景感知视频配音模型:画面驱动全场景音效与音乐同步生成
Pika推出专属视频配音模型,分析视频画面语义和节奏后同步生成音效、环境声和音乐底层,无需手动对口型或检索素材库
Pika推出专属视频配音(video-to-sound)模型:系统分析视频画面的语义内容、动作节奏和场景氛围,在无需用户手动操作的前提下同步生成全场景音效(物理碰撞、自然声响等)、环境声(空间混响、背景噪声)和音乐底层,实现”画面驱动声音”的音视频同步生成。该模型可与Pika的视频生成工作流直接串联,形成从无声生成视频到带声交付的完整流程。
AI视频配音能力的模型化解决了AI创作管线中”视频有画面无声音”的长期短板,与Adobe Firefly Audio GA共同构成AI全链路媒体创作的音频层基础设施。
查看原始来源 ↗
›阿里Wan3.0 Prime发布:$0.06–$0.30/秒的快速视频变体,支持文转视频、图转视频、音频输入
阿里Wan3.0 Prime快速变体上线,定价$0.06–$0.30/秒,支持文字转视频、图像转视频及音频驱动视频生成三类任务
阿里巴巴推出Wan3.0 Prime,作为Wan3.0全功能版的快速变体,在生成速度和成本之间做出权衡:API定价$0.06至$0.30/秒(根据分辨率和输出质量)。Wan3.0 Prime支持三类输入模式:文字描述直接转视频、静态图像转动态视频、以及音频驱动的视频生成(音乐或语音节奏同步生成视觉内容)。快速变体定位于高频调用和批量生产场景,与Wan3.0旗舰版形成差异化产品矩阵。
Prime快速变体与旗舰版并行的产品策略,反映了AI视频生成商业化中”质量-速度-成本”三角的精细化运营思路,也是平台满足不同用户群体需求的标配模式。
查看原始来源 ↗
TechCrunch/多家财经媒体·
8月25日一手
行业
›Stability AI完成$76M B轮:环球音乐、索尼、华纳、EA联合参投
Stability AI完成$76M B轮融资,环球音乐集团、索尼音乐、华纳音乐及游戏巨头EA联合参投,此轮融资被解读为内容产业对AI公司授权路径的战略背书
Stability AI宣布完成7600万美元B轮融资,投资方阵容包括环球音乐集团(UMG)、索尼音乐、华纳音乐及游戏公司Electronic Arts(EA)。这是Stability AI在公司历经高管更替和财务困境后的重要融资节点。三大唱片公司的联合参投被广泛解读为在版权诉讼之外,内容产业正在以投资方式参与AI生成内容授权体系的构建,以期在未来商业模式中获得议价地位。
三大唱片公司转变姿态从”诉讼方”到”投资方”,提示AI版权争议的解决路径可能不仅依赖法律判决,也取决于产业利益方的主动参与和谈判布局。
查看原始来源 ↗
Adobe官方博客 / 9to5Mac·
8月20日一手
产品
›Adobe Firefly 音频全面开放:商业授权音乐/配音/音效三合一,创意全链路扩展至有声
Adobe Firefly 音频工具(Generate Music / Generate Speech / Generate Sound Effects)2026年8月20日正式对所有用户全量开放;三工具均为商业免许可证授权,Generate Music由Firefly Music Model驱动可生成与视频时长/情绪匹配的原创音乐,Generate Speech支持ElevenLabs可选模型+情绪/语速调节,Generate Sound Effects根据视频节奏自动同步音效;同日新增Gemini Omni Flash为合作伙伴模型。
Adobe Firefly 音频工具(Generate Music / Generate Speech / Generate Sound Effects)2026年8月20日正式对所有用户全量开放;三工具均为商业免许可证授权,Generate Music由Firefly Music Model驱动可生成与视频时长/情绪匹配的原创音乐,Generate Speech支持ElevenLabs可选模型+情绪/语速调节,Generate Sound Effects根据视频节奏自动同步音效;同日新增Gemini Omni Flash为合作伙伴模型。
Adobe Firefly从”视觉生成工具”正式扩展为”音视频一体创作平台”——音乐/配音/音效商业免授权直接落地,是AI内容创作工作流的里程碑
查看原始来源 ↗
MiniMax官方Blog / MarkTechPost·
8月13日一手
模型
›MiniMax Music 3开源:首个产品级AI音乐模型,凭歌词+描述独立生成5分钟完整歌曲
MiniMax于8月13-14日发布MiniMax Music 3开源权重——首个「产品级」AI音乐生成模型,给定歌词+风格描述即可输出最长5分钟结构完整的歌曲(人声+乐器+编曲);8B Global LLM(基于Qwen3-8B)把控全曲语义进程,0.6B Local LLM精修声学细节;32kHz 16bit立体声输出,最低8GB显存可本地运行,权重已上HuggingFace与GitHub;ComfyUI v0.33.1(08-13)同步集成。
MiniMax于8月13-14日发布MiniMax Music 3开源权重——首个”产品级”AI音乐生成模型,给定歌词+风格描述即可输出最长5分钟结构完整的歌曲(人声+乐器+编曲);8B Global LLM(基于Qwen3-8B)把控全曲语义进程,0.6B Local LLM精修声学细节;32kHz 16bit立体声输出,最低8GB显存可本地运行,权重已上HuggingFace与GitHub;ComfyUI v0.33.1(08-13)同步集成。
MiniMax H3(视频)已是SEEN加更条目
查看原始来源 ↗
Lightricks 官方 / VentureBeat·
8月11日一手
模型
›LTX-2.5 开源:10 秒 720p 仅需 6.8 秒,支持 4K 与同步音频,ComfyUI 当日 Day-0 支持
Lightricks 于 2026-08-11 开源 LTX-2.5(HuggingFace `Lightricks/LTX-Video-2.5`):10 秒 720p 视频生成仅需 6.8 秒(单 RTX 4090),支持 4K 输出、同步音频、原生多镜头(multi-shot)叙事;ComfyUI 发布当日 day-0 官方支持(含节点与工作流模板);商业营收 $10M ARR 以下完全免费。
Lightricks 于 2026-08-11 开源 LTX-2.5(HuggingFace Lightricks/LTX-Video-2.5):10 秒 720p 视频生成仅需 6.8 秒(单 RTX 4090),支持 4K 输出、同步音频、原生多镜头(multi-shot)叙事;ComfyUI 发布当日 day-0 官方支持(含节点与工作流模板);商业营收 $10M ARR 以下完全免费。是目前开源视频模型中速度与质量综合最优选择。
6.8 秒/10 秒生成速度达到「课堂当场出片」级别,大幅降低 AI 视频教学摩擦
查看原始来源 ↗
ComfyUI 官方 GitHub / ComfyUI...·
8月11日一手
产品
›ComfyUI v0.32.0 + v0.33.1 双版本更新:LTX-2.5 原生支持 + MiniMax Music 3 T2M 最长 5 分钟
ComfyUI v0.32.0(2026-08-11):SageAttention 级别显存优化(速度提升约 20-30%)+ LTX 2.5 原生支持(day-0)+ Qwen Image 3.0 + Grok Imagine Image 2.0 节点;v0.33.1(2026-08-13):MiniMax Music 3 T2M 节点(文本→音乐,最长 5 分钟)+ CUDA Graph 计算图缓存进一步提速;两个版本合计大幅提升高端视频+音频生成的本地工作流能力。
ComfyUI v0.32.0(2026-08-11):SageAttention 级别显存优化(速度提升约 20-30%)+ LTX 2.5 原生支持(day-0)+ Qwen Image 3.0 + Grok Imagine Image 2.0 节点;v0.33.1(2026-08-13):MiniMax Music 3 T2M 节点(文本→音乐,最长 5 分钟)+ CUDA Graph 计算图缓存进一步提速;两个版本合计大幅提升高端视频+音频生成的本地工作流能力。
ComfyUI 是使「图像→视频→音乐」全链路本地工作流在一个界面内打通,可作为
查看原始来源 ↗
Google Developers Blog / Ge...·
8月5日一手
模型
›Google发布Veo 3.1:120秒4K视频+原生音频+三参考图一致性,Gemini API付费预览即开
Google Veo 3.1于2026年8月5日登陆Gemini API付费预览:视频时长从8秒升至120秒,支持4K分辨率、原生立体声音频全链路生成(对话/音效/环境音)、跨场景角色一致性、竖版9:16,最多3张参考图引导生图到视频;Veo 3.1 Lite专注高并发与快速迭代,同步上线。
Google Veo 3.1于2026年8月5日登陆Gemini API付费预览:视频时长从8秒升至120秒,支持4K分辨率、原生立体声音频全链路生成(对话/音效/环境音)、跨场景角色一致性、竖版9:16,最多3张参考图引导生图到视频;Veo 3.1 Lite专注高并发与快速迭代,同步上线。
视频时长×15(8s→120s)是AI视频从”片段”到”短片”的门槛跨越
查看原始来源 ↗
Black Forest Labs 官方 / Vent...·
8月5日一手
模型
›Black Forest Labs FLUX 3 Video 正式 GA:20 秒原生音频,Draft 模式 $0.06/秒,1080p 首发
Black Forest Labs 于 2026-08-05 将 FLUX 3 Video 推送至生产可用(GA):单次最长 20 秒视频生成,内置原生音频联动输出,Draft 模式定价 $0.06/s(约 ¥0.44/s),首发 1080p(2K/4K 已在路线图);依托 FLUX API 及授权合作平台接入,ComfyUI Partner Nodes 预计跟进。
Black Forest Labs 于 2026-08-05 将 FLUX 3 Video 推送至生产可用(GA):单次最长 20 秒视频生成,内置原生音频联动输出,Draft 模式定价 $0.06/s(约 ¥0.44/s),首发 1080p(2K/4K 已在路线图);依托 FLUX API 及授权合作平台接入,ComfyUI Partner Nodes 预计跟进。前序:FLUX 3 统一多模态框架 2026-07-23 发布(图像+视频+音频同权重),本次为视频 GA 里程碑。
FLUX 生态是视频 GA 使无需更换工具链
查看原始来源 ↗
The Unsigned Network/TechTi...·
7月29日一手
模型
›Google Lyria 3.5发布:Flow工具新增图片转音乐功能,上传图像即可生成情绪匹配原创音乐
Google发布Lyria 3.5音乐AI模型,在Google Labs Flow工具中集成「图片转音乐」功能,上传一张图像即可生成与其情绪、色彩、主题匹配的原创音乐,音质与音乐性显著提升。
Google发布Lyria 3.5音乐AI模型,在Google Labs Flow工具中集成「图片转音乐」功能:上传一张图片即可生成与之情绪、色彩与主题匹配的原创音乐;Lyria 3.5在音质与音乐性上较前代显著提升,面向艺术家与设计师的配乐创作场景。
视觉图像到情绪匹配音乐的跨模态生成,为视觉艺术家提供了一个无需音乐专业背景即可完成配乐创作的工作流入口。
查看原始来源 ↗
新浪科技 / IT之家 / 量子位 / 机器之心(多源)·
7月20日
模型
›阿里Qwen-Audio-3.0-TTS发布:Flash版首包延迟300ms级实时交互,Plus版登顶Artificial Analysis全球榜单,覆盖20种中文方言
阿里发布语音合成大模型Qwen-Audio-3.0-TTS,含实时交互Flash版(首包延迟300ms级)和高质量生成Plus版;支持细粒度标签控制、freestyle指令遵循、20种中文方言及多语种,Plus版登顶全球权威榜单Artificial Analysis。
阿里巴巴发布Qwen-Audio-3.0-TTS语音合成大模型,分为两个版本:Flash版面向实时交互场景,首包延迟达300ms量级;Plus版面向高质量生成场景,在全球权威评测榜单Artificial Analysis中排名第一。两个版本均支持细粒度情绪/节奏/语气标签控制、freestyle自然语言指令遵循、20种中文方言以及多语种输出,将AI语音合成从”能说话”推进至”会表达”的能力层级。
AI语音合成是视频创作、数字人和有声内容工作流的核心组件,300ms首包延迟接近实时门槛,20种方言覆盖为多元地域内容生产打开空间。
查看原始来源 ↗
机器之心 / 新浪财经 / Chinaz / 同花顺(多源)·
7月19日
行业
›昆仑万维WAIC宣布「2026世界模型元年」:Matrix-Game 3.5单卡实时生成,Riemann-1.0机器人世界模型同步发布
昆仑万维董事长方汉在WAIC 2026世界模型专场论坛宣布2026为「世界模型元年」;发布Matrix-Game 3.5(Patch级记忆注入、单卡实时生成)和Riemann-1.0机器人世界模型,同步升级Mureka v9.5与O3音乐模型,预判AI音乐与视频将成大众创作工具。
昆仑万维在WAIC 2026举办世界模型专场论坛,董事长方汉宣布2026年为「世界模型元年」;现场发布Matrix-Game 3.5世界模型,引入Patch级记忆注入机制,实现单卡实时生成;同步发布Riemann-1.0机器人专用世界模型,并将Mureka音乐生成模型升级至v9.5与O3版本;圆桌讨论聚焦AI与文娱产业融合,嘉宾一致认为AI音乐与视频将从技术试验转为大众创作工具,人机协同将成为全球文娱产业新范式。
「世界模型元年」定义是WAIC 2026中文创作工具赛道最具战略宣示意味的表态之一;Matrix-Game 3.5与Riemann-1.0分别覆盖内容生产与具身智能两大方向,结合Mureka音乐模型,形成「内容+机器人」双线世界模型布局;单卡实时生成意味着本地化部署门槛大幅降低,对高校创作工具应用具有直接价值。
查看原始来源 ↗
›歌歌AI音乐大模型全面上线:单卡10秒生成华语歌曲,打通字节七大平台
歌歌AI音乐大模型7月10日全面上线,十亿级参数华语端到端扩散+歌声合成混合架构,单卡10秒生成完整华语歌曲,中文咬字还原率较通用模型提升67%,打通字节七大平台,同期启动非遗民乐数据采集计划。
歌歌AI音乐大模型于2026年7月10日全面上线,采用十亿级参数规模的华语端到端扩散与歌声合成混合架构,支持在单卡设备上10秒内生成完整华语歌曲。相较于通用音乐模型,其中文咬字还原率提升67%,并已接入抖音、剪映、汽水音乐等字节跳动旗下七个内容平台。同期启动「中国声音采集计划」,面向非物质文化遗产民乐进行数据采集。由量子位、机器之心、IT Bear多源确认。
针对华语发音的专项优化大幅提升AI音乐在中文内容场景下的实用性,字节七平台接入意味着AI生成音乐将进入更大规模的内容分发体系。
查看原始来源 ↗
›OpenAI发布GPT-Live-1/mini:全双工实时语音模型支持打断与实时翻译
OpenAI发布GPT-Live-1与mini两款全双工实时语音模型,支持边听边说、主动打断及实时多语言翻译,已向ChatGPT用户和开发者开放。
OpenAI于2026年7月8日发布GPT-Live-1与GPT-Live-mini两款全双工实时语音模型,支持边听边说、主动打断与暂顿理解,以及实时多语言翻译能力。复杂推理任务将在后台调用GPT-5.5处理。ChatGPT Plus用户默认使用GPT-Live-1,Free用户使用mini版本,同时向开发者开放API接入。
全双工语音交互能力的商用化落地,为语音界面原型设计、多媒体创作及多语言教学工具的开发提供了新的底层模型选项。
查看原始来源 ↗
ComfyUI官方GitHub·
7月8日一手
产品
›ComfyUI v0.27.1:接入Seedream 5.0 Pro与Seed Audio 1.0节点
ComfyUI v0.27.1通过Partner Nodes接入Seedream 5.0 Pro图像生成与Seed Audio 1.0多模态音频节点,同时停用Ideogram旧版并移除StabilityAI合作节点。
ComfyUI v0.27.1于2026年7月8日发布,通过Partner Nodes同步接入字节Seedream 5.0 Pro图像生成节点与Seed Audio 1.0音频节点(支持语音、音效、多角色对白生成)。同时停用了Ideogram V1/V2旧版节点,并临时移除了StabilityAI partner nodes,修复了视频解码含不可解音频流时的崩溃问题。
ComfyUI节点生态在单次更新中同时扩展到最新图像模型和多模态音频生成,用户可在同一工作流内调用最新的图文音多模态能力而无需切换工具。
查看原始来源 ↗
PR Newswire / 雷锋网 / IT之家 / 量子位·
7月3日一手编辑精选
模型
›Vidu S1:一张照片 + 实时语音生成可持续互动的 AI 数字角色,AI 视频进入实时对话范式
生数科技发布 Vidu S1:一张照片 + 实时语音即可生成可持续互动的 AI 数字角色,540P/25FPS 全双工交互,AR+扩散混合架构,模型侧延迟约 200ms
生数科技于 2026 全球数字经济大会(7/3)发布 Vidu S1 实时交互视频生成模型:输入一张照片与实时语音,即可生成支持持续对话互动的 AI 数字角色,输出规格为 540P/25FPS 全双工交互,采用 AR+扩散混合架构,模型侧延迟约 200ms;支持真人、动漫、萌宠等多种视觉风格。消息由 PR Newswire 官方英文稿及中文 6 个信源同步确认。
AI 视频生成首次跨越从「批量预渲染」到「实时双向交互」的技术边界,将数字角色从单向播放内容升级为可持续对话的交互对象。
查看原始来源 ↗
›字节 Seed-Audio 1.0:零样本多模态参考生成人声、音效与 BGM 全要素
字节跳动于 FORCE 大会(6 月 23 日)发布 Seed-Audio 1.0,支持零样本多模态参考生成人声、音效与 BGM 全要素,可输出多角色对白与拟音,单次时长达 2 分钟并可延伸至数十分钟。
字节跳动于 2026 年 6 月 23 日 FORCE 大会发布 Seed-Audio 1.0,该模型支持以零样本(zero-shot)多模态参考一次性生成人声、音效与背景音乐(BGM)全要素,可处理多角色对白场景与拟音需求,单次生成时长可达 2 分钟,并支持延伸至数十分钟的长内容输出;主要面向影视内容配音后期、有声书与播客等音频制作场景。
覆盖人声、音效与 BGM 三类要素的一体式多模态音频生成,将过去需要多工具协作的音频后期流程整合为单一入口,对影视制作与内容创作教学中 AI 音频工具的应用提供了新的能力参照。
查看原始来源 ↗
Google Workspace Blog·
6月18日一手
产品
›Google Vids 三连更:Veo 3.1 对所有账号免费、Lyria 3 AI 音乐生成、AI 虚拟人扩容至 53 种
Google Vids 升级:Veo 3.1 免费、Lyria 3 AI 配乐、AI 虚拟人扩至 53 种。
Google 宣布对 Google Vids 进行重大升级:所有 Google 账号每月可免费使用 Veo 3.1 生成 10 条视频;AI Pro/Ultra 订阅用户可用 Lyria 3 生成 30 秒至 3 分钟自定义背景音乐;AI 虚拟人预设从 23 种扩展至 53 种(含写实、3D 卡通、图形小说等风格),新增导演级场景交互控制。
Veo 3.1 免费化显著降低文生视频的使用门槛;Lyria 3 的 AI 配乐省去背景音乐单独授权,对影像 / 多媒体创作有直接价值。
查看原始来源 ↗
Variety / Sixth Tone / 多源·
6月15日
产品
›MiniMax Hub 发布:图·视频·配音·音乐·剪辑一站式多模态 AI 创作平台
MiniMax 于上海国际电影节期间发布 MiniMax Hub,整合图像、视频、配音、音乐与剪辑的一站式多模态创作平台,由 Agent 拆解任务并保留人工决策节点,4 支跨国团队用于电影节 AI 短片制作。
2026 年 6 月,MiniMax 在上海国际电影节期间发布多模态 AI 创作平台 MiniMax Hub,将图像、视频、配音、音乐与剪辑整合到同一平台;平台以 Agent 自动拆解创作任务,并在流程中保留人工决策节点,强调「AI 执行、人把关」的协作方式。据 Variety 等报道,本届电影节有 4 支跨国团队实际使用该平台进行 AI 短片制作;平台经 hub.minimax.io 提供免费下载。
多模态创作从「分散的单点工具」走向「带任务编排的一体化平台」,对影视、动画与短片方向的创作教学而言,提供了一个可观察的「Agent 编排 + 人工把关」工作流样本。
查看原始来源 ↗