浅译快报

Google

与 Google 相关的资讯,按发布日倒序。

Google Workspace 官方博客· 9月1日一手 产品

Google 将 Pics 正式集成进 Workspace,以 Gemini 为底层提供文生图、背景替换、对象移除等专业级图像编辑,可在 Google Docs / Slides / Drive 内直接操作。

Google 于 2026 年 9 月 1 日正式将 Pics 集成进 Google Workspace,以 Gemini 模型为底层提供文生图、背景替换、对象移除、风格迁移等图像创建与编辑功能;支持在 Google Docs、Slides、Drive 内直接操作,无需离开 Workspace 生态;面向 Business 及以上套餐用户推送。

Google 将 AI 图像编辑直接嵌入办公套件,是 Workspace 正式进入 AI 辅助设计工具版图的具体信号。

查看原始来源 ↗

Google DeepMind官方· 8月27日一手 模型

Google发布Gemini Omni 1.1 Flash,支持40秒视频生成、首尾帧双重锁定、4K输出及$0.03/秒的Draft快速模式

Google DeepMind于8月27日发布Gemini Omni 1.1 Flash视频生成模型,在上一代基础上引入四项升级:最长单次生成时长从15秒延伸至40秒;新增首帧+尾帧双重锁定功能,用户可同时指定视频开头和结尾的画面,模型负责填充中间的运动过渡;原生输出分辨率升至4K;并推出Draft Mode,以$0.03/秒的定价大幅降低快速预览成本,正式模式仍维持原价。

Gemini Omni 1.1 Flash的首尾帧双锁定是AI视频生成向精确叙事控制迈进的关键功能,结合40秒时长和4K输出,覆盖了从快速原型到可交付成品的完整创作链路。

查看原始来源 ↗

ComfyUI官方GitHub/ComfyUI Wiki· 8月26日一手 产品

ComfyUI v0.34系列版本集成Pixal3D+TRELLIS2原生3D管线、Recraft V4风格生成、Gemini Omni 1.1 Flash视频及Wan3.0 Prime快速变体

ComfyUI v0.34系列更新(8月25日至26日)集中整合多个新模型:新增Pixal3D与TRELLIS2节点,支持从文本或图像直接生成三维网格和场景,构建本地3D生成管线;集成Recraft V4 Styles节点,支持1–10张参考图驱动的风格一致性图像生成;新增Gemini Omni 1.1 Flash视频生成节点(含4K和Draft Mode);以及Wan3.0 Prime快速变体节点($0.06–$0.30/秒定价)。单一版本系列内同时覆盖了图像生成、视频生成和3D生成三条核心创作管线。

ComfyUI v0.34系列的密集集成将平台定位从”图像生成工作流”进一步扩展为”多模态生成中枢”,3D管线的原生化是本轮更新的核心质变。

查看原始来源 ↗

Google Firebase官方文档 + ud.hk...· 8月17日一手 产品

Google于2026-08-17关闭全部Imagen 4系列API(imagen-4.0-generate-001 / ultra / fast),全线切换至Gemini 3.x图像族(Nano Banana);API调用方式从专用接口改为通用Gemini content-generation接口(modality=image);调用Imagen端点的Figma插件/Zapier/Make/n8n及大量小SaaS工具无声停摆;受影响用户须主动迁移端点+重写SDK调用逻辑。

Google于2026-08-17关闭全部Imagen 4系列API(imagen-4.0-generate-001 / ultra / fast),全线切换至Gemini 3.x图像族(Nano Banana);API调用方式从专用接口改为通用Gemini content-generation接口(modality=image);调用Imagen端点的Figma插件/Zapier/Make/n8n及大量小SaaS工具无声停摆;受影响用户须主动迁移端点+重写SDK调用逻辑。

使用Figma插件/Make/Zapier生成图像的教师和

查看原始来源 ↗

Runway官方· 8月12日一手 产品

Runway新增Gemini Omni Flash接入并推出API Model Router,根据任务类型自动选择最优底层视频模型

Runway于8月12日在平台接入Google Gemini Omni Flash视频生成能力,同时推出API Model Router功能:开发者通过Runway API调用视频生成时,Model Router根据任务参数(分辨率、时长、风格描述、成本预算)自动在Runway Gen-4、Gemini Omni Flash等底层模型间进行路由选择,无需手动指定模型版本。这一机制将底层模型差异对开发者透明化,降低了在多模型生态中构建视频生成应用的复杂度。

API Model Router将视频生成的模型选择从”开发者决策”转移至”平台智能调度”,是AI视频生成基础设施走向统一抽象层的进展。

查看原始来源 ↗

Google Developers Blog / Ge...· 8月5日一手 模型

Google Veo 3.1于2026年8月5日登陆Gemini API付费预览:视频时长从8秒升至120秒,支持4K分辨率、原生立体声音频全链路生成(对话/音效/环境音)、跨场景角色一致性、竖版9:16,最多3张参考图引导生图到视频;Veo 3.1 Lite专注高并发与快速迭代,同步上线。

Google Veo 3.1于2026年8月5日登陆Gemini API付费预览:视频时长从8秒升至120秒,支持4K分辨率、原生立体声音频全链路生成(对话/音效/环境音)、跨场景角色一致性、竖版9:16,最多3张参考图引导生图到视频;Veo 3.1 Lite专注高并发与快速迭代,同步上线。

视频时长×15(8s→120s)是AI视频从”片段”到”短片”的门槛跨越

查看原始来源 ↗

新智元 / 新浪科技· 8月1日 产品

谷歌地球嵌入Nano Banana 2模型,允许用户用文字指令修改真实地理影像(支持2K/4K输出+精准文字渲染),但因用户生成逼真「灾难场景」并在社媒传播,上线不到24小时紧急下架。

谷歌地球嵌入Nano Banana 2模型,允许用户用文字指令修改真实地理影像(支持2K/4K输出+精准文字渲染),但因用户生成逼真”灾难场景”并在社媒传播,上线不到24小时紧急下架。

AI图像生成合规与内容安全最具冲击力的近期案例——”功能无懈可击却因场景管控失守”。

查看原始来源 ↗

The Unsigned Network/TechTi...· 7月29日一手 模型

Google发布Lyria 3.5音乐AI模型,在Google Labs Flow工具中集成「图片转音乐」功能,上传一张图像即可生成与其情绪、色彩、主题匹配的原创音乐,音质与音乐性显著提升。

Google发布Lyria 3.5音乐AI模型,在Google Labs Flow工具中集成「图片转音乐」功能:上传一张图片即可生成与之情绪、色彩与主题匹配的原创音乐;Lyria 3.5在音质与音乐性上较前代显著提升,面向艺术家与设计师的配乐创作场景。

视觉图像到情绪匹配音乐的跨模态生成,为视觉艺术家提供了一个无需音乐专业背景即可完成配乐创作的工作流入口。

查看原始来源 ↗

Google DeepMind官方Blog / Tec...· 7月21日一手 模型

Google DeepMind同日发布三款新Flash模型:Gemini 3.6 Flash是主力workhorse、token成本降低17%,3.5 Flash-Lite为最低价轻量版($0.30/百万输入),3.5 Flash Cyber为安全漏洞专用精调版限政府伙伴;同步宣布Gemini 4已进入预训练阶段,Gemini 3.5 Pro仍在伙伴测试中。

Google DeepMind于2026年7月21日同日发布三款新Flash系列模型:Gemini 3.6 Flash定位主力workhorse,综合多模态能力提升,token成本较前代降低17%,DeepSWE编程评测49%、Computer Use任务83%,支持百万token上下文;Gemini 3.5 Flash-Lite为极低成本轻量场景设计,输入价格$0.30/百万token;Gemini 3.5 Flash Cyber是安全漏洞检测专项精调版,仅对政府合作伙伴开放;同时宣布Gemini 4已进入预训练阶段,此前原计划7月17日发布的Gemini 3.5 Pro仍在伙伴测试中延期推进。

Gemini模型已深度整合Google Workspace、Canva、Figma等设计工具生态,3.6 Flash降本17%直接降低基于Gemini驱动的创意工具API使用成本,Gemini 4预训练宣告则标志下一代能力的路线图节点。

查看原始来源 ↗

机器之心 / QQ新闻· 7月18日 论文

Google 团队提出 VGGRPO,通过隐空间 4D 几何奖励进行强化学习后训练,解决视频扩散模型几何漂移与摄像机轨迹不稳定问题,已被 ECCV 2026 收录。

ECCV 2026 收录 Google 团队提出的 VGGRPO:通过在 4D 隐空间中引入几何一致性奖励信号进行强化学习后训练,提升视频扩散模型的几何稳定性,解决几何漂移、摄像机轨迹不连贯和场景结构不稳定等问题,且无需对 VAE 进行额外解码。

几何一致性是 AI 视频生成进入专业影视和动画制作流程的核心障碍之一,VGGRPO 提供了可落地的 RL 后训练方案,对评估主流视频生成工具的底层几何稳定性有参考价值。

查看原始来源 ↗

新浪财经 / 36氪· 7月17日 模型

谷歌 Gemini 3.5 Pro 原定 7 月 17 日发布已确认延期,主因是编程能力仍在打磨,10 名现任和前任员工参与确认。

谷歌 Gemini 3.5 Pro 原定 2026 年 7 月 17 日发布,已被 10 名现任和前任谷歌员工证实延期,主因是编程能力仍在打磨;据此前泄露信息,该模型具备前端/SVG 代码像素级精准生成能力,上下文窗口达 200 万 token,并经过完全重新预训练。延期为 Claude Design 和 GPT-5.6 等竞品保留了更长的窗口期。

Gemini 3.5 Pro 的前端 UI 一次生成能力被视为设计工具赛道的潜在变革点,延期意味着相关 AI 辅助设计工作流在短期内尚不会受到该模型的冲击,但发布时间仍值得持续关注。

查看原始来源 ↗

Google Blog / TechCrunch· 7月16日一手 产品

Google Workspace 正式推出个人 AI 数字人,用户录制一次自拍和声音样本,即可在 Vids 中以本人形象出镜任意视频,并内嵌 SynthID 隐形水印。

Google Workspace 在 Vids 中正式上线「个人 AI 数字人」:用户录制一次自拍和声音样本,即可在后续所有 Vids 视频中以本人形象出镜;同步接入 Gemini Omni,支持自然语言驱动视频生成、背景替换与光效修复,并内嵌 SynthID 隐形水印。此次更新直接对标 HeyGen 和 Synthesia,将 AI 数字人与视频生成统一进 Workspace 生产力套件。

Google 通过办公视频场景将 AI 数字人主流化,打破了专用 AI 视频工具的订阅壁垒,为企业和教育场景的低成本 AI 讲解视频制作提供了新路径。

查看原始来源 ↗

Canva官方新闻室/量子位/优设(多源)· 7月16日一手 产品

Google将Canva作为Connected App引入Workspace,@Canva指令即可调用Gemini生成品牌视觉并直接插入文档;Canva同步推出Magic Layers AI图层分离功能,每层可独立编辑。

Google于2026年7月16日将Canva作为Connected App引入Google Workspace:用户在Docs/Slides/Sheets中输入@Canva指令即可调用Gemini驱动的Canva功能,生成品牌视觉内容并直接插入文档;Canva同步推出Magic Layers功能,利用AI自动分离图层,每层可独立编辑,并支持品牌Kit自动套用。该整合由Canva官方新闻室、量子位、优设等多源证实。

Canva与Google Workspace的Connected App整合,使视觉设计生成直接嵌入文档协作场景;Magic Layers图层分离将AI生成图像从「整体编辑」推进至「元素级可编辑」,是AI设计工具与办公生态深度融合的典型案例。

查看原始来源 ↗

genception.github.io/TechTi...· 7月13日一手 论文

DeepMind发布GenCeption,是首个在单一模型中统一视频理解与生成能力的视觉通用学习器,在多项基准上取得领先结果。

DeepMind于2026年7月13日发布GenCeption,这是一个将视频理解(描述、问答、分类)与视频生成(文本到视频、图像到视频)统一在单一模型架构中的视觉通用学习器,在多个标准基准上取得当前最优结果。项目详情发布于genception.github.io,机器之心等媒体进行了技术解读报道。

视觉理解与生成在统一模型中的融合是当前多模态研究的核心前沿方向,GenCeption的发布对从事AI视觉创作与人机协作研究的院校团队具有重要的学术参考意义。

查看原始来源 ↗

Google官方Blog· 7月8日一手 产品

Google Photos上线Video Remix功能,由Gemini Omni驱动,支持将用户视频转换为水彩、素描、油画艺术风格及电影级色彩重映,已在14国上线。

Google Photos于2026年7月8日推出Video Remix功能,由Gemini Omni模型驱动,支持对用户手机视频应用三档艺术风格——水彩、素描、油画——以及电影级色彩重映和背景替换效果。功能入口位于Google Photos「创意」标签页,已在14个国家面向Google AI Plus/Pro/Ultra订阅用户上线。

消费级应用将AI风格迁移能力直接集成到手机相册内,艺术类风格的实时可及性大幅提升,也为风格迁移技术的实际使用门槛与审美偏好提供了大规模用户验证场景。

查看原始来源 ↗

新智元 / 36氪 / 凤凰科技 / 多源· 7月7日 模型

多源传言 Google DeepMind 将于 7 月 17 日发布 Gemini 3.5 Pro,称完全重新预训练,主打前端代码像素级精准、200 万上下文窗口及 SVG 与 3D 建模能力,尚未经官方确认

多个中文科技媒体(新智元、36氪、凤凰科技等四源)于 7 月 7 日报道,Google DeepMind 预计于 7 月 17 日发布 Gemini 3.5 Pro,消息来自泄露信息,尚未获得官方确认。泄露描述称该版本为完全重新预训练,原 Gemini 2.5 Pro 架构被放弃,主要改进方向包括前端代码像素级精准生成、200 万 token 上下文窗口及 SVG 与 3D 建模能力提升,多项测试据称超越 Claude Fable 5。

若泄露信息属实,前端代码到视觉设计的 AI 辅助能力将迎来一次集中升级;该模型发布前仍应以官方公告为准。

查看原始来源 ↗

优设情报 / IT之家· 7月6日编辑精选 模型

Gemini Omni Flash 在 Video Arena 盲测中以 1404 Elo 分领先全部 AI 视频模型,字节 Seedance 2.0 Mini 以 1303 Elo 居次,前十名 Google 占 5 席

Video Arena 最新盲测排行显示(2026 年 7 月 6 日),Gemini Omni Flash 以 1404 Elo 分登顶所有 AI 视频生成模型,字节 Seedance 2.0 Mini 以 1303 Elo 居次,前十名中 Google 旗下产品占据 5 个席位。此次排名基于 Video Arena 公认的公正第三方盲测机制,由优设情报与 IT 之家双源报道。

Video Arena 盲测为目前公认的 AI 视频生成横向评测基准,该排名为 AI 视频教学工具选型和课程演示提供了当前最具参考价值的综合横向对比数据。

查看原始来源 ↗

SIGGRAPH 2026 官方 / PRNewswire· 7月2日一手 案例

SIGGRAPH 2026 计算机动画节入选 Google DeepMind 团队 AI 辅助油画风动画短片,艺术家全程主导 + AI 协同创作模式获学院奖认证节展认可

SIGGRAPH 2026 计算机动画节(CAF)公布入选名单,Google DeepMind 团队创作的 AI 辅助动画短片《Dear Upstairs Neighbors》入选,作品采用油画风格,由艺术家全程主导创作方向,AI 在过程中担任协同角色。CAF 为学院奖认证评审节展,将于 7 月 19–23 日在洛杉矶举办,同场包含《阿凡达:烈焰与灰烬》《曼达洛人与格罗古》等好莱坞大制作生产揭秘环节。

学院奖认证节展正式接纳 AI 辅助创作作品,且作品来自 Google DeepMind,是 AI 在主流动画产业认可体系中获得正式位置的参照节点。

查看原始来源 ↗

Google 官方 / CineD / NoFilmS...· 7月1日一手 模型

Google Veo 3.1 新增原生 9:16 竖版视频输出、1080p-4K 超分辨率及跨场景角色一致性能力,已上线 Gemini App、YouTube Shorts、Gemini API 等平台

Google 于 7 月 1 日发布 Veo 3.1 重大功能更新:新增原生 9:16 竖版视频输出(适配 YouTube Shorts 等竖屏平台)、1080p-4K 超分辨率处理,以及跨场景叙事中同一角色外观一致性的显著提升。更新已同步上线 Gemini App、YouTube Shorts、Flow 创作平台、Gemini API 及 Vertex AI。

Veo 3.1 将竖版格式作为原生输出选项,反映出主流 AI 视频生成工具开始原生适应短视频平台的竖屏内容生产需求。

查看原始来源 ↗

Google DeepMind / IT之家 / 新浪...· 6月30日一手编辑精选 模型

Google DeepMind 于 2026-06-30 同步发布 Nano Banana 2 Lite 图像模型(约 4 秒出图、每张 1K 分辨率图约 $0.034)与 Gemini Omni Flash 静态图转带运镜视频模型;两款均已接入 Adobe Firefly 与 Google Stitch 生态。

Google DeepMind 于 2026-06-30 同步发布 Nano Banana 2 Lite(Gemini 3.1 Flash Lite 图像模型)与 Gemini Omni Flash(静态图转带运镜视频模型):Nano Banana 2 Lite 约 4 秒生成一张 1K 分辨率图像,Text-to-Image Elo 较上一代提升 100 至 1251,强化字符一致性与文字渲染,质量表现反超更贵的 Pro 档;每张 1K 分辨率图约 $0.034(图像输出每百万 token $30),与 Midjourney(约 $0.01–0.05/张)处于同一价格区间。Gemini Omni Flash 支持将静态图转为带自然运镜的短视频,定价 $0.10/秒;两款均上线 AI Studio 与 Gemini API,并已接入 Adobe Firefly Partner Models、Google Stitch、NotebookLM、Google Photos 及 Google Ads 生态。

核心卖点是速度(约 4 秒出图)与「速度档定价、质量反超自家更贵 Pro 档」的质价比,单张成本与主流付费模型处于同一区间。Gemini Omni Flash 的静态图转运镜视频能力,为从平面作品到动态演示提供了低门槛路径。

查看原始来源 ↗

Google Labs / GitHub / 腾讯云开发者· 6月29日一手 产品

Google Labs 开源 DESIGN.md 格式规范,用 YAML 设计 token + Markdown 说明的双层结构,让 Claude Code、Cursor 等 AI 编码智能体持久、结构化地理解并遵循一套设计系统。

Google Labs 开源了 DESIGN.md 格式规范(GitHub:google-labs-code/design.md),用 YAML 设计 token + Markdown 说明的双层结构,向 Claude Code、Cursor 等 AI 编码智能体描述一套视觉身份,使其在生成界面时能持久、结构化地获取并遵循设计约束,而非每次由人重新解释。

把设计系统写成 AI「看得懂」的结构化说明,是设计与 AI 编码协作走向规范化的一个具体方向,对设计系统建设与 AI 辅助前端实践具参考价值。

查看原始来源 ↗

arXiv (2606.25306) / TechWa...· 6月24日一手 论文

北卡罗来纳大学、Johns Hopkins、AI2 与德克萨斯大学奥斯汀联合发布 PQSG 评估体系(arXiv:2606.25306),首次系统评估 AI 视频生成模型的物理一致性,覆盖刚体动力学、流体模拟、软体变形,揭示主流视频模型的系统性物理短板。

北卡罗来纳大学、Johns Hopkins、AI2 与德克萨斯大学奥斯汀联合发布 PQSG(物理问题场景图)评估体系(arXiv:2606.25306,2026-06-24),首次系统评估 AI 视频生成模型的物理一致性,覆盖刚体动力学、流体模拟、软体变形三大场景,对 Sora 2、Veo 3 等商业主流模型进行了定量评分,揭示现有视频模型在物理场景上存在系统性不足。

了解 AI 视频工具的物理局限,是在课堂中准确设定工具边界的前提:动画、影视、游戏方向的师生在用 Sora 2、Veo 3 制作含流体或刚体运动内容时,可参考 PQSG 指出的具体失效场景,避免将模型缺陷当作设计意图;该评估方法本身也是「批判性使用 AI 工具」教学单元的优质素材。

查看原始来源 ↗

RedSharkNews / PRONEWS / Cr...· 6月23日编辑精选 产品

Adobe CC 6 月 23 日周次更新:Photoshop 生成填充新增 FLUX Kontext 和 Google Gemini 作为可选伴侣模型,Generative Upscale 新增 Topaz Gigapixel 选项,After Effects AI 转描工具同步重构。

Adobe Creative Cloud 于 2026 年 6 月 20–23 日发布周次更新,核心变化包括:Photoshop 生成填充功能首次引入 FLUX Kontext 和 Google Gemini 作为可选伴侣模型,用户可在 Adobe 自有模型之外切换第三方开源或商业模型;Generative Upscale 新增 Topaz Gigapixel 和 Bloom 作为可选引擎;After Effects AI 转描(Rotoscoping)工具进行重构;Lightroom AI 智能筛片功能同步更新;三家以上英文媒体源核认。

开源模型 FLUX Kontext 首次作为伴侣模型进入 Photoshop 核心工具(生成填充),标志着 Adobe 开始向开放模型生态开放其主力工作流入口,是设计工具与开源 AI 模型融合进程的重要节点。

查看原始来源 ↗

Google DeepMind Blog / Vari...· 6月22日一手编辑精选 案例

Google DeepMind 宣布与独立电影公司 A24 建立 AI 研究合作并投资约 7500 万美元,DeepMind 研究员将与 A24 主创并肩开发 AI 分镜与工作流工具,这是 Google 首次持股电影公司。

Google DeepMind 于 2026 年 6 月 22 日宣布与独立电影公司 A24(《瞬息全宇宙》《Midsommar》出品方)建立 AI 研究合作,并以权益投资形式注资约 7500 万美元,这是 Google 首次持股电影公司;合作为非排他性,DeepMind 研究员将与 A24 主创并肩测试、迭代、开发面向创作者的 AI 分镜生成与制片工作流工具(驻场程度以官方「并肩」协作表述及后续为准),首个项目与 A24 即将上映的《The Backrooms》系列制作相关;A24 明确表示新工具不以降本或提速为核心卖点,而是服务于创作者的叙事表达;Variety、IndieWire、Deadline、Hollywood Reporter 等 9+ 媒体源同日报道。

顶级 AI 实验室以「嵌入制片流程」而非「提供 API」的方式进入创意制作,标志着 AI 与艺术创作机构关系模式的实质升级;AI 分镜工具的专业化落地,对影视、动画、插画等方向的教学实践具有直接参照价值。

查看原始来源 ↗

The Art Newspaper / Artnet ...· 6月20日一手 赛展

全球首座 AI 艺术博物馆 Dataland 在洛杉矶开幕,AI 生成艺术从实验室与网络走向机构化展陈。

由艺术家 Refik Anadol 联合创立、Google 提供技术支持的 Dataland 博物馆于 6 月 20 日在洛杉矶 The Grand LA(弗兰克·盖里设计建筑)正式开幕,占地 2,300 平方米,首展「机器之梦:雨林」以大规模 AI 生成影像沉浸呈现——数据集采集自全球 16 片雨林,并与史密森尼博物馆、康奈尔鸟类学实验室、盖蒂等机构合作建库;观众佩戴生物特征腕带,实时数据参与影像生成。

这是 AI 艺术史上首座专为 AI 生成艺术而建、面向公众常态运营的博物馆,标志着 AI 创作从实验室与网络走向机构化展陈。其策展方法、观众生物特征与影像生成的交互机制、以及基于伦理数据采集的大规模 AI 沉浸装置实践,都是研究 AI 艺术社会角色或筹备装置/展览方案的一手参考案例。

查看原始来源 ↗

Google Workspace Blog· 6月18日一手 产品

Google Vids 升级:Veo 3.1 免费、Lyria 3 AI 配乐、AI 虚拟人扩至 53 种。

Google 宣布对 Google Vids 进行重大升级:所有 Google 账号每月可免费使用 Veo 3.1 生成 10 条视频;AI Pro/Ultra 订阅用户可用 Lyria 3 生成 30 秒至 3 分钟自定义背景音乐;AI 虚拟人预设从 23 种扩展至 53 种(含写实、3D 卡通、图形小说等风格),新增导演级场景交互控制。

Veo 3.1 免费化显著降低文生视频的使用门槛;Lyria 3 的 AI 配乐省去背景音乐单独授权,对影像 / 多媒体创作有直接价值。

查看原始来源 ↗