浅译周报
GPT-6 发布与世界模型更新
8 月 31 日至 9 月 6 日,共收录资讯 14 条。OpenAI 发布 GPT-6(Project Astra),新增 Computer Use 能力,演示中可操控 3D 建模和 CAD 软件。Anthropic 更新 Fable 5.1 与 Mythos 5.1,缓存读取成本降低 75%。Runway 发布实时世界模型 GWM Worlds 2 和界面世界模型 Solaris。Suno 对免费账户实施终身 7 次下载上限。Midjourney V8.2 Edit Mode 全量开放,inclusionAI 开源 LLaDA-Image,Google Pics 进入 Workspace。
头条OpenAI发布GPT-6(Project Astra):Computer Use能力正式上线,可操控3D/CAD软件- 1
- 2
- 3
01通用大模型更新
本版导读OpenAI 发布 GPT-6(Project Astra),新增 Computer Use 能力,官方演示包括操控 3D 建模软件和 CAD 程序,完成多步骤设计任务。Anthropic 更新 Fable 5.1 和 Mythos 5.1,缓存读取成本降低 75%,输出 token 价格不变。
OpenAI正式发布GPT-6(Project Astra),新增Computer Use能力,官方演示包括操控3D建模软件和CAD程序执行多步骤设计任务
原文 ↗Anthropic更新Fable 5.1和Mythos 5.1,缓存读取(cache read)成本降低75%,输出token价格维持不变
原文 ↗02世界模型与视频工具
本版导读Runway 发布第二代通用世界模型 GWM Worlds 2,持续生成 720p、24fps 视频并实时响应文字指令。Runway 另发布研究模型 Solaris,把网页和应用界面实时渲染为连续视频,目前为研究 Demo;视频调色模型 Ruby 按自然语言描述做色彩分级。ComfyUI v0.34.4 首发 Meta Muse 视频生成节点,v0.34.5 支持子工作流嵌套。
Runway发布通用世界模型第二代GWM Worlds 2,持续生成720p/24fps视频并响应用户实时文字操控指令,世界从当前状态延续而非重置
原文 ↗Runway发布研究级模型Solaris,定义为界面世界模型(Interface World Model),可将网页和应用UI实时渲染为连续视频体验,目前为研究Demo阶段
原文 ↗ComfyUI v0.34.4首发Meta Muse视频生成节点;v0.34.5新增子工作流嵌套调用及Comfy Cloud原生视频流式预览
原文 ↗Runway发布Ruby专用视频调色模型,通过自然语言描述(如「70s胶片感」「清晨蓝调」)执行专业级色彩分级,理解光线情绪与时代氛围
原文 ↗03音乐版权与艺术教育
本版导读Suno 对免费账户实施终身 7 次下载上限,引发 AI 音乐版权争议。伦敦蛇形画廊首届 Art+Technology Fellowship 开放申请,Refik Anadol 和曹斐担任评审,面向 AI 艺术与科技交叉领域的创作者。arXiv 论文 2509.24167 考察 AI 工具如何支持视觉艺术初学者的创意构思,并讨论教学介入的边界。
伦敦蛇形画廊首届Art+Technology Fellowship正式开放申请,Refik Anadol和曹斐担任评审,面向AI艺术与科技交叉领域创作者
原文 ↗arXiv论文2509.24167考察AI工具如何支持视觉艺术初学者的创意构思过程,并探讨教学介入的适当边界
原文 ↗04图像编辑与创作工具
本版导读Midjourney V8.2 Edit Mode 全量开放,在一个界面整合 4 张参考图、内绘与外延。inclusionAI 开源 6B 参数的 LLaDA-Image,支持文生图、参考编辑和中英文排版。Adobe 把 Firefly 生图接入 Slack,Krea 发布支持 MCP 与长期记忆的 Krea Agents,Google Pics 以 Gemini 为底层进入 Workspace。
Midjourney V8.2 Edit Mode正式全量开放,在单一界面整合4张参考图输入、画布内绘(inpaint)与外延(outpaint)功能
原文 ↗inclusionAI 发布 LLaDA-Image:6B 参数开源统一图像生成与编辑模型,分 Base(50步高质量)和 Turbo(4步快速,Twin-DMD 蒸馏)双档,支持文生图、参考图风格迁移、精准编辑以及中英文文字排版渲染。
原文 ↗Adobe推出Firefly for Slack集成,用户在Slack对话中可直接调用文生图、图生图和重新着色功能生成商业可用视觉资产,无需切换应用
原文 ↗Krea 发布 Agents,单条自然语言指令驱动整套图像 / 视频生成工作流,内置 MCP 工具调用与跨会话长期记忆,面向 Krea Pro 订阅用户开放。
原文 ↗Google 将 Pics 正式集成进 Workspace,以 Gemini 为底层提供文生图、背景替换、对象移除等专业级图像编辑,可在 Google Docs / Slides / Drive 内直接操作。
原文 ↗05征集与赛展
- CHI 2027 国际人机交互会议征稿(学术会议)ACM SIGCHI · 截止 9月10日
- 第13届 INNODESIGN PRIZE · INNO AIGC 设计奖INNODESIGN PRIZE(北京环艺国际展览) · 截止 9月15日
- 第二届「复新」全球大学生智能影像创作大赛复旦大学新闻学院 · 截止 9月20日
- 2026-W38实时视频编辑与开源图像模型
- 2026-W37Sora 关停与剪辑软件插件
- 2026-W35视频生成模型集中更新
- 2026-W34版权归因研究与图像接口关停
- 2026-W33开源音乐与视频模型
- 2026-W32视频音频模型与创意软件接入
- 2026-W31视频模型发布与 AI 水印新规
- 2026-W30设计 Agent 与图像模型发布
- 2026-W29WAIC 多模态模型与交互视频
- 2026-W28Meta 图像功能下架与幽灵字体
- 2026-W27图像模型、版权诉讼与视频融资
(本期完)
条目均来自本站已发布资讯,链回原卡片与原始来源;导读与本版导读为编辑汇编,不含评价。全部资讯 →