浅译周报
Meta 图像功能下架与幽灵字体
7 月 6 日至 12 日,共收录资讯 37 条。Meta 发布首个自研图像模型 Muse Image,其中「@提及公开账号生成」功能遭 SAG-AFTRA 与 CAA 声讨,上线不足一周下架。设计师 Eric Lu 与 Mixfont 发布 Ghost Font,主流大模型起初都无法读取。字节 Seedream 5.0 Pro 全球发布,独立电影人转用 Seedance。大模型方面,GPT-5.6 全量公开,xAI 发布 Grok 4.5,Anthropic 发表全局工作空间研究。
头条Meta Muse Image上线不足一周因opt-out默认机制遭SAG-AFTRA/CAA联合声讨后下架- 1
- 2
- 3
01图像模型与肖像争议
本版导读Meta Superintelligence Labs 发布首个自研图像模型 Muse Image,上线 Meta AI、Instagram 与 WhatsApp。其「@提及公开账号生成」功能采用 opt-out 默认机制,遭 SAG-AFTRA 与 CAA 联合声讨后下架。字节 Seedream 5.0 Pro 全球发布,支持圈选编辑与 10 多种语言文字生成。Reve 发布 2.1 版本。
Meta Muse Image的「@提及公开账号生成」功能因采用opt-out默认机制允许生成公开IG账号AI图像,遭SAG-AFTRA与CAA联合声讨,Meta承认「missed the mark」后将该功能下架。
原文 ↗Meta Superintelligence Labs 发布首个自研图像生成模型 Muse Image,采用 Agent 式架构(调用搜索与代码工具自我修正),已上线 Meta AI 应用、Instagram Stories 及 WhatsApp,并将接入广告系统 Advantage+,多指标超越 Google Nano Banana 2
原文 ↗字节Seedream 5.0 Pro正式发布,带来高密度信息可视化、交互式精准编辑(圈选/图层分离)、真实影像质感及10+语言原生文字生成四项核心升级。
原文 ↗02设计与创作工具
本版导读Eric Lu 与 Mixfont 把字母编码为运动轨迹做成 Ghost Font,GPT-5.6、Gemini、Claude 起初都无法读取,72 小时后 GPT-5.6 凭一句方向提示破解。Figma Make 接入 GPT-5.6,开源插件 Cowart 在 tldraw 画布内用标注改图。ComfyUI v0.27.1 接入 Seedream 5.0 Pro 节点。
设计师Eric Lu与Mixfont将字母编码为移动轨迹,发布24小时内达14.7M播放;GPT-5.6、Gemini、Claude均无法读取;72小时后一句方向提示使GPT-5.6完整破解,完成设计与AI认知对抗的首个完整回合制案例。
原文 ↗Figma Make正式接入GPT-5.6,支持从提示词、草图或既有Figma文件生成可运行交互原型,首轮生成质量提升,遇错误可自我修复。
原文 ↗ComfyUI v0.27.1通过Partner Nodes接入Seedream 5.0 Pro图像生成与Seed Audio 1.0多模态音频节点,同时停用Ideogram旧版并移除StabilityAI合作节点。
原文 ↗Cowart开源插件将Codex与tldraw无限画布结合,通过视觉标注加截图的方式解决AI改图中空间关系描述难的问题。
原文 ↗openJiuwen Skill-Omni将AI Agent经验存储从纯文字升级为视觉+文字形式,支持从网页和视频自动提取截图生成可复用经验库。
原文 ↗爱范儿观点文章指出,大多数人在使用AI时最常犯的错误是一开始就“给指令”而非“提问题”,降低预期与承认无知是用好AI工具的前置条件。
原文 ↗03视频、影视与音乐
本版导读多源报道称独立电影人转用 Seedance 2.5,成本约 $9/分钟。导演 PJ Ace 用 PAI 2.0 生成的短片播放破百万。Gemini Omni Flash 以 1404 Elo 登顶 Video Arena。Runway 推出单一 API 平台 Runway Dev。歌歌 AI 音乐大模型全面上线。
独立电影人群体正悄然转向字节Seedance 2.5,AI视频生成成本约$9/分钟较传统摄制$24/分钟大幅压低,量子位、Variety等多源报道证实这一趋势正在专业创作圈扩散。
原文 ↗好莱坞独立导演PJ Ace使用PAI 2.0生成的3分钟AI短片播放量破百万,Utopai Studios平台在60天内年化营收达1100万美元,PAI Pro Skill矩阵开源并已接入Claude Code与Cursor。
原文 ↗Gemini Omni Flash 在 Video Arena 盲测中以 1404 Elo 分领先全部 AI 视频模型,字节 Seedance 2.0 Mini 以 1303 Elo 居次,前十名 Google 占 5 席
原文 ↗歌歌AI音乐大模型7月10日全面上线,十亿级参数华语端到端扩散+歌声合成混合架构,单卡10秒生成完整华语歌曲,中文咬字还原率较通用模型提升67%,打通字节七大平台,同期启动非遗民乐数据采集计划。
原文 ↗Google Photos上线Video Remix功能,由Gemini Omni驱动,支持将用户视频转换为水彩、素描、油画艺术风格及电影级色彩重映,已在14国上线。
原文 ↗Runway推出一站式AI媒体开发者平台Runway Dev,通过单一API调用接入Gen-4.5、Aleph 2.0、Act-Two、Seedance等多模型,Adobe、Figma Weave、Shutterstock等已接入,通过SOC 2 Type II合规认证。
原文 ↗04大模型动态
本版导读Anthropic 发表《语言模型中的全局工作空间》,J-lens 解释工具开源;官方回应 Claude Code 默认 Effort 由 high 调至 medium。GPT-5.6 三款模型于 7 月 9 日全量公开,xAI 发布 Grok 4.5,OpenAI 发布 GPT-Live 全双工实时语音模型。
Anthropic研究发现Claude内部自发形成J-space全局工作空间结构,J-lens解释工具已开源,Claude能感知自身处于测试状态。
原文 ↗Anthropic官方确认Claude Code近期「响应变浅」源于默认Effort从high静默调至medium,非模型退化;ultracode模式启用xhigh档位与自主子智能体调度可恢复深度推理能力。
原文 ↗Anthropic宣布Claude Cowork扩展至web、iOS与Android端,支持后台持续运行与跨设备协作,官方数据显示90%的使用场景集中于内容创作等知识型工作而非编程。
原文 ↗研究人员通过1600行代码提示Claude Fable 5,一次性生成63个完整3D世界场景(含水下曼哈顿等),此案例由新智元与Arena.ai报道,引发Karpathy等人公开评论。
原文 ↗GPT-5.6 Sol旗舰、Terra均衡、Luna轻量三款模型于7月9日全量公开,结束约两周国家安全审查,在ChatGPT与API中全球同步上线。
原文 ↗OpenAI发布GPT-Live-1与mini两款全双工实时语音模型,支持边听边说、主动打断及实时多语言翻译,已向ChatGPT用户和开发者开放。
原文 ↗xAI发布Grok 4.5,SpaceXAI+Cursor联合训练的1.5T参数V9架构,定位「Opus级」编程智能体,$2/$6每百万token,较同级模型便宜60%以上,AI分析指数排名第四。
原文 ↗05世界模型与视觉研究
本版导读蚂蚁旗下 Robbyant 开源 LingBot-World 2.0,可小时级连续运行,支持 720p/60fps 实时生成。魔芯 Flash World Model 称训练成本降低 70%。上海交大 ICRDrag 用掩码做区域拖拽编辑,TryOnCrafter 支持自由视角视频试衣。北大发布 HOI-Edit 基准与 LIMSSR。同济设创 11 项成果入选 CHI 2026。
Ant Group旗下Robbyant开源LingBot-World 2.0,实现全球首个小时级连续运行世界模型,支持720p/60fps实时生成,一张图片可延展为无限AI世界。
原文 ↗上海交大 ICRDrag 提出首个基于 DiT 上下文学习的区域拖拽图像编辑模型,用掩码替代点选实现源区域→任意目标区域精准变形,代码与模型已开源(ECCV 2026)
原文 ↗TryOnCrafter提出首个支持自由视角的视频虚拟试衣DiT框架,引入4D试衣代理机制,入选ECCV 2026,机器之心与arXiv双源确认。
原文 ↗北大王选所等团队发布HOI-Edit基准+SCPE自纠错框架(ICML 2026),将AI图像编辑从「改像素」推进到「交互理解」三层认知评测,L1交互分数提升22%,数据集与代码已开源。
原文 ↗北京大学与福州大学联合提出LIMSSR,将不完全多模态学习问题重定义为条件序列推理任务,通过LLM语义推理实现上下文感知模态插补,ICML 2026 Spotlight,不依赖完整训练数据即超越现有方法。
原文 ↗同济大学设计创意学院11项研究成果入选CHI 2026,其中2篇获最佳论文提名,研究聚焦AI与交互设计、可及性及教育技术的交叉应用。
原文 ↗魔芯发布Flash World Model,视频世界模型训练成本较同类降低70%,实现50FPS实时交互世界生成。
原文 ↗06展览与大会
本版导读SIGGRAPH 2026 首设 Games Summit,7 月 19 日聚焦 AI 在游戏开发中的应用;主旨演讲由 NVIDIA 与 TripoAI 参与;Experience Hall 的 Art Gallery 12 件入选作品中有 4 件 AI 艺术。同济设创毕业展「换行 NewLine」开幕,展出近 260 件作品。央美「异质共振」展探讨传统工艺与 AI。
SIGGRAPH 2026首次设立独立的Games Summit,以全天专题形式聚焦AI在游戏开发中的动效、无障碍、VFX、音频与管线应用,于7月19日在洛杉矶举办。
原文 ↗SIGGRAPH 2026 官方公布主旨演讲阵容:NVIDIA 主讲实时神经渲染技术方向,TripoAI 代表 3D 生成新范式参与演讲,大会 7 月 19–23 日于洛杉矶举行
原文 ↗SIGGRAPH 2026 Experience Hall公布五大板块完整阵容,Art Gallery「In-Betweens」12件入选作品中含4件AI艺术,探索AI与记忆、身份及人机关系,7月19-23日洛杉矶举行。
原文 ↗同济大学设计创意学院2026届毕业展「换行 NewLine」于7月6日开幕,近260件作品涵盖AI辅助设计方向,展现设计专业毕业生对AI工具融入创作实践的探索。
原文 ↗央美「异质共振」展览于7月6日开幕,以陶瓷、数字光影及AI生成石狮等作品探讨传统手工艺与AI技术之间的共生与张力关系。
原文 ↗07征集与赛展
- 第二届高校 AIGC 数字艺术设计大赛中国照明学会数字艺术专业委员会 × 上海市照明学会 · 截止 7月15日
- 第 38 届百花奖 AIGC 推优单元全球征集第 38 届大众电影百花奖组委会 · 截止 7月20日
- Generative Art 2026 第29届生成艺术国际会议(学术会议)Generative Art International(米兰理工大学发起) · 截止 9月3日
- CHI 2027 国际人机交互会议征稿(学术会议)ACM SIGCHI · 截止 9月10日
08SKILL
- JimLiu/baoyu-skills:宝玉 skill 合集(内容生成 + 发布)★ 26212
- mksglu/context-mode:AI 编码上下文优化 MCP★ 24185
- Agents365-ai/drawio-skill:自然语言生成技术图表★ 9742
- zarazhangrui/frontend-slides:零依赖 HTML Slides 生成★ 29941
- NarratorAI-Studio/narrator-ai-cli-skill:AI 视频解说★ 2676
- eugeniughelbur/obsidian-second-brain:Obsidian AI 知识库★ 4633
- nolangz/pixel2motion:AI logo 动效生成★ 2352
- irenerachel/visual-style-ppt-skill:图片式中文视觉 PPT★ 389
- 2026-W38实时视频编辑与开源图像模型
- 2026-W37Sora 关停与剪辑软件插件
- 2026-W36GPT-6 发布与世界模型更新
- 2026-W35视频生成模型集中更新
- 2026-W34版权归因研究与图像接口关停
- 2026-W33开源音乐与视频模型
- 2026-W32视频音频模型与创意软件接入
- 2026-W31视频模型发布与 AI 水印新规
- 2026-W30设计 Agent 与图像模型发布
- 2026-W29WAIC 多模态模型与交互视频
- 2026-W27图像模型、版权诉讼与视频融资
(本期完)
条目均来自本站已发布资讯,链回原卡片与原始来源;导读与本版导读为编辑汇编,不含评价。全部资讯 →