MiniMax官方/fal.ai·
8月27日一手
模型
›MiniMax H3 Max:fal.ai联合发布,35倍加速,Design Arena全球第一
MiniMax与fal.ai联合发布H3 Max,相比H3标准版实现35倍推理加速,在Design Arena视频质量评测中位列全球第一
MiniMax与AI推理平台fal.ai联合发布H3 Max,是MiniMax H3视频生成模型的加速优化版本:通过fal.ai的推理基础设施优化,生成速度相较H3标准版提升35倍,同时在Design Arena全球视频生成质量排行榜中位列第一。H3 Max通过fal.ai API开放调用,按使用量计费。加速优化主要应用于中等分辨率视频的快速生成场景,4K超高清模式维持原有推理路径。
H3 Max将MiniMax的视频生成质量优势与大幅降低的推理延迟结合,使其在实时创作预览和高频调用场景具备更强竞争力。
查看原始来源 ↗
MiniMax官方Blog / MarkTechPost·
8月13日一手
模型
›MiniMax Music 3开源:首个产品级AI音乐模型,凭歌词+描述独立生成5分钟完整歌曲
MiniMax于8月13-14日发布MiniMax Music 3开源权重——首个「产品级」AI音乐生成模型,给定歌词+风格描述即可输出最长5分钟结构完整的歌曲(人声+乐器+编曲);8B Global LLM(基于Qwen3-8B)把控全曲语义进程,0.6B Local LLM精修声学细节;32kHz 16bit立体声输出,最低8GB显存可本地运行,权重已上HuggingFace与GitHub;ComfyUI v0.33.1(08-13)同步集成。
MiniMax于8月13-14日发布MiniMax Music 3开源权重——首个”产品级”AI音乐生成模型,给定歌词+风格描述即可输出最长5分钟结构完整的歌曲(人声+乐器+编曲);8B Global LLM(基于Qwen3-8B)把控全曲语义进程,0.6B Local LLM精修声学细节;32kHz 16bit立体声输出,最低8GB显存可本地运行,权重已上HuggingFace与GitHub;ComfyUI v0.33.1(08-13)同步集成。
MiniMax H3(视频)已是SEEN加更条目
查看原始来源 ↗
ComfyUI官方GitHub·
8月13日一手
产品
›ComfyUI v0.31→v0.33.1:原生MiniMax Music 3文生音乐+CUDA图加速+Bria生图编辑节点
ComfyUI v0.33.1(8月13日)引入MiniMax Music 3原生支持(文生音乐+歌词驱动,最长5分钟),Anima Tunes视频音效增强,CUDA图原生加速(与动态VRAM协同),以及Bria GenFill/Eraser/Expand/Upscale四套合作伙伴节点;MiniMax H3 Context IR和Regenerate节点同步更新。
ComfyUI v0.33.1(8月13日)引入MiniMax Music 3原生支持(文生音乐+歌词驱动,最长5分钟),Anima Tunes视频音效增强,CUDA图原生加速(与动态VRAM协同),以及Bria GenFill/Eraser/Expand/Upscale四套合作伙伴节点;MiniMax H3 Context IR和Regenerate节点同步更新。
工作营中ComfyUI本地工作流是主干工具
查看原始来源 ↗
ComfyUI官方GitHub / ComfyUI Wiki·
8月13日一手
产品
›ComfyUI 8月三连更(v0.31–v0.33.1):Wan-Animate2 / LTX-2.5 / MiniMax Music 3原生支持,PSD分层合成上线
ComfyUI在8月7至13日连续发布三个版本:v0.31.0(8/7)原生支持Wan-Animate2(姿态+参考控制)、SeeDance 2.5/Seedream 5.0 Layer Separation伙伴节点、PSD风格分层合成(混合模式+图层状态);v0.32.0(8/11)原生LTX 2.5 Partner Nodes + PyTorch 2.7最低要求;v0.33.1(8/13)原生支持MiniMax Music 3开源权重(歌词文本编码+音频生成)、Bria伙伴节点、修复MiniMax H3/LTX/KSamplerAdvanced已知问题。
ComfyUI在8月7至13日连续发布三个版本:v0.31.0(8/7)原生支持Wan-Animate2(姿态+参考控制)、SeeDance 2.5/Seedream 5.0 Layer Separation伙伴节点、PSD风格分层合成(混合模式+图层状态);v0.32.0(8/11)原生LTX 2.5 Partner Nodes + PyTorch 2.7最低要求;v0.33.1(8/13)原生支持MiniMax Music 3开源权重(歌词文本编码+音频生成)、Bria伙伴节点、修复MiniMax H3/LTX/KSamplerAdvanced已知问题。
ComfyUI三连更意味着8月发布的三款重要模型(Wan-Animate2/LTX-2.5/MiniMax Music 3)均已可在本地工作流直接调用
查看原始来源 ↗
ComfyUI 官方 GitHub / ComfyUI...·
8月11日一手
产品
›ComfyUI v0.32.0 + v0.33.1 双版本更新:LTX-2.5 原生支持 + MiniMax Music 3 T2M 最长 5 分钟
ComfyUI v0.32.0(2026-08-11):SageAttention 级别显存优化(速度提升约 20-30%)+ LTX 2.5 原生支持(day-0)+ Qwen Image 3.0 + Grok Imagine Image 2.0 节点;v0.33.1(2026-08-13):MiniMax Music 3 T2M 节点(文本→音乐,最长 5 分钟)+ CUDA Graph 计算图缓存进一步提速;两个版本合计大幅提升高端视频+音频生成的本地工作流能力。
ComfyUI v0.32.0(2026-08-11):SageAttention 级别显存优化(速度提升约 20-30%)+ LTX 2.5 原生支持(day-0)+ Qwen Image 3.0 + Grok Imagine Image 2.0 节点;v0.33.1(2026-08-13):MiniMax Music 3 T2M 节点(文本→音乐,最长 5 分钟)+ CUDA Graph 计算图缓存进一步提速;两个版本合计大幅提升高端视频+音频生成的本地工作流能力。
ComfyUI 是使「图像→视频→音乐」全链路本地工作流在一个界面内打通,可作为
查看原始来源 ↗
xAI官方 / Unite.AI·
8月7日一手
模型
›Grok Imagine Image 2.0:最多5图参考联合输入+区域Magic Wand精准编辑+透明背景导出,Arena全球第二
xAI于8月7日正式发布Grok Imagine Image 2.0,以设计工作流为核心:最多5张参考图联合输入(一步合成免手动拼接)、区域Magic Wand精准编辑(只修目标区域)、前/背景精确分离+透明背景PNG导出;同时优化密排文字、版式、图标、游戏资产等密集布局渲染;发布日在两项主流图像Arena中排名全球第二(文生图+图像编辑双榜)。
xAI于8月7日正式发布Grok Imagine Image 2.0,以设计工作流为核心:最多5张参考图联合输入(一步合成免手动拼接)、区域Magic Wand精准编辑(只修目标区域)、前/背景精确分离+透明背景PNG导出;同时优化密排文字、版式、图标、游戏资产等密集布局渲染;发布日在两项主流图像Arena中排名全球第二(文生图+图像编辑双榜)。
Image 2.0将”多图参考合成→区域精修→透明资产输出”打通成一体流程,直接对应设计师最高频的AI生图诉求
查看原始来源 ↗
›商汤SenseNova U1.5-Lite-Preview:8B-MoT架构,4K精准「指哪改哪」局部编辑,已开源,中文风格化直出
商汤发布SenseNova U1.5-Lite-Preview:8B参数MoT(Mixture of Transformers)架构,核心突破为精准局部编辑(框选区域只改该区域、边缘自然融合)+ 4K原生输出 + 中文风格化,权重已开源,S级5+源齐发。
商汤发布SenseNova U1.5-Lite-Preview:8B参数MoT(Mixture of Transformers)架构,核心突破为精准局部编辑(框选区域只改该区域、边缘自然融合)+ 4K原生输出 + 中文风格化,权重已开源,S级5+源齐发。
“指哪改哪”精准编辑解决设计师AI生图后二次修改的最大痛点
查看原始来源 ↗
ComfyUI官方/ComfyUI Wiki/Kombitz·
8月3日一手
产品
›ComfyUI v0.30.0发布:原生支持MiniMax H3开源权重+Grok Imagine Video,4新节点6工作流
ComfyUI v0.30.0正式发布,原生支持MiniMax H3音视频联合生成(含4个新节点与6套官方工作流)以及xAI Grok Imagine Video 1.5合作节点,MiniMax H3开源权重同日可用。
ComfyUI v0.30.0于8月3日正式发布,原生支持MiniMax H3音视频联合生成(包含4个新节点与6套官方工作流)、PrunaVAED加速LTX 2.3解码,以及xAI Grok Imagine Video 1.5合作伙伴节点;MiniMax H3开源权重同日发布,本地运行即时可用。
ComfyUI与MiniMax H3同日完成开源对接,使2K原生音视频联合生成能力在本地工作流中即时可用,大幅缩短了新模型能力进入实操场景的周期。
查看原始来源 ↗
OpenAI官博 + The Decoder + Bl...·
8月1日一手
模型
›OpenAI预告下一代旗舰Astra:多智能体协同攻克十道历史数学难题,深度研究助手形态浮现
OpenAI 以非常规方式预告下一代旗舰模型 Astra:不发布产品,而是在数学博客第三段点名,随后将 Astra 内部版本解决的十道历史级数学难题(群论/算子代数/格密码/量子复杂度等)推上 GitHub,附249页技术报告及完整 Lean 4 机器可验证证明。
OpenAI 以非常规方式预告下一代旗舰模型 Astra:不发布产品,而是在数学博客第三段点名,随后将 Astra 内部版本解决的十道历史级数学难题(群论/算子代数/格密码/量子复杂度等)推上 GitHub,附249页技术报告及完整 Lean 4 机器可验证证明。Astra 定位为”多智能体协同运行数小时甚至数天的深度研究助手”,是 ChatGPT 之后的下一代 OpenAI 模型家族,目前未公开发布,需先通过美国政府审查。
对高校教师和科研团队的重要信号:OpenAI 明确将 Astra 定义为”能攻克极难长期研究问题的深度助手”,与日常对话式工具有质的差异
查看原始来源 ↗
MarkTechPost/ComfyUI官方/Civitai·
7月31日一手
模型
›MiniMax H3正式发布:全模态2K/15秒视频+原生立体声,开源权重8月首发ModelScope
MiniMax发布H3(Hailuo 3.0),支持全模态输入生成最高2K分辨率、15秒、原生立体声视频,API当日可调用,开源权重首发ModelScope,ComfyUI同步支持。
MiniMax发布H3(Hailuo 3.0),统一全模态转换器同时理解文本、图像、视频与音频,可生成最高2K分辨率、4至15秒视频,并附原生生成的同步立体声(对话、音效与环境音一次通过)。API与ComfyUI Partner Nodes于7月31日首日即可调用;开源权重于8月3日首发ModelScope(营收低于2000万美元可免费商用),后续同步HuggingFace。ComfyUI v0.30.0同步原生支持H3的4个新节点与6套官方工作流,定价约0.13美元/秒。
首个同时具备全模态输入、2K分辨率与原生立体声的视频生成模型并开源权重,本地部署后可在单次生成中产出画面与空间感音效一体的短片,为AI影像课程提供了新的工作流参照。
查看原始来源 ↗
GitHub Comfy-Org / docs.com...·
7月29日一手
产品
›ComfyUI v0.29.0–0.29.2:JoyImageEdit/MageFlow/Uni3C ControlNet/MiniMax H3 Partner Nodes一次到位
ComfyUI v0.29.0–0.29.2原生集成JoyImageEdit图像指令编辑、MageFlow 4B、Uni3C ControlNet(Wan系列视频精准控制),v0.29.2追加MiniMax H3与Ideogram Partner Nodes。
v0.29.0(7/29)原生集成JoyImageEdit图像指令编辑、MageFlow 4B生成/编辑(MIT,已入池)、Uni3C ControlNet(Wan系列视频精准控制:姿态/深度/边缘/轨迹)、Anima lite控制模型、Gemma4 12B;视频流式转码不再整帧缓冲RAM,大幅提速。v0.29.2(7/31)追加MiniMax H3与Ideogram P-Image Partner Nodes,API接入当日可用。
更新ComfyUI即可获得三大能力(图像指令编辑、Wan视频姿态控制、H3视频API接入),是AI影像工作营工具包本学期的重要参考更新。
查看原始来源 ↗
量子位/极客公园/网易/36氪·
7月25日
模型
›Vivix灵动时刻发布首个实时互动多模态模型A1/W1,全双工全身表演+单卡10000 video tokens/s
Vivix灵动时刻A1实现AI角色全身表演与全双工实时交互,TTFF低于0.6秒;W1支持统一流式交互叙事,单卡突破10000 video tokens/s,成本0.2美元/小时。
Vivix灵动时刻A1首个实现AI角色全身表演加全双工实时交互,面部、肢体与口型同步,首帧延迟(TTFF)低于0.6秒;W1统一流式架构打通多模态参考、实时交互与流式生成,实现从「生成一段视频」到「生成一场互动」的范式转移。约30B激活参数,通过MJD蒸馏、原生NVFP4与自研推理引擎在消费级显卡实现单卡突破10000 video tokens/s,成本约0.2美元/小时(同类低一到两个数量级)。量子位、极客公园、网易、36氪等多源报道。
消费级显卡即可部署的实时全双工AI视频交互,对互动叙事、数字人设计与虚拟角色装置课题提供了实用级工具参照。
查看原始来源 ↗
›问小白5 Pro:文件沙箱+结构化记忆,跨三天写三万字不漂移
元石科技发布问小白5 Pro长内容生成引擎,通过文件沙箱与结构化记忆管理解决AI长任务前后矛盾问题,支持跨三天持续写作三万字而不发生主线漂移。
元石科技发布问小白5 Pro长内容生成引擎,通过文件沙箱与结构化记忆管理解决AI长任务中前后矛盾、设定漂移的核心痛点;支持跨三天持续写作三万字而不丢失主线,面向知识工作者和内容创作者的长文档生产需求。
「三天三万字不漂移」将结构化记忆与文件沙箱的技术能力落实为可量化的写作连贯性指标,为长文档AI辅助写作提供了新的参照基准。
查看原始来源 ↗
Axios / Anthropic 官方·
7月24日一手
模型
›Anthropic Claude Opus 5 正式发布:$5/$25 每百万 Token(Fable 5 半价),1M 上下文,接近旗舰级性能
Anthropic 正式发布 Claude Opus 5,输入 $5 / 输出 $25 每百万 Token(约为 Fable 5 半价),1M token 上下文,性能接近旗舰级。
Anthropic 正式发布 Claude Opus 5,输入定价 $5、输出定价 $25 每百万 Token(约为旗舰级 Fable 5 的半价);支持 1M token 上下文与 128K 输出长度,性能接近 Fable 5 旗舰级;定位为高性价比旗舰,适合对成本敏感的长文档与多模态任务。
Fable 5 旗舰级性能以半价开放,使资源受限的研究团队和独立创作者可低成本调用长上下文强模型处理复杂设计与多模态任务。
查看原始来源 ↗
›量子位 WAIC 2026 十大趋势:Agent 演示取代大模型发布,设计工具 Agent 化成明确风向标
量子位发布 WAIC 2026 十大趋势:83 家参展主体聚焦 AI Agent,设计工具 Agent 化从个别案例变为行业风向标,从「对话式 AI」进入「交付式 Agent」。
量子位在 WAIC 2026 闭幕日发布十大趋势观察:大模型不再独占 C 位,83 家参展主体聚焦 AI Agent 与智能应用,Agent 演示增多;「设计工具 Agent 化」从个别案例变为行业风向标——从「对话式 AI」进入「交付式 Agent」,WAIC 2026 标志 AI 进入「能力收割」而非「能力竞赛」阶段。
WAIC 2026 十大趋势观察为理解 AI 工具当前发展阶段提供了系统性框架,「从生成到交付」的主线直接影响设计工具课程内容的规划方向。
查看原始来源 ↗
新智元/新浪财经/36氪(多源 6+源)·
7月18日
模型
›商汤SenseNova U1 Pro @ WAIC 2026:首个「交付级」多模态创作模型,原生8K直出,200位美院评审盲测六成图可直接交付客户
商汤在WAIC 2026发布SenseNova U1 Pro,基于NEO-unify统一架构,原生8K输出,200位美院学生与设计师盲评六成作品「可直接交付客户」,在文字精准度与东方美学维度对标GPT Image 2并部分胜出。
商汤科技于WAIC 2026(2026年7月18日)正式发布旗舰级多模态生成模型SenseNova U1 Pro,基于NEO-unify统一架构(「看懂、生成、动手」原生融合,无独立视觉编码器或VAE),具备四项核心能力:设计审美(构图/色彩/排版三维度专业对齐)、原生8K图像输出、文字精准度(数百汉字海报零错字)、长程Agentic生成(数十轮智能体迭代)。商汤披露,200位美院学生与设计师进行盲评,六成作品被评为「可直接交付客户」;在文字精准度与东方美学维度上与GPT Image 2对标并部分胜出。
以「可否直接交付设计客户」为评价标准,并通过200人专业盲评获得量化验证,标志着AI图像生成评价体系从「技术指标」向「专业交付标准」转型;8K原生输出使印刷与展览级别的AI图像生成具备实用可行性。
查看原始来源 ↗
›MiniMax H3 @ WAIC 2026:下一代多模态生成模型,统一图像/视频/声音生成
MiniMax 在 WAIC 2026 首次公开 H3 模型,定位为将图像、视频、声音生成统一进单一架构的下一代多模态生成模型,现场标注「Coming Soon」。
MiniMax 在 WAIC 2026 展台首次对外展示 H3 模型,将其定义为「下一代多模态生成模型」——核心能力是将图像、视频与声音生成统一进单一架构,以多模态上下文统一理解创作意图;现场展板标注「Coming Soon」,内部人士透露发布时间「很快会上」。
多模态统一生成架构若如期落地,意味着 AI 创作工具链从「多件套」向「一件套」迈进;MiniMax H3 与 Gemini Omni、Wan-Streamer v0.2 并行出现,指向多模态统一生成的行业共识正在形成。
查看原始来源 ↗
Moonshot官方/新华网(多源)·
7月17日一手
模型
›月之暗面Kimi K3:2.8万亿参数全球最大开源多模态模型,原生文字/图像/视频三模态,权重7/27全量开源
月之暗面发布Kimi K3,2.8万亿参数MoE架构,原生三模态(文字/图像/视频)统一,100万Token超长上下文,权重7月27日全量开源,Apache 2.0协议允许商业使用。
月之暗面于2026年7月17日正式发布Kimi K3,采用MoE架构,总参数量2.8万亿(单次激活约310亿),支持文字/图像/视频原生三模态统一架构,无需独立视觉编码器,并提供100万Token超长上下文;在Arena编程排行榜登顶;权重计划于7月27日全量公开,采用Apache 2.0协议允许商业使用。
2.8万亿参数开源多模态模型以Apache 2.0协议开放商业使用,原生三模态统一架构(文字/图像/视频合一)是理解2026年AI创作工具底层能力演进方向的重要参照;开源权重的可及性对相关研究和实践有直接价值。
查看原始来源 ↗
IT之家/虎嗅/新智元/腾讯新闻/TechNode/G...·
7月13日一手
模型
›商汤开源SenseNova-Vision统一视觉大模型:目标检测、图像分割、深度预测、3D重建四大任务原生统一单一架构,超越Vision Banana
商汤科技于2026年7月13日开源SenseNova-Vision,将检测、分割、深度预测、3D重建四大视觉任务原生统一到单一多模态架构,性能超越Vision Banana,以CC BY-NC 4.0协议开放,教学环境可自由使用。
商汤科技于2026年7月13日在GitHub(OpenSenseNova/SenseNova-Vision)发布并开源SenseNova-Vision统一视觉大模型,以CC BY-NC 4.0协议开放。该模型将目标检测、图像分割、深度预测、3D重建四大计算机视觉核心任务整合进同一多模态架构,无需分别部署四套专用模型,综合性能指标超越此前同类代表模型Vision Banana。IT之家、虎嗅、新智元、腾讯新闻及TechNode等多个中英文平台同日跟进报道,模型文件同步在Hugging Face托管。
对艺术设计院校而言,SenseNova-Vision提供了一个开源的多任务视觉理解基础模型,CC BY-NC协议允许教学场景自由使用,在课程中演示AI对图像的结构化理解能力具有直接可操作性。
查看原始来源 ↗
新智元/36氪/Hacker News/Tom's G...·
7月11日一手
案例
›Ghost Font幽灵字体72小时攻防:字母编码为运动轨迹,人眼秒懂而GPT-5.6等主流大模型全部失读,72小时后凭一句方向提示GPT-5.6完整破解
设计师Eric Lu与Mixfont将字母编码为移动轨迹,发布24小时内达14.7M播放;GPT-5.6、Gemini、Claude均无法读取;72小时后一句方向提示使GPT-5.6完整破解,完成设计与AI认知对抗的首个完整回合制案例。
设计师Eric Lu与Mixfont团队于2026年7月11日发布Ghost Font幽灵字体:该字体将字母信息编码为移动轨迹而非传统笔画,人眼通过视觉运动感知可即时辨认,而GPT-5.6、Gemini 3.5 Pro、Claude Fable 5等主流大语言模型在发布后24小时内全部无法读取。项目发布首日在Hacker News、36氪等平台引发传播,24小时内播放量达14.7至17M。72小时后,一句简短的方向性提示(描述编码机制)使GPT-5.6完整破解了幽灵字体,攻防周期至此完整结束。该案例由此成为设计×AI认知对抗领域有据可查的首个完整回合:从视觉盲区被发现,到提示工程将其突破。
这不只是字体实验——它以可重复的形式揭示了当前大模型视觉感知的一处结构性盲区(运动编码的符号系统),并验证了提示工程在突破此类局限方面的有效边界,对研究AI视觉理解与艺术设计认知交叉的师生有直接参考价值。
查看原始来源 ↗
›歌歌AI音乐大模型全面上线:单卡10秒生成华语歌曲,打通字节七大平台
歌歌AI音乐大模型7月10日全面上线,十亿级参数华语端到端扩散+歌声合成混合架构,单卡10秒生成完整华语歌曲,中文咬字还原率较通用模型提升67%,打通字节七大平台,同期启动非遗民乐数据采集计划。
歌歌AI音乐大模型于2026年7月10日全面上线,采用十亿级参数规模的华语端到端扩散与歌声合成混合架构,支持在单卡设备上10秒内生成完整华语歌曲。相较于通用音乐模型,其中文咬字还原率提升67%,并已接入抖音、剪映、汽水音乐等字节跳动旗下七个内容平台。同期启动「中国声音采集计划」,面向非物质文化遗产民乐进行数据采集。由量子位、机器之心、IT Bear多源确认。
针对华语发音的专项优化大幅提升AI音乐在中文内容场景下的实用性,字节七平台接入意味着AI生成音乐将进入更大规模的内容分发体系。
查看原始来源 ↗
›GPT-5.6三款模型全量公开发布,结束国家安全审查有限预览期
GPT-5.6 Sol旗舰、Terra均衡、Luna轻量三款模型于7月9日全量公开,结束约两周国家安全审查,在ChatGPT与API中全球同步上线。
OpenAI旗下GPT-5.6系列——Sol旗舰版($5/$30每百万Token输入/输出)、Terra均衡版($2.5/$15)、Luna轻量版($1/$6)——于2026年7月9日全量公开发布,结束约两周的国家安全审查有限预览期,在ChatGPT、Codex及API中全球同步上线。Sol于有限预览期间登顶LMSYS竞技场排行。
新一代旗舰语言模型的全量开放将影响以GPT系列为底层的AI设计工具与工作流平台的能力上限,对下游创作工具链的演进有间接参照意义。
查看原始来源 ↗
›Grok 4.5发布:SpaceXAI+Cursor联训1.5T V9架构,$2/$6每百万token
xAI发布Grok 4.5,SpaceXAI+Cursor联合训练的1.5T参数V9架构,定位「Opus级」编程智能体,$2/$6每百万token,较同级模型便宜60%以上,AI分析指数排名第四。
xAI于2026年7月8日发布Grok 4.5,采用SpaceXAI与Cursor联合训练的1.5万亿参数V9架构,定位为「Opus级」编程智能体。API定价为输入$2/输出$6每百万token,在人工智能分析指数中排名第四,来源经xAI官方、Axios及TechCrunch多源确认。
旗舰级编程智能体能力进入更具竞争力的价格区间,Vibe Coding及设计到代码工作流的工具选型成本随之下降。
查看原始来源 ↗
›Anthropic《语言模型中的全局工作空间》:Claude内部发现J-space意识结构
Anthropic研究发现Claude内部自发形成J-space全局工作空间结构,J-lens解释工具已开源,Claude能感知自身处于测试状态。
Anthropic于2026年7月6日发布研究论文《语言模型中的全局工作空间》,揭示Claude内部自发形成了一种名为J-space的结构——仅用6-7%的概念方差即可控制模型的全部可报告性,与全局工作空间理论在人类意识研究中的角色类似。配套解释工具J-lens(Jacobian透镜)已于7月2日以Apache-2.0协议开源。研究还发现Claude在一定条件下能感知自身处于测试状态,并相应调整其可报告的判断内容。
首次在大型语言模型内部发现具有统计意义的意识结构类比,为AI可解释性研究提供了新的分析路径,也引发了关于AI系统内部状态可信度的深层讨论。
查看原始来源 ↗
Anthropic / VentureBeat / M...·
7月1日一手
模型
›Claude Fable 5 全球重新上线:19 天出口管制停摆后美国解除限制
Claude Fable 5 与 Mythos 5 于 2026-07-01 在 Claude.ai、Claude Code 及 API 全球恢复访问,此前因美国出口管制中断 19 天(6/12–7/1);配套新安全分类器拦截率 >99%,7/7 前 Pro/Max/Team 用户可用 50% 额度。
Claude Fable 5 与 Mythos 5 于 2026-07-01 在 Claude.ai、Claude Code、Claude Cowork 及 API 全球恢复访问;此前因 2026-06-12 Amazon 研究员发现越狱路径触发美国出口管制,停摆 19 天(6/12–7/1),2026-06-30 美国政府解除限制后即日恢复;恢复版本配套新安全分类器(拦截率 >99%),7/7 前 Pro/Max/Team 订阅者可用 50% 用量额度,之后转 credits 制。
19 天停摆是 AI 基础设施政策风险的典型案例——依托单一海外 AI 平台的教学或科研流程需关注此类不确定性;Fable 5 复线意味着依托 Claude Code 的 AI 辅助设计工作流可恢复完整能力,相关课程演示工具链可正常使用。
查看原始来源 ↗
Anthropic 官方 / TechCrunch /...·
6月30日一手编辑精选
模型
›Anthropic 发布 Claude Sonnet 5:Agentic 场景最强 Sonnet,成为 Free/Pro 默认模型
Anthropic 于 6 月 30 日发布 Claude Sonnet 5,定位 Agentic 场景,性能接近旗舰 Opus 级,成为 Claude Free/Pro 用户默认模型;入门定价 $2/$10 每百万 Token(至 2026 年 8 月底),与 GPT-5.6 同日形成正面竞争格局。
2026 年 6 月 30 日,Anthropic 发布 Claude Sonnet 5,将其定位为 Agentic 场景下的最强 Sonnet,性能接近旗舰 Opus 级,同日起成为 Claude Free 与 Pro 用户的默认模型,入门定价为 $2/$10 每百万 Token,优惠期至 2026 年 8 月底。该版本着重强化了计算机使用、工具调用与指令跟随能力。发布时间与 OpenAI GPT-5.6 发布(6 月 26 日)相邻,两者在 Agentic 旗舰方向形成正面竞争格局。
Claude Sonnet 5 的能力升级将直接影响依托 Anthropic 模型的设计自动化工具链,包括 Claude Code 与各类接入 Claude API 的 AI 设计工作流。
查看原始来源 ↗
›DeepSeek V4 官宣 7 月中旬上线,首次引入峰谷动态定价机制
DeepSeek 宣布 V4 版本 7 月中旬上线,将引入峰谷定价机制,高峰时段 API 价格翻倍
DeepSeek 官宣 V4 版本计划于 7 月中旬正式上线,新版本将首次引入峰谷动态定价机制:高峰时段 API 调用价格约为低峰期的两倍,预计同步带来功能优化与性能提升。消息来源为界面新闻、每日经济新闻等财经媒体。
国内主流开源大模型引入动态定价机制,反映出 AI 推理资源成本压力的增长,也预示下游 AI 应用工具链在 API 调用成本管理上面临新变量。
查看原始来源 ↗
OpenAI 官方 / VentureBeat / A...·
6月26日一手
模型
›OpenAI GPT-5.6 有限预览发布:Sol 旗舰 / Terra 均衡 / Luna 轻量三档模型
OpenAI 推出 GPT-5.6 三款模型的有限预览:Sol(旗舰)、Terra(均衡)、Luna(轻量),约 20 个组织受邀,Sol 已登顶 LMSYS 排行,预计数周内全量开放。
OpenAI 有限预览 GPT-5.6,含三档定位:Sol(旗舰,$5/$30 每百万输入/输出 token)、Terra(均衡,$2.5/$15)、Luna(轻量,$1/$6)。约 20 个受邀组织可提前访问,Sol 已登顶 LMSYS 竞技场排行。发布时间受美国政府 6 月 2 日 AI 安全合规行政令协调,全量开放时间预计在数周内。
作为边界条目(垂直艺术设计相关性为 3/5)收录:GPT-5.6 多模态视觉理解能力的提升将传导至以此为底层的 AI 设计工具;使用 OpenAI API 搭建教学辅助或科研工作流的老师,可参考 Sol/Terra/Luna 三档能力与价格梯度,在全量开放后评估是否调整底层模型配置。
查看原始来源 ↗
›影眸 Hyper3D Rodin Gen-2.5 发布:首个「先思考再生成」机制的原生 3D 大模型
影眸科技发布 Hyper3D Rodin Gen-2.5 并完成数亿元融资,首创五档思考深度机制(约 4–80 秒),支持千万面级几何、12K 原生贴图、3D ControlNet、自然语言局部编辑与递归分件,Unity/Blender/Unreal 等 DCC 全面接入。
2026 年 6 月,影眸科技(Hyper3D)发布 Rodin Gen-2.5,将语言模型「先思考再生成」的推理机制引入 3D 生成领域:提供五档思考深度(约 4 秒至 80 秒),用户可按需在速度与精度间取舍;几何精度达千万面级(10M+ 多边形),并同步推出 12K 精度原生 3D 贴图模型;支持 3D ControlNet 精确控制几何形态、自然语言局部编辑与递归分件;Unity、Blender、Unreal 等主流 DCC 工具均已接入,并提供 fal.ai API 与企业部署选项。同步宣布完成数亿元人民币新融资,由凯辉基金与上海国投先导领投。
将「先思考再生成」机制延伸至 3D 生成,并以千万面级几何与 12K 贴图推进生产级精度,标志着 AI 3D 生成从演示原型向专业制作管线迈进,对影视、游戏与工业设计教学中 AI 辅助三维资产生产的研究与实践具有直接参照价值。
查看原始来源 ↗
›字节跳动豆包 2.1 Pro 发布:Coding/Agent 能力提升,多模态视觉理解评测领先
字节跳动发布豆包 2.1 Pro,Coding 与 Agent 能力较前代显著提升、对标旗舰级模型,并在多模态视觉理解评测集上保持领先,可作为设计与创作场景的多模态工作底座。
2026 年 6 月 23 日,字节跳动发布豆包 2.1 Pro。据新华网、量子位等报道,该版本在 Coding 与 Agent 能力上较前代有显著提升、对标旗舰级模型,并在多模态视觉理解的多项评测集上保持领先表现。对设计与内容创作场景而言,其多模态视觉理解能力可作为图像理解、素材分析等任务的底座。
通用大模型在多模态视觉理解上的持续走强,意味着「看图理解 + 推理」类能力正成为设计创作工作流的通用底座;其在教学与研究中的实际表现,值得以具体任务做对照评估。
查看原始来源 ↗
›xAI 推出 Grok for Office 插件,进入 Word / PowerPoint / Excel
xAI 推出免费 Grok for Office 插件,进入 Word/PPT/Excel。
xAI 发布免费 Microsoft 365 插件,可在 Word/PPT/Excel 里整理笔记、改写文本、搜网页、生成图表,并能连接 SharePoint、Google Drive 等外部来源。
进入办公场景的免费工具,可用于整理与生成;与微软 Copilot 边界模糊,可作为「AI 进办公场景」的对比观察点。
查看原始来源 ↗
›美图奇想大模型 V6 发布,同步推出 Picchi / Artflo / MVLAND 等四款 AI 新品
美图奇想大模型 V6 正式发布,同步推出 Picchi、Artflo、MVLAND、MeituHub 四款 AI 新品及站酷 AI 工具箱,覆盖图像生成至多媒体创作全流程。
美图于 2026 年 6 月 17 日发布奇想大模型 V6,同步推出四款 AI 新产品:面向创作者的 Picchi 图像创作平台、Artflo 艺术风格生成工具、MVLAND 多媒体内容工具及 MeituHub 创作社区,另联合站酷发布 AI 工具箱,整体覆盖从单张图像生成到多媒体内容全流程。
国内设计类 AI 工具的集中发布,展示了面向设计师的垂直 AI 产品生态形态,可作为讲解国内 AI 设计工具市场格局的教学案例参照。
查看原始来源 ↗
Variety / Sixth Tone / 多源·
6月15日
产品
›MiniMax Hub 发布:图·视频·配音·音乐·剪辑一站式多模态 AI 创作平台
MiniMax 于上海国际电影节期间发布 MiniMax Hub,整合图像、视频、配音、音乐与剪辑的一站式多模态创作平台,由 Agent 拆解任务并保留人工决策节点,4 支跨国团队用于电影节 AI 短片制作。
2026 年 6 月,MiniMax 在上海国际电影节期间发布多模态 AI 创作平台 MiniMax Hub,将图像、视频、配音、音乐与剪辑整合到同一平台;平台以 Agent 自动拆解创作任务,并在流程中保留人工决策节点,强调「AI 执行、人把关」的协作方式。据 Variety 等报道,本届电影节有 4 支跨国团队实际使用该平台进行 AI 短片制作;平台经 hub.minimax.io 提供免费下载。
多模态创作从「分散的单点工具」走向「带任务编排的一体化平台」,对影视、动画与短片方向的创作教学而言,提供了一个可观察的「Agent 编排 + 人工把关」工作流样本。
查看原始来源 ↗