›ComfyUI v0.37.0/v0.37.1:Qwen-Image 2.1 原生三模板 + MoGe 3 几何估计 + HY Image 3.5 Preview(5 参考图·2K 输出)
ComfyUI v0.37.0/v0.37.1 原生集成 Qwen-Image 2.1 三种生成模式节点,并接入 MoGe 3 单目几何估计与 HY Image 3.5 Preview 五参考图 2K 输出。
ComfyUI v0.37.0 于 9 月 21 日发布,原生集成阿里 Qwen-Image 2.1,提供三个即用模板:文生图、图像编辑和背景移除,其中背景移除节点支持 alpha 通道输出;同日接入微软研究院 MoGe 3,在 ViT-L/ViT-G 骨干基础上增加稀疏体素精修,实现更精确的单目几何估计;Qwen3.5/3.8 文本编码器引入推测解码与 DeltaNet 内核加速;NVMe 快速磁盘加载降低本地多模型切换开销。次日发布 v0.37.1,合作节点新增 HunyuanVideo Image 3.5 Preview,支持最多 5 张参考图输入与原生 2K 输出。
ComfyUI v0.37 将 Qwen-Image 2.1 的图像编辑与背景移除能力直接引入节点工作流,对教学中的设计稿处理与品牌一致性演示具有直接适用价值;MoGe 3 几何估计节点对建筑与三维课程的 AI 辅助深度分析有实质性补充。
查看原始来源 ↗
Qwen 官方博客 + GitHub + TechNo...·
9月20日一手
模型
›阿里开源 Qwen-Image-2.1:7B 统一图像生成+编辑模型,原生 RGBA 透明通道,支持 10 图参考,首日同步 ComfyUI/Diffusers/vLLM
阿里开源 Qwen-Image-2.1,7B 参数统一图像生成与编辑模型,首次原生支持 RGBA 透明通道,最多 10 张参考图输入,发布首日可通过 ComfyUI、Diffusers、vLLM 调用。
阿里巴巴于2026年9月20日开源 Qwen-Image-2.1,一个7B参数的统一图像生成与编辑模型。核心能力包括原生 RGBA 透明通道支持,可直接产出带透明度的 PNG 设计素材;最多10张参考图像同时输入,提升主题与风格一致性;发布首日同步支持 ComfyUI 节点、Diffusers 和 vLLM 推理框架;统一架构覆盖文生图、图像编辑、图像理解三类任务。模型权重、代码与数据全部开源,支持商用。
开源7B图像生成模型首次原生支持 RGBA 透明通道,使排版、品牌素材与 UI 元素生成可直接输出可合成的 PNG;10图参考的一致性控制为 IP 和角色设计课题提供工程层面的精确控制手段,高校服务器可直接部署。
查看原始来源 ↗
›MultiMatte by Feyn:文字引导多层蒙版,一键输出精细分层
Feyn 发布 MultiMatte,通过文字描述同时生成多个精准蒙版层,输出与 Photoshop / After Effects 兼容的 alpha 通道分层文件,支持复杂场景下对多对象分层抠图。
Feyn 于 2026 年 9 月 12 日发布 MultiMatte,通过文字描述同时生成多个精准蒙版层;支持复杂场景下对人物、服装、发丝、背景等多对象分层抠图;输出与 Photoshop / After Effects 兼容的 alpha 通道分层文件,主打免后期精修的一键精细分层体验。
文字驱动的多层蒙版生成将复杂场景的分层抠图从手动操作简化为文字描述,直接改善图像合成和后期制作工作流的效率。
查看原始来源 ↗
›OpenAI 发布 ChatGPT Images 2.5:新增手绘 Sketch 参考与双轨 API 模型
ChatGPT Images 2.5 新增手绘草图 Sketch 参考功能,生成速度提升 50%,并发布 Flare(速度优先)和 Sunburst(精度优先)两个 API 模型,全面取代 GPT-Image-2。
OpenAI 于 2026 年 9 月 8 日发布 ChatGPT Images 2.5,生成延迟较 2.0 降低 50%,主体保留更忠实。新增 Sketch 功能,用户可在对话窗口手绘草图作为参考——适用于勾勒房间布局、服装轮廓或创作草稿,AI 以手绘与文字双重参考生成结果。Templates 模块覆盖海报、商品图、图标、Logo、产品图等常用格式。API 同步推出两个新模型:GPT-Image-2.5 Flare(速度优先,$8/$30 per 1M tokens)与 Sunburst(精度优先,生成时间更长),全面取代 GPT-Image-2。
手绘参考图(Sketch)将「画一下表达设计意图」这一直觉动作引入 AI 生图流程,降低创意传达门槛;双轨 API 满足教学演示(速度)与精细输出(精度)两类场景需求。
查看原始来源 ↗
›LLaDA-Image:开源6B统一文生图+参考编辑+中英文排版,Base+Turbo双档
inclusionAI 发布 LLaDA-Image:6B 参数开源统一图像生成与编辑模型,分 Base(50步高质量)和 Turbo(4步快速,Twin-DMD 蒸馏)双档,支持文生图、参考图风格迁移、精准编辑以及中英文文字排版渲染。
inclusionAI 发布 LLaDA-Image:6B 参数开源统一图像生成与编辑模型,分 Base(50步高质量)和 Turbo(4步快速,Twin-DMD 蒸馏)双档,支持文生图、参考图风格迁移、精准编辑以及中英文文字排版渲染。
开源且支持中文文字渲染的 6B 图像模型;Turbo 模式(4步出图)意味着本地运行演示可行,中文海报/信息图生成对设计专业有直接可用性;有本地私有化部署需求的科研课题可优先评估。
查看原始来源 ↗
›Adobe for Slack:Firefly生图能力嵌入Slack工作流,商业授权直接可用
Adobe推出Firefly for Slack集成,用户在Slack对话中可直接调用文生图、图生图和重新着色功能生成商业可用视觉资产,无需切换应用
Adobe于9月3日推出Slack原生集成,用户可在Slack对话界面和工作流中直接调用Adobe Firefly的文生图、图生图和重新着色功能,生成具备商业授权的视觉资产,无需切换至Adobe Creative Cloud应用。生成内容自动携带Firefly商业授权标注,并与Adobe Creative Cloud生态打通,支持直接导入后续处理。该集成面向在Slack中进行日常协作的设计和营销团队。
AI生图能力嵌入即时通讯协作工具,改变了”设计需求→设计师处理→交付”的传统工作动线,团队成员在讨论语境中即可生成可用素材。
查看原始来源 ↗
Google Workspace 官方博客·
9月1日一手
产品
›Google Pics 登陆 Workspace:Gemini 驱动的专业级 AI 图像创建与编辑
Google 将 Pics 正式集成进 Workspace,以 Gemini 为底层提供文生图、背景替换、对象移除等专业级图像编辑,可在 Google Docs / Slides / Drive 内直接操作。
Google 于 2026 年 9 月 1 日正式将 Pics 集成进 Google Workspace,以 Gemini 模型为底层提供文生图、背景替换、对象移除、风格迁移等图像创建与编辑功能;支持在 Google Docs、Slides、Drive 内直接操作,无需离开 Workspace 生态;面向 Business 及以上套餐用户推送。
Google 将 AI 图像编辑直接嵌入办公套件,是 Workspace 正式进入 AI 辅助设计工具版图的具体信号。
查看原始来源 ↗
›Recraft V4 Styles:1–10张参考图驱动风格一致性图像生成
Recraft发布V4 Styles功能,支持输入1至10张参考图提取视觉风格,生成与参考图高度一致的新图像
Recraft发布V4 Styles图像生成功能:用户上传1至10张具有统一视觉风格的参考图像,系统从中提取色彩、线条、质感、光影等风格特征,并将提取的风格应用于新的文字提示词生成,确保输出图像与参考风格高度一致。V4 Styles支持创建自定义风格库,实现品牌视觉的批量一致性生产。相较于传统IP-Adapter等方法,V4 Styles将风格提取能力整合进产品界面,降低了品牌设计师应用风格一致性生成的操作门槛。
风格一致性生成是AI图像工具走向品牌设计工作流的关键能力,Recraft V4 Styles将多参考图风格提取从技术研究推向产品实用,对品牌内容团队有直接应用价值。
查看原始来源 ↗
Google Firebase官方文档 + ud.hk...·
8月17日一手
产品
›Google于8月17日关闭全部Imagen 4 API,Figma插件/Make/Zapier工作流静默失效,强制迁移至Nano Banana
Google于2026-08-17关闭全部Imagen 4系列API(imagen-4.0-generate-001 / ultra / fast),全线切换至Gemini 3.x图像族(Nano Banana);API调用方式从专用接口改为通用Gemini content-generation接口(modality=image);调用Imagen端点的Figma插件/Zapier/Make/n8n及大量小SaaS工具无声停摆;受影响用户须主动迁移端点+重写SDK调用逻辑。
Google于2026-08-17关闭全部Imagen 4系列API(imagen-4.0-generate-001 / ultra / fast),全线切换至Gemini 3.x图像族(Nano Banana);API调用方式从专用接口改为通用Gemini content-generation接口(modality=image);调用Imagen端点的Figma插件/Zapier/Make/n8n及大量小SaaS工具无声停摆;受影响用户须主动迁移端点+重写SDK调用逻辑。
使用Figma插件/Make/Zapier生成图像的教师和
查看原始来源 ↗
ComfyUI官方GitHub·
8月13日一手
产品
›ComfyUI v0.31→v0.33.1:原生MiniMax Music 3文生音乐+CUDA图加速+Bria生图编辑节点
ComfyUI v0.33.1(8月13日)引入MiniMax Music 3原生支持(文生音乐+歌词驱动,最长5分钟),Anima Tunes视频音效增强,CUDA图原生加速(与动态VRAM协同),以及Bria GenFill/Eraser/Expand/Upscale四套合作伙伴节点;MiniMax H3 Context IR和Regenerate节点同步更新。
ComfyUI v0.33.1(8月13日)引入MiniMax Music 3原生支持(文生音乐+歌词驱动,最长5分钟),Anima Tunes视频音效增强,CUDA图原生加速(与动态VRAM协同),以及Bria GenFill/Eraser/Expand/Upscale四套合作伙伴节点;MiniMax H3 Context IR和Regenerate节点同步更新。
工作营中ComfyUI本地工作流是主干工具
查看原始来源 ↗
xAI官方 / Unite.AI·
8月7日一手
模型
›Grok Imagine Image 2.0:最多5图参考联合输入+区域Magic Wand精准编辑+透明背景导出,Arena全球第二
xAI于8月7日正式发布Grok Imagine Image 2.0,以设计工作流为核心:最多5张参考图联合输入(一步合成免手动拼接)、区域Magic Wand精准编辑(只修目标区域)、前/背景精确分离+透明背景PNG导出;同时优化密排文字、版式、图标、游戏资产等密集布局渲染;发布日在两项主流图像Arena中排名全球第二(文生图+图像编辑双榜)。
xAI于8月7日正式发布Grok Imagine Image 2.0,以设计工作流为核心:最多5张参考图联合输入(一步合成免手动拼接)、区域Magic Wand精准编辑(只修目标区域)、前/背景精确分离+透明背景PNG导出;同时优化密排文字、版式、图标、游戏资产等密集布局渲染;发布日在两项主流图像Arena中排名全球第二(文生图+图像编辑双榜)。
Image 2.0将”多图参考合成→区域精修→透明资产输出”打通成一体流程,直接对应设计师最高频的AI生图诉求
查看原始来源 ↗
Alibaba Qwen 官方 X / Alibaba...·
8月5日一手
模型
›阿里 Qwen-Image-3.0-Pro 发布:10px 文字渲染精度大幅提升,全球图像生成排名第五
阿里在 Qwen-Image-3.0(7月21日发布,已入池)基础上推出 Pro 版本,重点强化 10px 文字渲染精度(毛孔/发丝/微表情细节),注入更丰富的世界知识(地标/品牌/符号可信度),Qwen 团队自评全球排名第五。
阿里在 Qwen-Image-3.0(7月21日发布,已入池)基础上推出 Pro 版本,重点强化 10px 文字渲染精度(毛孔/发丝/微表情细节),注入更丰富的世界知识(地标/品牌/符号可信度),Qwen 团队自评全球排名第五。已上线阿里云灵积 API 平台与 OpenRouter,无公开权重/基准测试报告。
Qwen-Image 系列已是设计流程中排名靠前的可用图像模型
查看原始来源 ↗
OpenAI帮助中心 + CryptoBriefing...·
8月4日一手
产品
›ChatGPT官方DALL-E GPT将于8/30退役,图像生成入口统一迁往ChatGPT Images
OpenAI 宣布 8月30日关闭 ChatGPT 内的官方 DALL-E GPT,所有图像生成入口统一迁往「ChatGPT Images」(基于 gpt-image-1 和 gpt-image-1-mini)。
OpenAI 宣布 8月30日关闭 ChatGPT 内的官方 DALL-E GPT,所有图像生成入口统一迁往「ChatGPT Images」(基于 gpt-image-1 和 gpt-image-1-mini)。DALL-E 2/3 API 快照已于5月12日停用,此次是 DALL-E 产品线整合收尾。用户自建的含图像功能 GPT 不受影响;现有 DALL-E GPT 内的图片需在8/30前自行下载保存。
用 ChatGPT 做 AI 生图的设计师和艺术家需注意:8/30起使用路径改变,但能力不降(gpt-image-1 优于 DALL-E 3)
查看原始来源 ↗
›谷歌地球集成Nano Banana 2生图功能不到24小时因「灾难场景」紧急撤回
谷歌地球嵌入Nano Banana 2模型,允许用户用文字指令修改真实地理影像(支持2K/4K输出+精准文字渲染),但因用户生成逼真「灾难场景」并在社媒传播,上线不到24小时紧急下架。
谷歌地球嵌入Nano Banana 2模型,允许用户用文字指令修改真实地理影像(支持2K/4K输出+精准文字渲染),但因用户生成逼真”灾难场景”并在社媒传播,上线不到24小时紧急下架。
AI图像生成合规与内容安全最具冲击力的近期案例——”功能无懈可击却因场景管控失守”。
查看原始来源 ↗
GitHub Comfy-Org / docs.com...·
7月29日一手
产品
›ComfyUI v0.29.0–0.29.2:JoyImageEdit/MageFlow/Uni3C ControlNet/MiniMax H3 Partner Nodes一次到位
ComfyUI v0.29.0–0.29.2原生集成JoyImageEdit图像指令编辑、MageFlow 4B、Uni3C ControlNet(Wan系列视频精准控制),v0.29.2追加MiniMax H3与Ideogram Partner Nodes。
v0.29.0(7/29)原生集成JoyImageEdit图像指令编辑、MageFlow 4B生成/编辑(MIT,已入池)、Uni3C ControlNet(Wan系列视频精准控制:姿态/深度/边缘/轨迹)、Anima lite控制模型、Gemma4 12B;视频流式转码不再整帧缓冲RAM,大幅提速。v0.29.2(7/31)追加MiniMax H3与Ideogram P-Image Partner Nodes,API接入当日可用。
更新ComfyUI即可获得三大能力(图像指令编辑、Wan视频姿态控制、H3视频API接入),是AI影像工作营工具包本学期的重要参考更新。
查看原始来源 ↗
›四大 AI 8 轮迭代临摹蒙娜丽莎:谁最接近原作?过度修正如何发生
测试者用 GPT-4o/Midjourney/SD/Flux 各自完成 8 轮蒙娜丽莎临摹迭代,记录过度修正与风格漂移全过程
AIERA 发布四大主流 AI 图像模型 8 轮迭代临摹达芬奇《蒙娜丽莎》的完整对比实验。每轮迭代以前一轮输出作为参考图输入,记录各模型在多轮反馈后的收敛行为;实验发现所有模型均在 3–5 轮后出现不同程度的”过度修正”现象——对用户指出的局部问题进行过激修正,同时丢失已正确还原的其他区域细节;Midjourney 在色彩还原上表现最稳定,GPT-4o Image 在五官结构精度上领先;文章附有每一轮的输出图像对比与结构相似度(SSIM)量化数据。
多轮迭代中的过度修正现象揭示了当前 AI 图像生成模型在”局部修正+全局一致性保持”上的系统性缺陷,对工作流设计有直接操作指导价值。
查看原始来源 ↗
Midjourney 官方更新页·
7月24日一手
模型
›Midjourney V8.2 正式成为默认版本:美学与个性化升级,sref 风格板精准度提升,新增 Big Batch Draft Mode
Midjourney V8.2 于 7 月 24 日正式成为默认版本,美学表现和 sref 风格板个性化一致性较 V8.1 显著提升,新增 Big Batch Draft Mode 加速风格探索。
Midjourney 于 7 月 24 日将 V8.2 升格为默认版本,结束此前的预览期;与 V8.1 相比,V8.2 在美学表现(尤其人像与光影处理)和个性化一致性(sref 风格板精准度与个性化图片池扩大)方面有显著提升;并新增 Big Batch Draft Mode,支持 --sref random 实现约 24 倍更快的风格空间探索,延续 V8.x 系列与 V7 的不同审美路线。
Midjourney V8.2 成为默认版本意味着课堂演示与工作坊实操的标准生成体验全面更新,sref 风格板一致性提升对「建立专属风格语言」训练有直接价值。
查看原始来源 ↗
Bloomberg / TechCrunch / Gi...·
7月24日
行业
›Midjourney 收购天文 App Co-Star:全部 24 名员工加入,创始人 Banu Guler 出任设计总监,独立图像 App 建设提速
Midjourney 全盘收购天文 App Co-Star,全部 24 名员工加入,创始人 Banu Guler 出任设计总监,信号 Midjourney 独立消费端 App 建设明显提速。
Midjourney 宣布全盘收购 Gen Z 天文 App Co-Star(月活超千万),全部 24 名员工随迁,创始人 Banu Guler 出任 Midjourney 设计总监;外界普遍解读为 Midjourney 加速推进首款独立移动图像应用,同步补充消费者产品设计与用户增长能力;Co-Star 以简洁界面和 Gen Z 用户基础著称。
收购消费端 App 团队并引入专职设计总监,信号 Midjourney 独立移动 App 上线在即,图像生成工具的移动端体验将迎来重要变化。
查看原始来源 ↗
›美图发起 Hatch Catch AI 影像 Builder 挑战赛:1 亿元总奖金,寻找已上线 AI 原生影像产品,单项最高 500 万投资
美图发起 Meitu Hatch Catch 产品挑战赛,总规模 1 亿元,面向已上线且有种子用户的 AI 原生影像产品,聚焦 AI 影像赛道,单项最高投资 500 万元。
美图公司发起 Meitu Hatch Catch 产品挑战赛,总规模 1 亿元,定向寻找已上线且拥有种子用户的 AI 原生影像产品(B2C 优先);聚焦 AI 相机、AI 修图、AI 视频、AI 设计工具等影像赛道,单个项目最高获得 500 万元投资;美图提供产品推广、算力资源与商业整合支持;不接受纯 ToB 项目。
美图主动发起 Builder 挑战赛且设置「已上线 + 种子用户」高门槛,说明 AI 影像应用赛道已进入产品化验证阶段,是观察 AI 影像商业化路径的重要信号。
查看原始来源 ↗
Black Forest Labs 官方博客/Vent...·
7月23日一手
模型
›Black Forest Labs FLUX 3 发布:首个统一图像/视频/音频的多模态前沿模型,20 秒视频生成,Canva/Krea/Magnific 等伙伴首批接入
Black Forest Labs 发布 FLUX 3,首个统一图像生成、20 秒视频与原生音频输出的多模态流模型,Canva 等首批生态伙伴同步接入。
Black Forest Labs 于 2026 年 7 月 23 日发布 FLUX 3,将图像生成、视频生成与音频理解统一在单一前沿模型架构中;视频生成支持 20 秒连贯输出并含原生音频轨;与 FLUX.2 系列相比是架构层面的代际跨越;Canva、Krea、Magnific、Picsart 为首批生态接入伙伴;Dev 权重承诺 2026 年内开源。
FLUX 系列开源图像模型首次将静态图像、有声视频与机器人动作预测纳入单套权重,标志 AI 视觉基础模型从单模态工具向统一多模态引擎的代际跨越。
查看原始来源 ↗
量子位 / 腾讯新闻 / 虎嗅 / 新浪财经 / 数字...·
7月22日
产品
›腾讯 Miora 国际版全量上线:生图 / 视频 / 3D / UI 四子 Agent 协同,登顶 Product Hunt 日榜,新用户赠 1000 积分
腾讯首个设计 Agent 平台 Miora 国际版全量上线,生图 / 视频 / 3D / UI 四子 Agent 同一画布协同交付,首日登顶 Product Hunt 日榜第一。
腾讯首个设计 Agent 平台 Miora 国际版正式全量上线,覆盖品牌设计、影视创意、电商广告、网页应用四大场景;平台内置生图、视频、3D、UI 四个子 Agent,可在同一画布内协同拆解任务、输出风格一致的完整视觉方案;开放 Skill 生态;新用户注册赠 1000 积分;发布首日登顶 Product Hunt 日榜第一;英文端多家媒体同步确认。
首个国产全栈设计 Agent 平台全量商用,标志 AI 设计从单点生成工具进入「多 Agent 协同一次交付整套视觉方案」阶段。
查看原始来源 ↗
机器之心/ComfyUI Wiki/arXiv/Git...·
7月22日
模型
›微软开源 Mage-Flow:4B 参数原生任意分辨率图像生成与编辑,GenEval 0.90 开源最高,MIT 许可可商用
Mage-Flow 4B 参数原生支持 512–2048 任意宽高比文生图与指令式编辑,GenEval 0.90 为开源最优,Turbo 版 0.59 秒/张。
微软亚洲研究院发布 Mage-Flow,Mage-VAE + NR-MMDiT 紧凑生成栈,4B 参数原生支持 512–2048 任意宽高比文生图与指令式图像编辑;GenEval 0.90(开源最高);Turbo 蒸馏版单张 0.59 秒;MIT 许可证可商用;已提供 ComfyUI 节点。
4B 参数在 GenEval 超越部分数倍体量模型,MIT 许可与 ComfyUI 集成使其在资源受限环境下具备直接可用的商业级图像生成能力。
查看原始来源 ↗
AIHub/量子位/网易/无界AI/aitop100/...·
7月21日一手
模型
›阿里通义 Qwen-Image-3.0 发布:4.5K 超长指令、10px 文字清晰渲染、12 国语言+100 余种艺术风格,图像生成从「画质比拼」转向「生产力交付」
Qwen-Image-3.0 文字渲染精度达 10px 可辨级别,4.5K 超长指令支持多区域版面控制,12 语言覆盖多语言出版需求。
阿里通义万象第三代图像生成模型 Qwen-Image-3.0 正式发布;核心突破:4.5K token 超长指令输入支持复杂多区域版面、10px 小字清晰可辨(文字渲染精度显著提升)、12 国语言原生渲染(含中文)、100+ 种艺术风格一键切换;多家媒体已实测与 GPT-Image-2 的全面对比。
Qwen-Image-3.0 的文字渲染精度与超长指令支持,使其具备处理信息图表、品牌物料等真实设计交付需求的能力,推动 AI 图像生成进入生产力交付阶段。
查看原始来源 ↗
›NVIDIA × Black Forest Labs FLUX.2 RTX优化:NVFP4量化2.7×加速+55%显存减少,SIGGRAPH同步推进ComfyUI集成
NVIDIA与Black Forest Labs在SIGGRAPH 2026发布FLUX.2 RTX专项优化:FP8量化VRAM减少40%/性能提升40%,NVFP4量化进一步实现2.7×加速和55%显存减少,ComfyUI深度集成同步推进,让消费级RTX显卡可流畅运行FLUX.2工作流。
NVIDIA与Black Forest Labs在SIGGRAPH 2026联合发布FLUX.2 RTX专项优化方案:FP8量化可使VRAM减少40%、性能提升40%;更进一步的NVFP4量化在此基础上实现2.7×加速并将显存占用再降55%;同步推进的ComfyUI深度集成让设计师无需命令行即可使用优化后的FLUX.2工作流;上述优化覆盖GeForce RTX消费级显卡,使原本需要高端专业卡的工作流可在RTX 4080/5070等设备上流畅运行。
FLUX.2是目前图像生成质量最受专业创作者认可的模型之一,NVFP4量化将其本地部署门槛大幅下降,对高校实验室和独立创作者的实际影响直接且可量化。
查看原始来源 ↗
›北大+深势科技提出PRA自回归图像生成框架:16维低维中间状态+并行解码,135M参数在像素空间超越1.9B基线
北京大学联合深势科技提出PRA自回归图像生成框架,采用16维低维中间状态与并行解码机制,135M参数规模在像素空间的表现超过1.9B参数基线,绕开传统视觉tokenizer,目前处于理论突破阶段,工程化程度待评估。
北京大学联合深势科技发布PRA(Parallel Recurrent Autoregressive)图像生成框架,于2026年7月13日经机器之心报道。PRA采用16维低维中间状态与并行解码机制,在像素空间直接建模而非依赖传统视觉tokenizer,使得135M参数规模的模型在标准基准测试中超越1.9B参数基线模型。该方法在理论层面提供了一种降低图像生成模型参数量的新路径,但当前研究仍处于理论突破阶段,工程化落地程度有待进一步评估。
以更小的参数量超越更大的模型,这类参数效率研究对艺术设计类院校的AI课程演示有参考价值——它展示了模型架构设计如何影响生成质量,而非仅靠堆叠参数。
查看原始来源 ↗
财联社/Deadline/Hollywood Repo...·
7月10日一手
行业
›Meta Muse Image上线不足一周因opt-out默认机制遭SAG-AFTRA/CAA联合声讨后下架
Meta Muse Image的「@提及公开账号生成」功能因采用opt-out默认机制允许生成公开IG账号AI图像,遭SAG-AFTRA与CAA联合声讨,Meta承认「missed the mark」后将该功能下架。
Meta于2026年7月上旬推出自研图像生成模型Muse Image,其中「@提及功能」允许用户在提示词中@任意公开Instagram账号,AI即可参考该账号历史图像生成新图,且默认为所有成年公开账号用户开启(opt-out机制)。上线约三天后,美国演员工会SAG-AFTRA与顶级经纪公司CAA联合公开声讨,指出任何人的姓名、肖像、声音或创作未经明确同意均不得被AI引用。7月10日Meta将该功能下架,官方声明使用了「missed the mark」(未达预期)的措辞。据报道,功能下架前已生成的图像不会被自动删除。
这是主流消费级AI图像功能首次因opt-out默认机制引发的大规模抵制与撤回,验证了「默认征用公开内容」模式在创作者数字资产保护层面的不可行性,对AI生成内容的同意机制设计与版权研究具有直接参考价值。
查看原始来源 ↗
›北大HOI-Edit+SCPE:AI图像编辑进入「交互理解」时代(ICML 2026)
北大王选所等团队发布HOI-Edit基准+SCPE自纠错框架(ICML 2026),将AI图像编辑从「改像素」推进到「交互理解」三层认知评测,L1交互分数提升22%,数据集与代码已开源。
北京大学王选所联合研究团队在ICML 2026上发布HOI-Edit基准与SCPE自纠错框架,将AI图像编辑能力评测重新定义为三层认知任务:基础交互理解、空间关系推理、因果物理推理。SCPE框架通过I2V视频过程诊断失败案例并自动纠错,L1交互评分提升22%。相关数据集与代码已开源,arXiv编号2606.19073,由机器之心与163.com双源报道。
AI图像编辑从像素操控向意图理解与自纠错范式演进,HOI-Edit为评测新一代可交互编辑工具提供了系统性基准框架。
查看原始来源 ↗
›Reve 2.1 发布:图像质量与风格一致性双升级
Reve发布2.1版本,重点提升图像质量与风格一致性,是2.0基础上的稳定性与精度迭代。
Reve于2026年7月9日发布2.1版本,在2.0基础上重点优化图像生成质量与跨提示词的风格一致性表现,细节渲染与色彩准确度均有提升。此次更新定位为稳定性与精度迭代,而非功能层面的大版本跃升,适合对出图质量有持续需求的创作者跟进使用。
Reve在图像生成赛道保持高频迭代节奏,2.1的一致性改善对需要批量出图保持风格统一的设计教学场景有实际参考价值。
查看原始来源 ↗
›字节Seedream 5.0 Pro全球发布:信息可视化、图层分离、10+语言文字渲染
字节Seedream 5.0 Pro正式发布,带来高密度信息可视化、交互式精准编辑(圈选/图层分离)、真实影像质感及10+语言原生文字生成四项核心升级。
字节跳动旗下Seed团队于2026年7月8日全球正式发布Seedream 5.0 Pro,带来四项核心升级:高密度信息可视化(可将数据与概念转化为专业排版图表);交互式精准编辑(支持圈选、点选与图层分离输出,直接对接PSD工作流);真实影像质感提升;以及支持10余种语言的原生文字生成。模型已上线Volcano Ark平台,ComfyUI同日通过Partner Nodes接入。
图像生成模型开始向「理解设计意图」方向演进,图层分离与可编辑输出将AI生图结果更紧密地嵌入现有平面设计工作流。
查看原始来源 ↗
Meta 官方 / TechCrunch / CNBC...·
7月7日一手编辑精选
模型
›Meta Muse Image 正式发布:Superintelligence Labs 首个自研图像模型,Agent 式架构上线 Instagram/WhatsApp
Meta Superintelligence Labs 发布首个自研图像生成模型 Muse Image,采用 Agent 式架构(调用搜索与代码工具自我修正),已上线 Meta AI 应用、Instagram Stories 及 WhatsApp,并将接入广告系统 Advantage+,多指标超越 Google Nano Banana 2
7 月 7 日,Meta Superintelligence Labs(由 Alexandr Wang 领导)正式发布 Muse Image,这是 Meta 首个完全自主研发的图像生成模型。模型采用 Agent 式生成架构,可调用搜索与代码工具对输出进行自我修正,支持文生图、图像编辑、多参考图合成及以 Instagram 公开图片为参考源等功能;已在 Meta AI 应用、Instagram Stories(美国)及 WhatsApp(部分地区)上线,并计划接入广告投放系统 Advantage+。在多项第三方评测中,Muse Image 超越 Google Nano Banana 2,仅略低于 OpenAI 最新 GPT Image 模型;Muse Video 版本即将推出。消息由 Meta 官方及 TechCrunch、CNBC、Bloomberg、Axios 等 7 个以上信源同步报道。
更新(7 月 10 日):其中「@提及公开账号生成」功能因采用 opt-out 默认机制、允许参考任意公开 Instagram 账号历史图像,遭 SAG-AFTRA 与 CAA 联合声讨后由 Meta 下架,模型本体仍在运行。详见后续报道。
Meta 以 Agent 式架构切入图像生成并直接整合社交与广告分发渠道,标志着图像生成模型进入「生成即分发」的平台化阶段,对 AI 视觉生成在商业内容生产及社交平台工作流中的渗透路径有直接参考意义。
查看原始来源 ↗
机器之心 / 新浪科技 / arXiv:2606.25907·
7月6日一手编辑精选
论文
›ICRDrag:上海交大提出首个上下文区域拖拽图像编辑模型,精准变形代替点选
上海交大 ICRDrag 提出首个基于 DiT 上下文学习的区域拖拽图像编辑模型,用掩码替代点选实现源区域→任意目标区域精准变形,代码与模型已开源(ECCV 2026)
上海交大研究团队在 arXiv(2606.25907)发布 ICRDrag,这是首个上下文区域拖拽图像编辑模型,入选 ECCV 2026。方法基于 DiT 上下文学习框架,以掩码替代传统点选操作,可实现源区域到任意目标区域的精准变形,涵盖姿态、形状与位置调整;研究同时构建了百万级 Paired Region Dataset 训练集,代码与模型已在 GitHub(bcmi/ICRDrag-Region-Drag-Editing)开源。由机器之心、新浪科技双源报道。
可控区域精准编辑是 AI 辅助设计中的高频需求,ICRDrag 以掩码替代点选降低了操作门槛,对 AI 图像编辑工具的实际教学演示与研究复现均有直接参考价值。
查看原始来源 ↗
机器之心 / 腾讯新闻 / arXiv:2605.21...·
7月1日一手编辑精选
论文
›GenEvolve:自进化图像生成 Agent 开源,工具编排轨迹替代单步提示词
GenEvolve 将图像生成从『一句话提示词』升级为 Agent 自主编排工具调用轨迹,港科广+美团+港科大+新加坡国立联合开源
GenEvolve(arXiv:2605.21605)由港科广、美团、港科大、新加坡国立大学联合提出,将图像生成范式从「单步提示词→图像」升级为 Agent 自主工具编排:系统自动调用网页搜索、图像检索、生成知识等工具,编排 prompt-reference program 后交渲染器执行,实现「自进化」的生图策略。模型、代码、数据集、评测集全部开源(MeiGen-AI GitHub 仓库,MIT+Apache-2.0 许可)。中文报道集中于 7 月 1 日,多源确认。
将 Agent 工具编排能力引入图像生成流程,是对传统「提示词工程」范式的结构性升级,开源特性使其可直接用于研究复现与教学演示。
查看原始来源 ↗
Google DeepMind / IT之家 / 新浪...·
6月30日一手编辑精选
模型
›Google Nano Banana 2 Lite + Gemini Omni Flash:4 秒出图、质量反超 Pro 档,静态图一键带运镜
Google DeepMind 于 2026-06-30 同步发布 Nano Banana 2 Lite 图像模型(约 4 秒出图、每张 1K 分辨率图约 $0.034)与 Gemini Omni Flash 静态图转带运镜视频模型;两款均已接入 Adobe Firefly 与 Google Stitch 生态。
Google DeepMind 于 2026-06-30 同步发布 Nano Banana 2 Lite(Gemini 3.1 Flash Lite 图像模型)与 Gemini Omni Flash(静态图转带运镜视频模型):Nano Banana 2 Lite 约 4 秒生成一张 1K 分辨率图像,Text-to-Image Elo 较上一代提升 100 至 1251,强化字符一致性与文字渲染,质量表现反超更贵的 Pro 档;每张 1K 分辨率图约 $0.034(图像输出每百万 token $30),与 Midjourney(约 $0.01–0.05/张)处于同一价格区间。Gemini Omni Flash 支持将静态图转为带自然运镜的短视频,定价 $0.10/秒;两款均上线 AI Studio 与 Gemini API,并已接入 Adobe Firefly Partner Models、Google Stitch、NotebookLM、Google Photos 及 Google Ads 生态。
核心卖点是速度(约 4 秒出图)与「速度档定价、质量反超自家更贵 Pro 档」的质价比,单张成本与主流付费模型处于同一区间。Gemini Omni Flash 的静态图转运镜视频能力,为从平面作品到动态演示提供了低门槛路径。
查看原始来源 ↗
Midjourney 官方 / Pexo·
6月28日一手
模型
›Midjourney V8.2 预览版开放:强化非 V7 审美路线,Sref 一致性提升
Midjourney V8.2 预览版可通过 --preview 参数提前体验,主要强化非 V7 审美风格路线、提升 Sref 风格板一致性;目前尚在开发阶段,表现不保证稳定,与 V8.1 Draft Mode 并行可用。
Midjourney 推出 V8.2 预览版,用户可在生成指令中添加 --preview 参数提前体验。V8.2 的主要方向是进一步强化有别于 V7 审美风格的路线,同时提升 Sref 风格板的跨提示词一致性。官方说明该版本仍处于开发中,生成表现尚不稳定,与现有的 V8.1 及 V8.1 Draft Mode 并行运行,用户可按需切换。
在 V8.1 已稳定运行的同时开放 V8.2 预览参数,提供了一种对比评估不同版本审美风格走向的实验通道,对视觉风格研究与提示词教学具有一定参考意义。
查看原始来源 ↗
科技行者 / arXiv (2606.27608)·
6月25日一手
论文
›Qwen-Image-2.0-RL:阿里用强化学习训练 AI「审美」,图像生成 Elo 提升 78 分
阿里 Qwen 团队发布 Qwen-Image-2.0-RL(arXiv:2606.27608),通过 GRPO 强化学习与在线策略蒸馏设计图文对齐、美感、肖像三类奖励模型,文生图 Elo 从 1115 升至 1193(+78),图像编辑 Elo 从 1256 升至 1349(+93)。
阿里 Qwen 团队发布 Qwen-Image-2.0-RL(arXiv:2606.27608),通过 GRPO 强化学习与在线策略蒸馏(OPD)构建三套奖励模型——图文对齐、美感、肖像——赋予图像生成模型更强的「审美判断」能力;技术方案含混合 CFG 策略、异步奖励管道与提示词筛选工程;文生图 Elo 从 1115 升至 1193(+78),图像编辑 Elo 从 1256 升至 1349(+93),在评测界属显著提升。
「用强化学习训练 AI 审美」的技术路径对艺术设计×AI 领域研究有直接方法论参考价值:如何定义可量化的「美感奖励」、如何让模型从人类偏好数据中习得审美判断,是生成式 AI 艺术研究的核心方法论问题;arXiv 全文适合研究生与教研方向师生作为前沿参考阅读。
查看原始来源 ↗
机器之心 / arXiv:2512.11883·
6月25日一手
论文
›ICML 2026 Spotlight:AI 图像审美对齐机制正在削弱生成内容的艺术多样性
ICML 2026 Spotlight 论文指出,HPS 等 AI 图像审美评分系统的对齐机制正在削弱生成图像的艺术多样性,越符合评分标准的图像越缺乏表现力
ICML 2026 Spotlight 论文(arXiv:2512.11883)系统研究了 AI 图像生成模型审美对齐机制的副作用:以 HPS(Human Preference Score)等审美评分体系为优化目标的训练过程,会导致生成图像趋向「高分但单一」的同质化审美,而牺牲图像的艺术表现力与多样性。研究结论指出,「越符合评分标准的图越缺乏表现力」。
对 AI 生成图像的评估指标与实际艺术价值之间的系统性矛盾进行了实证研究,是批判性审视当前 AI 图像生成技术路线的重要参照文献。
查看原始来源 ↗
Kyutai / UC Berkeley / 腾讯新闻·
6月24日一手
论文
›Kyutai+UC Berkeley 预印本系统质疑 FID 指标:AI 图像生成评测可靠性存疑
Kyutai 与 UC Berkeley 联合预印本(arXiv:2606.20536)对 AI 图像生成常用评测指标 FID 的可靠性提出系统性质疑,指出不同评测环境下结论相互矛盾,「最强」排名可能依赖了一个有缺陷的指标。
法国 Kyutai 与加州大学伯克利分校联合发布预印本(arXiv:2606.20536),对 AI 图像生成领域最常用的评测指标 FID(Fréchet Inception Distance)提出系统性质疑。研究指出,在不同评测环境与参数设置下,同一方法的 FID 结论存在相互矛盾的情况,当前部分「最强」方法的排名可能建立在一个存在缺陷的指标基础上,对现有研究结论的可信度构成方法论层面的挑战。
对 AI 图像生成的研究者与学习者而言,该研究提示在阅读和引用相关论文时需批判性审视 FID 排名,不宜以其高低作为方法优劣的单一依据。
查看原始来源 ↗
ComfyUI 官方·
6月24日一手编辑精选
产品
›ComfyUI v0.26.0 发布:一次接入 Krea 2、Boogu-Image、Qwen3-VL 三大开源模型
ComfyUI v0.26.0 在单次版本更新中同时接入 Krea 2(12B DiT 开源图像模型,含 Raw/Turbo 两版)、Boogu-Image(Qwen3-VL-8B 编码器)、Qwen3-VL(4B/8B),并新增 Load3DAdvanced 3D 节点与 LTX2 视频上下文采样支持,工作流模板升至 0.9.26。
2026 年 6 月 24 日,ComfyUI 发布 v0.26.0 版本,在单次更新中同时接入三个新开源模型:Krea 2(提供 Raw 与 Turbo 两个权重变体,Raw 版适合 LoRA 微调训练,Turbo 版支持 8 步蒸馏推理)、Boogu-Image(采用 Qwen3-VL-8B 作为文本编码器,配套 TextEncodeBooguEdit 节点支持局部图像编辑)以及 Qwen3-VL(4B 与 8B 两档,支持文本生成与图像理解);同时新增 Load3DAdvanced 3D 网格加载节点、LTX2 视频上下文窗口采样器,工作流模板版本升至 0.9.26。
ComfyUI 以单次版本更新接入三个最新开源模型,延续了其作为开源生成生态聚合枢纽的角色——用户升级版本即可本地获取多个最新模型的运行能力,是当前开源图像与视频工作流可及性持续下沿的直接体现。
查看原始来源 ↗
›字节 Seeddream 5.0 Pro:交互式精准编辑与多图层分离输出,对接 PSD 工作流
字节跳动于 FORCE 大会(6 月 23 日)发布 Seeddream 5.0 Pro,新增箭头/圈选直接标注的交互式精准编辑、多图层分离输出(可直接对接 PSD 工作流)及 10 余种语言原生文字生成,与 Seedance 2.5 构成图像→视频完整工业化链路。
字节跳动于 2026 年 6 月 23 日 FORCE 大会发布 Seeddream 5.0 Pro,新增三项主要能力:交互式精准编辑(支持在图像上直接以箭头标注或圈选区域的方式指定编辑目标,精确到局部内容);多图层分离输出(生成结果可按图层独立导出,直接对接 Photoshop PSD 工作流进行后期精修);以及 10 余种语言的原生文字生成能力,拓展多语言内容制作场景。Seeddream 5.0 Pro(图像)与此前发布的 Seedance 2.5(视频生成)共同构成字节在生成式视觉创作领域的图像→视频完整工业化链路。
图层分离输出与交互式局部标注编辑,将 AI 图像生成结果直接纳入专业后期管线,对「AI 生成→后期精修」教学工作流的演示与实践具有参考价值。
查看原始来源 ↗
›Krea 2 技术报告:开源 12B DiT 图像模型,明确不使用 AI 生成图像预训练
Krea 发布 Krea 2 技术报告,推出 Raw(LoRA 微调基座)与 Turbo(8 步推理,约 2 秒生成)两个开放权重变体,明确训练数据中不使用 AI 生成图像,采用商业友好许可,ComfyUI v0.26.0 于发布当日接入。
Krea AI 于 2026 年 6 月 23 日发布 Krea 2 开源图像模型技术报告,提供两个开放权重变体:Krea-2-Raw(未蒸馏基座版,适合训练 LoRA)与 Krea-2-Turbo(8 步蒸馏推理版,可在约 2 秒内生成高分辨率图像);模型采用单流 Diffusion Transformer 架构,以 Qwen 3 VL 多层特征聚合作为文本编码器、Qwen Image VAE 与 FLUX 2 VAE 为自编码器;官方技术报告明确预训练数据中不包含 AI 生成图像,并自建分类器进行过滤;权重发布于 HuggingFace,代码开源于 GitHub,采用宽松商业许可,ComfyUI v0.26.0 于发布当日完成原生接入。
在合成数据被广泛用于训练的当下,Krea 2「不使用 AI 生成图像预训练」的数据立场及「反审美同质化」定位,为讨论开源图像模型训练路线与风格多样性提供了具体参照;开放权重与 ComfyUI 原生支持使其可直接本地部署。
查看原始来源 ↗
›阿里 HappyHorse 1.1 升级五维度,同步开启 Horsepower AI 影像大赛
阿里 HappyHorse 1.1 版本升级动态表现力、9 图角色一致性、复杂场景指令、视觉质感和音频口播五个维度,同步宣布启动 Horsepower AI 影像大赛(张纪中评委)。
阿里于 2026 年 6 月 22 日发布 HappyHorse 1.1 版本更新,在五个维度进行了针对性提升:动态表现力、9 张图像角色一致性、复杂场景指令遵循、视觉质感和音频口播能力;同步宣布启动 Horsepower AI 影像大赛,邀请著名影视制作人张纪中出任评委之一。
HappyHorse 在角色一致性和复杂场景指令方向的持续升级,对关注国产视频生成模型能力演进或正在评估 AI 视频工具用于教学实验的师生有参照意义。
查看原始来源 ↗
›2026 AI 设计工具全收录:按使用场景分类整理
AI工坊pro 发布 2026 年 AI 设计工具全收录,按图像、视频、3D、UI 等使用场景分类整理,覆盖当前主流工具生态。
AI 工坊 pro 于 2026 年 6 月 22 日前后发布 2026 年 AI 设计工具全收录,按图像生成、视频生成、3D 建模、UI 设计、排版辅助等使用场景对当前主流 AI 设计工具进行分类整理,并附基本功能和适用场合说明,旨在帮助设计师和学生快速定位适合自身需求的工具。
按场景分类的工具合集,适合作为工作营开幕第一课的工具导览参考,也可直接用于课程教材的工具栏更新。
查看原始来源 ↗
›Runway Gen-4.5 + Studio 内置编辑器上线:视频生成与后期整合进单一工具
Runway 上线 Studio 内置编辑器,Gen-4.5 居文生视频基准榜首。
Runway 于 6 月 18 日推出 Studio 功能,用户可在同一界面内完成 AI 视频裁剪、拼接、重排序与导出;Gen-4.5 目前在 Artificial Analysis 文生视频基准测试中以 Elo 1247 居于榜首,近期新增 image-to-video 功能;同期 Runway API 接入 Seedance 2.0 Fast(6/5),支持关键帧控制与参考图像视频生成,4–15 秒、480p/720p 输出。
视频生成 + 内置后期整合进单一工具,缩短了影像创作工作流;Gen-4.5 当前的基准排名意味着它是综合可用性最强的文生视频工具之一。
查看原始来源 ↗
复旦大学 / 阶跃星辰 / 西湖大学 / 港大·
6月18日一手
论文
›FreeStyle:复旦+阶跃星辰等联合提出社区 LoRA 驱动的大规模任意风格迁移方法
复旦大学、阶跃星辰、西湖大学与港大联合提出 FreeStyle(arXiv:2606.20506),通过系统挖掘社区 LoRA 构建大规模内容×风格双参考数据集,实现任意风格迁移并完整保留内容结构,支持水墨、刺绣、油画、吉卜力等多样风格。
复旦大学、阶跃星辰、西湖大学与香港大学研究团队发布预印本 FreeStyle(arXiv:2606.20506v1),通过系统挖掘 Stable Diffusion 社区中大量开源 LoRA 构建了一个大规模的内容与风格双参考配对数据集,并在此基础上训练了一个支持任意风格迁移的生成模型,在迁移过程中可完整保留原始内容的结构与细节;支持中国水墨、刺绣、油画、吉卜力、赛博朋克、像素朋克等多种风格转换。
利用社区 LoRA 资产而非重新标注数据的训练思路,为 AI 风格迁移的研究与教学提供了一个新的数据构建路径,对图像设计、插画与 IP 视觉延伸方向的创作实践有参考价值。
查看原始来源 ↗
›美图奇想大模型 V6 发布,同步推出 Picchi / Artflo / MVLAND 等四款 AI 新品
美图奇想大模型 V6 正式发布,同步推出 Picchi、Artflo、MVLAND、MeituHub 四款 AI 新品及站酷 AI 工具箱,覆盖图像生成至多媒体创作全流程。
美图于 2026 年 6 月 17 日发布奇想大模型 V6,同步推出四款 AI 新产品:面向创作者的 Picchi 图像创作平台、Artflo 艺术风格生成工具、MVLAND 多媒体内容工具及 MeituHub 创作社区,另联合站酷发布 AI 工具箱,整体覆盖从单张图像生成到多媒体内容全流程。
国内设计类 AI 工具的集中发布,展示了面向设计师的垂直 AI 产品生态形态,可作为讲解国内 AI 设计工具市场格局的教学案例参照。
查看原始来源 ↗
GitHub / 机器之心 / HuggingFace·
6月16日一手
模型
›Boogu-Image-0.1 开源:10B 参数统一图像生成与编辑模型,Apache-2.0
Boogu-Image-0.1 以 Apache-2.0 协议开源,10B 参数统一图像生成与编辑,中英双语密集文本渲染为开源第一,ComfyUI 整合包同步上线。
Boogu-Image-0.1 于 2026 年 6 月 16 日在 GitHub 和 HuggingFace 发布,采用 Apache-2.0 协议,提供 Base、Turbo、Edit 三个变体,参数量 10B,可统一执行图像生成与图像编辑任务;其中英双语密集文本渲染能力在现有开源模型中排名第一,ComfyUI 整合包同步发布;中文社区于 6 月 22 日起大量讨论,三家以上媒体源核认。
Apache-2.0 协议允许商业用途,对有本地部署需求或研究型开发需求的师生尤为友好;超密集中英文本渲染的开源第一,对平面设计、排版研究类课题有直接参考价值。
查看原始来源 ↗
Midjourney 官方·
6月10日一手
模型
›Midjourney V8.1 成为默认版本:生成速度 4–5 倍提升,原生 2K 高清输出
Midjourney V8.1 成默认版本,速度提升约 4–5 倍,支持原生 2K 输出。
Midjourney 于 6 月 10 日将 V8.1 设为全平台默认版本,标准任务速度较早期版本提升约 4–5 倍,支持原生 2K 高清输出(无需额外放大步骤),Prompt 理解精准度同步升级。
出图速度与分辨率直接影响演示与实操节奏;提速约 4–5 倍、原生 2K 降低了高清出图的额外步骤。使用 Midjourney 的现有教程截图可能需要相应更新。
查看原始来源 ↗
›Ideogram 4.0 发布首个开放权重文生图模型,ComfyUI 首日支持
Ideogram 发布 4.0 开放权重文生图模型(9.3B DiT),支持 JSON 精控色彩与文字布局,ComfyUI 首日支持,可本地免费部署。
Ideogram 于 2026 年 6 月 3 日发布首个开放权重文生图模型 Ideogram 4.0,参数量 9.3B(DiT 架构),支持 JSON 结构化 Prompt 精控色彩、布局与文字位置,文字渲染能力在 DesignArena 开源模型榜排名第一,超越参数量更大的 FLUX.2 dev(32B)及 HunyuanImage 3.0(80B MoE);ComfyUI 首日提供原生支持,非商业用途可本地免费部署。
前沿文生图能力首次以可本地运行的开放权重形式出现,为没有商业 API 预算的师生和独立创作者提供了直接可用的高质量文生图工具参照。
查看原始来源 ↗