商汤于 7 月 13 日发布并开源统一视觉大模型 SenseNova-Vision,对应论文《Vision as Unified Multimodal Generation》(arXiv:2607.06560)。它的核心主张是:不再为每类视觉任务单独设计专门结构,而是把众多异构视觉任务,统一表达进一个多模态模型的”文本+图像”原生生成空间里,用一个模型来完成。

已知事实

  • 是什么:SenseNova-Vision 是一个”统一多模态生成”范式的视觉模型。它把不同视觉任务表达为同一个多模态模型的原生文本与图像生成,不使用任务专用的预测头或结构改动
  • 覆盖任务:据论文摘要,涵盖目标检测、OCR、关键点估计、分割、深度估计、表面法向预测、点图(point maps)、相机位姿估计,以及结合类别、颜色、区域、视觉线索的语言定义变体。相关报道将其归纳为四大任务族——结构化视觉理解、分割、稠密几何预测、多视图视觉几何。
  • 怎么用:用自然语言指令+可选的视觉提示来指定任务、区域、视图与输出格式;输出可以是文本(符号型结果)、图像(稠密空间预测)或图文混合。
  • 效果主张(官方口径):论文摘要称,单一统一模型即可”媲美领先的专用系统”(match leading task-specialized systems),并未在摘要中点名对比某个具体竞品。
  • 开源:论文明确”模型与语料均已公开”;模型与数据集已上线 GitHub(OpenSenseNova)与 Hugging Face(含 7B-MoT 版本与配套语料)。

横向与纵向定位

横向看,计算机视觉长期是”一个任务一套模型/一个预测头”的格局——检测、分割、深度各有专门架构。SenseNova-Vision 代表的方向,是把这些异构任务收进同一个多模态生成框架,用统一的”指令→文本/图像输出”来表达,思路与近年”用一个大模型通吃多任务”的趋势一致,但把重心放在稠密几何与空间预测这类过去更依赖专用结构的视觉任务上。需要注意的是,部分中文报道称其”能力超越 Vision Banana”,但这一对比并未见于论文摘要,官方表述是更克制的”媲美专用系统”。

纵向看,视觉模型正从”专用、分立”走向”统一、可指令化”。当检测、分割、深度、相机位姿都能由一句自然语言指令驱动、由同一个模型产出,视觉能力的调用方式会更接近”对话式”,也更易与多模态大模型链路打通。这一步对研究与工具生态的意义在于:统一框架+开源模型和语料,降低了在多种视觉任务上做对比、复现与二次开发的门槛;而”单一模型能否真正在各专用任务上都不掉队”,仍需以公开权重在真实任务上逐项检验。

⚠️ 待核实:具体覆盖任务的数量、四大任务族划分、”媲美领先专用系统”的评测口径与基准,以论文原文与开源仓库为准;”能力超越 Vision Banana”为部分中文报道口径,未见于论文摘要,不宜作为定论;开源范围(权重/语料/许可)与各任务实际效果,以官方仓库说明与实测为准。

商汤开源的 SenseNova-Vision 以”统一多模态生成”把目标检测、分割、深度、几何等异构视觉任务收进单一模型,用自然语言指令+视觉提示驱动、以文本或图像输出,论文称单一模型即可媲美领先的专用系统并公开了模型与语料;它代表视觉能力从”专用分立”向”统一可指令化”演进,为视觉计算、多模态研究与工具开发提供了可复现、可二次开发的开源底座,其在各任务上的实际水平仍待以公开权重逐项验证。

参考来源

  • arXiv:2607.06560《Vision as Unified Multimodal Generation》:https://arxiv.org/abs/2607.06560
  • GitHub(OpenSenseNova/SenseNova-Vision):https://github.com/OpenSenseNova/SenseNova-Vision
  • Hugging Face(sensenova/SenseNova-Vision-7B-MoT):https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT
  • KrASIA(英文报道):https://kr-asia.com/pulses/163001
  • IT之家 / 虎嗅(中文报道,经由):https://finance.sina.com.cn/tech/digi/2026-07-13/doc-inihrsvh9048257.shtml