商汤SenseNova-Vision:一个模型统一所有视觉任务,全面超越,代码已开源
基本信息
- 论文标题:Vision as Unified Multimodal Generation / 视觉即统一多模态生成
- 作者团队:商汤科技研究院 + 南洋理工大学 + 香港中文大学 + 北京大学 + 上海交通大学 + 浙江大学
- 发表信息:arXiv:2607.06560, 2026年7月
- 代码链接:https://github.com/OpenSenseNova/SenseNova-Vision
研究背景
你有没有想过一个问题:为什么目标检测需要一个模型,分割需要另一个,深度估计还得换第三个?计算机视觉领域长期处于"一任务一模型"的碎片化局面——DETR做检测,SAM做分割,MoGe做深度,每个模型架构不同、数据格式不同、互不兼容。
这不仅是研究者的烦恼,更是产业落地的瓶颈。自动驾驶需要同时跑检测、深度估计和场景理解三四个模型,机器人抓取需要检测+分割+深度联合推理。如果能把所有视觉任务放进一个模型,像ChatGPT统一NLP那样,会怎样?
商汤科技联合六所高校的最新工作SenseNova-Vision,正是朝这个方向迈出的关键一步。
创新点
SenseNova-Vision的核心思路极其直接:把所有视觉任务都转化为"看图说话"和"看图生成"。
无论是输出文字坐标"红酒杯在[100,200,300,400]",还是生成一张深度图,甚至是图文混合的指代分割结果,都落在同一个多模态生成框架内。这相当于把ChatGPT"文本进→文本出"的思路搬到了视觉领域:输入图像和自然语言指令,输出可以是文字、图像或两者混合,不需要任何任务专用的预测头。
核心方法
技术实现分两步,每一步都很务实。
第一步:重新定义数据。研究团队构建了 SenseNova-Vision Corpus,核心操作是把所有异构的CV标注统一转写成"指令-回答"对。COCO的检测框变成"图中的猫在哪?→猫在[坐标]“,深度图的像素矩阵变成"估计深度→输出深度图”,分割掩码变成"把红酒杯分出来→掩码图+标签"。
第二步:在统一语料上训练。从一个现成的预训练多模态模型出发,不做任何架构改动,不添加任何任务专用模块,仅在这个"翻译"后的语料库上训练。模型自然学会了将不同视觉任务理解为不同的"问答模式"——文字问答、图像生成、图文混合,三种模式共用一套参数。
这个设计的巧妙之处在于:架构零改动。统一不是靠魔改网络结构实现的,而是靠重新定义输入输出空间。
实验结果
SenseNova-Vision在四大类视觉任务上对飙各领域最强专用模型:
| 任务类别 | 具体指标 | 本文结果 | 最佳专用模型 |
|---|---|---|---|
| 结构化感知 | 检测 F1@mIoU | 56.6 | Rex-Omni 52.9 |
| 稠密几何 | 深度 δ1 | 93.2 | MoGe-2 92.6 |
| 分割 | GCG分割 mIoU | 69.2 | LISA 61.9 |
| 多视图3D | 重建 F1 | 87.9 | VGGT 84.3 |
一个没有任务专用头的统一模型,在多个指标上反而超越了各领域最强的专用模型。深度估计的 δ1 达到93.2%意味着93.2%的像素深度误差在25%以内,已接近实用精度。多视图3D重建的87.9 F1也大幅领先此前的SOTA。
应用场景
自动驾驶:当前方案需要多个独立模型做检测、深度估计和场景理解。SenseNova-Vision一个模型覆盖全部感知需求,显著降低系统复杂度和推理延迟。
机器人操作:机械臂抓取物体需要同时做检测、深度感知和分割。统一模型让感知链路从"多模型串行"变成"单模型并行"。
AR/VR:从单张图片重建3D结构、估计相机姿态、分割物体——这些是AR眼镜的核心能力,SenseNova-Vision的多视图几何能力恰好对齐这个方向。
局限与展望
推理速度方面,作为大模型目前还达不到轻量级专用模型的实时性,但这是工程优化问题而非原理瓶颈。极端场景下的鲁棒性——强光照、严重遮挡等条件下——仍需进一步验证。此外,当前模型仅处理静态图像,尚未扩展到视频时序理解。
但方向已经非常清晰。"One Model for All Vision"正在从口号变成工程现实,统一多模态生成可能是视觉基础模型的最终形态。
总结
- 一句话:SenseNova-Vision证明了一个统一多模态生成模型能同时胜任七大视觉任务,且超越专用模型。
- 覆盖检测、OCR、分割、深度、法线、3D重建、相机姿态,架构零改动。
- 模型和代码已全面开源。
以上就是SenseNova-Vision论文的核心解读。如果觉得有帮助,欢迎点赞、在看、转发三连支持!你觉得"一模型通吃所有视觉任务"离产业落地还有多远?欢迎在评论区聊聊。