
编辑:计算机视觉工坊
添加小助理:dddvision,备注:方向+学校/公司+昵称,拉你入群。文末附行业细分群
扫描下方二维码,加入3D视觉知识星球,星球内凝聚了众多3D视觉实战问题,以及各个模块的学习资料:近20门视频课程(星球成员免费学习)、最新顶会论文、3DGS系列、计算机视觉书籍、优质3D视觉算法源码等。想要入门3D视觉、做项目、搞科研,欢迎扫码加入!

0. 这篇文章干了啥?
MASA提供了一个通用的实例外观模型,用于匹配任何域中的任何对象。
多目标跟踪(MOT)是计算机视觉中的基本问题之一。它在许多机器人系统中发挥着关键作用,例如自动驾驶。跟踪既需要检测视频中的感兴趣对象,又需要在帧与帧之间关联这些对象。虽然最近的视觉基础模型已经展现出对任何对象进行检测、分割和深度感知的出色能力,但在视频中关联这些对象仍然具有挑战性。最近成功的多目标跟踪方法强调了学习有判别力的实例嵌入对于准确关联的重要性。有些人甚至认为,除了检测之外,这是唯一必要的跟踪组件。
我爱3D视觉工坊
,赞50
然而,学习有效的对象关联通常需要大量的注释数据。收集各种图像的检测标签是一项繁琐的工作,而在视频上获取跟踪标签则更具挑战性。因此,当前的MOT数据集主要集中在具有少量固定类别或有限数量标记帧的特定领域的对象。
在这些数据集上进行训练限制了跟踪模型对不同领域和新概念的泛化能力。尽管最近的研究已成功尝试解决对象检测和分割的模型泛化问题,但学习一个通用的跟踪任何对象的关联模型的途径仍然不明确。我们的目标是开发一种能够匹配任何对象或区域的方法。我们旨在将这种可泛化的跟踪能力与任何检测和分割方法相结合,以帮助它们跟踪检测到的任何对象。一个主要挑战是在不产生大量标记成本的情况下,为不同领域的通用对象获取匹配监督。
为此,我们提出了通过分割一切来匹配一切(Matching Anything by Segmenting Anything,MASA)的流水线,以从任何领域的未标记图像中学习对象级别的关联。我们利用基础分割模型SAM编码的丰富对象外观和形状信息,结合广泛的数据变换,建立强大的实例对应关系。对同一图像应用不同的几何变换可以在来自同一图像的两个视图中自动产生像素级别的对应关系。SAM的分割能力允许将来自同一实例的像素自动分组,从而方便将像素级别的对应关系转换为实例级别的对应关系。这一过程为学习具有判别性的对象表示提供了自监督信号,利用视图对之间的密集相似性学习。我们的训练策略使我们能够使用来自不同领域的丰富原始图像集,证明在多样化原始图像上的这种自动自训练提供了出色的零次学习多目标跟踪性能,甚至超越了依赖于领域内视频注释进行关联学习的模型。
除了自训练流程外,我们还构建了一个通用的跟踪适配器——MASA适配器,以赋能任何现有的开放世界分割和检测基础模型(如SAM、Detic和Grounding-DINO)来跟踪它们检测到的任何对象。为了保留它们原始的分割和检测能力,我们冻结了它们的原始主干网络,并在其上添加了MASA适配器。
此外,我们提出了一种多任务训练流程,该流程同时执行SAM检测知识的蒸馏和实例相似性学习。这种方法使我们能够学习SAM的对象位置、形状和外观先验,并在对比相似性学习中模拟真实的检测提议。这一流程进一步提高了我们跟踪特征的泛化能力。此外,我们学习的检测头将原始SAM的密集均匀点提议加速了十倍以上,这对于跟踪应用至关重要。
我们在多个具有挑战性的基准测试中评估了MASA,包括TAO MOT、开放词汇MOT、BDD100K上的MOT和MOTS以及UVO。广泛的实验表明,与在完全域内标记视频上训练的最先进对象跟踪方法相比,我们的方法使用具有相同模型参数的单个模型并在零次学习关联设置下进行测试,实现了相当甚至更好的关联性能。
下面一起来阅读一下这项工作~
1. 论文信息
标题:Matching Anything by Segmenting Anything
作者:Siyuan Li, Lei Ke, Martin Danelljan, Luigi Piccinelli, Mattia Segu, Luc Van Gool, Fisher Yu
机构:ETHZ、INSAIT
原文链接:https://arxiv.org/abs/2406.04221
代码链接:https://github.com/siyuanliii/masa
官方主页:https://matchinganything.github.io/
2. 摘要
在复杂场景中跨视频帧稳健地关联相同对象是许多应用的关键,尤其是多目标跟踪(MOT)。当前方法主要依赖于标记的特定领域视频数据集,这限制了学习到的相似嵌入的跨领域泛化能力。我们提出了MASA,一种新颖的方法,用于稳健的实例关联学习,能够在没有跟踪标签的情况下,匹配不同领域中视频内的任何对象。MASA利用Segment Anything Model(SAM)丰富的对象分割功能,通过详尽的数据变换来学习实例级别的对应关系。我们将SAM的输出视为密集的对象区域提议,并学习从庞大的图像集合中匹配这些区域。我们进一步设计了一个通用的MASA适配器,可以与基础分割或检测模型协同工作,并使它们能够跟踪任何检测到的对象。这些组合在复杂领域呈现出强大的零次学习跟踪能力。在多个具有挑战性的MOT和MOTS基准测试中进行的广泛测试表明,所提出的方法仅使用未标记的静态图像,在零次学习关联方面,其性能甚至超过了使用完全注释的域内视频序列训练的最新方法。
3. 效果展示
给定来自任何领域的未标记图像,我们应用强大的增强技术φ(·)和ϕ(·)对图像进行处理,生成两个具有自动建立的像素对应关系的不同视图。然后,我们利用基础分割模型SAM编码的丰富对象级信息,将像素级对应关系转移到密集的实例级对应关系。这种对应关系使我们能够利用多样化的未标记图像集合,在任何分割或检测基础模型(例如SAM)之上训练一个通用的跟踪适配器。这个适配器使基础模型能够跟踪它们检测到的任何对象,并在复杂领域中显示出强大的零次学习跟踪能力。

4. 基本原理是啥?
我们的方法包含两个关键组件。首先,基于SAM,我们开发了一个新的流程:MASA。利用该流程,我们从丰富的未标记图像集合中构建了密集的实例级对应关系的详尽监督。这使得我们能够学习强大的判别性实例表示来跟踪任何对象,而无需任何视频注释。其次,我们引入了一个通用的MASA适配器,以有效地转换来自冻结的检测或分割主干的特征,用于学习可泛化的实例外观表示。作为副产品,MASA适配器的蒸馏分支也可以显著提高分割一切的效率。此外,我们还构建了一个统一的模型,以共同检测/分割和跟踪任何对象。我们的完整训练流程如图2所示。
MASA 训练流程。给定来自任何领域的未标记图像,SAM 会自动为其生成详尽的实例掩码。然后,我们对原始图像和详尽的实例分割应用强大的增强操作,ϕ(·) 和 φ(·),得到两个不同的视图作为我们模型的输入。我们通过联合蒸馏 SAM 的检测知识和实例相似性学习来训练我们的 MASA 适配器。放大彩色视图以获得更好的观看效果。

图3展示了使用我们的统一模型的测试流程。
检测并跟踪任何物体:当我们将MASA适配器与对象检测器结合使用时,我们移除了训练过程中学到的MASA检测头。此时,MASA适配器仅作为跟踪器使用。检测器预测边界框,然后利用这些边界框来触发MASA适配器,后者会检索相应的跟踪特征以进行实例匹配。我们使用简单的双softmax最近邻搜索进行准确的实例匹配。

5. 实验结果
TAO和TETA 我们使用了与TETer-SwinT相同的观测数据。如表1所示,在零次学习设置下,无论是AssocA还是TETA,我们的方法在没有任何域内标记视频训练的情况下,使用Grounding-DINO的主干网络表现最佳。我们还测试了我们的统一Detic模型,该模型同时输出检测和跟踪结果。它显著优于其他所有方法,并达到了新的最先进水平。这表明我们的方法可以很好地与当前的检测基础模型相结合,并将其强大的检测能力转移到跟踪任务中。

开放词汇表MOT 与开放词汇表对象检测任务类似,开放词汇表MOT规定方法仅应使用LVIS中频繁和常见的类别注释进行训练,将稀有类别视为新颖类别。我们评估了我们的统一“检测并跟踪任何内容”模型Detic,该模型仅使用基类注释进行训练。如表2所示,我们的统一Detic模型在基类和新颖类别的所有指标上均优于现有模型,尽管我们的跟踪器仅使用域外未标记图像进行训练,但仍取得了显著的领先。

TAO 跟踪mAP我们使用与GTR相同的观察结果。如表3所示,在给定相同检测的情况下,我们的方法(使用SAM-B)表现最佳(Track mAP50为23.9)。我们的大多数模型都优于当前的最新方法GTR,GTR是一种利用未来信息进行关联的离线方法。相比之下,我们的方法以在线方式进行跟踪,并在零次学习设置中进行测试。我们的统一Detic模型再次以大幅超越GTR的成绩达到了新的最先进水平。

BDD100K MOTS 我们使用与最新方法UNINEXT-H相同的观察结果,并在BDD100K MOTS基准上进行零次学习关联测试。如表4所示,我们的方法在所有方法中实现了最佳的关联性能(mIDF1为49.7,AssocA为54.5)。这证明了我们的方法学习到的实例嵌入的优越性。

BDD100K MOT 如表5所示,给定与ByteTrack相同的观测数据,我们的方法达到了最高的IDF1分数71.7和AssocA分数52.9。与最先进的ByteTrack相比,我们的方法在IDF1和AssocA上均提高了约1.4%,且没有使用任何BDD图像进行训练。ByteTrack还选择了低置信度的边界框,并将它们添加到轨迹片段中,从而获得了更好的mMOTA分数,该分数优先考虑检测性能。

UVO VIS 我们基于SAM对我们的统一“分割并跟踪任何内容”模型进行了零次学习测试。我们直接使用MASA检测头中的边界框提示来更快地分割所有内容。如图4a所示,我们的方法在图像和视频轨迹上都取得了最佳性能,大幅超过了其他方法。此外,我们还将我们的方法与SAM的默认自动掩码分割进行了比较。如图4b所示,随着推理时间的增加,由于蒸馏检测分支的作用,我们的方法的AR100增长速度远快于SAM。使用ViT-Base主干的我们的方法的AR100上限甚至超过了SAM 10%。此外,当达到相同的AR100时,我们的方法比SAM快约10倍。这源于我们的方法学习了一个强大的对象先验,通过少量的稀疏提议来捕获潜在对象。然而,为了分割所有内容,SAM必须均匀采样约1k个点,这既不灵活也不高效,同时还依赖于手工制作的复杂后处理方法。

6. 总结
我们提出了MASA,这是一种新颖的方法,它利用SAM提供的丰富的实例级形状和外观信息,从未标记的图像中学习可泛化的实例关联。MASA在各种基准测试中展示了卓越的零次学习关联性能,消除了对昂贵的特定领域标签的需求。此外,我们的通用MASA适配器可以添加到任何现有的检测和分割模型中,使它们能够在不同领域高效地跟踪任何对象。
对更多实验结果和文章细节感兴趣的读者,可以阅读一下论文原文~
本文仅做学术分享,如有侵权,请联系删文。
计算机视觉工坊交流群
目前我们已经建立了3D视觉方向多个社群,包括2D计算机视觉、大模型、工业3D视觉、SLAM、自动驾驶、三维重建、无人机等方向,细分群包括:
2D计算机视觉:图像分类/分割、目标/检测、医学影像、GAN、OCR、2D缺陷检测、遥感测绘、超分辨率、人脸检测、行为识别、模型量化剪枝、迁移学习、人体姿态估计等
大模型:NLP、CV、ASR、生成对抗大模型、强化学习大模型、对话大模型等
工业3D视觉:相机标定、立体匹配、三维点云、结构光、机械臂抓取、缺陷检测、6D位姿估计、相位偏折术、Halcon、摄影测量、阵列相机、光度立体视觉等。
SLAM:视觉SLAM、激光SLAM、语义SLAM、滤波算法、多传感器融合、多传感器标定、动态SLAM、MOT SLAM、NeRF SLAM、机器人导航等。
自动驾驶:深度估计、Transformer、毫米波|激光雷达|视觉摄像头传感器、多传感器标定、多传感器融合、自动驾驶综合群等、3D目标检测、路径规划、轨迹预测、3D点云分割、模型部署、车道线检测、BEV感知、Occupancy、目标跟踪、端到端自动驾驶等。
三维重建:3DGS、NeRF、多视图几何、OpenMVS、MVSNet、colmap、纹理贴图等
无人机:四旋翼建模、无人机飞控等
除了这些,还有求职、硬件选型、视觉产品落地、最新论文、3D视觉最新产品、3D视觉行业新闻等交流群
添加小助理: dddvision,备注:研究方向+学校/公司+昵称(如3D点云+清华+小草莓), 拉你入群。

3D视觉学习知识星球
3DGS、NeRF、结构光、相位偏折术、机械臂抓取、点云实战、Open3D、缺陷检测、BEV感知、Occupancy、Transformer、模型部署、3D目标检测、深度估计、多传感器标定、规划与控制、无人机仿真、三维视觉C++、三维视觉python、dToF、相机标定、ROS2、机器人控制规划、LeGo-LAOM、多模态融合SLAM、LOAM-SLAM、室内室外SLAM、VINS-Fusion、ORB-SLAM3、MVSNet三维重建、colmap、线面结构光、硬件结构光扫描仪,无人机等。
