论文题目:Class-aware Sounding Objects Localization via Audiovisual Correspondence
作者列表:胡迪(中国人民大学),卫雅珂(中国人民大学),钱锐(香港中文大学),林巍峣(上海交通大学),宋睿华(中国人民大学),文继荣(中国人民大学)
论文摘要:
视听场景在我们的日常生活中无处不在。对人类来说,判别性定位不同的发声物体是司空见惯的,但对机器来说,在没有类别标注的情况下实现对发声物体的判别性定位相当具有挑战性的,即不仅定位出发声物体并识别其类别。为了解决这个问题,我们提出了一个两阶段的学习框架,在复杂的视听场景中仅利用视音一致性定位和识别发声物体。首先,我们在单声源情况下通过粗粒度的视音对应关系来确定发声区域。然后利用发声区域提取发声物体的视觉特征,继而建立不同类别物体视觉表征的字典。而后,在多声源的鸡尾酒会场景中利用该字典得到判别性物体定位图,随后利用视音一致性抑制画面中存在但不发声的物体的区域。最后,我们采用类别级别的视音一致性作为自监督信号,以实现细粒度的视音分布对齐。在真实及合成视频上的实验表明,我们的模型在判别性定位发声物体并过滤掉不发声的物体方面具有优势。我们还将所训练的视听网络迁移到无监督物体检测任务中,获得了良好的性能。
论文信息:
[1] Di Hu, Yake Wei, Rui Qian, Weiyao Lin, Ruihua Song, Ji-Rong Wen. Class-aware Sounding Objects Localization via Audiovisual Correspondence. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022.
论文链接:
[https://ieeexplore.ieee.org/abstract/document/9662191/]
项目主页:
[https://gewu-lab.github.io/CSOL_TPAMI2021/]
代码链接:
[https://github.com/DTaoo/Discriminative-Sounding-Objects-Localization]
视频讲者简介:
卫雅珂,中国人民大学高瓴人工智能学院博士生,研究方向为多模态学习。