报告嘉宾:王语霖 (清华大学)
报告时间:2025年12月10日 (星期三)晚上20:40 (北京时间)
报告题目:受人类视觉系统启发的动态机器视觉模型
报告人简介:
王语霖,清华大学自动化系博士 (导师:吴澄院士、黄高副教授),研究兴趣为计算机视觉、多模态人工智能基础模型、AI4Science等。在高水平期刊Nature Machine Intelligence、Nature Communications、TPAMI、IJCV与CCF-A会议上发表论文30余篇,代表作为一作 (或学生一作)NMI 1篇、TPAMI 4篇、IJCV 1篇。4次入选NeurIPS/ICCV/CVPR的Oral/Spotlight/Highlight。谷歌引用3900余次。获中国图象图形学学会自然科学一等奖 (3/5)、百度奖学金(每年全球10人)、微软学者 (每年亚太12人)、CCF-CV学术新锐奖 (每年全国3人)、字节跳动奖学金 (每年全国10人)、清华博士国奖 (2次,清华Top 2%)、清华优博、北京市/清华优毕等荣誉.
个人主页:
wyl.cool
报告摘要:
人类视觉系统往往可以根据所处场景和主观意图的不同,动态改变视觉输入的内容、形式、和处理成本,例如自适应寻找和关注于图像中最关键的空间区域、视频中的任务相关帧等,以及在某些场景下“不假思索”给出判断、在另一些情况下深入辨认思考等。相比之下,广为使用的神经网络往往采用静态推理范式,即在计算开销意义上,均等地处理输入样本的全部时空区域以及不同输入样本。
本报告将介绍 AdaptiveNN 架构,通过借鉴人类“主动自适应视觉”机制,将视觉感知建模为由粗到精的最优序贯决策问题:逐步定位关键区域、累积多次注视信息,并在信息足够完成任务时主动终止感知过程。具体的,通过结合表征学习与自奖励强化学习,建立了基于离散-连续混合优化问题的AdaptiveNN模型,并给出了高效的端到端求解方法。在涵盖9类视觉任务的实验中,AdaptiveNN 在保持精度的同时实现了最高28倍的推理效率提升,并且具有在线动态调整推理开销以适配算力约束的能力。此外,其基于注视路径的推理机制具有更好的人类可理解性,为研究者更好地理解视觉模型的行为提供了更多的线索。同时,AdaptiveNN 的感知行为在多项测试中与人类视觉系统相类似,为未来探索和理解人类视觉认知机制提供了新的视角和研究工具。
参考文献:
[1] Wang, Y., Yue, Y., Yue, Y. et al. Emulating Human-like Adaptive Vision for Efficient and Flexible Machine Visual Perception. Nature Machine Intelligence (NMI), 2025
[2] Wang Y, Zhang H, Yue Y, et al. Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition, IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025
[3] Ni Z, Wang Y, Hua Y, et al. AdaGen: Learning Adaptive Policy for Image Synthesis, IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025
[4] Huang G, Wang Y, Lv K, et al. Glance and Focus Networks for Dynamic Visual Recognition, IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2023