20251210【高效视觉感知与理解】王语霖:受人类视觉系统启发的动态机器视觉模型

2102
0
2025-12-19 18:58:23
48
24
113
29
报告嘉宾:王语霖 (清华大学) 报告时间:2025年12月10日 (星期三)晚上20:40 (北京时间) 报告题目:受人类视觉系统启发的动态机器视觉模型 报告人简介: 王语霖,清华大学自动化系博士 (导师:吴澄院士、黄高副教授),研究兴趣为计算机视觉、多模态人工智能基础模型、AI4Science等。在高水平期刊Nature Machine Intelligence、Nature Communications、TPAMI、IJCV与CCF-A会议上发表论文30余篇,代表作为一作 (或学生一作)NMI 1篇、TPAMI 4篇、IJCV 1篇。4次入选NeurIPS/ICCV/CVPR的Oral/Spotlight/Highlight。谷歌引用3900余次。获中国图象图形学学会自然科学一等奖 (3/5)、百度奖学金(每年全球10人)、微软学者 (每年亚太12人)、CCF-CV学术新锐奖 (每年全国3人)、字节跳动奖学金 (每年全国10人)、清华博士国奖 (2次,清华Top 2%)、清华优博、北京市/清华优毕等荣誉.   个人主页: wyl.cool   报告摘要: 人类视觉系统往往可以根据所处场景和主观意图的不同,动态改变视觉输入的内容、形式、和处理成本,例如自适应寻找和关注于图像中最关键的空间区域、视频中的任务相关帧等,以及在某些场景下“不假思索”给出判断、在另一些情况下深入辨认思考等。相比之下,广为使用的神经网络往往采用静态推理范式,即在计算开销意义上,均等地处理输入样本的全部时空区域以及不同输入样本。 本报告将介绍 AdaptiveNN 架构,通过借鉴人类“主动自适应视觉”机制,将视觉感知建模为由粗到精的最优序贯决策问题:逐步定位关键区域、累积多次注视信息,并在信息足够完成任务时主动终止感知过程。具体的,通过结合表征学习与自奖励强化学习,建立了基于离散-连续混合优化问题的AdaptiveNN模型,并给出了高效的端到端求解方法。在涵盖9类视觉任务的实验中,AdaptiveNN 在保持精度的同时实现了最高28倍的推理效率提升,并且具有在线动态调整推理开销以适配算力约束的能力。此外,其基于注视路径的推理机制具有更好的人类可理解性,为研究者更好地理解视觉模型的行为提供了更多的线索。同时,AdaptiveNN 的感知行为在多项测试中与人类视觉系统相类似,为未来探索和理解人类视觉认知机制提供了新的视角和研究工具。 参考文献: [1] Wang, Y., Yue, Y., Yue, Y. et al. Emulating Human-like Adaptive Vision for Efficient and Flexible Machine Visual Perception. Nature Machine Intelligence (NMI), 2025 [2] Wang Y, Zhang H, Yue Y, et al. Uni-AdaFocus: Spatial-temporal Dynamic Computation for Video Recognition, IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025 [3] Ni Z, Wang Y, Hua Y, et al. AdaGen: Learning Adaptive Policy for Image Synthesis, IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025 [4] Huang G, Wang Y, Lv K, et al. Glance and Focus Networks for Dynamic Visual Recognition, IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2023
为计算机视觉、图像处理、模式识别与机器学习等研究领域内的华人青年学者提供深入学术交流的舞台。
客服
顶部
赛事库 课堂 2021拜年纪