20230426【通用大模型时代的计算机视觉研究】郑锋:“Segment Anything”浅谈及应用介绍

6551
4
2023-04-28 00:35:49
155
69
370
109
报告嘉宾:郑锋 (南方科技大学) 报告时间:2023年04月26日 (星期三)晚上20:00 (北京时间) 报告题目:“Segment Anything”浅谈及应用介绍 报告人简介: 郑锋,南方科技大学副教授 (研究员),国自然优秀青年基金获得者,于英国谢菲尔德大学获得博士学位。研究兴趣包括机器学习、计算机视觉与跨媒体计算。曾在腾讯优图实验室任高级研究员,在美国匹兹堡大学和德克萨斯大学阿灵顿分校任博后研究员,在中国科学院深圳先进技术研究院任研究助理及助理研究员。目前,在国际顶级杂志和会议上包括IEEE TPAMI/ TIP/ TNNLS/ ICML/ NeuIPS/ AAAI/ CVPR/ ICCV/ ECCV发表100余篇学术论文, 其中,高被引论文2篇;CCF推荐A类论文62篇。指导学生在包括CVPR ActivityNet/ CVPR LOVEU/ ACM MM PIC等多个国际重要竞赛中多次取得了第一或第二名的好成绩。获得了人机交互相关技术多项授权专利,其研究的人机交互技术曾被多家主流媒体报道过,并实现了向包括华为和创维等企业的技术转化。同时,是IET Image Processing杂志副编辑,是ACM MM 2020/ 2021领域主席,ICME 2021/ IJCB 2021本地主席,PRCV 2022组委会主席,在多个国际顶级人工智能会议包括CVPR/ AAAI/ IJCAI/ NeuIPS/ ICML/ ICLR/ KDD/ ICCV担任委员会成员。 个人主页: https://faculty.sustech.edu.cn/fengzheng/ 报告摘要: 基于Alexnet视觉模型的成功,带动了近十年人工智能的飞速发展。但是基于Transformer语言大模型的出现,构建了ChatGPT和GPT4,让人类第一次接近了通用人工智能。事实上,人们一直期待能出现类似的视觉领域大模型,解决人类80%信息源的认知问题。Meta AI近期推出的“Segment Anything”视觉大模型,试图将视觉分割任务统一起来,其效果令人震惊。基于“Segment Anything”模型,我们迅速推出了两个旨在验证该模型基础作用的系统: 1) Caption Anything 是一款集Segment Anything、Visual Captioning 和ChatGPT 功能于一体的多功能图片处理工具。我们的解决方案为图像中的任何对象生成描述性说明,提供一系列语言风格以满足不同的用户偏好。它支持视觉控制 (鼠标点击)和语言控制 (长度、情感、真实性和语言)。2) Track Anything 是一个灵活的交互式视频对象跟踪和分割工具。在跟踪过程中,用户可以灵活地更改他们想要跟踪的对象,或者在出现歧义的情况下更正感兴趣的区域。用户可以使用此系统擦除或修复 (Inpainting)视频内容。视觉大模型任重而道远,我们认为这一切才刚刚开始。 参考文献: [1] Segment Anything. Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C. Berg, Wan-Yen Lo, Piotr Dollár, Ross Girshick. CVPR, 2023. [2] Teng Wang, Ruimao Zhang, Zhichao Lu, Feng Zheng*, Ran Cheng, Ping Luo. End-to-End Dense Video Captioning with Parallel Decoding. ICCV, 2021. [3] Teng Wang, Yixiao Ge, Feng Zheng*, Ran Cheng, Ying Shan, Xiaohu Qie, Ping Luo. Accelerating Vision-Language Pretraining with Free Language Modeling. CVPR, 2023.
为计算机视觉、图像处理、模式识别与机器学习等研究领域内的华人青年学者提供深入学术交流的舞台。
客服
顶部
赛事库 课堂 2021拜年纪