报告嘉宾:郑锋 (南方科技大学)
报告时间:2023年04月26日 (星期三)晚上20:00 (北京时间)
报告题目:“Segment Anything”浅谈及应用介绍
报告人简介:
郑锋,南方科技大学副教授 (研究员),国自然优秀青年基金获得者,于英国谢菲尔德大学获得博士学位。研究兴趣包括机器学习、计算机视觉与跨媒体计算。曾在腾讯优图实验室任高级研究员,在美国匹兹堡大学和德克萨斯大学阿灵顿分校任博后研究员,在中国科学院深圳先进技术研究院任研究助理及助理研究员。目前,在国际顶级杂志和会议上包括IEEE TPAMI/ TIP/ TNNLS/ ICML/ NeuIPS/ AAAI/ CVPR/ ICCV/ ECCV发表100余篇学术论文, 其中,高被引论文2篇;CCF推荐A类论文62篇。指导学生在包括CVPR ActivityNet/ CVPR LOVEU/ ACM MM PIC等多个国际重要竞赛中多次取得了第一或第二名的好成绩。获得了人机交互相关技术多项授权专利,其研究的人机交互技术曾被多家主流媒体报道过,并实现了向包括华为和创维等企业的技术转化。同时,是IET Image Processing杂志副编辑,是ACM MM 2020/ 2021领域主席,ICME 2021/ IJCB 2021本地主席,PRCV 2022组委会主席,在多个国际顶级人工智能会议包括CVPR/ AAAI/ IJCAI/ NeuIPS/ ICML/ ICLR/ KDD/ ICCV担任委员会成员。
个人主页:
https://faculty.sustech.edu.cn/fengzheng/
报告摘要:
基于Alexnet视觉模型的成功,带动了近十年人工智能的飞速发展。但是基于Transformer语言大模型的出现,构建了ChatGPT和GPT4,让人类第一次接近了通用人工智能。事实上,人们一直期待能出现类似的视觉领域大模型,解决人类80%信息源的认知问题。Meta AI近期推出的“Segment Anything”视觉大模型,试图将视觉分割任务统一起来,其效果令人震惊。基于“Segment Anything”模型,我们迅速推出了两个旨在验证该模型基础作用的系统: 1) Caption Anything 是一款集Segment Anything、Visual Captioning 和ChatGPT 功能于一体的多功能图片处理工具。我们的解决方案为图像中的任何对象生成描述性说明,提供一系列语言风格以满足不同的用户偏好。它支持视觉控制 (鼠标点击)和语言控制 (长度、情感、真实性和语言)。2) Track Anything 是一个灵活的交互式视频对象跟踪和分割工具。在跟踪过程中,用户可以灵活地更改他们想要跟踪的对象,或者在出现歧义的情况下更正感兴趣的区域。用户可以使用此系统擦除或修复 (Inpainting)视频内容。视觉大模型任重而道远,我们认为这一切才刚刚开始。
参考文献:
[1] Segment Anything. Alexander Kirillov, Eric Mintun, Nikhila Ravi, Hanzi Mao, Chloe Rolland, Laura Gustafson, Tete Xiao, Spencer Whitehead, Alexander C. Berg, Wan-Yen Lo, Piotr Dollár, Ross Girshick. CVPR, 2023.
[2] Teng Wang, Ruimao Zhang, Zhichao Lu, Feng Zheng*, Ran Cheng, Ping Luo. End-to-End Dense Video Captioning with Parallel Decoding. ICCV, 2021.
[3] Teng Wang, Yixiao Ge, Feng Zheng*, Ran Cheng, Ying Shan, Xiaohu Qie, Ping Luo. Accelerating Vision-Language Pretraining with Free Language Modeling. CVPR, 2023.