VASA-1,由微软亚洲研究员开发的项目,可以实现从单一静态图像和一段语音音频生成逼真的对话面部动画。VASA-1不仅能够精确同步音频和唇部动作,还能捕捉到丰富的面部细微表情和自然的头部动作,增强了真实感和生动感。
项目及演示:
https://www.microsoft.com/en-us/research/project/vasa-1/
论文: https://arxiv.org/abs/2404.10667