最近很多大佬都在做ACG的语音合成呢,但一直没见星光咖啡馆的模型出来,那我就试着做做吧:)
视频中使用的模型是VITS,在我自己收集的星光咖啡馆数据集(2W条语音)上用colab的P100跑了40个小时左右。效果还不错,再跑几天品质应该还能提升!
另外在尝试做GUI……
Github:https://github.com/Francis-Komizu/VITS
Colab demo:https://colab.research.google.com/drive/1nKa-l15f_talGvIwPmKTLYwwaE1Mztjg?usp=sharing
模型(generator):https://drive.google.com/file/d/1MffEp1So-GsI9wc3OgG7dacNfRJCVpUh/view?usp=sharing