GPT-SoVITS介绍
官方介绍:1分钟的语音数据也可以用来训练一个好的TTS模型!
简单来说:一个能够高质量高效率完成声音克隆的工具。
官网教程地址B站up主:花儿不哭
网页链接;vd_source=4d7819b82193f7361a8b1753733c9e13
注:个人感觉原作者讲的很乱,更推荐这个UP主的视频:网页链接;vd_source=4d7819b82193f7361a8b1753733c9e13
整合包网盘位置(原作者做的整合包,下载并解压即可)
注:解压推荐使用7-zip,或者bandizip(否则使用过程会出问题)
作者在语雀上做的教程
此处为语雀内容卡片,点击链接查看:https://www.yuque.com/baicaigongchang1145haoyuangong/ib3g1e
注:目前GPT-SoVITS只支持对中文的声音克隆
GPT-SoVITS使用
1:获取前置数据集
获取目标声音的数据集:你希望克隆谁的声音,拿到他的声音数据,并做对应的处理。这些处理步骤为以下:
1.1:人声伴奏分离
对于你拿到的目标声音的音频文件,
如果音频文件很干净(没有杂音,没有背景音,没有噪音,只有声音的干声),那么即便音频文件只有2分钟,训练出来的效果也会很好!
如果有客观因素不可避免,音频文件里有杂音/背景音/噪音,那么即应该选择人声伴奏分离工具对音频进行过滤处理(净化整个音频,最大程度除去:杂音/背景音/噪音)。
操作如下:
1.1.1 打勾:是否开启UVR5-WebUI
1.1.2 等待数秒后,自动弹出一个新页面(人声伴奏分离)。在该页面进行人声伴奏分离操作。
1.1.3 需要输入的有2个地方:输入待处理音频文件夹路径(或者是直接上传该音频文件)+模型(根据页面中的提示自行选择)。 输入完成后点击“转换”,输出信息为shuzirenceshi.wav->Success,说明成功。
1.2:语音切分
2.1.1 语音切分:对经过人声伴奏分离后的干净音频文件进行切分(比如将一个2分钟的音频切分为若干个2秒/3秒的音频)。需要关注以下几点内容:
2.1.2 输入音频自动切分输入路径(右击文件夹,选择复制文件地址),可文件可文件夹(如果是文件路径,注意把文件路径两边的“”去掉)
2.1.3 min_length建议将原值改为30(对于2分钟的音频而言)
2.1.4 min_interval建议将原值改为11(对于2分钟的音频而言)
2.1.5 前面的参数值设定好后,点击开启语音切割。右侧语音切割进程输出信息输出:切割结束,后台也没有报错,说明完成语音切分。
2.1.6 切分后的音频数据集在这里:
1.3:中文批量离线ASR
1.3.1 这一步是将上一步切分的多个音频整合为一个list清单文件,输出在asr_opt文件之中
1.3.2 过程如下:输入切分后的音频数据集文件夹路径,点击开启离线批量ASR。ASR进程输出信息输出为:ASR任务成功,后台没有操作,即代表完成中文批量离线ASR
1.4:语音文本校对标注
1.4.1 这一步是将上一步拿到的list文件,进行音频和文本的校对标注处理。以获得最优质的训练数据集。
1.4.2 输入:.list标注文件的路径(同样需要注意:(如果是文件路径,注意把文件路径两边的“”去掉)),打勾:是否开启达标webUI。等待数秒,在跳转出来的新页面进行处理。
1.4.3 核对音频和文本是否对应。选中音频,可进行合并和删除操作。注意校对标注一个音频后及时保存,完成一页校对后,进入下一页继续标注。
2:GPT-SoVITS-TTS
对整理好的目标音频数据集,进行微调训练和推理。完成这一步,即可实现让目标声音说出任何文本内容,并进行测试试听。
2.1:训练集格式化
这一步是将上一步标注好的list音频文件进行某种整合,为后续的训练做最后的准备。具体操作如下:
2.1.1 命名该模型:如我要训练小张的声音,将模型命名为xiaozhang
2.1.2 文本标注文件:输入上一步标注好的文件路径(.list文件路径,不是文件夹路径)
2.1.3 训练集音频文件目录:输入第1.2步骤语音切分出来的音频数据集的文件夹路径
2.1.4 点击:开启一键三连 一键三连进程输出信息输出为:一键三连进程结束,且后台程序没有报错,说明训练集格式化成功
2.2:微调训练
这一步是训练,操作相对简单。进入页面后,无需做其他太多的设置,直接分别点击开启SoVITs训练和开启GPT训练即可。当SoVITS训练进程输出信息和GPT训练进程输出信息分别显示SoVITS训练完成和GPT训练完成,同时后台无报错。表明训练成功。
后台显示训练中。
训练完成后,训练出来的音频模型会分别显示在GPT_weights和SoVITS_weights文件夹中。
2.3:推理
这一步是推理并测试最终训练出来的音频效果。具体步骤如下:
2.3.1 在推理页,点击刷新模型路径,即可在GPT模型列表中看到上一步训练的音频模型:xiaozhang
2.3.2 打勾:是否开启TTS原理webUI。等待数秒,在开启的TTS原理webUI进行操作
2.3.3 上传参考音频文件(1.2步骤语音切分出来的一个音频文件),以及对应该参考音频的文本内容。参考音频的语种选择中文即可。 做这一步的意义是,一定程度上影响接下来测试的效果(测试出来的效果将保持该参考音频的语气和情绪)。
2.3.4 输入需要合成的文本:即想让训练的声音说什么内容,然后点击合成语音即可在右侧输出的语音中试听声音效果。
3:GPT-SoVITS-变声
施工中,请静候佳音。作者尚未完成这部分的开发。