GPT-SoVITS整合包部署及使用教程
SuperAI小夜
编辑于 2024年02月05日 23:39

GPT-SoVITS介绍

官方介绍:1分钟的语音数据也可以用来训练一个好的TTS模型!

简单来说:一个能够高质量高效率完成声音克隆的工具。

官网教程地址B站up主:花儿不哭

网页链接​;vd_source=4d7819b82193f7361a8b1753733c9e13

注:个人感觉原作者讲的很乱,更推荐这个UP主的视频:网页链接​;vd_source=4d7819b82193f7361a8b1753733c9e13

整合包网盘位置(原作者做的整合包,下载并解压即可)

注:解压推荐使用7-zip,或者bandizip(否则使用过程会出问题)

作者在语雀上做的教程

此处为语雀内容卡片,点击链接查看:https://www.yuque.com/baicaigongchang1145haoyuangong/ib3g1e

注:目前GPT-SoVITS只支持对中文的声音克隆

GPT-SoVITS使用

1:获取前置数据集

获取目标声音的数据集:你希望克隆谁的声音,拿到他的声音数据,并做对应的处理。这些处理步骤为以下:

1.1:人声伴奏分离

对于你拿到的目标声音的音频文件,

如果音频文件很干净(没有杂音,没有背景音,没有噪音,只有声音的干声),那么即便音频文件只有2分钟,训练出来的效果也会很好!

如果有客观因素不可避免,音频文件里有杂音/背景音/噪音,那么即应该选择人声伴奏分离工具对音频进行过滤处理(净化整个音频,最大程度除去:杂音/背景音/噪音)。

操作如下:

1.1.1  打勾:是否开启UVR5-WebUI

1.1.2  等待数秒后,自动弹出一个新页面(人声伴奏分离)。在该页面进行人声伴奏分离操作。

1.1.3  需要输入的有2个地方:输入待处理音频文件夹路径(或者是直接上传该音频文件)+模型(根据页面中的提示自行选择)。 输入完成后点击“转换”,输出信息为shuzirenceshi.wav->Success,说明成功。

1.2:语音切分

2.1.1 语音切分:对经过人声伴奏分离后的干净音频文件进行切分(比如将一个2分钟的音频切分为若干个2秒/3秒的音频)。需要关注以下几点内容:

2.1.2 输入音频自动切分输入路径(右击文件夹,选择复制文件地址),可文件可文件夹(如果是文件路径,注意把文件路径两边的“”去掉)

2.1.3 min_length建议将原值改为30(对于2分钟的音频而言)

2.1.4 min_interval建议将原值改为11(对于2分钟的音频而言)

2.1.5 前面的参数值设定好后,点击开启语音切割。右侧语音切割进程输出信息输出:切割结束,后台也没有报错,说明完成语音切分。

2.1.6 切分后的音频数据集在这里:

1.3:中文批量离线ASR

1.3.1 这一步是将上一步切分的多个音频整合为一个list清单文件,输出在asr_opt文件之中

1.3.2 过程如下:输入切分后的音频数据集文件夹路径,点击开启离线批量ASR。ASR进程输出信息输出为:ASR任务成功,后台没有操作,即代表完成中文批量离线ASR

1.4:语音文本校对标注

1.4.1 这一步是将上一步拿到的list文件,进行音频和文本的校对标注处理。以获得最优质的训练数据集。

1.4.2 输入:.list标注文件的路径(同样需要注意:(如果是文件路径,注意把文件路径两边的“”去掉))打勾:是否开启达标webUI。等待数秒,在跳转出来的新页面进行处理。

1.4.3 核对音频和文本是否对应。选中音频,可进行合并和删除操作。注意校对标注一个音频后及时保存,完成一页校对后,进入下一页继续标注。

2:GPT-SoVITS-TTS

对整理好的目标音频数据集,进行微调训练和推理。完成这一步,即可实现让目标声音说出任何文本内容,并进行测试试听。

2.1:训练集格式化

这一步是将上一步标注好的list音频文件进行某种整合,为后续的训练做最后的准备。具体操作如下:

2.1.1 命名该模型:如我要训练小张的声音,将模型命名为xiaozhang

2.1.2 文本标注文件:输入上一步标注好的文件路径(.list文件路径,不是文件夹路径)

2.1.3 训练集音频文件目录:输入第1.2步骤语音切分出来的音频数据集的文件夹路径

2.1.4 点击:开启一键三连   一键三连进程输出信息输出为:一键三连进程结束,且后台程序没有报错,说明训练集格式化成功

2.2:微调训练

这一步是训练,操作相对简单。进入页面后,无需做其他太多的设置,直接分别点击开启SoVITs训练和开启GPT训练即可。当SoVITS训练进程输出信息和GPT训练进程输出信息分别显示SoVITS训练完成和GPT训练完成,同时后台无报错。表明训练成功。

后台显示训练中。

训练完成后,训练出来的音频模型会分别显示在GPT_weights和SoVITS_weights文件夹中。

2.3:推理

这一步是推理并测试最终训练出来的音频效果。具体步骤如下:

2.3.1 在推理页,点击刷新模型路径,即可在GPT模型列表中看到上一步训练的音频模型:xiaozhang

2.3.2 打勾:是否开启TTS原理webUI。等待数秒,在开启的TTS原理webUI进行操作

2.3.3 上传参考音频文件(1.2步骤语音切分出来的一个音频文件),以及对应该参考音频的文本内容。参考音频的语种选择中文即可。     做这一步的意义是,一定程度上影响接下来测试的效果(测试出来的效果将保持该参考音频的语气和情绪)。

2.3.4 输入需要合成的文本:即想让训练的声音说什么内容,然后点击合成语音即可在右侧输出的语音中试听声音效果。

3:GPT-SoVITS-变声

施工中,请静候佳音。作者尚未完成这部分的开发。