RVC 变声器萌新教程指南
最低配置要求:
GPU显卡:NVIDIA GTX 1060 6G or AMD RX580 8G
CPU:Intel_酷睿 or AMD_锐龙四核心以上
内存:8G RAM以上
操作系统:Windows_10系统 or Windows_11系统
推荐配置:
GPU显卡:RTX 3060 8G
CPU:lntel十二代酷睿i5或锐龙7000系以上
内存:32G RAM以上
操作系统:Windows_10系统 or Windows_11系统
注:目前AMD和英特尔的显卡延迟会比较高,建议英伟达RTX20系以上显卡使用
https://mxgf.cc/rvc-bendi-jiaocheng/
下载变声模型 48K全音域 RVC变声模型 访问 mxgf.cc


提取码:psrs
N卡用户请下载RVCXXXXNvidia.7z
A卡I卡用户请下载RVXXXXAMD_Intel.7z
以下教程基于官方RVC813版本制作
使用之前建议关闭GPU加速计划
操作方式:开始菜单输入图形设置
WIN10

然后重启电脑
下载官方RVC压缩包,解压后打开文件
双击go-realtime-gui.bat打开RVC变声器

等待CMD控制台加载......
(10系和16系显卡可能需要按一下回车)
启动失败的话请跳转后面的问题排查

启动成功后你就会获得这个界面

选择正确路径的pth文件和index文件
pth为音色文件(主要文件),index为索引文件(实时推理中意义不大)
(没有index就随便选一个后面index rate拉到0就行了)
(路径内不能含有中文名)


重要!!!重要!!!
重要!!!
如果你是第一次使用RVC,从未安装过其他虚拟声卡之类的软件,请跳转虚拟声卡Voicemeeter使用教程来安装虚拟声卡。
(RVC并不能直接输出声音到麦克风,需要机架或者虚拟声卡将转换的声音发送到一个虚拟麦克风使用。)
选择输入输出设备,输入选择你的硬件麦克风
输出则是你的虚拟声卡输出线路VoiceMeeter Input (VB-Audio Voi (MME)。

input前后没有其他文字
输入输出全部请选择末尾为MME的驱动
以下为通用参数设置具体详解后面会说明,通常这么设置肯定能用。
看后面的参数详解

点击 开始音频转换

开始推理,等待几秒....


代表参数没错(如果这部分卡住了通常都是音频设备问题,可以重启碰碰运气)
如果报错可以截图控制台去群里问问咋回事(实在搞不定找个明白的帮你搞搞)

推理时间开始跳动

控制台开始刷屏
就代表变声流程完成
虚拟麦克风输出的就是变音了
然后就可以愉快的变声啦——————! ! !
注意
更换模型,更改参数需要先停止推理
再开始推理才会生效。
尽量拉满-60,如果有比较大的环境噪音:
有n卡的,且无独立声卡的,直接通过nvidia broadcast的ai降噪处理噪音,是非常方便的选择,装好后自动降噪。
有独立声卡的,且通道数至少2进2出的,在机架内设置RVC变声输出轨,直接用降噪插件处理,但是要注意如果在输入端进行降噪,可能会出现吞字(也就是声音无法很好的识别),可以在输入端稍微加点降噪,输出端也稍微加点降噪。
最简单的方法:使用RVC软件自带的输入降噪和输出降噪,之前切的比较厉害,现在使用体验不错。
如果打游戏同时开英伟达降噪,游戏对显存要求比较高的话,尽量8gb以上,不然打游戏可能会卡的。 需要注意的是:降噪过多,音色会发闷些,无法达到完美的效果,减少一些底噪就是成功的。
数值代表的意义:越高越女性化,越低越男性化。
男转女一般在10~12,在这附近左右调整,分别可以变粗或变细,选好之后就不要动了。
女转男一般在-12~-10左右。
左边是接近底模的音色,右边是接近模型的音色。如果调高不影响口齿,可以略微调高,一般0.2-0.5都是可以的。如果电脑配置不太好,直接拉到0,可以更流畅。如果没有要求必须和模型音色有多像,则调0;调高可以拉进和模型目标音色的相似度,但CPU占用和延迟会略微增加一点。
(在实时推理中 index的意义依然在探索 以上为以前的结论,仅供参考)
不好的音高算法会经常出现哑声的情况
pm对应0416版本。延迟最低CPU占用最小。理论上唱歌效果可以,但说话效果对嘈杂环境不太好
harvest:最好的音高算法,CPU占用较大,通过调高右侧"harvest进程数"降低延迟,分摊负载;单显卡打游戏还想低延迟变声的首选。
crepe:效果接近harvest的音高算法,稍吃GPU。有rmvpe之后crepe就是充数的。
rmvpe:效果默秒全,速度比harvest和crepe快,吃一点GPU(比crepe占用更小),不吃CPU,现无脑推荐,除非显卡太拉了。
尽量调低一些,只要不卡,但是需要注意如果调太低,cpu占用会很高,如果再打游戏啥的,cpu可能会吃不消。 调得越高,变声结果距离录音时间点越远; 调得太低,假如最下面推理时间经常大于变声延迟,会造成"机关枪"卡顿情况,应调整其他参数降低延迟或调高该参数。
只有音高算法为harvest生效
rmvpe算法就不用看了
进程数会音响音质,如果对音质有要求,进程数不建议大于4。
决定音高算法最高占用多少系统线程(最多吃多少比例CPU) 如果有其他任务也要吃CPU,会影响你的工作(比如打游戏),则不宜拉太高; 调低了推理延迟会增大,如果推理延迟不能满足需求则应拉高采样长度,或者更换音高算法; 如果推理延迟已经能满足变声延迟的需求,则建议该选项进行微调,越低越好。
影响延迟,可以自己拉到0.1和0.15体会一下就懂了,很难叙述明白。
1以上3以内,建议至少要留1s,效果越长越好,调高了咬字识别更好。会影响CUDA占用。