RVC 变声器教程指南
醒醒新一
2026年04月20日 22:43

RVC 变声器萌新教程指南

配置要求

最低配置要求:

GPU显卡:NVIDIA GTX 1060 6G or AMD RX580 8G

CPU:Intel_酷睿 or AMD_锐龙四核心以上

内存:8G RAM以上

操作系统:Windows_10系统 or Windows_11系统

推荐配置:

GPU显卡:RTX 3060 8G

CPU:lntel十二代酷睿i5或锐龙7000系以上

内存:32G RAM以上

操作系统:Windows_10系统 or Windows_11系统

注:目前AMD和英特尔的显卡延迟会比较高,建议英伟达RTX20系以上显卡使用

官方RVC最新下载链接

https://mxgf.cc/rvc-bendi-jiaocheng/

下载变声模型 48K全音域 RVC变声模型 访问 mxgf.cc

图片
图片

提取码:psrs

N卡用户请下载RVCXXXXNvidia.7z

A卡I卡用户请下载RVXXXXAMD_Intel.7z

以下教程基于官方RVC813版本制作

使用之前建议关闭GPU加速计划

操作方式:开始菜单输入图形设置

WIN10

图片

然后重启电脑

实时变声推理

下载官方RVC压缩包,解压后打开文件

启动RVC

双击go-realtime-gui.bat打开RVC变声器

图片

等待CMD控制台加载......

(10系和16系显卡可能需要按一下回车)

启动失败的话请跳转后面的问题排查

图片

启动成功后你就会获得这个界面

图片

选择模型

选择正确路径的pth文件和index文件

pth为音色文件(主要文件),index为索引文件(实时推理中意义不大)

(没有index就随便选一个后面index rate拉到0就行了)

(路径内不能含有中文名)

图片

音频设备选择

图片

重要!!!重要!!!

重要!!!

如果你是第一次使用RVC,从未安装过其他虚拟声卡之类的软件,请跳转虚拟声卡Voicemeeter使用教程来安装虚拟声卡。

(RVC并不能直接输出声音到麦克风,需要机架或者虚拟声卡将转换的声音发送到一个虚拟麦克风使用。)

选择输入输出设备,输入选择你的硬件麦克风

输出则是你的虚拟声卡输出线路VoiceMeeter Input (VB-Audio Voi (MME)。

图片

input前后没有其他文字

输入输出全部请选择末尾为MME的驱动

参数设置

以下为通用参数设置具体详解后面会说明,通常这么设置肯定能用。

看后面的参数详解

图片

XX启动!

点击 开始音频转换

图片

开始推理,等待几秒....

图片
图片

代表参数没错(如果这部分卡住了通常都是音频设备问题,可以重启碰碰运气)

如果报错可以截图控制台去群里问问咋回事(实在搞不定找个明白的帮你搞搞)

图片

推理时间开始跳动

图片

控制台开始刷屏

就代表变声流程完成

虚拟麦克风输出的就是变音了

然后就可以愉快的变声啦——————! ! !

注意

更换模型,更改参数需要先停止推理

再开始推理才会生效。

参数详解

1.响应阈值

尽量拉满-60,如果有比较大的环境噪音:

有n卡的,且无独立声卡的,直接通过nvidia broadcast的ai降噪处理噪音,是非常方便的选择,装好后自动降噪。

有独立声卡的,且通道数至少2进2出的,在机架内设置RVC变声输出轨,直接用降噪插件处理,但是要注意如果在输入端进行降噪,可能会出现吞字(也就是声音无法很好的识别),可以在输入端稍微加点降噪,输出端也稍微加点降噪。

最简单的方法:使用RVC软件自带的输入降噪和输出降噪,之前切的比较厉害,现在使用体验不错。

如果打游戏同时开英伟达降噪,游戏对显存要求比较高的话,尽量8gb以上,不然打游戏可能会卡的。 需要注意的是:降噪过多,音色会发闷些,无法达到完美的效果,减少一些底噪就是成功的。

2.音调设置

数值代表的意义:越高越女性化,越低越男性化。

男转女一般在10~12,在这附近左右调整,分别可以变粗或变细,选好之后就不要动了。

女转男一般在-12~-10左右。

3.index rate

左边是接近底模的音色,右边是接近模型的音色。如果调高不影响口齿,可以略微调高,一般0.2-0.5都是可以的。如果电脑配置不太好,直接拉到0,可以更流畅。如果没有要求必须和模型音色有多像,则调0;调高可以拉进和模型目标音色的相似度,但CPU占用和延迟会略微增加一点。

(在实时推理中 index的意义依然在探索 以上为以前的结论,仅供参考)

4.音高算法

不好的音高算法会经常出现哑声的情况

pm对应0416版本。延迟最低CPU占用最小。理论上唱歌效果可以,但说话效果对嘈杂环境不太好

harvest:最好的音高算法,CPU占用较大,通过调高右侧"harvest进程数"降低延迟,分摊负载;单显卡打游戏还想低延迟变声的首选。

crepe:效果接近harvest的音高算法,稍吃GPU。有rmvpe之后crepe就是充数的。

rmvpe:效果默秒全,速度比harvest和crepe快,吃一点GPU(比crepe占用更小),不吃CPU,现无脑推荐,除非显卡太拉了。

5.采样长度(决定变声延迟)

尽量调低一些,只要不卡,但是需要注意如果调太低,cpu占用会很高,如果再打游戏啥的,cpu可能会吃不消。 调得越高,变声结果距离录音时间点越远; 调得太低,假如最下面推理时间经常大于变声延迟,会造成"机关枪"卡顿情况,应调整其他参数降低延迟或调高该参数。

6.harvest进程数

只有音高算法为harvest生效

rmvpe算法就不用看了

进程数会音响音质,如果对音质有要求,进程数不建议大于4。

决定音高算法最高占用多少系统线程(最多吃多少比例CPU) 如果有其他任务也要吃CPU,会影响你的工作(比如打游戏),则不宜拉太高; 调低了推理延迟会增大,如果推理延迟不能满足需求则应拉高采样长度,或者更换音高算法; 如果推理延迟已经能满足变声延迟的需求,则建议该选项进行微调,越低越好。

7.淡入淡出长度

影响延迟,可以自己拉到0.1和0.15体会一下就懂了,很难叙述明白。

8.额外推理时长

1以上3以内,建议至少要留1s,效果越长越好,调高了咬字识别更好。会影响CUDA占用。