文字转语音声音克隆神器软件CosyVoice 3.0一键启动整合包,高质量情感语音合成工具
AI画师大阳
2026年02月01日 17:23
收录于文集
共44篇

CosyVoice是一个非常强大的语音合成工具,提供文字转语音、声音克隆和情感语音合成控制功能。这是一个由阿里团队推出的应用,在声音克隆和语音合成软件中,算是比较不错的一款应用了。合成的语音非常的自然,不会像以前其它软件那么的僵硬。当前最新版本为3.0版,我基于最新版制作了免安装一键启动整合包。

CosyVoice 3.0说明

Fun-CosyVoice 3.0 是一个基于大型语言模型 (LLM) 的高级文本转语音 (TTS) 系统,在内容一致性、说话人相似度和韵律自然性方面超越了其前身 (CosyVoice 2.0)。它旨在实现零样本多语种野外语音合成。

主要特点

  1. 语言覆盖范围: 涵盖9种常用语言(中文、英语、日语、韩语、德语、西班牙语、法语、意大利语、俄语),18种以上的中文方言/口音(广东话、闽南话、四川话、东北话、陕西话、山西话、上海话、天津话、山东话、宁夏话、甘肃话等),同时支持多语种/跨语种零样本语音克隆。

  2. 内容一致性和自然性: 在内容一致性、说话人相似度和韵律自然性方面达到最先进的性能。

  3. 发音修复: 支持中文拼音和英文CMU音素的发音修复,提供更多可控性,因此适用于生产使用。

  4. 文本规范化: 支持读取数字、特殊符号和各种文本格式,无需传统的前端模块。

  5. 双向流处理: 支持文本输入流和音频输出流,并在保持高质量音频输出的同时实现低至150毫秒的延迟。

  6. 指令支持: 支持多种指令,如语言、方言、情感、速度、音量等。

CosyVoice整合包使用说明

首先到网盘内将压缩包下载到电脑上解压,然后双击运行【启动软件.bat】,稍等一会即可启动webUI界面。软件主要有下面4项功能:

0样本复刻

只需提供一段3秒的音频素材,即可克隆音色,并使用这个音色进行文字转语音操作。声音音色克隆效果非常好,非常逼真。

支持跨语种复刻。

指令控制

通过自然语言指令控制生成语音的风格、语种或语速。如生成各地方言,各种情绪等。

高级控制

直接构建完整的 Prompt 字符串。适用于:

  1. 插入 [breath], [laught], [noise] 等标签。

  2. 拼音修正 (Hotfix),如 [j][ǐ]。

  3. 日语合成(需输入片假名)。

所有功能都要依赖于音频样本,所以你首先需要先导入一个3-5秒的prompt音频文件和prompt文本。设置完成后可以点击下方生成音频按钮来合成语音,语音生成完成后可点击预览播放音频,也可以点击音频右侧的下载符号按钮下载音频结果。

注意事项

软件运行路径中不要有非英文字符及空格

未测试最低电脑配置要求,建议英伟达显卡显存4G以上用户使用

整合包只支持Windows 10或11系统

日语文本必须手动转换为片假名输入。

声音克隆及语音合成工具CosyVoice 3.0一键启动包下载地址

https://nuowa.net/1566