
CosyVoice是一个非常强大的语音合成工具,提供文字转语音、声音克隆和情感语音合成控制功能。这是一个由阿里团队推出的应用,在声音克隆和语音合成软件中,算是比较不错的一款应用了。合成的语音非常的自然,不会像以前其它软件那么的僵硬。当前最新版本为3.0版,我基于最新版制作了免安装一键启动整合包。

Fun-CosyVoice 3.0 是一个基于大型语言模型 (LLM) 的高级文本转语音 (TTS) 系统,在内容一致性、说话人相似度和韵律自然性方面超越了其前身 (CosyVoice 2.0)。它旨在实现零样本多语种野外语音合成。
语言覆盖范围: 涵盖9种常用语言(中文、英语、日语、韩语、德语、西班牙语、法语、意大利语、俄语),18种以上的中文方言/口音(广东话、闽南话、四川话、东北话、陕西话、山西话、上海话、天津话、山东话、宁夏话、甘肃话等),同时支持多语种/跨语种零样本语音克隆。
内容一致性和自然性: 在内容一致性、说话人相似度和韵律自然性方面达到最先进的性能。
发音修复: 支持中文拼音和英文CMU音素的发音修复,提供更多可控性,因此适用于生产使用。
文本规范化: 支持读取数字、特殊符号和各种文本格式,无需传统的前端模块。
双向流处理: 支持文本输入流和音频输出流,并在保持高质量音频输出的同时实现低至150毫秒的延迟。
指令支持: 支持多种指令,如语言、方言、情感、速度、音量等。
首先到网盘内将压缩包下载到电脑上解压,然后双击运行【启动软件.bat】,稍等一会即可启动webUI界面。软件主要有下面4项功能:
0样本复刻
只需提供一段3秒的音频素材,即可克隆音色,并使用这个音色进行文字转语音操作。声音音色克隆效果非常好,非常逼真。
支持跨语种复刻。
指令控制
通过自然语言指令控制生成语音的风格、语种或语速。如生成各地方言,各种情绪等。
高级控制
直接构建完整的 Prompt 字符串。适用于:
插入 [breath], [laught], [noise] 等标签。
拼音修正 (Hotfix),如 [j][ǐ]。
日语合成(需输入片假名)。
所有功能都要依赖于音频样本,所以你首先需要先导入一个3-5秒的prompt音频文件和prompt文本。设置完成后可以点击下方生成音频按钮来合成语音,语音生成完成后可点击预览播放音频,也可以点击音频右侧的下载符号按钮下载音频结果。
软件运行路径中不要有非英文字符及空格
未测试最低电脑配置要求,建议英伟达显卡显存4G以上用户使用
整合包只支持Windows 10或11系统
日语文本必须手动转换为片假名输入。
https://nuowa.net/1566