AI语音生成的主流工具的评测
辉の帝
2026年07月09日 23:05
收录于文集
共14篇

目前已经完成测试的全部AI 语音工具。 1.实测下来小红书的Dot.tts情绪最像真人,不过需要大量抽卡情绪seed 2.Minimax-audio不好说是还原能力过强还是别的原因,参考音频对生成情绪影响极大,其他工具达不到这个程度,这属于双刃剑,对长文本情绪波动小的内容很友好,也适合精准还原具体某句话的情绪,但情绪变盘识别能力就有点死板了,要手动拆分。 另外可以对逐词逐字进行精准等待,也能对逐字逐词语速进行较为模糊的影响,这一点其他工具暂时还做不到。 3.indextts2.0在社区魔改的支持下综合潜力很强,能训练自己的专属模型,适合快速商业级别的开发,基于文本的情感向量微调比音频参考效果还要好,但无奈在语气语速的操控性上有所欠缺。Bilibili官方已经在几个月前预告了2.5的到来,相信届时会较大程度的提升可用性。 4.Fish audio S2目前应该是综合能力榜首,实测效果和Indextts2.0差不多,可控性的丰富程度目前是最高的,不过属于比较模糊的控制而且有时候不一定有效,可以和Indextts2.0还有dot.tts搭档。 5.RVC变声器可惜了,后继的GPT-Sovits毕竟也是个TTS,RVC如果能继续刚更新的话,是完全可以走出一种异于TTS的工作流的,毕竟找个声优来套模型怎么想也不会比文本的模糊控制强吧……RVC的情绪迁移是基于音素的,虽然训练笨重了一些,但只要模型涵盖的音域足够广,那理论上是能让人实时控制情绪生成文件的,如果继续发展这条路线,个人感觉将来时可以一个演员替代一群人的,理论上质量上限比TTS高。