【免责声明】本文仅用于 AI 语音技术交流学习与合规原创内容创作,严禁用于侵权、伪造他人声音、诈骗及不良导向内容生成,使用者自行承担相关合规责任与使用风险。

模型名解析:VoxCPM2.safetensors 是面壁智能联合 OpenBMB 开源社区、清华大学人机语音交互实验室发布的第二代语音基础模型。Vox 代表语音技术领域,CPM 为连续概率模型核心架构标识,2 为第二代迭代版本,safetensors 为防恶意代码的安全权重格式。
核心功能:
48kHz 影视级高保真音质
:输出 CD 级无损音频,保留丰富的声学细节与情感特征
3 秒零样本音色克隆
:仅需 3 秒清晰参考音频即可精准复刻任意人声
30 种语言 + 9 大方言支持
:原生覆盖中英日韩等主流语言及中国主要方言
超实时推理
:单卡生成速度达实时的 7 倍以上,支持流式输出
全功能集成
:单模型实现语音合成、音色克隆、情绪控制与音色设计
安装位置:
ComfyUI 平台需先安装 ComfyUI-VoxCPM 插件,GitHub 官方仓库(作者:wildminder):https://github.com/wildminder/ComfyUI-VoxCPM。将模型放入models/tts/VoxCPM2文件夹;其他 Python 环境放入项目根目录models/tts文件夹,通过官方推理代码加载调用。显存需求:FP8 量化版仅需2GB 显存即可流畅运行,BF16 全精度版需 4GB 显存,无独立显卡设备可使用 CPU 运行,生成速度略有下降。使用说明:本模型为独立语音基础模型,非 LoRA 微调模块,无需设置强度参数,支持 LoRA 音色微调。
插件推荐安装方法
通过 ComfyUI-Manager 一键安装:
打开 ComfyUI,点击右上角的「Manager」
选择「Install Custom Nodes」
搜索框输入 ComfyUI-VoxCPM
点击右侧「Install」按钮,等待安装完成
重启 ComfyUI 即可使用。
https://www.runninghub.cn/ai-detail/2046998156096839681
国内直连零门槛渠道(优先推荐,无需特殊网络)
https://pan.quark.cn/s/42994c0df601
https://huggingface.co/openbmb/VoxCPM2/tree/main
这款模型是目前开源领域效果最好的语音合成方案之一,在音质、自然度和多语言支持上远超同级别其他模型。它采用无分词器扩散自回归架构,无需复杂的语言标注,多语言混合文本也能流畅合成。特别适合自媒体配音、有声书制作、数字人语音合成、游戏角色配音等场景。使用时建议使用清晰无背景噪音的参考音频,可获得最佳的克隆效果。需严格遵守相关法律法规,严禁未经授权使用他人声音进行合成,坚守原创底线,尊重他人声音权。欢迎关注,在评论区留言交流使用技巧与创意应用经验,共同探讨 AI 语音技术的更多可能性。