【免责声明】本文仅用于 AI 语音技术交流学习与合规原创内容创作,严禁用于侵权、伪造他人声音、违法及不良导向内容生成,使用者自行承担相关合规责任与使用风险。

模型名解析:Qwen3-TTS-12Hz-1.7B-Base.safetensors 是阿里巴巴通义千问团队官方发布的第三代文本转语音基础模型。Qwen3 为千问 3 系列标识,TTS 代表文本转语音技术,12Hz 为每秒 12 个音频帧的生成帧率,1.7B 为核心参数量,Base 为通用基础版本,safetensors 为防恶意代码的安全权重格式。
核心功能:
12Hz 超实时生成
:生成速度远超实时,单卡每秒可生成 100 + 秒语音
多语言多音色支持
:原生支持中英日等 10 + 语言,内置 8 种基础音色
高自然度语音合成
:接近真人的语音质感,语调起伏自然无机械感
长文本稳定生成
:支持万字以上超长文本连续合成,无断句错误
跨平台轻量化部署
:适配 Windows、Linux、Mac 及各类边缘设备
安装位置:
ComfyUI 平台需先安装官方 Qwen-TTS 插件,将模型放入models/tts/Qwen3-TTS文件夹;其他 Python 环境放入项目根目录models/tts文件夹,通过官方推理代码直接加载。显存需求:FP8 量化版仅需2GB 显存即可流畅运行,BF16 版需 3.5GB 显存,无独立显卡设备可使用 CPU 运行,生成速度略有下降。使用说明:本模型为独立基础模型,非 LoRA 微调模块,无需设置强度参数。
https://www.runninghub.cn/ai-detail/2046971751761973249
国内直连零门槛渠道(优先推荐,无需特殊网络,满速下载)
https://pan.quark.cn/s/42994c0df601
https://huggingface.co/Qwen/Qwen3-TTS-1.7B-Base/tree/main
在功能方面,该模型具备强大的零样本(Zero-shot)语音克隆与高保真多语言合成能力,只需短短几秒的参考音频,即可精准复刻音色与情感。
这款基础版模型是目前性价比最高的开源 TTS 方案之一,在语音自然度和生成速度上实现了完美平衡。它无需复杂的环境配置,新手也能快速上手,特别适合自媒体配音、有声书制作、数字人语音合成等场景。使用时建议搭配官方推荐的采样参数,可获得最佳的语音效果。需严格遵守相关法律法规,严禁未经授权使用他人声音进行合成,坚守原创底线,合规使用模型。欢迎关注,在评论区留言交流使用技巧与音色定制经验,共同探讨 AI 语音技术的更多可能性。