语音合成新利器:Qwen3-TTS-1.7B Base 学习笔记
赖床的贾斯特
2026年04月23日 01:46
收录于文集
共52篇

【免责声明】本文仅用于 AI 语音技术交流学习与合规原创内容创作,严禁用于侵权、伪造他人声音、违法及不良导向内容生成,使用者自行承担相关合规责任与使用风险。

模型名解析:Qwen3-TTS-12Hz-1.7B-Base.safetensors 是阿里巴巴通义千问团队官方发布的第三代文本转语音基础模型。Qwen3 为千问 3 系列标识,TTS 代表文本转语音技术,12Hz 为每秒 12 个音频帧的生成帧率,1.7B 为核心参数量,Base 为通用基础版本,safetensors 为防恶意代码的安全权重格式。

核心功能

  • 12Hz 超实时生成

  • :生成速度远超实时,单卡每秒可生成 100 + 秒语音

  • 多语言多音色支持

  • :原生支持中英日等 10 + 语言,内置 8 种基础音色

  • 高自然度语音合成

  • :接近真人的语音质感,语调起伏自然无机械感

  • 长文本稳定生成

  • :支持万字以上超长文本连续合成,无断句错误

  • 跨平台轻量化部署

  • :适配 Windows、Linux、Mac 及各类边缘设备

安装位置

ComfyUI 平台需先安装官方 Qwen-TTS 插件,将模型放入models/tts/Qwen3-TTS文件夹;其他 Python 环境放入项目根目录models/tts文件夹,通过官方推理代码直接加载。显存需求:FP8 量化版仅需2GB 显存即可流畅运行,BF16 版需 3.5GB 显存,无独立显卡设备可使用 CPU 运行,生成速度略有下降。使用说明:本模型为独立基础模型,非 LoRA 微调模块,无需设置强度参数。

在线试用

https://www.runninghub.cn/ai-detail/2046971751761973249

模型下载地址

国内直连零门槛渠道(优先推荐,无需特殊网络,满速下载)

https://pan.quark.cn/s/42994c0df601

海外官方仓库下载地址

https://huggingface.co/Qwen/Qwen3-TTS-1.7B-Base/tree/main

在功能方面,该模型具备强大的零样本(Zero-shot)语音克隆与高保真多语言合成能力,只需短短几秒的参考音频,即可精准复刻音色与情感。

这款基础版模型是目前性价比最高的开源 TTS 方案之一,在语音自然度和生成速度上实现了完美平衡。它无需复杂的环境配置,新手也能快速上手,特别适合自媒体配音、有声书制作、数字人语音合成等场景。使用时建议搭配官方推荐的采样参数,可获得最佳的语音效果。需严格遵守相关法律法规,严禁未经授权使用他人声音进行合成,坚守原创底线,合规使用模型。欢迎关注,在评论区留言交流使用技巧与音色定制经验,共同探讨 AI 语音技术的更多可能性。