适合本地 TTS 创作、角色语音模拟、二创配音)
随着 IndexTTS2 的开源,越来越多人开始在本地尝试情感 TTS、角色语音克隆和多语言演绎。在众多社区贡献中,由 Jmica 训练的日语权重模型 是目前质量最稳定、可玩性最高、最适合二创的日语模型之一。
为了帮助后来者更快上手,本文整理了:
✔ 模型简介
✔ 权重目录结构
✔ 实际使用效果
✔ 我们遇到的所有问题与解决方法
✔ 权重文件改名的关键性说明
✔ UI 配置建议
✔ 许可证说明
✔ 使用须知
你可以直接收藏 / 转发给朋友一起玩。
模型名称: IndexTTS-2-Japanese
作者: Jmica
模型地址:
👉 https://huggingface.co/Jmica/IndexTTS-2-Japanese
这个模型提供了 完整的日语能力,对比原版中文/英文权重,在日语发音上更自然、更稳定。
模型特点
✔ 日语自然度高(几乎无“鸟语”问题)
✔ 支持 IndexTTS2 的完整情感系统(emo_audio / emo_vec / emo_text)
✔ 可一键替换官方权重目录直接使用
✔ 本地运行,不依赖在线服务
✔ 适合角色配音、二创台词、剧情演绎
checkpoints-ja/ 目录应该包含:
checkpoints-ja/│ ├── gpt.pth <- ★ 日语主模型(必须改名) ├── s2mel.pth <- 声学模型 ├── bpe.model <- tokenizer ├── japanese_bpe.model <-(视模型提供情况) ├── config.yaml ├── wav2vec2bert_stats.pt ├── emo_matrix.pt <-(从官方模型复制) ├── feat1.pt <-(从官方模型复制) ├── feat2.pt <-(从官方模型复制) └── ... 这套文件齐全后,才能保证 IndexTTS2 日语正常工作。
启动命令:
uv run webui.py --model_dir ./checkpoints-ja --fp16
如果使用 Python 直接跑:
python webui.py --model_dir ./checkpoints-ja --fp16
本章节非常关键,是我实际踩过的坑,你可以直接参考。
旧命令:
huggingface-cli download ...
会报错无法下载。
✅ 正确命令:
hf download Jmica/IndexTTS-2-Japanese --local-dir ./checkpoints-ja
如果不想用软链接:
hf download Jmica/IndexTTS-2-Japanese --local-dir ./checkpoints-ja --no-symlinks
错误内容:
huggingface-hub>=0.34.0,<1.0 is requiredfound huggingface-hub==1.1.4
✅ 解决方法:
pip install huggingface-hub==0.39.0 pip install transformers==4.40.0 与 IndexTTS2 完美兼容。
错误示例:
FileNotFoundError: './checkpoints-ja/feat1.pt'
原因
社区版日语模型 不包含 官方模型的额外特征矩阵。
✅ 解决方案
从官方模型目录 checkpoints/ 中复制以下文件到 checkpoints-ja/:
feat1.pt feat2.pt emo_matrix.pt wav2vec2bert_stats.pt 复制即可,无需改动。
表现:
输入中文 → 输出奇怪的日语
输入日语 → 输出乱码
原因
模型加载到 错误的 gpt.pth(可能加载到了官方中文/英文模型)。
✔ 真正关键点:权重文件名必须改成官方格式!!!
Jmica 的模型默认名称类似:
model_jp_163000.pth model_step36000.pth
但 IndexTTS2 强制读取:
gpt.pth
如果你不改名:
IndexTTS2 会加载不到主模型
然后 fallback 回官方模型
🔥 导致:你输入什么语言,它都输出奇怪的音(鸟语)
❗ 正确做法:
将主模型改名为:
gpt.pth
只保留一个主模型文件,多余的移到备份目录。
例如:
--local-dir-use-symlinks
PowerShell 不认。
✅ 用法:
--local-dir ./checkpoints-ja
简单稳定。
这是文本情感模块额外加载的,但不影响生成。
解决方法
只要你的日语模型能正常加载 gpt.pth / s2mel.pth,其他模块报 Warning 不用管。
1. 输入尽量使用纯日文
不要混写中文,否则会影响分词。
2. 推荐情绪权重(emo_weight)
情绪emo_weight温柔哭腔0.55 ~ 0.75平静温柔0.35 ~ 0.45激烈哭泣0.75 ~ 0.9
3. emo_audio 效果最好
提供角色原版语气 → 模型会更自然。
4. UI 中开启 FP16
你N卡 → 性能提升显著
Apache 2.0 License(可商用)
官方仓库:
https://github.com/IndexTeam/IndexTTS
截至目前 未标明具体许可证
按照社区惯例,建议如下:
✔ 可做:
个人使用
非商业创作
二创视频
教学 / 研究
⚠ 需联系作者获得授权:
商业用途
收费项目
有收益的视频、游戏、广告等
作者主页:
👉 https://huggingface.co/Jmica
❌ 不可做:
冒充声优本人
用于违法或欺骗
侵犯第三方版权(如克隆声优并商用)
感谢 Jmica 训练并分享了这份日语模型,为 IndexTTS2 社区带来了非常重要的新语言支持。
如果你觉得模型好用,可以去作者主页点个 ⭐ 支持:
👉 https://huggingface.co/Jmica
IndexTTS2 的生态正在飞速成长,社区模型更是让它拥有无限可能。
通过这篇文章,你应该能顺利完成:
日语模型下载
权重目录配置
常见错误修复
情感语音生成
模型优化使用
如果本文对你有帮助,欢迎关注、点赞、收藏,也欢迎转发给需要的人。
一起让本地 TTS 变得更强、更有趣!