
更新时间:2025.06.27
禁止商用,本数据集以及使用本数据集训练出来的任何模型都不得用于任何商业行为,如要用于商业用途,请找数据列表内的所有厂商授权(笑),因违反开源协议而出现的任何问题都与本人无关!
训练出来的模型是否开源由训练者自主决定,是否在README内引用本数据集也由训练者自主决定,不做强制要求。
解压密码:9ll9Ke4iq0jqyq3gS1Wy。
标注说明:标注,说话人和对应的音频是直接读游戏引擎的脚本生成的,应该是100%准确率,全部存放在index.json里面,如果还有错误可以在开issues反馈(有些遗漏的控制符可能没洗干净)。 务必根据index.json里面的键值对找音频,不在index内的音频请直接丢弃,说话人为???的请直接丢弃。
数据语言:日语(100%)
数据时长:10588h 26m 22s
角色总数:30331人(未合并)
音频格式:ogg(7171015个),opus(135772个),wav(147501个)
原始:https://huggingface.co/datasets/OOPPEENN/56697375616C4E6F76656C5F44617461736574
命令:
huggingface-cli login
huggingface-cli download --repo-type dataset OOPPEENN/56697375616C4E6F76656C5F44617461736574 --local-dir VN_Dataset
不要用git直接拉仓库,git lfs会占用双倍空间!
直接看huggingface仓库吧,懒得再写一遍了(逃