
头图截图自官网。
今天中午起床时发现推特突然被AI Kiritan刷屏了,然后研究了一下发生了啥之后就想简单写一下这篇文章。
本人使用方法是按照 http://amanokei.hatenablog.com/entry/2020/02/22/011737 教程来的,所以操作方法会与这篇文章相同。
NEUTRINO官网:https://n3utrino.work/
简单说的话,NEUTRINO就是AI帮你调音然后导出声音的这么一个软件。
A社SSS社(感谢评论纠正)前段时间放出了切蒲英的声音数据集(https://zunko.jp/kiridev/login.php)以供音声合成研究使用,这里NEUTRINO所使用的kiritan可能就是从这里取的声音。
此前有类似于Sinsy一类的工具也是与此类似的,但一般情况下Sinsy是用的各种比较普通的音高连接算法进行音符拼接,而NEUTRINO则是通过AI算法进行这一工作,也就是相当于咱们在Vocaloid里的调音工作啦。(NEUTRINO的另一个歌手謡子就是Sinsy歌手)
(其实依我的看法的话这个就有点像无法调节参数的SynthV一样……但这个是完全免费软件这样。)


上图为两个作品就是用NEUTRINO导出的作品了。
需要提醒的是,因为软件是将数据集进行AI学习后用学习结果进行调音的,所以调音效果很大程度上受到了这一数据集的影响(就像调音师有自己擅长的曲风一样)。
其中官网上标注切蒲英适合流行曲,谣子适合歌谣。选曲时如果反向选择歌手可能最终效果会非常差。
1.准备
首先要准备NEUTRINO软件与歌曲的MusicXML文件。
一般情况下是没有现成的MusicXML文件的,所以我们可以准备歌曲的ust文件,或者vsqx/vpr等文件转成ust文件。
vsqx转ust工具可以用UtaFormatix(http://akatsuki.sdercolin.com/utaformatix/)。

这个工具可以实现Vocaloid/Utau/Cevio工程的相互转换,非常强大。
由于需要调用utau插件所以需要utau(http://utau2008.xrea.jp/ ,这里提供的是日文原版的utau软件)。
ust转musicxml则可以使用"Sinsy辅助插件"(配布地址:sm21531107)。这个插件很有可能是只能用于日文版utau中用的(没试过中文环境运行utau)所以不保证这种方法可以在中文系统上进行。将解压后的插件文件夹复制到utau编辑器安装目录下的plugins文件夹里即可完成安装。

只要确定了下载文件的安全性,下到压缩包所做的第一件事永远是解压而不是双击进去运行什么东西。
我现在的电脑环境为Windows10 pro 64bit 日文系统(以下设置均为日文,如果有LE打开乱码的软件的话用下面这种设置是一定可以搞定乱码问题的,就是重新启动电脑需要点时间……)。可以保证在以下环境中必定可用,但不保证在此环境外是否可用。


非win10 pro系统这里是没法改的,pro系统可以加日文语言包

2.生成ust文件(已有ust文件则跳过这一步)
将已经填好歌词的vsqx/vpr文件拖到UtaFormatix中,然后点击utau图标。
歌词需要为假名形式。若你的vsqx文件歌词为罗马音,则需要在弹出的对话框按照截图顺序点击后点OK。随后UtaFormatix会将分好轨道的ust文件存到你随后指定的文件夹里。

3.ust转musicxml
打开这个ust文件,检查是否有需要改动的歌词。
在NEUTRINO中,「'」代表消除母音(例如すこし' 即可将shi音的i消掉只剩sh),「ー」则是延音记号。一个音符内尾部追加「っ」或者单独画一个っ音符可以添加促音(例如♪ず(z + u) ♪っ(u + cl) ♪と(t + o) → ♪ずっ(z + u + cl) ♪と(t + o))
然后Ctrl+A全选音符,运行下图插件即可生成musicxml工程。

4.用musicxml工程生成作品
解压下载到的NEUTRINO,将刚才生成的xml文件放到 解压目录/score/musicxml 文件夹里,并改一下文件名。(后缀最好跟其他文件一样改成musicxml)

右键-记事本打开解压目录下的Run.bat文件,将BASENAME改成文件名,ModelDir改成歌手名(KIRITAN或YOKO),保存后关闭。


然后双击Run.bat,即可运行NEUTRINO。(如果会用cmd的话可以在地址栏输入cmd回车,然后在cmd界面输入Run.bat回车。这样完成后不会关窗口,能看到完整log。)

窗口自动关闭一般就是成功导出了。生成的音频文件在 解压目录/output 文件夹下。

导出一首TV Size的歌大致需要五六分钟,正常长度的歌大概需要10分钟以上。电脑会很吵且黑框里没有动静都属于正常现象。
至此,NEUTRINO就运行完成了。之后就是大家所熟悉的修音混音视频发布流程了。
自己所导出的音频效果是这个样子的 https://vc.bilibili.com/video/2922342
步骤很繁杂,大多是这个软件只认MusicXML所造成的,前面麻烦的地方都是为了生成这个工程,后边费时间则是NEUTRINO导出费时了。官方所推荐的是用MuseScore这个打谱软件做MusicXML文件,另外cadencii或者Cevio等很多软件也支持导出MusicXML各位可以尝试下(感谢评论补充)。以后应该会有大佬给这个软件做UI界面的吧。
效果方面,说实话我觉得这声音一点儿都不像切蒲英(只试过切蒲英),完全没有小学生的感觉,反而更像CeVIO的莎莎拉一点儿……除了声线以外,在发音快的时候有种VEL拉低了的感觉,s音很明显。
找到这个编辑器对口的曲子还是很难的。试过3首歌其中一首出bug了另一首效果并不佳(可能是工程的问题)。建议导出了人声之后再用Vocalshifter一类的软件进行修整,官网也提供了用WaveSurfer修小节奏问题的方式(https://n3utrino.work/300/)。
个人还是更喜欢Voiceroid切一点……