
AI字幕打轴+机翻完全教程,未来人均字幕组(2024版)
——作者 音音
==============================================
事先声明,Whisper意义在于提取出音频里面的语言字幕,不在于替代繁琐打轴流程。
对于做双语字幕的人来说,完全是提高效率
对于纯打轴的人,想完全依靠ai是不可能的,做出来的字幕文件还要进行轴的调整。
对于不懂语言的人来说,就能解决不懂语言也能看生肉的问题,字幕只要能懂个大概也能猜出来是什么意思就行。
AI工具出现一直是辅助人类提高工作效率,而不是完全替代,请明确这一点
【如不认同观点可以不用看这篇教程,因为只会浪费你的时间】
===============================================
干货内容较多,多图教程。平台专栏的图片是被压缩过的,可能会存在看不清的情况。
具体图片看评论区的word版本,放大排版即可。
多段教程其实是单独分开独立的,已经用分割线具体区分好了,内容以分割线为准。
有具体问题不懂的可以加群,请看个人空间顶置动态。
相关的软件,翻译服务全部都是免费的,没有涉及到付费。
【总结部分】
我觉得最实用的功能就是FasterWhisper GUI里面的人声和BGM分离功能。因为直接提取人声音轨,对于用aegisub打轴的人来说,是完全地提高效率。我也是作为老字幕组打轴人员,没有bgm的干扰实在是太爽了
AI打轴功能目前只能说差强人意,但是也是到了能用的地步。就好像chatGPT问世一样,给全世界带来的惊艳,AI会一直发展下去,直到越来越好用的地步。现在AI时代进步发展太快,过几个月完全就变样了,锻炼出来的模型精度只会越来越高,越来越好用。
未来只需要一个人懂语言会点翻译,会最基本的aegisub调轴,预见未来人均字幕组
===============================================
2022年属于ai元年,openAI公布了chatGPT,当时真的让全世界眼前一亮。以前的ai都只是有问必答的程度,没想到这个大模型ai竟然能做到理解上下文,还能做到面面俱到的回答。从此之后,ai进入飞速发展的时代,可以说是一个月一个大版本更新。人在生活中也渐渐接触到更多的ai产品,各种功能的落地实用。最直接的体现就是手机厂商推出的系统和软件更新里面,融入了各种ai功能,比如小米,华为,oppo,vivo,等等。
今年是2024年,过了2年后的现在,能看到更多的ai产品落地。我也好久没有关注AI这方面,最近时间刚好有空可以去研究这些新技术。其中就刚好发现了,openAI的另一个语音识别模型产品—whisper。能识别多种语音,进行字幕输出的功能。
===============================================
Whisper 的官网是 OpenAI 的官方网站,
具体链接是:https://openai.com/research/whisper
Whisper提供了语音识别功能,之后发展了各种软件应用分支。
接下来由我一一来介绍吧。
WhisperDesktop
github.com/sakura6264/WhisperDesktop
建议这个用来识别音乐歌曲
FasterWhisper GUI
github.com/CheshireCC/faster-whisper-GUI
识别音乐歌曲效果太差,建议这个用来识别动漫,电影
这两个都是本地运行的Whisper语音大模型软件。因为是本地离线的缘故,所以会对硬件有一定的要求(简称硬件ai炼丹)。硬件不达标,强行跑只会卡死,就不推荐尝试了。
===============================================

本人的笔记本硬件配置参考,2060显卡老古董。目前40系显卡会更佳,因为40系显卡有对ai计算加速。
最关键的是显卡。N卡,有cuda计算效果会高很多。如果是A卡的话可以试一下。 其次是显存。。。运行语音识别的时候会瞬间把全部显存给占用满的,显卡进行高负载状态。显存小于6g的慎用(低于会卡死)。
===============================================
先介绍WhisperDesktop
Ai语音识别的初次体验
优点:对于显卡要求低,占用空间小,体积小
缺点:时间长的视频音频解析不了【只推荐解析5分钟歌曲,超过10分钟会解析失败】
网址地址
https://github.com/sakura6264/WhisperDesktop


按箭头提示下载即可

软件打开界面

如图修改一下gpu设置

点击如图的连接,跳转到model模型下载页面

Model模型需要下载bin格式的,如图圈起来了。
训练模型越大,语音识别效果更好
large为效果最好,体积大 tiny为最简模型,体积小
由于有墙的原因,提供普通模型网盘
https://pan.quark.cn/s/c896fb0de9b8#/list/share
目前最好的模型是ggml-large-v3,有意自己魔法下载(https://huggingface.co/ggerganov/whisper.cpp/tree/main)

加载下载好的模型,点OK

语言选择要识别的语言,我这里选择日语
以日语歌为例子

这里是选择输出格式,字幕文件选择srt格式


好了,得到ai打轴日文字幕文件了。
===========================================
接下来介绍另一款语言识别软件
FasterWhisper GUI
这款软件更加优秀,可以用来做电影字幕了。
优点:模型更加好,识别精度更高,功能更多,国人开发有中文 缺点:太迟硬件,模型和软件太大,过于占空间
网站地址
https://github.com/CheshireCC/faster-whisper-GUI

下载large-v3 model float32模型,作者也提供了百度云盘链接


下载exe安装包
下载ffmpeg,并安装【一定要安装,因为ffmpeg是图形界面库】
网站地址https://ffmpeg.org/download.html

【保姆级教程:0基础在Windows上安装Ffmpeg】 网页链接

把管理员身份勾上才能运行。
刚打开软件配置一下


如图配置,加载下载好的模型
如果模型加载失败,请调整计算精度。【因为精度太高爆显存了】
显卡显存越大,可以把精度调大。越往下的精度越大。当然精度越高要求算力越高。
============================================
【这一部请走完上一部,需要分离人声的音轨,这样才能提高识别的准确度,当然你也能用WhisperDesktop来识别字幕】
准备工作都做完了,接下来可以使用功能了。
先进行人声分离,设置一下输出音轨

依旧是以日文歌为例子,点击提取


修改一下识别音轨的语言


把分离出来的人声音轨进行识别



保存字幕文件,用aegisub调轴就选择ass
纯字幕文件就srt
=================================================
机翻篇【抵制机翻的话,不需要看以下内容】
上述解决了视频音轨字幕提取问题,那么我们拿到了这份字幕,就需要进行翻译的转化。
不懂翻译的人只能依靠机翻,现在的机翻水平也算是勉强能看吧,当然人工翻译的话质量会好很多,但是需要的是人力。
彩云小译
网站,https://fanyi.caiyunapp.com/
直接把srt字幕文件丢进去就能进行翻译,

下载即可得到机翻后的srt字幕文件。
沉浸式翻译插件
网站地址:https://immersivetranslate.com/zh-Hans/
能对srt文件进行直接翻译,再导出字幕文件,

=================================================

假如视频文件里面有内嵌字幕,就不需要用whisper提取了。
我们只需要提取出视频里面的字幕,就可以了。

具体方法:
用potplayer对视频进行加速处理,最好3倍~4倍速,
一直等到快播放完(在结束前暂停即可)
【一定不能直接跳到视频片尾,不然加载不到中间部分的内嵌字幕,一定要不跳过的播放一次】


如图把内嵌字幕提取出来。保存srt格式就可以了。
之后用上面的机翻方式,把生肉机翻即可。
======================================================
Potplayer的实时字幕翻译设置


由于国内墙的原因无法使用,国内推荐使用百度翻译。
服务是收费的,用插件接入key即可。我就不详细描述了。
具体教程
http://www.potplayercn.com/course/2971.html