最全AI字幕打轴+机翻完全教程,免费本地运行(2024版)
大萌音音
2024年11月13日 23:47

AI字幕打轴+机翻完全教程,未来人均字幕组(2024版)

——作者 音音

==============================================

事先声明,Whisper意义在于提取出音频里面的语言字幕,不在于替代繁琐打轴流程。

对于做双语字幕的人来说,完全是提高效率

对于纯打轴的人,想完全依靠ai是不可能的,做出来的字幕文件还要进行轴的调整。

对于不懂语言的人来说,就能解决不懂语言也能看生肉的问题,字幕只要能懂个大概也能猜出来是什么意思就行。

AI工具出现一直是辅助人类提高工作效率,而不是完全替代,请明确这一点

【如不认同观点可以不用看这篇教程,因为只会浪费你的时间】

===============================================

干货内容较多,多图教程。平台专栏的图片是被压缩过的,可能会存在看不清的情况。

具体图片看评论区的word版本,放大排版即可。

多段教程其实是单独分开独立的,已经用分割线具体区分好了,内容以分割线为准。

有具体问题不懂的可以加群,请看个人空间顶置动态。

相关的软件,翻译服务全部都是免费的,没有涉及到付费。

【总结部分】

我觉得最实用的功能就是FasterWhisper GUI里面的人声和BGM分离功能。因为直接提取人声音轨,对于用aegisub打轴的人来说,是完全地提高效率。我也是作为老字幕组打轴人员,没有bgm的干扰实在是太爽了

AI打轴功能目前只能说差强人意,但是也是到了能用的地步。就好像chatGPT问世一样,给全世界带来的惊艳,AI会一直发展下去,直到越来越好用的地步。现在AI时代进步发展太快,过几个月完全就变样了,锻炼出来的模型精度只会越来越高,越来越好用。

未来只需要一个人懂语言会点翻译,会最基本的aegisub调轴,预见未来人均字幕组

===============================================

2022年属于ai元年,openAI公布了chatGPT,当时真的让全世界眼前一亮。以前的ai都只是有问必答的程度,没想到这个大模型ai竟然能做到理解上下文,还能做到面面俱到的回答。从此之后,ai进入飞速发展的时代,可以说是一个月一个大版本更新。人在生活中也渐渐接触到更多的ai产品,各种功能的落地实用。最直接的体现就是手机厂商推出的系统和软件更新里面,融入了各种ai功能,比如小米,华为,oppo,vivo,等等。

今年是2024年,过了2年后的现在,能看到更多的ai产品落地。我也好久没有关注AI这方面,最近时间刚好有空可以去研究这些新技术。其中就刚好发现了,openAI的另一个语音识别模型产品—whisper。能识别多种语音,进行字幕输出的功能。

===============================================

Whisper 的官网是 OpenAI 的官方网站,

具体链接是:https://openai.com/research/whisper

 

Whisper提供了语音识别功能,之后发展了各种软件应用分支。

接下来由我一一来介绍吧。

WhisperDesktop

github.com/sakura6264/WhisperDesktop

建议这个用来识别音乐歌曲

 

FasterWhisper GUI

github.com/CheshireCC/faster-whisper-GUI

识别音乐歌曲效果太差,建议这个用来识别动漫,电影

 

这两个都是本地运行的Whisper语音大模型软件。因为是本地离线的缘故,所以会对硬件有一定的要求(简称硬件ai炼丹)。硬件不达标,强行跑只会卡死,就不推荐尝试了。

===============================================

本人的笔记本硬件配置参考,2060显卡老古董。目前40系显卡会更佳,因为40系显卡有对ai计算加速。

最关键的是显卡。N卡,有cuda计算效果会高很多。如果是A卡的话可以试一下。 其次是显存。。。运行语音识别的时候会瞬间把全部显存给占用满的,显卡进行高负载状态。显存小于6g的慎用(低于会卡死)。

===============================================

先介绍WhisperDesktop

 

Ai语音识别的初次体验

优点:对于显卡要求低,占用空间小,体积小

缺点:时间长的视频音频解析不了【只推荐解析5分钟歌曲,超过10分钟会解析失败】

 

网址地址

https://github.com/sakura6264/WhisperDesktop

按箭头提示下载即可

软件打开界面

如图修改一下gpu设置

点击如图的连接,跳转到model模型下载页面

Model模型需要下载bin格式的,如图圈起来了。

训练模型越大,语音识别效果更好

large为效果最好,体积大 tiny为最简模型,体积小

 

由于有墙的原因,提供普通模型网盘

https://pan.quark.cn/s/c896fb0de9b8#/list/share

 

目前最好的模型是ggml-large-v3,有意自己魔法下载(https://huggingface.co/ggerganov/whisper.cpp/tree/main)

加载下载好的模型,点OK

语言选择要识别的语言,我这里选择日语

以日语歌为例子

这里是选择输出格式,字幕文件选择srt格式

好了,得到ai打轴日文字幕文件了。

===========================================

接下来介绍另一款语言识别软件

FasterWhisper GUI

 

这款软件更加优秀,可以用来做电影字幕了。

优点:模型更加好,识别精度更高,功能更多,国人开发有中文 缺点:太迟硬件,模型和软件太大,过于占空间

 

网站地址

https://github.com/CheshireCC/faster-whisper-GUI

下载large-v3 model float32模型,作者也提供了百度云盘链接

下载exe安装包

 

下载ffmpeg,并安装【一定要安装,因为ffmpeg是图形界面库】

网站地址https://ffmpeg.org/download.html

【保姆级教程:0基础在Windows上安装Ffmpeg】 网页链接​

把管理员身份勾上才能运行。

刚打开软件配置一下

如图配置,加载下载好的模型

如果模型加载失败,请调整计算精度。【因为精度太高爆显存了】

显卡显存越大,可以把精度调大。越往下的精度越大。当然精度越高要求算力越高。

============================================

【这一部请走完上一部,需要分离人声的音轨,这样才能提高识别的准确度,当然你也能用WhisperDesktop来识别字幕】

准备工作都做完了,接下来可以使用功能了。

先进行人声分离,设置一下输出音轨

依旧是以日文歌为例子,点击提取

修改一下识别音轨的语言

把分离出来的人声音轨进行识别

保存字幕文件,用aegisub调轴就选择ass

纯字幕文件就srt

=================================================

机翻篇【抵制机翻的话,不需要看以下内容】

上述解决了视频音轨字幕提取问题,那么我们拿到了这份字幕,就需要进行翻译的转化。

 

不懂翻译的人只能依靠机翻,现在的机翻水平也算是勉强能看吧,当然人工翻译的话质量会好很多,但是需要的是人力。

 

彩云小译

网站,https://fanyi.caiyunapp.com/

直接把srt字幕文件丢进去就能进行翻译,

下载即可得到机翻后的srt字幕文件。

沉浸式翻译插件

网站地址:https://immersivetranslate.com/zh-Hans/

能对srt文件进行直接翻译,再导出字幕文件,

=================================================

假如视频文件里面有内嵌字幕,就不需要用whisper提取了。

我们只需要提取出视频里面的字幕,就可以了。

具体方法:

用potplayer对视频进行加速处理,最好3倍~4倍速,

一直等到快播放完(在结束前暂停即可)

【一定不能直接跳到视频片尾,不然加载不到中间部分的内嵌字幕,一定要不跳过的播放一次】

如图把内嵌字幕提取出来。保存srt格式就可以了。

 之后用上面的机翻方式,把生肉机翻即可。

======================================================

Potplayer的实时字幕翻译设置

由于国内墙的原因无法使用,国内推荐使用百度翻译。

服务是收费的,用插件接入key即可。我就不详细描述了。

 

具体教程

http://www.potplayercn.com/course/2971.html