使用 faster-whisper 提升 OpenAI 新一代语音识别模型的推理速度
AI日日新
编辑于 2023年12月03日 00:22

首先需要安装faster-whisper依赖包:

代码块
Python
自动换行
复制代码
!pip install faster-whisper
复制成功

接着下载一个中文音频用于测试模型效果:

代码块
Python
自动换行
复制代码
!wget -c https://paddlespeech.bj.bcebos.com/PaddleAudio/zh.wav
复制成功

然后我们就可以加载模型了,这里可以选择适合于你电脑的加载方式:

代码块
Python
自动换行
复制代码
from faster_whisper import WhisperModel

model_size = "large-v3"

# Run on GPU with FP16
# model = WhisperModel(model_size, device="cuda", compute_type="float16")

# or run on GPU with INT8
model = WhisperModel(model_size, device="cuda", compute_type="int8_float16")
# or run on CPU with INT8
# model = WhisperModel(model_size, device="cpu", compute_type="int8")
复制成功

最终我们就可以进行模型推理:

代码块
Python
自动换行
复制代码
segments, info = model.transcribe("zh.wav", beam_size=5)

print("Detected language '%s' with probability %f" % (info.language, info.language_probability))

for segment in segments:
    print("[%.2fs -> %.2fs] %s" % (segment.start, segment.end, segment.text))
复制成功

若你使用notebook环境,还可以在线运行下载的音频,方便对比:

代码块
Python
自动换行
复制代码
import IPython.display as display
display.Audio("zh.wav", autoplay=False)
复制成功