首先需要安装faster-whisper依赖包:
!pip install faster-whisper 接着下载一个中文音频用于测试模型效果:
!wget -c https://paddlespeech.bj.bcebos.com/PaddleAudio/zh.wav 然后我们就可以加载模型了,这里可以选择适合于你电脑的加载方式:
from faster_whisper import WhisperModel
model_size = "large-v3"
# Run on GPU with FP16
# model = WhisperModel(model_size, device="cuda", compute_type="float16")
# or run on GPU with INT8
model = WhisperModel(model_size, device="cuda", compute_type="int8_float16")
# or run on CPU with INT8
# model = WhisperModel(model_size, device="cpu", compute_type="int8") 最终我们就可以进行模型推理:
segments, info = model.transcribe("zh.wav", beam_size=5)
print("Detected language '%s' with probability %f" % (info.language, info.language_probability))
for segment in segments:
print("[%.2fs -> %.2fs] %s" % (segment.start, segment.end, segment.text)) 若你使用notebook环境,还可以在线运行下载的音频,方便对比:
import IPython.display as display
display.Audio("zh.wav", autoplay=False)