13 分钟音频 59 秒转完faster-whisper 快速上手与模型选型指南【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper一段 13 分钟的会议录音原版 Whisper 要转 2 分 23 秒faster-whisper 只需 59 秒显存从 4.7GB 降到 2.9GB。同一个 Whisper 模型同样的准确率速度最高快 4 倍。 一句话定位Whisper 的极速推理引擎faster-whisper 是 OpenAI Whisper 的 Python 重写版。它用 CTranslate2一个专门加速 Transformer 推理的 C 引擎替换了原版 PyTorch 推理路径识别逻辑不变只是跑得更快、更省内存。你不需要换模型也不需要重新训练装完直接替换原来的 Whisper 调用即可。 2 分钟跑通一条命令装完3 行代码出结果环境要求只有一条Python 3.9 或更高。不用装 FFmpeg音频解码由打包好的 PyAV 库完成。pip install faster-whisper装好后用下面 3 行代码转一段录音。compute_type控制精度有显卡选 float16没显卡选 int8from faster_whisper import WhisperModel model WhisperModel(medium, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})首次运行会自动下载模型权重之后走缓存。跑完你会看到逐句带时间戳的文本并打印检测到的语言例如Detected language zh with probability 0.96。⚙️ 4 个最影响体验的能力1. INT8 量化显存和内存近乎减半8 位量化是用更少的位数存储模型权重精度损失很小。加载时改一个参数即可model WhisperModel(large-v3, devicecuda, compute_typeint8_float16) # GPU model WhisperModel(small, devicecpu, compute_typeint8) # CPU实测 13 分钟音频GPU int8 用 59 秒、2.9GB 显存CPU int8 用 1 分 42 秒、1.5GB 内存原版要 6 分 58 秒。2. 字级时间戳定位到每个词做字幕、跟读、关键词高亮都要用。加一个参数segments, _ model.transcribe(audio.mp3, word_timestampsTrue)每个segment.words里都有单词级的起止秒数。3. VAD 静音过滤跳过没人说话的片段VAD语音活动检测先找出真正有人声的区间再送去识别。长录音里的大段静音、背景音乐直接被跳过省时间也少幻觉segments, _ model.transcribe(audio.mp3, vad_filterTrue)默认只剔除超过 2 秒的静音可用vad_parametersdict(min_silence_duration_ms500)收紧。4. 批量推理GPU 利用率拉满BatchedInferencePipeline把音频切片打包成批处理。官方数据里13 分钟音频从 1 分 03 秒压到 17 秒from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(turbo, devicecuda, compute_typefloat16) pipeline BatchedInferencePipeline(modelmodel) segments, _ pipeline.transcribe(audio.mp3, batch_size16)注意segments是生成器不遍历就不会真正开始转录。 场景走一遍10 分钟会议录音变带时间轴字幕输入meeting.mp310 分钟多人讨论含停顿和杂音。操作开启 VAD 过滤静音 字级时间戳segments, _ model.transcribe( meeting.mp3, vad_filterTrue, word_timestampsTrue ) with open(meeting.srt, w) as f: for i, seg in enumerate(segments, 1): fmt lambda t: f{int(t//3600):02d}:{int(t%3600//60):02d}:{int(t%60):02d},{int(t%1*1000):03d} f.write(f{i}\n{fmt(seg.start)} -- {fmt(seg.end)}\n{seg.text}\n\n)产出meeting.srt标准字幕文件可直接拖进播放器或剪映。因为开了 VAD静音段不会生成空字幕条每条都对应真实发言。 模型与配置怎么选对号入座表你的情况modeldevice / compute_type预期13 分钟音频有独显日常使用medium 或 large-v3cuda / float16约 1 分钟显存紧张8GB 内跑大模型large-v3cuda / int8_float1659 秒显存约 2.9GB只有 CPUsmallcpu / int81 分 42 秒内存约 1.5GB追求极速、GPU 显存够turbo / large-v3 批量推理cuda / float16batch_size1617~25 秒只要英文、精度优先distil-large-v3cuda / float16比 large 快数倍补充两点beam_size默认 5调到 1 更快但略降精度distil-large-v3建议显式指定languageen并加condition_on_previous_textFalse。️ 5 个最常踩的坑GPU 报错找不到 CUDA/cuDNNctranslate2 4.x 只支持 CUDA 12 cuDNN 9。只有 cuDNN 8 就pip install --force-reinstall ctranslate24.4.0CUDA 11 则降到 3.24.0。transcribe 调用后像卡住了返回的segments是生成器必须用for循环或list(segments)遍历才会真正执行。第一次运行特别慢在自动下载模型。把模型加载放在服务启动时预热后续调用才是极速状态。长音频出现重复、幻觉文字尝试condition_on_previous_textFalse或给initial_prompt提供主题提示专业术语可写进hotwords参数提命中率。装不上或依赖冲突确认 Python ≥ 3.9优先用干净的虚拟环境pip install faster-whisper避免和旧版 torch 环境混装。下一步装好faster-whisper后拿一段自己的录音跑一遍上面的 3 行代码。想深入看参数细节可以读 转录主逻辑 和 VAD 实现想复现速度数据仓库里带了 speed_benchmark.py。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考