faster-whisper 语音转文字完整指南三步跑通转写GPU 加速按需开启【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 是基于 CTranslate2 重构的 Whisper 语音转文字方案同等准确率下比原版快最高 4 倍显存与内存占用更低。本文带你三步跑通第一条转写并讲清 GPU 加速的配置方法。 转写变慢、硬件吃紧时换个推理引擎试试用原版 openai/whisper 转一段 30 分钟的讲座录音你会看到进度条爬得很慢、内存占用居高不下音频文件一多队列越排越长。如果你的部署机器资源有限瓶颈往往不在模型本身而在推理引擎——faster-whisper 用 Transformer 推理引擎 CTranslate2 重写了同一套 Whisper 模型在同等准确率下速度最高提升 4 倍配合 int8 八位量化CPU 和 GPU 的内存占用还能再降一截。先跑起来再说安装只有一条命令。 三步安装 faster-whisper 并跑通第一条转写第一步安装。要求 Python 3.9 及以上不用提前装 FFmpegpip install faster-whisper第二步加载模型第三步循环输出结果这两步写在同一个脚本里from faster_whisper import WhisperModel model WhisperModel(base) segments, info model.transcribe(audio.mp3) for segment in segments: print([%.2fs - %.2fs] %s % (segment.start, segment.end, segment.text))注意segments是生成器循环遍历或list(segments)时转写才真正开始执行只调用transcribe而不遍历什么都不会发生。跑通之后如果你有 NVIDIA 显卡可以看看怎么让它再快一些。⚡ GPU 加速配置与 CUDA 12、cuDNN 9 兼容性按需选读启用 GPU 只需在加载模型时指定devicecudacompute_type可选float16精度优先或int8_float16省显存纯 CPU 场景则用int8。前提是系统里有 cuBLASCUDA 12 版和 cuDNN 9Linux 上可以用pip install nvidia-cublas-cu12 nvidia-cudnn-cu129.*一次装好但启动 Python 前需要先export LD_LIBRARY_PATH指向这两个库的 lib 目录。**注意**最新版ctranslate2仅支持 CUDA 12 cuDNN 9。环境是 CUDA 11 cuDNN 8 时降级执行pip install --force-reinstall ctranslate23.24.0CUDA 12 cuDNN 8 则降级到ctranslate24.4.0。速度之外这个库能做的事情也值得花两分钟过一遍。️ 能力速览转录、翻译、批量与时间戳语音转录默认能力自动检测语种info.language会给出识别结果和概率。语音翻译指定tasktranslate把非英语音频直接译成英文文本。批量推理BatchedInferencePipeline可直接替代普通transcribe官方基准里 large-v2 模型转写 13 分钟音频GPU 上batch_size8时约 17 秒完成。时间戳默认输出每段起止时间加word_timestampsTrue可细化到单词。关键片段放在一起segments, _ model.transcribe(audio.mp3, tasktranslate) # 翻译 segments, _ model.transcribe(audio.mp3, word_timestampsTrue) # 单词级时间戳 from faster_whisper import BatchedInferencePipeline # 批量推理 seg, _ BatchedInferencePipeline(model).transcribe(audio.mp3, batch_size8)功能讲完提前说说新手最常踩的三处坑。️ 避坑指南三个新手问题和对应解法调了 transcribe() 却没有任何输出就是上面提过的生成器机制用list(segments)收集结果或写 for 循环消费即可别只调用不遍历。开 GPU 后提示找不到 cuDNN / cuBLAS九成是版本不匹配。核对驱动对应的 CUDA 版本与 ctranslate2 版本——新版只认 CUDA 12 cuDNN 9旧环境先按上一节的降级方案处理再重试。担心要先装 FFmpeg 才能解码音频不用。音频解码由 PyAV 完成FFmpeg 库已随 pip 包自带装完包就能直接读 mp3、flac、wav。最后指个路文档、贡献入口和核心代码都在这几处。 文档、贡献与许可证项目采用 MIT 许可证。想参与贡献的话看 CONTRIBUTING.md按里面说明克隆仓库后执行pip install -e .[dev]即可进入开发模式提交前用pytest tests/自检。读源码建议从核心转录逻辑 faster_whisper/transcribe.py 入手音频解码实现在 faster_whisper/audio.py。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考