FunASR 本地转写快速上手:10 分钟从安装到出文本
FunASR 本地转写快速上手10 分钟从安装到出文本【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR会议录音、访谈录音你想把它们变成文字又不想让音频离开自己的机器。本文的 FunASR 本地转写全程在本地电脑完成不用云端 API key音频不出内网CPU 就能跑。跟着做10 分钟内你会拿到第一条可用的转写结果。️ 为什么要做本地转写FunASR 能给你什么FunASR 是达摩院开源的语音识别工具包工具包代码采用 MIT 协议模型权重单独授权。一句话概括它把 ASR、语音活动检测VAD、标点、说话人分离等模型放进同一条流水线让你按任务挑模型。相比之下Whisper 是单一模型云 ASR 则需要把音频传出去。本地做 FunASR 转写有三个理由数据留在本机。客服录音、访谈内容这类隐私场景正合适CPU 可用。README 的 Benchmark 表显示SenseVoice-Small 在 CPU 上跑约 17 倍实时速度装完即用。不需要容器不需要配置常驻服务与云端按量付费不同FunASR 本地部署的额外成本只有电费。下面先选模型数据取自 CLI 文档 的模型表模型CLI 别名语言速度适用场景sensevoice默认中/英/日/韩/粤约 70ms/10sCPU 友好带情感与音频事件标签paraformer中文混合约 60ms/10s中文生产场景带标点paraformer-en英文约 60ms/10s纯英文fun-asr-nano中/英/日方言随设备EncoderLLM复杂音频需 GPU 不确定选哪个先保持默认 sensevoice 跑通后面用--model切换。 本地安装 FunASR三步拿到可用环境第 1 步检查前置条件python --version预期结果版本号 ≥ 3.8。另外两个前提网络畅通模型默认从 ModelScope 下载首次运行会拉取约 234M 参数的模型GPU 可选CPU 足够跑通。第 2 步安装pip install torch torchaudio pip install funasr预期结果两条命令结尾均无报错第二条最后一行包含Successfully installed和 funasr 的版本号。第 3 步验证版本python -c import funasr; print(funasr.__version__)预期输出1.4.3当前仓库版本PyPI 更新后会更高。⚠️ torch 和 torchaudio 必须先于 funasr 安装且建议来自同一安装渠道版本错配是导入失败最常见的原因。 第一次转写一条命令拿到文本第 4 步准备音频手头没有音频文件时下载官方示例命令来自 READMEcurl -L https://isv-data.oss-cn-hangzhou.aliyuncs.com/ics/MaaS/ASR/test_audio/asr_example_zh.wav -o sample.wav预期结果当前目录出现sample.wav。第 5 步执行转写funasr sample.wav首次运行会下载 sensevoice 模型耗时几分钟随后终端打印一行转写文本欢迎大家来体验达摩院推出的语音识别模型看到这行字就成功了。默认输出为纯文本每个文件一行方便直接管道给其他命令。注意首次下载的模型会写入缓存再次运行只需数秒。这张图是一条funasr命令内部发生的事VAD 先切分语音声学模型解码标点模型补标点最后做文本规范化。生成字幕时 CLI 会自动请求句级时间戳和标点。️ 进阶调优CLI 参数速查与常用组合常用参数取自 CLI 文档 的选项表参数短参默认作用--model-msensevoice切换模型paraformer、paraformer-en、fun-asr-nano--hub-Hms模型来源msModelScope或 hfHugging Face--language-lautozh / en / ja / ko / yue / auto--deviceauto指定 cuda:0 或 cpu--output-format-ftexttext / json / srt / tsv--output-dir-ostdout输出文件写入指定目录--timestampsoff包含词级时间戳--spkoff启用说话人分离--hotwordsnone逗号分隔的热词三个值得记住的组合# 生成 SRT 字幕写入 subs 目录 funasr sample.wav --output-format srt --output-dir ./subs # 说话人分离 时间戳JSON 输出 funasr meeting.wav --spk --timestamps -f json # 中文生产paraformer 热词 funasr sample.wav --model paraformer --language zh --hotwords FunASR,达摩院预期结果subs目录生成.srt文件json 输出包含segments数组毫秒级起止时间热词能提升专有名词的召回率。 排障三个高频卡点排障指南 中最常卡住新手的三个问题均按现象 → 原因 → 解决给出问题 1安装后导入报错现象import funasr时抛出与 torch 相关的错误原因torch 装得晚于 funasr或 torch、torchaudio 来自不同渠道、版本错配解决按下面的顺序重装仍失败就新建虚拟环境重来python -m pip install -U torch torchaudio python -m pip install -U funasr问题 2模型下载慢或失败现象首次运行卡在下载进度条或连接中断原因默认源是 ModelScope部分网络环境访问困难中断的下载会留下不完整的缓存解决非大陆网络给命令加--hub hf换用 Hugging Face中断后清理该模型的部分缓存再重跑并确认能访问所选模型源问题 3指定了 GPU 却退回 CPU 或报错现象加了 cuda 参数仍跑 CPU或直接报 CUDA 错误原因PyTorch 装成了 CPU 版或驱动与 wheel 不匹配解决先执行python -c import torch; print(torch.cuda.is_available())打印 True 就加--device cudaFalse 则用--device cpu或安装与驱动匹配的 CUDA 版 wheel 你属于哪种场景对号入座继续走跑通第一条命令后按场景选入口一次性转写funasr audio.wav默认参数就够批量归档funasr *.wav --output-format srt --output-dir ./output常驻 HTTP 服务funasr-server暴露 OpenAI 兼容 API详见 部署矩阵不想敲命令行打开仓库自带的 Web 客户端直接上传文件转写卡住了先看 官方 FAQ再查 模型选型指南。版本展望v1.4.3 新增可选的 Silero VAD 适配器llama.cpp 运行时 v0.2.0 起 CLI 可直接写出 SRT 字幕。把第一条转写结果跑出来后面的一切调优才有对象。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考