Dolphin词级时间戳教程如何精准获取每个词的起止时间【免费下载链接】DolphinDolphin is a multilingual, multitask ASR model jointly trained by DataoceanAI and Tsinghua University.项目地址: https://gitcode.com/gh_mirrors/dolphin22/Dolphin做语音识别ASR时光拿到整句文本往往不够——字幕、剪辑、教学切片、会议纪要哪一个不需要知道每个词到底在哪个时间点说的Dolphin 词级时间戳功能正是为此而生它是 DataoceanAI 与清华大学联合训练的多语言多任务 ASR 模型支持 40 种东方语言和 22 种中文方言只需一个参数即可输出每个词的起止时间。本教程手把手带你从安装到实战快速上手 Dolphin 词级时间戳。上图是 Dolphin 的多任务数据格式模型既可以输出带时间戳begin time / end time的对齐转录也可以输出纯文本。词级时间戳就是左边这条绿色通道每个词都精确对应一段语音。什么是 Dolphin 词级时间戳传统 ASR 只给出一句话的起止时间而词级时间戳Word Timestamp把精度细化到每一个词。Dolphin 返回的结果是类似这样的结构{word: 今天, start: 0.42, end: 0.85}每个词都有独立的开始秒数与结束秒数单位精确到毫秒级保留 3 位小数。这意味着你可以直接用它做 逐字/逐词字幕karaoke 效果✂️ 自动剪辑按词定位说话人重点 语言教学中的单词发音定位准备工作两分钟安装环境Dolphin 需要 FFmpeg 将音频统一转为 WAV 格式先装上它# Ubuntu / Debian sudo apt update sudo apt install ffmpeg # macOS brew install ffmpeg然后安装 Dolphin 本体pip install -U dataoceanai-dolphin 提示词级时间戳依赖 torchaudio 的强制对齐功能如果安装时没有自动带上请执行pip install torchaudio补齐。最快方法命令行一行开启词级时间戳Dolphin 的命令行工具默认就开启了词级时间戳--word_timestamp默认值为 true直接执行dolphin audio.wav --word_timestamp true指定方言模型更精准例如中文普通话 中国地区dolphin audio.wav --model small.cn --lang_sym zh --region_sym CN --word_timestamp true运行结束后日志里会直接打印每个词的时间戳类似text: 今天天气真不错 Timestamp: [{word: 今天, start: 0.42, end: 0.85}, ...]相关参数定义可以在 dolphin/transcribe.py 中查看命令行入口封装在 dolphin/main.py。Python 调用获取结构化的起止时间数据如果你要做二次开发Python 接口更灵活。核心就两步加载模型 调用transcribe并传入word_timestampTrueimport dolphin from dolphin import transcribe model dolphin.load_model(small.cn, devicecuda) result transcribe(model, audio.wav, lang_symzh, region_symCN, word_timestampTrue) print(result.text) # 整句文本 print(result.word_timestamps) # 每个词的起止时间result.word_timestamps是一个列表每个元素都是{word: ..., start: ..., end: ...}字典。想逐词打印可以这样for item in result.word_timestamps: print(f{item[start]:.2f}s ~ {item[end]:.2f}s {item[word]})输出示例0.42s ~ 0.85s 今天 0.88s ~ 1.30s 天气 1.35s ~ 1.92s 真不错词级时间戳是如何算出来的理解原理能帮你更好地排查问题。Dolphin 的词级时间戳流程分三步源码见 dolphin/search.py 和 dolphin/model.pyCTC 对齐利用 torchaudio 的forced_align把识别出的词对齐到编码器的每一帧上帧转秒通过子采样率和帧移10ms/帧把帧序号换算成秒得到初步的起止时间边界精修过滤标点、合并 BPE 子词比如英文单词被拆成多个子词时自动合并为一个完整单词最终输出规整的word_timestamps。这也是为什么 Dolphin 时间戳能支持中文按字、英文按词的两种模式——分词器会智能判断。常见问题与提升精度的小技巧长音频怎么办Dolphin 会自动启用 VAD 分段处理transcribe_long每一段都会返回独立的词级时间戳还附带段落的start/end信息参见 dolphin/transcribe.py。识别结果不理想指定语言和地区能显著提升准确率例如中文用small.cnlang_symzhregion_symCN完整模型列表与语言支持见 dolphin/model_registry.py 和 languages.md。想用热词纠错结合 hotword 功能--hotword_list_path可以在不牺牲时间戳的前提下纠正专有名词。现在你已经掌握了 Dolphin 词级时间戳的核心用法一条命令开启、一个参数拿数据、三行代码读结果。无论是做字幕工具还是音频分析这个每个词的起止时间能力都能让你的产品立刻上一个台阶。快去试试吧【免费下载链接】DolphinDolphin is a multilingual, multitask ASR model jointly trained by DataoceanAI and Tsinghua University.项目地址: https://gitcode.com/gh_mirrors/dolphin22/Dolphin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考