TMSpeech 离线语音转文字完整指南3 分钟把电脑声音变成实时字幕【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeechTMSpeech 是一款免费、开源的 Windows 离线语音转文字工具。它通过 WASAPI 抓取电脑正在播放的内音调用本地模型完成识别把语音实时变成屏幕上的中文字幕——声音不上传、不依赖网络断网也能用。适合需要会议录音转文字、看网课补字幕以及想给无字幕视频配上本地字幕的 Windows 用户。三个场景为什么你需要一个离线字幕生成器开会走神被点名时接不上话。注意力飘了几分钟突然被要求发言场面多少有点尴尬——TMSpeech 这个名字就诞生于此。它把会议软件里说出的话转成字幕挂在屏幕上瞟一眼就能找回话题走神更安心。会议录音转文字省掉整理纪要的时间。识别结果默认按日期自动存入我的文档下的TMSpeechLogs文件夹散会后打开当天的文件稍加润色就是会议纪要初稿。网课和外语视频没有字幕。把它当成本地字幕生成器跟着文字练听力也很顺手。有个实用细节由于音频是从系统内部采集的把系统音量调成静音也不影响识别深夜学习不扰民。⚡ 五步快速上手第一次出字获取软件从 Release 页下载最新压缩包解压后直接运行TMSpeech.exe没有安装向导也不用注册账号想自己构建源码也可以执行git clone https://gitcode.com/gh_mirrors/tm/TMSpeech。首次启动程序会自动在系统目录创建配置文件和日志目录基本不用手动调整。选音频源默认系统音频会捕获电脑播放的全部声音多数人无需改动。装模型进入设置页的资源标签找到中文模型点安装等待下载完成约 300MB 体积条目显示已安装即可。开始识别点主窗口的红色开始按钮声音开始变成文字。界面几乎没有层级一个红色开始按钮加计时器旁边是历史记录、设置等入口字幕显示在下方。核心设置音频来源、识别引擎与语言模型音频来源三种声音三种取法设置在音频源一栏可切换三种来源系统音频基于 WASAPI CaptureLoopback 录内音能拿到会议软件、网课、视频播放等所有系统播放的声音且系统静音时依旧可用。覆盖面最广只选一种就选它。麦克风直接采集你的说话声适合语音笔记、口述草稿这类个人录音。进程音频只锁定某一个指定应用的声音其他程序一概忽略。只想录某个播放器或某个窗口时用它。识别引擎三选一看你的需求语音识别一栏的下拉列表提供三种引擎Sherpa-Onnx 离线识别器默认面向普通 CPU 优化装好模型即可跑是大多数人的省心选择。Sherpa-Ncnn 离线识别器可调用 GPUVulkan加速速度和资源占用策略更激进追求低延迟且显卡允许时值得试试。命令行识别器给高级用户留的开放接口TMSpeech 启动一个外部子进程把它的标准输出当字幕文本、标准错误写入日志文件。凡是能输出文字的识别程序基本都能接进来协议细节见进阶功能。语言模型中文、英文、双语都有识别引擎决定怎么算语言模型决定会说什么。设置页的资源标签集中管理模型安装模型来自社区仓库目前可安装的是 Zipformer-transducer 系列中文模型、英文模型、中英双语模型每项旁边都有安装按钮。以中文模型为例体积约 300MB 级别下载完成后条目变为已安装。如果内置模型与你的口音、场景不合还可以从 sherpa-onnx 的预训练流式模型列表里另选一个再在设置中修改模型路径。进阶功能历史记录、字幕样式与自带识别器历史记录记录页按时间戳列出识别结果支持右键菜单或 Ctrl-C 复制摘取关键段落很方便完整文本同时按日期落盘到我的文档/TMSpeechLogs。字幕样式字幕显示在无边框小窗口里可任意拖动、调整大小放到视频下方或会议窗口旁都不遮挡右键可修改字体、字号、颜色、透明度和阴影。命令行识别器协议想把识别程序自己接进来双方约定很简单——子进程标准输出即字幕以单换行\n结尾表示更新当前句子以多换行\n\n结尾表示本句识别结束标准错误输出写入日志文件方便排查统一使用 UTF-8 编码。输出格式示意一二 一二三四 一二三四五六七 七六两个细节要注意只有多换行结尾的行才会写入历史记录临时结果允许被后续识别修正最终留下的是一条稳定的完整句子此外该模式下由子进程自行获取音频设置里的音频源切换不会生效。参数用空格分隔含空格的路径需加双引号若指定.bat脚本开头加隐藏命令回显结尾不要写pause。仓库的 external_recognizer/ 目录提供了 Python 参考脚本可先跑通原型再替换自己的模型。遇到问题看这里五个高频问题1. 识别准确率不理想现象错字多、断句乱。常见原因环境音嘈杂、多人同时说话、麦克风音量不当或模型与场景、口音不匹配。解决先排查环境和音频源确认无误就换模型或从 sherpa-onnx 预训练流式模型列表挑选更合适的并在设置里修改模型路径。2. 系统声音录不到现象点击识别后长时间不出字。常见原因多为 Windows 音频设备设置问题内录设备未启用并非程序本身故障。解决打开声音控制面板的录制标签启用立体声混音未显示时右键空白处勾选显示禁用的设备再将其作为内音采集设备使用。3. 历史记录找不到现象识别结束后翻不到记录文件。常见原因TMSpeechLogs文件夹不存在或无写入权限。解决检查我的文档/TMSpeechLogs路径与权限权限异常时以管理员身份运行程序通常可解决。4. CPU 占用偏高现象配置一般的笔记本上风扇明显变响。常见原因引擎与模型偏重叠加实时标点等附加处理。解决换用更省资源的 Sherpa-Onnx 识别器、选择轻量模型或关闭实时标点。参考数据作者实测 AMD 5800u 笔记本上 CPU 占用不到 5%。5. 配置改乱想恢复现象调过若干参数后行为怪异。常见原因手工修改的配置项互相冲突。解决运行 Release 包附带的重置配置 bat 脚本它会清除现有配置让程序回到默认状态。原理深潜为什么它快、省、还能扩展TMSpeech 的代码是核心框架 功能插件结构核心框架src/TMSpeech.Core/负责插件管理、任务调度、配置与资源管理具体功能都是 src/Plugins/ 下的插件每个插件目录带一个tmmodule.json描述文件。启动时程序扫描 plugins 目录按描述加载程序集——好比机箱与扩展卡的关系新增音频源或引擎只需实现对应接口如 IAudioSource、IRecognizer、ITranslator核心代码不用动一行。音频链路是WASAPI 低延迟采集 → 环形缓冲区避免丢数据 → 特征提取 → 流式引擎边采边识别 → 标点等后处理 → 上屏。整条链路留在本机低延迟与低占用正源于此。配置文件为 JSON存放在%AppData%/TMSpeech/config.json并支持热重载改完字幕样式即时生效无需重启。完整交互流程可查阅 docs/Process.md。适合谁以及下一步一句话定位把电脑里的声音变成你随时能翻回来看的文字。免费、开源、离线解压即跑。需要会议纪要或想让走神更安心下载压缩包即可开始想接入自己的识别程序命令行识别器与 external_recognizer 示例脚本已经备好发现更好的开源模型或想贡献功能提 Issue、发 PR 都是最快的参与方式。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考