Windows离线语音转文字免费工具TMSpeech完整使用指南
Windows离线语音转文字免费工具TMSpeech完整使用指南【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeechTMSpeech 是一款运行在 Windows 上的免费开源离线语音转文字工具它会捕获电脑内部播放的声音把语音实时转换成中文文字字幕。整个过程完全在本地完成不需要联网装好后打开即可使用CPU 占用通常不到 5%。这篇文章按我自己的上手顺序记录从下载、配置到日常使用的完整过程也把识别引擎、语言模型、历史记录这些环节里大家常问的问题一并讲清楚。开会走神这件小事催生了这个项目先坦白一件事我开会时经常走神。倒不是态度不端正而是会议一长注意力难免会漂移。麻烦的是万一这时候突然被点名发言我连刚才讲到哪里都接不回来场面会有点尴尬。TMSpeech 这个名字就来源于这个场景它最初的定位是开会摸鱼工具。它能捕捉电脑正在播放的声音把语音实时转成文字并以类似歌词字幕的形式显示在屏幕上。这样哪怕走神了几分钟只要瞟一眼字幕就能把话题接回来。想更从容的话还能打开历史记录把之前几十分钟的识别内容翻出来慢慢看。当然会议记录只是它最典型的用法。看在线课程、看没有字幕的视频、跟着外文视频练听力它都能当做一个本地字幕生成器来用。它凭什么敢叫离线语音转文字市面上多数语音识别服务做法是把音频上传到云端转写完成后再把文字返回给你。TMSpeech 走的是另一条路它基于 sherpa-onnx 语音识别框架和模型做二次开发模型文件就放在本地音频采集、特征提取、识别计算全部在本机完成。由此带来的两点好处非常实际断网照常工作不依赖任何服务端也没有服务到期这类问题声音数据从头到尾不离开你的电脑适合会议纪要这类隐私敏感的内容换句话说它的隐私保障不靠什么承诺而是由架构决定的——你的声音根本没有被送出去过。我第一次拿到它解压、双击、打开TMSpeech 的安装非常简单没有安装向导也不需要注册账号。你可以用git clone https://gitcode.com/gh_mirrors/tm/TMSpeech拉取源码自行构建也可以直接下载 Release 里的压缩包解压后运行TMSpeech.exe。首次启动时程序会自动在系统目录下创建配置文件和日志目录之后基本不用再手动调整什么。如果哪天把配置改乱了Release 包里还附带一个重置配置的 bat 脚本运行一下就会清除现有配置让程序回到默认状态。对新手来说这个细节很让人安心至少不用担心调坏了怎么办。启动后你会看到一个简洁的主窗口顶部有控制录音开始的红色按钮、录音时长计时以及历史记录、设置等功能入口。界面没有复杂的层级属于打开就知道怎么用的类型。决定听到什么三种音频来源怎么选TMSpeech 把声音来源分成三类对应不同的使用场景这也是我第一次配置时花时间琢磨的地方。系统音频捕获电脑正在播放的全部声音适合会议软件、在线课程、视频播放这类场景。它的实现方式是 Windows 的 WASAPI CaptureLoopback也就是录内音只要软件在出声就能被取到。这里有个很实用的附带效果即使你把系统音量完全关闭识别依然可以正常进行因为它是直接从系统内部拿音频的。麦克风直接录制你的说话声适合语音笔记、口述草稿这类个人录音场景。进程音频只针对某一个指定应用程序的声音比如只想录某个播放器的声音其他应用一概忽略。多数人的第一选择都是系统音频因为它的覆盖面最广。只有当你想明确只录麦克风或某个特定程序时才需要切换到另外两种。识别引擎到底怎么选在设置里切到语音识别一栏就能看到识别器下拉列表。TMSpeech 内置了三类识别引擎定位差异比较明显选之前最好先想清楚自己的需求。Sherpa-Onnx 离线识别器默认选项为普通 CPU 用户做了优化装好模型即可使用是大多数人最省心的选择。Sherpa-Ncnn 离线识别器对识别速度有更高要求的用户可以试试它的速度和资源占用表现更激进。命令行识别器面向高级用户的开放接口。它启动一个外部子进程子进程的标准输出按约定格式输出识别文本标准错误输出写入日志文件。这意味着你几乎可以把任何能输出文字的识别程序接进来灵活度最高后面我会单独展开讲。如果你只是想老老实实把功能用起来保持默认的 Sherpa-Onnx 就够了。装一个语言模型识别才能开始识别引擎相当于发动机真正的知识来自语言模型。TMSpeech 在设置界面的资源标签页里集中管理模型安装模型由社区仓库提供。目前可以安装的模型包括中文模型、英文模型和中英双语模型都属于 Zipformer-transducer 系列。每一项旁边都有安装按钮点击后等待下载完成即可以中文模型为例体积大约在 300MB 级别。安装完成后对应条目会显示已安装状态之后就可以回到主界面开始识别了。开始识别之后字幕与历史记录点击开始识别电脑里的声音就会变成屏幕上的实时字幕。字幕显示在一个无边框的小窗口里可以随意拖动和调整大小右键可以修改字体、字号、颜色、透明度、阴影等样式。把它放到视频下方或会议窗口旁边基本不会遮挡内容。与此同时识别结果会按日期自动保存到我的文档下的TMSpeechLogs文件夹。开完一场会打开当天的记录文件稍作整理一份会议纪要就有了。历史记录界面还支持右键菜单或 Ctrl-C 复制方便摘出关键段落。它真的不占资源吗就我自己的体验来说在普通配置的笔记本上运行时CPU 占用很低。项目作者实测在 AMD 5800u 笔记本上CPU 占用不到 5%。识别链路基本是边说边出字的节奏没有明显的滞后感因为识别能力来自本地模型不依赖网络往返响应天然就快。使用中常见的几个问题用了一段时间我自己踩过坑也在社区里见过不少类似的提问挑几个典型的说一下。识别准确率不理想。先排查环境是不是环境音太吵、有没有多人同时说话、麦克风音量是否合适。再确认音频源是否选对。如果这些都正常那多半是模型与你的场景或口音不完全匹配可以换一个模型试试也可以去 sherpa-onnx 的预训练模型列表里找更适合的流式模型然后在设置里修改模型路径。录不到系统声音。这通常不是 TMSpeech 的问题而是 Windows 音频设备设置。需要进入声音控制面板的录制标签页启用立体声混音设备如果没显示右键空白处勾选显示禁用的设备再把它作为系统音频源使用。历史记录找不到。确认一下我的文档/TMSpeechLogs文件夹是否存在、有无写入权限。如果权限异常以管理员身份运行程序通常能解决。CPU 占用偏高。如果电脑配置一般可以考虑换用更省资源的 Sherpa-Onnx 识别器、选择轻量级的语言模型或者关掉实时标点这类附加处理能省下一部分开销。它是怎么做到这一切的插件化架构TMSpeech 的代码结构遵循核心框架 功能插件的思路。核心框架集中在src/TMSpeech.Core/负责插件管理、任务调度、配置管理、资源管理等通用能力具体功能放在src/Plugins/下比如音频源插件TMSpeech.AudioSource.Windows和各个识别器插件。每个插件目录里都有一个tmmodule.json描述文件程序启动时扫描plugins目录按描述加载对应的程序集。这套机制意味着想新增一个音频来源、识别引擎或翻译功能只需要写一个插件并实现相应接口比如IAudioSource、IRecognizer、ITranslator放进插件目录即可核心代码完全不用动。项目用 C# 与 .NET 编写界面基于 Avalonia结构清晰读起来不算费劲。音频从采集到出字的链路大致是这样的先用 WASAPI 低延迟采集音频经过环形缓冲区缓冲以避免数据丢失再做特征提取交给流式识别引擎边采边识别最后对识别文本做标点等后处理再上屏。整条链路都在本地完成这也是低延迟、低占用两个特性的来源。配置方面配置文件是 JSON 格式存放在%AppData%/TMSpeech/config.json。比较有意思的是它支持热重载——配置变更后程序会通过事件通知相关模块即时更新比如修改字幕样式后马上生效不需要重启程序。命令行识别器把任何识别程序接进来如果你对内置引擎不满意命令行识别器是扩展空间最大的一条路。它按这样的协议工作子进程的标准输出作为字幕文本输出以单换行\n结尾的行表示更新当前句子输出以多个换行\n\n结尾表示当前句子识别结束。子进程的标准错误输出写入日志文件方便排查问题。双方统一使用 UTF-8 编码。值得说明的是只有以多个换行结尾的行才会被存进历史记录临时结果允许被后续识别修正。也就是说模型可以一边出字一边纠正之前的结果最终留下的是一条稳定的完整句子。配合 Python 脚本可以很快搭一个外部识别的原型项目里的external_recognizer/目录就放了参考脚本。用的时候有几个细节要注意由于子进程是独立获取音频的在命令行识别器模式下设置里的音频源切换不会生效程序参数用空格分隔含空格的路径要用双引号转义如果指定的是 bat 批处理脚本记得在开头加隐藏命令回显结尾也不要写pause。如果你想参与进来TMSpeech 是开源项目参与方式很灵活。觉得哪里用得不顺手、想要新功能直接提 Issue 或发起讨论就行如果你熟悉 Windows 开发和 C#也可以直接提交 Pull Request代码都在src/目录下入口清晰容易找到下手的地方。识别准确率这类问题往往要靠更好的模型解决如果你发现了更优秀的开源模型也欢迎推荐给社区。写在最后从开会走神救星到本地字幕生成器TMSpeech 的定位其实很朴素把电脑里的声音变成你随时能翻回来看的文字。它免费、开源、离线运行装好后几分钟就能开始干活。如果你正好需要一款 Windows 下的离线语音转文字工具或者只是想让自己开会时走神得安心一点不妨下载试一下。【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考