告别手记时代:TMSpeech 给 Windows 装一台免费的离线实时语音转文字字幕机
2026/8/20 11:08:55 网站建设 项目流程

告别手记时代:TMSpeech 给 Windows 装一台免费的离线实时语音转文字字幕机

【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech

TMSpeech 是一款免费开源的 Windows 实时语音转文字工具:它能接住电脑里播放的任何声音——视频会议、网课、录播课、视频——并转成歌词一样的滚动字幕,识别全程在本地完成,离线可用,也不用担心语音数据被传到云端。

🎬 从一场"差点翻车"的会议说起

下午三点的项目例会,领导讲完第三页方案,突然停下来点名:"小李,刚才这个排期调整,你给大家复述一遍?"

我承认,那一刻我脑子里只有刚刚偷偷打开的购物页面。但奇怪的是,我并没有慌——因为屏幕角落有一行淡色字幕一直在滚动,那是 TMSpeech 把领导的话一句句打出来的结果。我瞄了两眼历史记录,三秒钟后把原话复述得七七八八,连领导都愣了一下。

TMSpeech 这个名字本身就来自"开会摸鱼"这个梗:你可以放心走神,因为总有人——不对,是有个开源工具——在帮你记下每一句话。

它到底能帮你做什么

往大了说,它像一位 24 小时待机的"隐形记录员":系统里播放的任何声音,它都能接住并转成文字;字幕窗口可随意拖动、缩放,置顶显示在最上层,像歌词一样逐行刷新;识别结果还会自动按日期归档到"我的文档/TMSpeechLogs"文件夹,随时回看、右键复制。

更妙的是,它通过 WASAPI 回环采集直接"录内音",就算你把系统音量拉到静音,字幕照样跟得上。加上所有识别都在本地进行,CPU 占用通常很温和,普通办公本也能轻松跑起来,是一台非常称职的 Windows 离线语音识别助手。

🚀 新手篇:4 步跑通你的第一行实时字幕

第一步:获取并启动软件

打开终端克隆仓库:git clone https://gitcode.com/gh_mirrors/tm/TMSpeech。如果你已经拿到发布包,直接解压、双击TMSpeech.exe即可,首次启动会自动生成默认配置,不用手动建任何文件。

第二步:装一个语言模型

识别之前得先给它一对"耳朵"——也就是语言模型。进入设置里的"资源"页,中文、英文、中英双语三种模型任选,点"安装"等待下载完成就行。这一步需要联网,装完之后日常使用就完全离线了。

📌 避坑小提示:换电脑或重装系统时,模型需要重新下载;建议记住模型安装目录,方便日后备份复用。

第三步:选好"耳朵"和"嘴巴"

"音频源"决定它听哪里:系统音频、麦克风,还是某个具体进程;"语音识别"决定用哪个引擎干活。新手直接保持默认的"系统音频 + SherpaOnnx 离线识别器"组合,最省心。

第四步:点下开始按钮

主界面左上角的播放键就是开关。识别开始后顶部会出现红色计时显示,字幕窗口实时刷新文字;点击历史记录图标,还能随时翻出刚才说过的每一句。

⚙️ 进阶篇:把字幕调教成你的专属工作流

三款识别器,按场景挑

识别器列表里一共有三张"嘴",参考下面的场景表,一分钟就能选好:

你的场景推荐组合一句话理由
日常办公、电脑配置一般SherpaOnnx 离线识别器对 CPU 友好,装上即用
游戏直播、追求响应速度Sherpa-Ncnn 离线识别器可走 GPU 加速,出字快
想接入自己的模型或脚本命令行识别器任何能输出文本的程序都能接

换个音频来源,换个玩法

想只记自己说话,把音频源切成"麦克风";想精准录制某个应用的声音,选"进程音频";回到开会场景再切回"系统音频"。这些切换在设置里完成,不需要重启软件。相关实现都在src/Plugins/TMSpeech.AudioSource.Windows/目录下,想深入研究可以翻一翻。

让字幕更像你想要的样子

"显示"设置里能调字号、字体、颜色、对齐方式,甚至字幕阴影——默认 48 号大字,投屏演示时尤其醒目。再配合"通知"设置里的敏感词提醒,一旦会议里出现你关注的词,系统就会弹通知提示你。

📌 避坑小提示:桌面应用有"锁定"按钮,开启后鼠标点不到字幕窗口;开会时建议先锁定,避免手滑点到其他功能按钮。

进阶彩蛋:命令行识别器

如果你手头有更好的模型或现成脚本,可以选"命令行识别器":TMSpeech 会启动你的子进程,把标准输出当字幕读。约定很简单——单个换行表示更新当前句,连续两个换行表示这句话说完了。示例脚本就在项目的external_recognizer/目录下,照着改就能接上你自己的引擎。

常见问题速查表

问题一句话解决
识别不准怎么办?换更大更合适的模型,并尽量在安静环境下使用
抓不到系统声音?系统音频通常开箱即用;若选的是混音设备,请先在系统声音设置里启用"立体声混音"
历史记录找不到了?去"我的文档/TMSpeechLogs"按日期查找;以管理员身份运行可避免目录访问受限
资源占用偏高?换 SherpaOnnx 引擎,或改用体积更小的模型

写在最后:它属于每一个认真生活的人

TMSpeech 是完全开源的,核心框架在src/TMSpeech.Core/,各种功能都以插件形式存在——你想加一个新的识别引擎、新的音频来源,或者只是顺手提交一个 bug 反馈,都可以参与进来。它最初不过是作者给自己"开会摸鱼"写的小工具,如今却成了不少人的会议助理、网课笔记搭档。

下一次,当你把字幕窗口拖到屏幕角落、看它一行行跟上说话的节奏时,或许也会想:技术服务普通人的一天,往往就是从这样一行字幕开始的。现在就下载试试吧——你踩过的坑、提过的建议,都会成为这个项目继续走下去的燃料。

【免费下载链接】TMSpeech腾讯会议摸鱼工具项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询