Handy 免费离线语音转文本:4 档量化把识别模型压到 139MB
【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy
按下快捷键、开口说话,文字立刻出现在光标处——全程不碰网络。免费开源的离线语音转文本工具 Handy 能让普通电脑跑动语音识别,靠的就是量化:把模型原本的高精度浮点参数压成低比特整数存储,文件变小、推理(模型计算出声→文字的过程)更快。
离线模型为什么能这么小?
Handy 的模型目录里,几乎每个模型都提供 Q4_K_M、Q5_K_M、Q6_K、Q8_0 到 F16/F32 的多档量化版本。同样是 0.6B 参数的 Parakeet Unified EN,Q4_K_M 版只有 477MB,而全精度 F32 版要 2473MB。
| 模型 | 量化版体积 | 全精度 F32 | 缩小倍数 |
|---|---|---|---|
| Canary 180M Flash | 139MB(Q4_K_M) | 756MB | 约 5.4 倍 |
| Parakeet Unified EN 0.6B | 477MB(Q4_K_M) | 2473MB | 约 5.2 倍 |
| Whisper Medium | 504MB(Q4_K_M) | 3057MB | 约 6.1 倍 |
目录中共收录 69 个模型,默认档多为 Q8_0 或 Q5_K_M——在精度损失很小(Q8 通常保留绝大部分精度)的前提下,把体积压到全精度的 1/3 到 1/5。
量化后实际体验如何?
官方给出的数据:Parakeet V3 纯 CPU 运行,在中端硬件(i5)上达到约 5 倍实时速度,即转写 1 分钟语音只需约 12 秒。搭配 0.9.0 版引入的 transcribe.cpp 引擎后,流式模型可以边说边显示文字,转写完成得更快。
三步上手体验
- 从发布页下载应用安装;也可以克隆源码
git clone https://gitcode.com/GitHub_Trending/handy11/Handy后按 BUILD.md 自行编译 - 授予麦克风与辅助功能权限,在设置里把快捷键行为设为 Auto(长按录音,轻点一下开、再点一下停)
- 打开 Models 页面挑一个模型,量化版会自动下载;之后任意应用里按快捷键说话,文字直接粘进输入框
量化落在哪些源码里?
- src-tauri/src/managers/model.rs:模型下载、加载与引擎路由
- src-tauri/src/catalog/catalog.json:模型目录,记录每档量化的文件名、体积和 SHA-256 校验
- src-tauri/src/managers/gguf_meta.rs:只读 GGUF 文件头元数据,在下载前就判断模型能力
参与与反馈
项目按 MIT 协议开源。想换语言支持、调默认量化档或改进下载流程,都可以从 CONTRIBUTING.md 入手提 PR;遇到问题先翻 README.md 的 Troubleshooting 一节。
【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考