从零搭建专属AI智能对话桌宠软件教程(一)
2026/8/22 8:20:58 网站建设 项目流程

基本思路:人声采集>语音监测>语音识别>大语言模型处理>语音合成>动态显示

【1】人声采集环节需要授权软件使用设备麦克风🎙权限,用于采集用户输出信息,那怎么判断用户是否输出信息、信息是否输出完整以及排除其他噪音干扰?这里需要用到VAD,也就是声音监测功能。

【2】语音监测(VAD)的主要作用是判断用户有没有说话、用户有没有讲完以及处理噪声污染等,让后续的语音识别更精准。

【3】语音识别(ASR)的功能是将用户输出的音频转换为文字。目前免费开源模型比较好的有很多,这里需要根据自己项目实际选择。

如果需要本地离线语音识别,则需要选择轻量的ASR模型,同时就需要牺牲识别速度以及准确率,选择高精准度本地离线语音识别模型的话就会导致桌宠软件包很大且对用户电脑性能要求要高。

我初始想法是桌宠软件应该是绿色轻量软件,便携可移动的,比如软件放在u盘里,随用随插,任意电脑都能呼唤出桌宠。而且语音识别开源模型这么多,直接搞一个离线的模型加载进软件内部,即免费🆓还有隐私性。

所以这里我一开始用了比较轻量的一款模型:whisper tiny,模型39M左右,很轻量适合添加进软件包,电脑运行桌宠软件也很快,且能实现简单的语音识别,语音转文字反馈也很快,但是准确率太低,测试软件功能还可以但是无法正常给用户使用;后来替换为whisper small,该模型244M,添加进软件后已经导致安装包接近300M了,运行效果对比tiny有了明显嗯识别准确率提升,但是输出延迟大,语音对话的低延迟要求无法满足,也不能作为最终选择!而且两个模型都是openAI开源的,对中文支持并不是很好,主要是英文识别准确率高。

此时我认为对于桌宠软件来说,将本地离线语音识别模型装进软件安装包并不是明智的选择,掉头转向实时在线语音识别思路,首选就是各大AI模型公司提供的语音识别接口调用,收费都挺贵。

不如自己搭建一个语音识别服务,用云服务器安装开源的语音识别模型(无需考虑轻量化,模型可选择面更广,不需要付费隐私性也有),我的云服务器性能并不高4核4G系统盘70G,一年才不到200米,虽然还跑着其他业务,但是空闲内存性能还有接近2G足够使用了。

通过前面ASR模型的对比,我主要按照国内开源、中文识别率高、模型体积中等这几个角度考虑,最后选择了SenseVoice-small模型,安装完成后增加了密钥鉴权功能,客户端调用语音服务时需提供API Key,防止被攻击后滥用服务(想蹭免费的语音识别服务的可私我要密钥进行测试)。

经实际测试发现,该方法延迟可以忽略不计,语音识别很准确,反馈输出也很快,能满足桌宠软件的正常使用。

【4】大语言模型(LLM),语音识别输出的文本信息发送给大语言模型,处理后输出文字信息。这里我采用的是Deepseek,如果你有本地部署大语言模型也可以用自己的大模型接口,这样就不用给桌宠花一分钱啦!

【5】语音合成(TTS)将大语言模型处理后反馈的文本信息合并成音频文件播放给用户听。

【6】数字人显示,驱动数字人肢体表情口型与音频文件内容表达的信息一致。

语音合成以及数字人显示这一块直接采用了魔珐星云提供的3D数字人功能,展示效果良好,端侧实时渲染高清低延迟,有多种人物形象选择,可以设置音色,语速,情绪等等功能,现在用邀请码【XDBAC5Q6KM】注册可以获得2200分钟的免费使用额度。

魔珐星云做的好的一点就是很简洁,而且接口代码适配非常友好,几乎不会出现无法调用情况,新手第一次直接就能上手。

首先创建应用后选择调用,查看调用示例代码,或者复制后喂给Agent让AI直接快速帮你搭建一个测试页面,很简单就能上手,基本不会出现问题。想动手尝试的可以看我的上一篇文章!

总结:语音识别部署在云服务器免费🆓,魔珐星云提供了大额免费测试时长=免费🆓,Deepseek已经全是最便宜的大模型了约等于免费🆓!

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询