从零搭建专属AI智能对话桌宠软件教程(一)
基本思路人声采集语音监测语音识别大语言模型处理语音合成动态显示【1】人声采集环节需要授权软件使用设备麦克风权限用于采集用户输出信息那怎么判断用户是否输出信息、信息是否输出完整以及排除其他噪音干扰这里需要用到VAD也就是声音监测功能。【2】语音监测(VAD)的主要作用是判断用户有没有说话、用户有没有讲完以及处理噪声污染等让后续的语音识别更精准。【3】语音识别(ASR)的功能是将用户输出的音频转换为文字。目前免费开源模型比较好的有很多这里需要根据自己项目实际选择。如果需要本地离线语音识别则需要选择轻量的ASR模型同时就需要牺牲识别速度以及准确率选择高精准度本地离线语音识别模型的话就会导致桌宠软件包很大且对用户电脑性能要求要高。我初始想法是桌宠软件应该是绿色轻量软件便携可移动的比如软件放在u盘里随用随插任意电脑都能呼唤出桌宠。而且语音识别开源模型这么多直接搞一个离线的模型加载进软件内部即免费还有隐私性。所以这里我一开始用了比较轻量的一款模型whisper tiny模型39M左右很轻量适合添加进软件包电脑运行桌宠软件也很快且能实现简单的语音识别语音转文字反馈也很快但是准确率太低测试软件功能还可以但是无法正常给用户使用后来替换为whisper small该模型244M添加进软件后已经导致安装包接近300M了运行效果对比tiny有了明显嗯识别准确率提升但是输出延迟大语音对话的低延迟要求无法满足也不能作为最终选择而且两个模型都是openAI开源的对中文支持并不是很好主要是英文识别准确率高。此时我认为对于桌宠软件来说将本地离线语音识别模型装进软件安装包并不是明智的选择掉头转向实时在线语音识别思路首选就是各大AI模型公司提供的语音识别接口调用收费都挺贵。不如自己搭建一个语音识别服务用云服务器安装开源的语音识别模型(无需考虑轻量化模型可选择面更广不需要付费隐私性也有)我的云服务器性能并不高4核4G系统盘70G一年才不到200米虽然还跑着其他业务但是空闲内存性能还有接近2G足够使用了。通过前面ASR模型的对比我主要按照国内开源、中文识别率高、模型体积中等这几个角度考虑最后选择了SenseVoice-small模型安装完成后增加了密钥鉴权功能客户端调用语音服务时需提供API Key防止被攻击后滥用服务想蹭免费的语音识别服务的可私我要密钥进行测试。经实际测试发现该方法延迟可以忽略不计语音识别很准确反馈输出也很快能满足桌宠软件的正常使用。【4】大语言模型(LLM)语音识别输出的文本信息发送给大语言模型处理后输出文字信息。这里我采用的是Deepseek如果你有本地部署大语言模型也可以用自己的大模型接口这样就不用给桌宠花一分钱啦【5】语音合成(TTS)将大语言模型处理后反馈的文本信息合并成音频文件播放给用户听。【6】数字人显示驱动数字人肢体表情口型与音频文件内容表达的信息一致。语音合成以及数字人显示这一块直接采用了魔珐星云提供的3D数字人功能展示效果良好端侧实时渲染高清低延迟有多种人物形象选择可以设置音色语速情绪等等功能现在用邀请码【XDBAC5Q6KM】注册可以获得2200分钟的免费使用额度。魔珐星云做的好的一点就是很简洁而且接口代码适配非常友好几乎不会出现无法调用情况新手第一次直接就能上手。首先创建应用后选择调用查看调用示例代码或者复制后喂给Agent让AI直接快速帮你搭建一个测试页面很简单就能上手基本不会出现问题。想动手尝试的可以看我的上一篇文章总结语音识别部署在云服务器免费魔珐星云提供了大额免费测试时长免费Deepseek已经全是最便宜的大模型了约等于免费