1. 香薰机加语音控制,到底图个啥
做了十几年消费类电子方案,我越来越觉得,香薰机这个品类特别有意思。它本身技术门槛不高——一个超声波雾化片、一个风扇、一个水位检测、再加个MCU控制,硬件成本压到十几块钱就能做出来。但恰恰因为门槛低,这个赛道卷得离谱,大家都在找差异化的卖点。前几年拼外观、拼灯光、拼定时功能,现在这些都成标配了,于是语音控制就成了新的角力点。
你可能会问,香薰机加语音控制,用户真的会用吗?我一开始也怀疑。但实测下来,场景其实很自然:晚上躺床上不想摸手机开APP,直接说一句“打开香薰机”“调到二档”“定时一小时”,体验确实比按键和APP都顺手。尤其是放在卧室、书房这种场景,语音的免手操作优势非常明显。而且香薰机的工作噪音本身就在30分贝以下,语音识别的环境干扰相对可控,这比语音控制油烟机、空调要友好得多。
这篇内容我打算把香薰机语音控制芯片的选型逻辑彻底讲透。核心会围绕离线语音方案展开,重点对比WTK6900和WT2606A这两颗在业内出货量很大的芯片,同时也会聊到选型时容易踩的坑、外围电路怎么配、语音包怎么做、量产测试怎么搞。适合正在做香薰机方案选型的硬件工程师、产品经理,也适合刚入行想了解离线语音方案的朋友。看完你至少能搞清楚:什么场景该选哪颗芯片、成本差在哪、开发周期多长、量产时哪些参数必须卡死。
2. 为什么香薰机优先选离线语音而不是在线方案
2.1 在线语音方案的三个硬伤
先说结论:香薰机这个品类,除非你要做带屏幕的高端智能音箱融合款,否则离线语音几乎是唯一合理的选择。为什么这么说?我拿实际项目经历给你拆解。
在线语音方案的核心问题是依赖网络和云端。你想想,一个香薰机卖出去,用户家里的WiFi环境千差万别,2.4G频段被邻居家十几个路由器挤得满满当当,丢包率一高,语音指令延迟就上去了。我见过最夸张的案例,用户说“打开香薰机”,等了四秒才响应,这体验还不如直接按按键。而且云端识别要经过录音上传、服务器解析、指令下发这一整条链路,任何一个环节抖动都会影响响应速度。
第二个硬伤是隐私顾虑。香薰机放在卧室,用户对“一直在录音上传”这件事天然敏感。虽然正规方案都会做唤醒词本地检测、只在唤醒后才上传,但用户不管这些技术细节,看到“需要联网”四个字心里就犯嘀咕。离线语音方案所有识别都在本地完成,不联网、不上传,这个卖点在详情页上写出来就是实打实的转化率。
第三个硬伤是成本和复杂度。在线方案需要WiFi模组、需要云端服务费、需要配网流程开发、需要处理断网重连逻辑。WiFi模组再便宜也要五六块钱,加上云端授权费、APP开发分摊,整体BOM成本比离线方案高出不少。而香薰机整机出厂价可能就几十块,你让老板多掏十几块做在线语音,他肯定跟你急。
2.2 离线语音方案的核心优势
离线语音方案的本质是把语音识别算法跑在本地芯片上,不需要联网、不需要云端。它的优势可以总结成四个字:快、稳、私、省。
快是指响应速度。本地识别没有网络往返延迟,从说完指令到执行动作,通常能控制在300毫秒以内,用户感觉就是“话音刚落就动了”。稳是指不受网络环境影响,用户家里断网了、路由器坏了,语音控制照样能用。私是指语音数据不出设备,用户心理负担小。省是指BOM成本和开发成本都更低,一颗离线语音芯片几块钱,外围电路简单,开发周期也短。
当然离线语音也有局限。它的识别词条数量有限,一般支持几十到上百条指令,不能像在线方案那样做自然语言理解。但对于香薰机这种指令集固定的产品来说,完全够用。你无非就是开关、档位调节、定时、灯光控制这几类指令,撑死了二十条,离线方案绰绰有余。
2.3 香薰机语音指令集的典型设计
在选芯片之前,先要把指令集定下来。我做过好几个香薰机项目,指令集设计有几个原则:常用指令要短、易混淆指令要拉开差异、反馈要明确。
典型的指令集大概长这样:唤醒词用“小香小香”或者“你好香薰”;开关指令用“打开香薰”“关闭香薰”;档位调节用“一档”“二档”“三档”或者“调大”“调小”;定时用“定时一小时”“定时两小时”“取消定时”;灯光用“打开灯光”“关闭灯光”“呼吸灯模式”。加起来大概十五到二十条。
这里有个坑要注意:指令词之间要有足够的音素差异。比如“打开”和“调大”如果放在一起,识别率会受影响,因为韵母都是“a”。我一般建议把容易混的指令在词条设计阶段就改掉,比如把“调大”改成“增强”,音素差异就拉开了。这个细节后面讲语音包制作时还会展开。
3. WTK6900与WT2606A芯片选型的核心对比
3.1 两颗芯片的定位差异
WTK6900和WT2606A都是业内做离线语音方案很常见的芯片,但它们的定位其实有差异。WTK6900更偏向纯语音识别MCU,主打低成本、低功耗、快速响应,适合指令集简单、不需要复杂外设控制的产品。WT2606A则是一颗带语音识别能力的多媒体主控,除了语音识别,还能做音频播放、LED驱动、触摸控制,适合功能更丰富的产品。
打个比方,WTK6900像是一个专职的“耳朵”,你告诉它听什么它就听什么,听完输出一个信号给主控去执行。WT2606A则像是一个“耳朵+嘴巴+小脑”,它不光能听,还能直接控制外设、播放反馈音、驱动灯效,一颗芯片把活全干了。
对于香薰机来说,选哪颗取决于你的产品定义。如果你做的是基础款香薰机,只要语音开关和档位调节,WTK6900就够了,成本更低。如果你做的是带RGB灯效、带语音反馈、带多档定时的高配款,WT2606A更合适,因为它能省掉一颗主控和一颗音频功放。
3.2 关键参数对比表
我把两颗芯片的关键参数整理成表格,方便你直接对照选型。
| 参数项 | WTK6900 | WT2606A |
|---|---|---|
| 核心架构 | 专用语音识别DSP | 32位MCU+DSP双核 |
| 识别方式 | 离线命令词识别 | 离线命令词识别+语音播报 |
| 词条数量 | 最多约50条 | 最多约100条 |
| 响应时间 | 约200-300ms | 约300-500ms |
| 音频输出 | 无(仅输出控制信号) | 支持PWM/DAC音频输出 |
| 外设接口 | UART/GPIO | UART/GPIO/PWM/ADC/I2C |
| 工作电压 | 3.3V | 3.3V |
| 待机功耗 | 约10mA | 约25mA |
| 封装 | SOP16/QSOP24 | QFN32 |
| 典型单价 | 3-5元 | 6-10元 |
| 开发难度 | 低 | 中 |
从表格能看出来,WTK6900的优势是便宜、简单、功耗低;WT2606A的优势是集成度高、功能全、可扩展性强。选型时不要只看单价,要把外围BOM省下来的钱算进去。比如WT2606A能直接驱动喇叭做语音反馈,省掉一颗功放芯片和一颗主控,整体BOM可能反而更低。
3.3 什么场景选WTK6900
WTK6900最适合的场景是:产品功能简单、成本敏感、开发周期短。具体到香薰机,如果你做的是走量款,只要求语音开关和两三个档位调节,WTK6900是首选。
它的开发流程也简单。芯片通过UART和主控MCU通信,识别到指令后输出对应的串口码,主控收到码值执行动作。你甚至不需要改主控的固件架构,只要在串口中断里加一个解析函数就行。我做过一个项目,从拿到芯片到出样机,三天时间,其中两天还是在等PCB打样。
WTK6900的另一个优势是功耗低。香薰机虽然大部分时间是插电使用,但有些便携款需要电池供电,待机功耗就很关键。WTK6900待机电流大概10mA,配合主控的休眠策略,整机待机功耗可以压到很低。
3.4 什么场景选WT2606A
WT2606A适合功能更丰富的香薰机。比如你想做语音反馈——用户说“打开香薰”,机器回一句“好的,已为您打开”,这种交互体验明显更好,但需要音频播放能力。WT2606A内置音频解码和DAC输出,直接接一个小喇叭就能播报,不需要额外的语音芯片。
再比如你想做RGB灯效联动——语音切换档位时,灯环颜色跟着变。WT2606A有丰富的PWM通道,可以直接驱动WS2812灯带,省掉一颗灯效驱动芯片。还有触摸控制,WT2606A内置触摸检测,可以做触摸+语音双模控制,用户体验更完整。
WT2606A的代价是开发复杂度高一些,需要配置音频参数、调试触摸灵敏度、处理多任务调度。但如果你团队有嵌入式开发经验,这些都不是大问题。而且WT2606A的SDK通常提供图形化配置工具,很多参数点选就能完成,不需要从头写代码。
3.5 选型决策的五个关键问题
我总结了一个选型决策清单,你对着问自己五个问题,答案就清楚了。
第一,你的产品需要语音反馈吗?需要就选WT2606A,不需要就选WTK6900。第二,你的指令集超过30条吗?超过就选WT2606A,不超过就选WTK6900。第三,你需要芯片直接驱动灯效或触摸吗?需要就选WT2606A。第四,你的整机BOM预算卡得很死吗?卡得死就选WTK6900。第五,你的开发周期有多长?两周以内选WTK6900,一个月以上可以考虑WT2606A。
这五个问题问完,选型基本就定了。我见过很多项目在选型上纠结太久,其实大可不必。先定产品定义,再定指令集,芯片选型是水到渠成的事。
4. 硬件设计与外围电路的关键细节
4.1 麦克风选型与布局
离线语音方案的效果,一半靠芯片算法,一半靠麦克风选型和布局。我见过太多项目,芯片选对了,但麦克风没搞好,识别率惨不忍睹。
麦克风首选驻极体麦克风或者MEMS麦克风。驻极体便宜,几毛钱一颗,但一致性差一些,需要做灵敏度分档。MEMS麦克风贵一点,但一致性好、抗干扰强,量产时省心。我的建议是:走量款用驻极体,中高端款用MEMS。
布局上有三个铁律。第一,麦克风开孔要远离喇叭,否则语音反馈时会产生回声干扰识别。如果结构限制实在避不开,就要在固件里做回声消除,但离线芯片的回声消除能力有限,最好还是从结构上解决。第二,麦克风开孔要朝上或者朝侧面,不要朝下,否则放在桌面上时声音会被桌面反射干扰。第三,麦克风周围要加密封泡棉,防止机壳内部的气流和震动传到麦克风上。
还有一个细节:麦克风开孔的直径和深度会影响频响。开孔太小,高频衰减严重,识别率下降;开孔太大,容易进灰。我一般建议开孔直径1.5到2毫米,深度不超过3毫米。这个参数最好在结构打样阶段就验证,不要等到量产了才发现问题。
4.2 电源设计与滤波
离线语音芯片对电源噪声比较敏感,尤其是WTK6900这种纯DSP架构的芯片。电源纹波大了,识别率会明显下降。我一般建议在语音芯片的电源引脚旁边放一颗10微法和一颗0.1微法的电容,10微法滤低频纹波,0.1微法滤高频噪声。
如果香薰机用的是超声波雾化片,那电源设计要格外注意。雾化片工作时会产生高频开关噪声,这个噪声会通过电源线传导到语音芯片。我通常会在雾化片驱动电路和语音芯片之间加一颗磁珠或者电感做隔离,同时语音芯片的电源走线要单独从LDO拉出来,不要和雾化片共用一路。
还有一点:如果香薰机用锂电池供电,要注意电池电压范围。WTK6900和WT2606A的工作电压都是3.3V,但锂电池电压从4.2V放到3.0V,所以需要一颗LDO稳压到3.3V。选LDO时要注意压差和静态电流,压差大了效率低,静态电流大了待机功耗高。
4.3 喇叭与音频反馈电路
如果你选WT2606A做语音反馈,喇叭和功放电路也要设计好。香薰机体积小,喇叭一般选小尺寸的,比如20毫米到30毫米直径、8欧姆0.5瓦的规格。功放可以用WT2606A内置的DAC直接驱动,但输出功率有限,如果音量要求大,还是要加一颗功放芯片。
这里有个坑:喇叭的磁场会干扰麦克风。如果喇叭和麦克风离得太近,喇叭播放语音反馈时,磁场会直接耦合到麦克风上,造成识别误触发。我一般建议喇叭和麦克风的间距至少3厘米,如果结构做不到,就要在麦克风后面加磁屏蔽片。
音频反馈的内容也要设计好。不要用太长的语音,比如“好的,已为您打开香薰机并设置为一档”,太啰嗦了。用户要的是快速确认,一句“好的”或者“已打开”就够了。反馈音太长还会影响下一次识别的响应速度,因为喇叭播放时麦克风在收音,容易把反馈音当成指令。
4.4 与主控MCU的通信接口
WTK6900和WT2606A都支持UART通信,这也是最常用的接口方式。通信协议一般是这样:语音芯片识别到指令后,通过UART发送一串数据,主控MCU收到后解析执行。
协议设计要注意两点。第一,要有帧头和校验,防止误触发。我一般用“0xAA + 指令码 + 校验和”的格式,主控收到后先检查帧头和校验,都对了才执行。第二,要有防重复机制。用户说一次指令,语音芯片可能连续发送多次,主控要做去重,比如500毫秒内收到相同指令只执行一次。
如果主控MCU的串口资源紧张,也可以用GPIO直连。WTK6900支持把识别结果映射到GPIO电平输出,比如识别到“打开”就拉高某个引脚,识别到“关闭”就拉低。这种方式最简单,但指令多了引脚不够用,适合指令集很少的产品。
5. 语音包制作与识别率调优实战
5.1 语音包制作流程
语音包制作是离线语音方案开发中最容易被低估的环节。很多人以为芯片选好了、电路画好了就完事了,结果语音包没做好,识别率上不去,项目卡在最后一步。
语音包制作的一般流程是:先整理指令词列表,然后用芯片厂商提供的工具生成语音模型,再把模型烧录到芯片里。WTK6900和WT2606A都有配套的PC端工具,操作界面大同小异,基本就是导入词条、选择发音人、生成模型、下载到芯片。
词条整理有几个原则。第一,词条要短,最好控制在四个字以内。第二,词条之间音素差异要大,避免“打开”和“调大”这种韵母相同的组合。第三,要覆盖用户可能说的多种表达方式,比如“打开香薰”和“开机”可以都加上,但不要加太多同义句,否则容易互相干扰。
发音人的选择也有讲究。一般工具会提供男声、女声、童声几种选项。香薰机的用户以女性居多,我一般选女声模型,识别率会更好。如果产品面向全年龄段,可以选中性一点的发音人。
5.2 识别率调优的五个手段
语音包生成后,识别率不达标怎么办?我总结了五个调优手段,按优先级排列。
第一,调整麦克风增益。语音芯片一般有AGC自动增益控制,但AGC的响应速度和目标电平可以调。如果识别率低,先试试把增益调高一点,让麦克风拾取的信号更强。但也不能太高,太高了底噪也放大,反而影响识别。
第二,优化词条设计。如果某个词条总是识别错,先看看它和哪个词条容易混,然后把其中一个改掉。比如“定时”和“提示”容易混,可以把“提示”改成“提醒”。
第三,调整唤醒词灵敏度。唤醒词是语音识别的第一道关,唤醒率低了,后面识别率再高也没用。唤醒词灵敏度一般可以在工具里调,调高了容易误唤醒,调低了唤醒困难。我一般建议在安静环境下测试,唤醒率要达到95%以上,误唤醒率控制在24小时内不超过3次。
第四,做环境噪声测试。香薰机的工作环境有雾化片的水声、风扇的风声,这些噪声会影响识别。测试时要把香薰机开到最大档,然后在不同距离下测试识别率。如果噪声影响大,就要在结构上做隔音,或者换指向性更好的麦克风。
第五,考虑加一颗降噪芯片。如果以上手段都试过了还是不行,可以考虑在麦克风后面加一颗硬件降噪芯片。降噪芯片能滤掉稳态噪声,对风扇声、水声这种持续噪声效果明显。但降噪芯片会增加BOM成本和PCB面积,不到万不得已不建议加。
5.3 实测数据与经验值
我拿一个实际项目的数据给你参考。项目是一台超声波香薰机,用WTK6900方案,麦克风是驻极体,放在桌面中央,用户在1米距离说话。
安静环境下,唤醒率98%,指令识别率96%。开一档雾化时,唤醒率96%,指令识别率93%。开三档雾化时,唤醒率93%,指令识别率88%。距离拉到3米时,安静环境下唤醒率92%,指令识别率85%。
这些数据说明什么?说明香薰机自身的噪声对识别率有影响,但影响可控。三档雾化时识别率降到88%,还在可用范围内。距离拉到3米时识别率下降明显,但香薰机一般不会放那么远,1到2米是典型使用距离。
我的经验值是:量产标准定在安静环境识别率95%以上、最大档噪声环境识别率85%以上,这个标准用户基本感知不到识别问题。如果低于这个标准,就要回去调优。
6. 量产测试与常见问题排查
6.1 量产测试工装设计
语音方案量产时,测试工装很关键。你不能让产线工人对着每台机器喊指令,效率太低,而且产线噪声大,识别率不稳定。
我一般建议用工装播放标准音频。工装里存一段标准指令音频,通过小喇叭对着香薰机播放,香薰机识别后输出信号,工装检测信号是否正确。这种方式一致性好、速度快,适合大批量生产。
工装设计要注意三点。第一,喇叭和香薰机的距离要固定,一般10到15厘米。第二,测试环境要尽量安静,如果产线噪声大,就要加隔音罩。第三,工装要能自动判断结果,识别正确亮绿灯,识别错误亮红灯,工人只管放机器和看灯就行。
测试项一般包括:唤醒测试、每条指令的识别测试、误唤醒测试。误唤醒测试比较耗时,一般抽检,不做全检。全检只做唤醒和主要指令识别。
6.2 常见问题速查表
我把量产和售后中遇到的常见问题整理成表格,方便你快速排查。
| 问题现象 | 可能原因 | 排查方法 | 解决方案 |
|---|---|---|---|
| 唤醒困难 | 麦克风增益低 | 测麦克风输出幅度 | 调高AGC增益 |
| 唤醒困难 | 麦克风开孔堵塞 | 检查开孔是否有异物 | 清理开孔或改结构 |
| 误唤醒频繁 | 唤醒词灵敏度高 | 安静环境测试误唤醒率 | 调低灵敏度 |
| 指令识别错 | 词条音素相近 | 分析混淆词条 | 修改词条设计 |
| 指令识别错 | 电源噪声大 | 示波器测电源纹波 | 加滤波电容或磁珠 |
| 语音反馈时误触发 | 喇叭干扰麦克风 | 断开喇叭测试 | 增加间距或加屏蔽 |
| 响应延迟大 | 主控处理慢 | 测串口输出到执行的时间 | 优化主控固件 |
| 部分机器识别差 | 麦克风一致性差 | 抽测麦克风灵敏度 | 换MEMS麦克风或分档 |
这张表基本覆盖了80%的常见问题。遇到问题时按表排查,一般都能定位到原因。
6.3 几个容易踩的坑
第一个坑是忽略结构对声学的影响。很多硬件工程师觉得语音是电路的事,结构随便搞搞就行。实际上麦克风开孔位置、腔体密封、内部气流都会影响识别率。我建议在结构设计阶段就让声学工程师参与,至少要做一次声学仿真。
第二个坑是语音包版本管理混乱。量产时发现识别率不行,改了语音包重新烧录,但忘了记录版本号,后面出了问题找不到对应关系。我一般要求语音包文件名带日期和版本号,比如“香薰机语音包_v1.2_20240615”,烧录记录也要存档。
第三个坑是测试标准不统一。研发阶段在安静办公室测,识别率很好;量产在嘈杂产线测,识别率下降。所以测试标准要提前定好,在什么环境、什么距离、什么噪声条件下测,研发和量产用同一套标准。
第四个坑是忽略温度影响。香薰机工作时内部温度会升高,尤其是雾化片附近。麦克风的灵敏度会随温度漂移,高温下识别率可能下降。我一般建议做高低温测试,在45度环境下验证识别率。
7. 成本拆解与方案落地建议
7.1 两种方案的BOM成本对比
我拿一个典型香薰机项目做成本拆解,对比WTK6900和WT2606A两种方案的BOM差异。
WTK6900方案:语音芯片4元、驻极体麦克风0.5元、外围阻容0.3元、PCB分摊0.5元,合计约5.3元。主控MCU和雾化驱动电路是原有设计,不额外增加成本。
WT2606A方案:语音芯片8元、MEMS麦克风1.5元、喇叭1元、功放0.8元、外围阻容0.5元、PCB分摊0.8元,合计约12.6元。但WT2606A省掉了原有主控MCU的2元,实际净增约10.6元。
从成本看,WTK6900方案明显更省。但WT2606A方案多了语音反馈、灯效驱动、触摸控制这些功能,产品溢价空间也更大。选哪个取决于你的产品定位和定价策略。
7.2 开发周期估算
WTK6900方案开发周期大概两到三周。第一周做硬件设计和打样,第二周做语音包和固件调试,第三周做测试和优化。如果团队有现成的香薰机主控方案,时间还能压缩。
WT2606A方案开发周期大概四到六周。多出来的时间主要花在音频调试、灯效联动、触摸调优上。如果团队第一次用WT2606A,还要花时间熟悉SDK和工具链。
我的建议是:如果项目时间紧,先用WTK6900快速出样机验证市场,等产品定型了再考虑升级到WT2606A做高配款。这样风险最小,节奏也最稳。
7.3 方案落地检查清单
最后给你一份方案落地检查清单,从选型到量产逐项确认。
- 产品定义明确:指令集不超过20条,功能不复杂,选WTK6900;需要语音反馈和灯效联动,选WT2606A。
- 麦克风选型确认:走量款用驻极体,中高端用MEMS,开孔位置和尺寸在结构阶段验证。
- 电源设计确认:语音芯片电源单独走线,加滤波电容,远离雾化片驱动电路。
- 语音包制作完成:词条音素差异大,唤醒率95%以上,指令识别率90%以上。
- 通信协议确认:UART帧头校验完整,防重复机制到位。
- 量产工装就绪:标准音频播放测试,自动判断结果,测试标准统一。
- 高低温测试通过:45度环境下识别率不低于常温的90%。
- 版本管理规范:语音包和固件版本号记录存档,烧录记录可追溯。
这份清单是我做了多个香薰机语音项目后总结出来的,照着走基本不会出大问题。实际做的时候,每个项目还会有各自的特殊情况,但核心逻辑是一样的:先定产品,再定芯片,然后死磕语音包和声学结构,最后把量产测试卡死。这几步做到位,语音控制的体验就不会差。