端侧语音控制方案:固定命令为什么不需要完整 ASR
设备只需听懂“开始、停止、下一页、关灯”等少量固定命令时,不必先把整句话转成文字。关键词识别(KWS)可以直接在端侧判断目标词并触发动作。
一句话选择:固定的 2–10 个短命令优先考虑 KWS;自由表达、听写或开放式对话再使用 ASR。
什么是端侧语音控制?
“端侧”表示麦克风音频在手机、电脑、网页或嵌入式设备本地处理。模型输出关键词标签或转录文本,业务代码再把结果映射为 UI、GPIO、媒体或设备动作。它不等于“完全没有服务器”:模型可以在线生成或下载,但运行阶段可以留在设备本地。
KWS、离线 ASR、云 ASR 怎么选
| 需求 | 合适方案 | 输出 |
|---|---|---|
| 几个固定命令或一个唤醒词 | KWS | 关键词 + 分数 |
| 较大但受限的词表,需要完整文本 | 离线 ASR | 本地转录文本 |
| 开放式问答、听写、复杂语义 | 云 ASR 或端云结合 | 完整文本/意图 |
典型处理链路
麦克风 → 16 kHz 音频 → Mel 特征 → KWS 模型
→ 检测后处理 → 关键词标签 → 业务动作KWS 不生成整段文字,因此词表必须预先确定。它适合展台翻页、App 拍照、机器人启停、智能开关和工业免手操作;如果用户可能说任意设备名、数字或句子,就应引入 ASR。
落地时最容易漏掉的四件事
- 命令设计:避免同时使用过短、常见或互相包含的词。
- 目标设备测试:用最终麦克风、距离、噪声和未参与训练的人测试。
- 误触发控制:联合使用连续帧、冷却时间、能量门限等后处理,不只调一个阈值。
- 动作安全:删除、支付、解锁等高风险动作必须二次确认,不能只凭常驻麦克风结果执行。
听词的对应路径
听词生成自定义 ONNX/TFLite 关键词模型,配套开源推理代码覆盖 Android、Python/Linux、Web、ESP32-S3 和 Wyoming。下载后可以在自有运行时离线检测,不需要每次推理连接训练服务,也不需要运行时 AccessKey。
生成端侧关键词模型