端侧语音控制方案:固定命令为什么不需要完整 ASR

2026 年 8 月 · 端侧语音交互 · KWS · 方案选型

设备只需听懂“开始、停止、下一页、关灯”等少量固定命令时,不必先把整句话转成文字。关键词识别(KWS)可以直接在端侧判断目标词并触发动作。

一句话选择:固定的 2–10 个短命令优先考虑 KWS;自由表达、听写或开放式对话再使用 ASR。

什么是端侧语音控制?

“端侧”表示麦克风音频在手机、电脑、网页或嵌入式设备本地处理。模型输出关键词标签或转录文本,业务代码再把结果映射为 UI、GPIO、媒体或设备动作。它不等于“完全没有服务器”:模型可以在线生成或下载,但运行阶段可以留在设备本地。

KWS、离线 ASR、云 ASR 怎么选

需求合适方案输出
几个固定命令或一个唤醒词KWS关键词 + 分数
较大但受限的词表,需要完整文本离线 ASR本地转录文本
开放式问答、听写、复杂语义云 ASR 或端云结合完整文本/意图

典型处理链路

麦克风 → 16 kHz 音频 → Mel 特征 → KWS 模型
       → 检测后处理 → 关键词标签 → 业务动作

KWS 不生成整段文字,因此词表必须预先确定。它适合展台翻页、App 拍照、机器人启停、智能开关和工业免手操作;如果用户可能说任意设备名、数字或句子,就应引入 ASR。

落地时最容易漏掉的四件事

  1. 命令设计:避免同时使用过短、常见或互相包含的词。
  2. 目标设备测试:用最终麦克风、距离、噪声和未参与训练的人测试。
  3. 误触发控制:联合使用连续帧、冷却时间、能量门限等后处理,不只调一个阈值。
  4. 动作安全:删除、支付、解锁等高风险动作必须二次确认,不能只凭常驻麦克风结果执行。

听词的对应路径

听词生成自定义 ONNX/TFLite 关键词模型,配套开源推理代码覆盖 Android、Python/Linux、Web、ESP32-S3 和 Wyoming。下载后可以在自有运行时离线检测,不需要每次推理连接训练服务,也不需要运行时 AccessKey。

生成端侧关键词模型