语音唤醒和语音识别有什么区别?KWS、ASR、命令词一次讲清

2026 年 8 月 · 语音唤醒 · 关键词识别 · ASR

语音唤醒只判断预设短语是否出现;语音识别把用户说的话转换成文字。两者不是互相替代,而是经常前后配合。

能力回答的问题典型输出
唤醒词有没有说“你好小听”?已唤醒 + 分数
多关键词 KWS说的是“开始、停止、下一页”中的哪个?关键词标签 + 分数
ASR用户完整说了什么?转录文本

最常见的组合

常驻 KWS 检测唤醒词
  → 唤醒后启动 ASR
  → 文本进入命令解析或对话系统
  → 交互结束后回到 KWS

这样可以让复杂识别只在需要时运行。另一种产品根本不需要 ASR:例如只控制“开灯、关灯、增亮、减暗”,多关键词 KWS 可以直接返回动作标签。

为什么不能把 KWS 当成通用识别?

KWS 的词表在训练前确定。新增设备名、数字、地址或自由句子时,模型不会自动理解。反过来,用完整 ASR 只识别两个固定命令,通常会引入更多集成、资源和文本解析工作。

三个选型问题

  1. 用户能说任意句子吗?能,选择 ASR。
  2. 是否只需要几个固定动作?是,优先测试多关键词 KWS。
  3. 是否需要“叫醒后再自由对话”?是,采用唤醒词 KWS + ASR。
术语提醒:“语音唤醒”“离线语音控制”对应声音交互;“语言控制”“语言唤醒”容易被理解成语言切换或 NLP,不是同一个搜索和技术意图。
生成 KWS 唤醒词/命令词模型