语音唤醒和语音识别有什么区别?KWS、ASR、命令词一次讲清
语音唤醒只判断预设短语是否出现;语音识别把用户说的话转换成文字。两者不是互相替代,而是经常前后配合。
| 能力 | 回答的问题 | 典型输出 |
|---|---|---|
| 唤醒词 | 有没有说“你好小听”? | 已唤醒 + 分数 |
| 多关键词 KWS | 说的是“开始、停止、下一页”中的哪个? | 关键词标签 + 分数 |
| ASR | 用户完整说了什么? | 转录文本 |
最常见的组合
常驻 KWS 检测唤醒词
→ 唤醒后启动 ASR
→ 文本进入命令解析或对话系统
→ 交互结束后回到 KWS这样可以让复杂识别只在需要时运行。另一种产品根本不需要 ASR:例如只控制“开灯、关灯、增亮、减暗”,多关键词 KWS 可以直接返回动作标签。
为什么不能把 KWS 当成通用识别?
KWS 的词表在训练前确定。新增设备名、数字、地址或自由句子时,模型不会自动理解。反过来,用完整 ASR 只识别两个固定命令,通常会引入更多集成、资源和文本解析工作。
三个选型问题
- 用户能说任意句子吗?能,选择 ASR。
- 是否只需要几个固定动作?是,优先测试多关键词 KWS。
- 是否需要“叫醒后再自由对话”?是,采用唤醒词 KWS + ASR。
术语提醒:“语音唤醒”“离线语音控制”对应声音交互;“语言控制”“语言唤醒”容易被理解成语言切换或 NLP,不是同一个搜索和技术意图。
生成 KWS 唤醒词/命令词模型