Recall stable à 90%+ pour vos mots de réveil – from scratch vs frozen embedding
« 90%+ de recall » est une promesse que beaucoup d'outils font mais peu tiennent constamment. Les modèles personnalisés d'openWakeWord oscillent entre 25% et 90% selon le mot et le jour. Voici ce que « stable » signifie vraiment — et pourquoi l'entraînement from scratch l'obtient.
À quoi ressemble un recall instable
- Le notebook d'entraînement automatique d'openWakeWord a déjà produit des modèles à 25,7% de recall.
- Les modèles qui atteignaient 90%+ nécessitaient chacun des hyperparamètres différents — « aucun jeu unique ne fonctionne pour tous les wake words ».
- Un benchmark indépendant place openWakeWord à 69% de recall et 8,5 fausses détections par heure.
C'est toujours le même schéma : un chiffre qui paraît bon dans un test, puis qui s'effondre au mot suivant. Voici le mécanisme complet (en anglais).
Pourquoi les frozen embeddings sont instables
openWakeWord gèle un embedding de vérification du locuteur et n'entraîne qu'une petite tête par mot. Cet embedding a été entraîné pour répondre « qui parle ? » — ce qui exige d'ignorer ce qui est dit. La détection de wake word est l'exact inverse. L'inadéquation fait que certains mots se séparent proprement dans cet espace emprunté et d'autres non : le recall devient une loterie.
Pourquoi l'entraînement from scratch est stable
Voicute entraîne un TCN (réseau convolutif temporel) from scratch pour chaque mot. Les filtres apprennent directement la forme acoustique de votre mot — sans espace de features emprunté. Le biais inductif convolutif (connexions locales, partage des poids, invariance par translation) rend le modèle économe en données : il généralise de l'audio synthétique aux vrais locuteurs et aux pièces bruyantes, sans que le recall s'effondre.
Le résultat est un recall stable à plus de 90% : le même chiffre pour le français, l'anglais, l'allemand, le japonais et le chinois, quels que soient la voix et le bruit — sans réglage par mot.
| Frozen embedding (openWakeWord) | TCN from scratch (Voicute) | |
|---|---|---|
| Recall | 25%–90%, selon le mot | Stable 90%+ |
| Sélection de mots | Oui | Non |
| Non-anglais | Scores ~0,001 | Natif FR / EN / DE / JA / ZH |
| Réglage | Hyperparamètres par mot | Aucun |
FAQ
Que signifie un recall stable pour un mot de réveil ?
Un recall stable signifie que le modèle atteint plus de 90% quels que soient le mot, la voix et le niveau de bruit — pas 90% pour un mot chanceux et 25% pour un autre.
Pourquoi le recall d'openWakeWord est-il instable ?
openWakeWord construit chaque mot sur un embedding de vérification du locuteur, gelé et entraîné en anglais pour ignorer le contenu. Cette inadéquation d'objectif provoque la sélection de mots et un recall qui oscille entre ~25% et ~90%.
Comment l'entraînement from scratch maintient-il un recall stable à 90%+ ?
Un TCN entraîné from scratch apprend directement la forme acoustique du mot cible, sans espace de features emprunté. Le biais inductif convolutif le rend économe en données et stable face au bruit et à la variation de locuteur.
Les mots de réveil français ont-ils aussi un recall stable à 90%+ ?
Oui. Comme chaque modèle est entraîné dans la langue cible, les mots de réveil français atteignent le même recall stable de plus de 90% que l'anglais.
Entraîner un mot de réveil stable →