Recall stable à 90%+ pour vos mots de réveil – from scratch vs frozen embedding

Août 2026 · Voicute

« 90%+ de recall » est une promesse que beaucoup d'outils font mais peu tiennent constamment. Les modèles personnalisés d'openWakeWord oscillent entre 25% et 90% selon le mot et le jour. Voici ce que « stable » signifie vraiment — et pourquoi l'entraînement from scratch l'obtient.

À quoi ressemble un recall instable

C'est toujours le même schéma : un chiffre qui paraît bon dans un test, puis qui s'effondre au mot suivant. Voici le mécanisme complet (en anglais).

Pourquoi les frozen embeddings sont instables

openWakeWord gèle un embedding de vérification du locuteur et n'entraîne qu'une petite tête par mot. Cet embedding a été entraîné pour répondre « qui parle ? » — ce qui exige d'ignorer ce qui est dit. La détection de wake word est l'exact inverse. L'inadéquation fait que certains mots se séparent proprement dans cet espace emprunté et d'autres non : le recall devient une loterie.

Pourquoi l'entraînement from scratch est stable

Voicute entraîne un TCN (réseau convolutif temporel) from scratch pour chaque mot. Les filtres apprennent directement la forme acoustique de votre mot — sans espace de features emprunté. Le biais inductif convolutif (connexions locales, partage des poids, invariance par translation) rend le modèle économe en données : il généralise de l'audio synthétique aux vrais locuteurs et aux pièces bruyantes, sans que le recall s'effondre.

Le résultat est un recall stable à plus de 90% : le même chiffre pour le français, l'anglais, l'allemand, le japonais et le chinois, quels que soient la voix et le bruit — sans réglage par mot.

Frozen embedding (openWakeWord)TCN from scratch (Voicute)
Recall25%–90%, selon le motStable 90%+
Sélection de motsOuiNon
Non-anglaisScores ~0,001Natif FR / EN / DE / JA / ZH
RéglageHyperparamètres par motAucun

FAQ

Que signifie un recall stable pour un mot de réveil ?

Un recall stable signifie que le modèle atteint plus de 90% quels que soient le mot, la voix et le niveau de bruit — pas 90% pour un mot chanceux et 25% pour un autre.

Pourquoi le recall d'openWakeWord est-il instable ?

openWakeWord construit chaque mot sur un embedding de vérification du locuteur, gelé et entraîné en anglais pour ignorer le contenu. Cette inadéquation d'objectif provoque la sélection de mots et un recall qui oscille entre ~25% et ~90%.

Comment l'entraînement from scratch maintient-il un recall stable à 90%+ ?

Un TCN entraîné from scratch apprend directement la forme acoustique du mot cible, sans espace de features emprunté. Le biais inductif convolutif le rend économe en données et stable face au bruit et à la variation de locuteur.

Les mots de réveil français ont-ils aussi un recall stable à 90%+ ?

Oui. Comme chaque modèle est entraîné dans la langue cible, les mots de réveil français atteignent le même recall stable de plus de 90% que l'anglais.

Entraîner un mot de réveil stable →