Plusieurs mots d'activation, un seul modèle
La plupart des moteurs de mot de réveil partent d'une hypothèse : un modèle détecte une phrase. Mais un mot d'activation n'est pas une commande : c'est le nom auquel un appareil répond. Et les noms sont personnels — c'est précisément pour cela que les vrais produits finissent par en avoir besoin de plusieurs.
Pourquoi les produits ont besoin de plusieurs mots d'activation
- Chaque membre de la famille a son mot. L'un dit « Lumière », les enfants crient autre chose — avec les deux dans un même modèle, l'appareil répond à qui l'appelle. Fini la bataille pour le mot de réveil.
- Une firmware, plusieurs SKU. Même matériel, trois noms de marque, trois mots d'activation. Un modèle multi-mots permet à toute la gamme de partager une seule image firmware.
- Changer de mot sans reflash. Les solutions hors ligne classiques exigent une mise à jour firmware — parfois un retour usine — pour changer un seul mot. Avec un modèle multi-mots, le changement tient en une ligne de configuration.
- Toutes les façons de l'appeler. Un même nom se dit de dix façons. Mettez chaque variante dans le modèle et l'appareil répondra quel que soit l'appel.
Un modèle contre une pile de modèles
| Un modèle par mot | Un modèle multi-mots | |
|---|---|---|
| Fichiers à déployer | N fichiers ONNX | 1 fichier ONNX |
| Taille pour 10 mots | ~1,28 Mo | 167 Ko |
| Inférence par trame | N passes | 1 passe, tous les résultats d'un coup |
| Confusion entre mots | Aucune contrainte, modèles qui se confondent | Entraînés ensemble, naturellement séparés |
| Changement de mot | Remplacer les fichiers modèle | Modifier une ligne de config |
Changer de mot d'activation = éditer la config
Un modèle multi-mots est livré avec un model_info.json où chaque phrase est une entrée :
{
"model_type": "dscnn",
"mel_time": 98,
"multi_model": true,
"models": [
{"wake_word": "Nougat", "model_file": "nougat.onnx", "cons_frames": 2},
{"wake_word": "Bonjour Nougat", "model_file": "bonjourownougat.onnx", "cons_frames": 2}
]
}
Par défaut, l'appareil écoute tous les mots listés ; supprimez une entrée et le mot se tait — sans réentraînement, sans toucher la firmware. C'est tout l'intérêt d'un-modèle-plusieurs-mots : la liberté de changer le mot d'activation reste entre vos mains, pas celles de l'usine.
Et les faux déclenchements ?
Plus de mots, plus de surface de faux déclenchements — la bonne question à poser. Deux lignes de défense :
- À l'entraînement : tous les mots vivent dans un même modèle et chacun sert d'échantillon négatif aux autres, donc ils restent bien séparés. Une passe d'optimisation R1 a fait chuter les faux déclenchements de centaines par heure à quelques unités (environ 95 % de réduction en moyenne) dans nos tests.
- À l'inférence : le runtime open source embarque 5 couches anti-faux-déclenchement activables (filtrage par trames consécutives, temps de repos, détection de saut d'énergie, etc.).
Où le multi-mots d'activation s'applique
| Scénario | Mots d'activation | Nombre de mots |
|---|---|---|
| Enceinte / maison | Le mot de chaque membre de la famille | 2–4 |
| Gamme multi-SKU | Mot de marque par variante | 3–6 |
| Jouets / matériel éducatif | Nom du personnage + surnoms | 3–8 |
| Embarqué véhicule | Mot de marque en deux langues | 2–4 |
| Robotique | Nom + nom répété | 2–5 |
Comment en obtenir un
Sur Voicute, choisissez la formule multi-mots, saisissez vos mots d'activation séparés par des virgules — la plateforme synthétise la voix d'entraînement et livre un modèle ONNX en 15 à 25 minutes environ. 2 à 10 mots dans un même modèle, tarif par palier : 3 mots 85 $, 5 mots 99 $, 8 mots 125 $, 10 mots 149 $ — un seul paiement, déploiement sur un nombre illimité d'appareils.
Le modèle est au format ONNX standard et tourne entièrement hors ligne sur Android / Linux / Windows / Web / ESP32 grâce au runtime open source onnx-wakeword. Si vous cherchez plutôt des commandes comme « joue » ou « stop », voyez Multi-Keyword Wake Word Detection (en anglais).
Créer votre modèle multi-mots d'activation →