Mehrere Wake Words, ein Modell
Die meisten Wake-Word-Engines gehen von einer Annahme aus: Ein Modell erkennt eine Phrase. Aber ein Wake Word ist nicht dasselbe wie ein Befehl – es ist der Name, auf den ein Gerät hört. Und Namen sind persönlich. Genau deshalb brauchen echte Produkte am Ende mehr als eines.
Warum Produkte mehrere Wake Words brauchen
- Jedes Familienmitglied hat sein eigenes Wort. Der eine sagt „Licht an“, das Kind ruft etwas anderes – mit beiden Worten in einem Modell antwortet das Gerät dem, der ruft. Kein Streit ums Wake Word.
- Eine Firmware, mehrere SKUs. Gleiche Hardware, drei Markennamen, drei Wake Words. Ein Multi-Word-Modell lässt die komplette Produktlinie ein einziges Firmware-Image teilen.
- Wake Word wechseln ohne Reflash. Klassische Offline-Lösungen brauchen für einen Wortwechsel ein Firmware-Update, manchmal eine Rücksendung ins Werk. Mit einem Multi-Word-Modell ist der Wechsel eine Ein-Zeilen-Config-Änderung.
- Alle Varianten, wie es gerufen wird. Ein Name wird auf viele Arten gerufen – nimm jede Variante ins Modell auf, dann funktioniert der Sprachstart, wie die Nutzer es auch sagen.
Ein Modell gegen einen Stapel Modelle
| Ein Modell pro Wort | Ein Multi-Word-Modell | |
|---|---|---|
| Zu deployende Dateien | N ONNX-Dateien | 1 ONNX-Datei |
| Größe bei 10 Wörtern | ~1,28 MB | 167 KB |
| Inferenz pro Frame | N Durchläufe | 1 Durchlauf, alle Ergebnisse auf einmal |
| Verwechslung zwischen Wörtern | Ungebunden, Modelle verwechseln leicht | Gemeinsam trainiert, sauber getrennt |
| Wake-Word-Wechsel | Modelldateien tauschen | Eine Config-Zeile ändern |
Wake Word wechseln per Config
Ein Multi-Word-Modell kommt mit einer model_info.json, in der jede Phrase ein Eintrag ist:
{
"model_type": "dscnn",
"mel_time": 98,
"multi_model": true,
"models": [
{"wake_word": "Entchen", "model_file": "entchen.onnx", "cons_frames": 2},
{"wake_word": "Hey Licht", "model_file": "heylicht.onnx", "cons_frames": 2}
]
}
Standardmäßig hört das Gerät auf alle gelisteten Wörter; lösche einen Eintrag und das Wort verstummt – ohne Nachtraining, ohne Firmware-Änderung. Das ist der praktische Nutzen von einem-Modell-viele-Wörter: Die Freiheit, das Wake Word zu ändern, bleibt bei dir und nicht beim Werk.
Und die Fehlauslösungen?
Mehr Wörter bedeuten mehr Angriffsfläche für Fehlauslösungen – die richtige Frage. Zwei Verteidigungslinien:
- Im Training: Alle Wake Words leben in einem Modell, und jedes Wort dient den anderen als Negativsample – so bleiben sie sauber getrennt. Eine Runde R1-Optimierung senkte die Fehlauslösungen in unseren Tests von Hunderten pro Stunde auf einstellige Werte (im Schnitt ca. 95 % Reduktion).
- In der Inferenz: Die Open-Source-Runtime bringt 5 zuschaltbare Anti-Fehlauslösungs-Ebenen mit (Kurzes-Zeitfenster-Filter, Cooldown, Energie-Sprung-Erkennung und mehr).
Wo Multi-Wake-Word passt
| Szenario | Wake Words | Wortanzahl |
|---|---|---|
| Smart Speaker / Zuhause | Das Wort jedes Familienmitglieds | 2–4 |
| Multi-SKU-Produktlinie | Markenwort pro Modellvariante | 3–6 |
| Spielzeug / Lernhardware | Charaktername + Spitznamen | 3–8 |
| Automotive | Markenwort in zwei Sprachen | 2–4 |
| Robotik | Name + doppelter Name | 2–5 |
So bekommst du eines
Auf Voicute den Multi-Keyword-Tarif wählen, die Wake Words per Komma getrennt eingeben – die Plattform synthetisiert die Trainingssprache und liefert in etwa 15–25 Minuten ein fertiges ONNX-Modell. 2–10 Wörter in einem Modell, Preis nach Stufe: 3 Wörter $85, 5 Wörter $99, 8 Wörter $125, 10 Wörter $149 – einmal bezahlt, auf unbegrenzt vielen Geräten einsetzbar.
Das Modell ist Standard-ONNX und läuft mit der Open-Source-Runtime onnx-wakeword vollständig offline auf Android / Linux / Windows / Web / ESP32. Wenn du eher Befehle wie „an“ und „aus“ suchst, lies Multi-Keyword-Wake-Word: Ein Modell, 10 Befehle.
Multi-Wake-Word-Modell erstellen →