Stabil 90%+ Recall für Wake Words – from-scratch statt Frozen Embedding
„90%+ Recall" versprechen viele Wake-Word-Tools, aber nur wenige halten es zuverlässig. Die eigenen Modelle von openWakeWord schwanken je nach Wort und Tag zwischen 25% und 90%. Hier ist, was „stabil" wirklich bedeutet – und warum from-scratch-Training es liefert.
Wie instabiler Recall aussieht
- Das automatische Trainings-Notebook von openWakeWord hat schon Modelle mit 25,7% Recall erzeugt.
- Die Modelle, die 90%+ erreichten, brauchten jeweils andere Hyperparameter – „kein einziger Satz funktioniert für alle Wake Words".
- Ein unabhängiger Benchmark setzte openWakeWord bei 69% Recall und 8,5 Fehlauslösungen pro Stunde an.
Das Muster ist immer dasselbe: eine Zahl, die in einem Test gut aussieht, und beim nächsten Wort auseinanderfällt. Hier ist der volle Mechanismus (Englisch).
Warum Frozen Embeddings instabil sind
openWakeWord friert ein Sprecher-Verifikations-Embedding ein und trainiert pro Wort nur einen kleinen Kopf. Dieses Embedding wurde trainiert, um „wer spricht?" zu beantworten – also den Inhalt zu ignorieren. Wake-Word-Erkennung ist das genaue Gegenteil. Die Fehlanpassung führt dazu, dass sich manche Wörter im geliehenen Raum sauber trennen und manche nicht – Recall wird zur Lotterie.
Warum from-scratch-Training stabil ist
Voicute trainiert für jedes Wort ein temporales Convolutional Network von Grund auf. Die Filter lernen die akustische Form deines Worts direkt – ohne geliehenen Merkmalsraum. Der konvolutionale induktive Bias (lokale Verbindungen, Gewichtsteilung, Translationsinvarianz) macht das Modell dateneffizient: Es generalisiert von synthetischem Trainingsaudio zu echten Sprechern und lauten Räumen, ohne dass der Recall einbricht.
Das Ergebnis ist stabil 90%+ Recall – dieselbe Zahl für Deutsch, Englisch, Französisch, Japanisch und Chinesisch, über Stimmen und Geräuschpegel hinweg, ganz ohne Wort-Tuning.
| Frozen Embedding (openWakeWord) | From-scratch TCN (Voicute) | |
|---|---|---|
| Recall | 25%–90%, wortabhängig | Stabil 90%+ |
| Wort-Selektion | Ja | Nein |
| Nicht-Englisch | ~0,001 Scores | Nativ DE / EN / FR / JA / ZH |
| Tuning | Hyperparameter pro Wort | Keins |
FAQ
Was bedeutet „stabiler Recall" bei einem Wake Word?
Stabiler Recall heißt, dass das Modell über 90% erreicht – bei verschiedenen Wörtern, Stimmen und Geräuschpegeln, nicht 90% für ein Glückswort und 25% für ein anderes.
Warum ist der Recall von openWakeWord instabil?
openWakeWord baut jedes Wort auf einem eingefrorenen englischen Sprecher-Embedding auf, das trainiert wurde, um den Inhalt zu ignorieren. Diese Ziel-Fehlanpassung verursacht Wort-Selektion und einen Recall, der zwischen ~25% und ~90% schwankt.
Wie hält from-scratch-Training den Recall stabil über 90%?
Ein von Grund auf trainiertes TCN lernt die akustische Form des Zielworts direkt, ohne geliehenen Merkmalsraum. Der konvolutionale induktive Bias macht es dateneffizient und stabil gegenüber Rauschen und Sprechervariation.
Bekommen auch deutsche Wake Words stabil 90%+ Recall?
Ja. Da jedes Modell in der Zielsprache trainiert wird, erreichen deutsche Wake Words denselben stabilen 90%+-Recall wie englische.
Stabiles Wake Word trainieren →