Stabil 90%+ Recall für Wake Words – from-scratch statt Frozen Embedding

August 2026 · Voicute

„90%+ Recall" versprechen viele Wake-Word-Tools, aber nur wenige halten es zuverlässig. Die eigenen Modelle von openWakeWord schwanken je nach Wort und Tag zwischen 25% und 90%. Hier ist, was „stabil" wirklich bedeutet – und warum from-scratch-Training es liefert.

Wie instabiler Recall aussieht

Das Muster ist immer dasselbe: eine Zahl, die in einem Test gut aussieht, und beim nächsten Wort auseinanderfällt. Hier ist der volle Mechanismus (Englisch).

Warum Frozen Embeddings instabil sind

openWakeWord friert ein Sprecher-Verifikations-Embedding ein und trainiert pro Wort nur einen kleinen Kopf. Dieses Embedding wurde trainiert, um „wer spricht?" zu beantworten – also den Inhalt zu ignorieren. Wake-Word-Erkennung ist das genaue Gegenteil. Die Fehlanpassung führt dazu, dass sich manche Wörter im geliehenen Raum sauber trennen und manche nicht – Recall wird zur Lotterie.

Warum from-scratch-Training stabil ist

Voicute trainiert für jedes Wort ein temporales Convolutional Network von Grund auf. Die Filter lernen die akustische Form deines Worts direkt – ohne geliehenen Merkmalsraum. Der konvolutionale induktive Bias (lokale Verbindungen, Gewichtsteilung, Translationsinvarianz) macht das Modell dateneffizient: Es generalisiert von synthetischem Trainingsaudio zu echten Sprechern und lauten Räumen, ohne dass der Recall einbricht.

Das Ergebnis ist stabil 90%+ Recall – dieselbe Zahl für Deutsch, Englisch, Französisch, Japanisch und Chinesisch, über Stimmen und Geräuschpegel hinweg, ganz ohne Wort-Tuning.

Frozen Embedding (openWakeWord)From-scratch TCN (Voicute)
Recall25%–90%, wortabhängigStabil 90%+
Wort-SelektionJaNein
Nicht-Englisch~0,001 ScoresNativ DE / EN / FR / JA / ZH
TuningHyperparameter pro WortKeins

FAQ

Was bedeutet „stabiler Recall" bei einem Wake Word?

Stabiler Recall heißt, dass das Modell über 90% erreicht – bei verschiedenen Wörtern, Stimmen und Geräuschpegeln, nicht 90% für ein Glückswort und 25% für ein anderes.

Warum ist der Recall von openWakeWord instabil?

openWakeWord baut jedes Wort auf einem eingefrorenen englischen Sprecher-Embedding auf, das trainiert wurde, um den Inhalt zu ignorieren. Diese Ziel-Fehlanpassung verursacht Wort-Selektion und einen Recall, der zwischen ~25% und ~90% schwankt.

Wie hält from-scratch-Training den Recall stabil über 90%?

Ein von Grund auf trainiertes TCN lernt die akustische Form des Zielworts direkt, ohne geliehenen Merkmalsraum. Der konvolutionale induktive Bias macht es dateneffizient und stabil gegenüber Rauschen und Sprechervariation.

Bekommen auch deutsche Wake Words stabil 90%+ Recall?

Ja. Da jedes Modell in der Zielsprache trainiert wird, erreichen deutsche Wake Words denselben stabilen 90%+-Recall wie englische.

Stabiles Wake Word trainieren →