Eigenes ONNX Wake-Word-Modell 2026 online trainieren
Für eine feste Sprachaktion braucht eine Anwendung nicht immer eine vollständige Spracherkennung. Ein kleines Keyword-Spotting-Modell kann Ausdrücke wie „Hallo Nova“, „Licht an“ oder „Maschine Stopp“ direkt auf dem Gerät erkennen.
Mit Voicute gibst du ein deutsches Wort oder eine Phrase ein und startest das Training online. Danach bewertest du das Basic-Modell in der Konsole mit deiner Stimme und entscheidest, ob du den ONNX-Download kaufen und mit Gerätetests fortfahren möchtest. Für Training und Test musst du keine Python-Umgebung, GPU oder Trainingspipeline einrichten.
Phrase eingeben, Deutsch auswählen und das Ergebnis vor dem Download mit der eigenen Stimme prüfen.
Training und Test starten →Wake Word und Schlüsselworterkennung
Ein Wake Word ist meist eine einzelne Phrase, die einen Assistenten aktiviert. Bei der Schlüsselworterkennung beziehungsweise beim Keyword Spotting (KWS) erkennt ein Modell mehrere kurze Befehle.
- Ein Wake Word: „Hallo Orion“ aktiviert die weitere Sprachverarbeitung.
- Mehrere Keywords: „Start“, „Stopp“, „Öffnen“ und „Schließen“ lösen verschiedene Aktionen aus.
- Keine Transkription: Das Modell liefert ein erkanntes Keyword und einen Score, keinen vollständigen Text.
Deutsches Wake Word online erstellen
- Bei Voicute anmelden und die Modellgenerierung öffnen.
- Deutsch auswählen und die gewünschte Phrase exakt eingeben.
- Die Aussprachevorschau anhören und bei Bedarf die Schreibweise anpassen.
- Das Basismodell ohne Aufnahme oder optional die Sprachverstärkung auswählen.
- Training starten und das Basic-Modell in der Konsole mit der eigenen Stimme sowie normaler Hintergrundsprache bewerten.
- Danach über den Kauf des Downloads entscheiden und das Modell auf dem Zielgerät weiter validieren.
ONNX-Modell mit mehreren deutschen Befehlen
Für eine feste Sprachsteuerung lassen sich 2 bis 10 Begriffe in einem gemeinsamen Modell zusammenfassen. Eine Inferenz liefert die erkannte Klasse. Das eignet sich für Smart Home, Android-Apps, Bedienhilfen, Kiosksysteme und industrielle Sprachsteuerungen.
Offline auf mehreren Plattformen
Das Modell läuft mit der Open-Source-Engine onnx-wakeword. Sie enthält Audio-Vorverarbeitung und Erkennungslogik. Unterstützte Ziele sind Android, Browser mit WebAssembly, Windows, macOS, Linux und Raspberry Pi. Das fertige Modell bleibt auf dem Gerät; es gibt keine Lizenz pro Gerät.
Ein gutes deutsches Wake Word wählen
- Eine Phrase mit drei bis sechs Silben und markantem Rhythmus wählen.
- Sehr kurze, im Alltag häufige Wörter vermeiden.
- Mit mehreren Sprechern, Abständen und realen Hintergrundgeräuschen testen.
- Nur bei Akzent, Dialekt oder Markennamen optional fünf kurze Sprachbeispiele ergänzen.
Häufige Fragen
Muss ich meine Stimme aufnehmen?
Nein. Die Basisversion nutzt synthetische Stimmen und akustische Datenaugmentation. Fünf kurze eigene Beispiele sind nur eine optionale Verstärkung.
Läuft das Modell ohne Internet?
Ja. Das Training findet online statt, die spätere ONNX-Inferenz vollständig lokal.
Kann ein Modell mehrere deutsche Befehle erkennen?
Ja. Das Multi-Keyword-Modell enthält 2 bis 10 Befehle in einer kompakten Datei.