Mot d’activation français sur ESP32-S3 avec TFLite Micro

Août 2026 · ESP-IDF · TFLite Micro · Mot d’activation personnalisé

Le composant ESP32 open source reçoit du PCM à 16 kHz, calcule les caractéristiques Mel et exécute un petit modèle INT8 TFLite directement sur l’ESP32-S3. Le flux du microphone n’est pas envoyé vers un service cloud pendant la détection.

Configuration vérifiée : l’application complète a été testée sur ESP32-S3-HMI-DevKit à 240 MHz, avec 8 Mo de PSRAM octal, 16 Mo de flash, quatre microphones MEMS via ES7210, ESP-IDF 6.0.1 et esp-tflite-micro 1.3.5. Une autre carte nécessite l’adaptation du BSP audio et de la mémoire.

Performances mesurées

Sur cette carte, l’extraction Mel prend environ 28,5 à 33 ms et l’appel TFLite Invoke() environ 154,9 à 155,7 ms. Une nouvelle fenêtre de 98 trames est traitée toutes les 160 ms.

Exemple public

La démonstration fournie détecte actuellement le mot anglais Hey Robot, puis accepte des commandes qui changent la couleur d’une LED. Le fichier TFLite et head.h forment une paire et doivent être remplacés ensemble.

git clone https://github.com/voicute/onnx-wakeword.git
cd onnx-wakeword/esp32/examples/esp32s3_hmi_devkit
idf.py set-target esp32s3
python patch_led_strip.py
idf.py build
idf.py -p COM6 flash monitor

Utiliser un mot français personnalisé

Le pipeline d’entraînement peut exporter un modèle INT8 TFLite et sa tête pour un mot ou une courte expression en français. Évaluez d’abord le modèle Basic, puis testez-le de nouveau avec le microphone, la distance et les bruits du matériel final. Des faux déclenchements propres au mot choisi peuvent nécessiter des échantillons négatifs supplémentaires.

Composant et exemple open source : onnx-wakeword/esp32.

Transparence : Voicute développe le composant d’inférence ESP32 open source et un service commercial séparé pour entraîner et exporter des modèles personnalisés.
Entraîner et évaluer un modèle Basic