La reconnaissance vocale, ou speech-to-text (STT), transcrit la parole en texte. Des modèles comme Whisper l'ont rendue précise, multilingue et exécutable en local. C'est la porte d'entrée de tout agent vocal : la qualité de la transcription conditionne tout ce qui suit.
En pratique chez Gensai
Gensai utilise faster-whisper en local pour ses dispositifs vocaux, dont l'installation des Océans et l'analyse d'appels de dons.