Une intelligence artificielle qui interviewe un humain au sujet de l'intelligence artificielle vocale : c'est le format choisi par Gradium pour sa série d'entretiens avec les équipes qui utilisent ses modèles. Le 5 octobre 2026, c'est Sébastien Lecocq, cofondateur de Gensai, qui répond à « Marlo », la voix de synthèse de Gradium. Trois minutes, en anglais.
Ces trois minutes disent beaucoup de l'état de l'IA vocale en 2026, et surtout des critères qui comptent quand on la met en production : la vitesse de réponse, l'expressivité de la voix et la maîtrise de l'endroit où tournent les modèles. Retour sur l'entretien, et sur ce qu'il permet de réutiliser pour évaluer un fournisseur vocal.
Que se passe-t-il quand l'intervieweuse est une IA ?
Marlo pose ses questions, reformule, remercie, relance. L'échange est fluide, et c'est précisément le point : chez un fournisseur de voix de synthèse, la fluidité de la conversation est le produit lui-même. Une hésitation de deux secondes avant chaque réponse, une intonation plate, et la démonstration tombe. Gradium prend donc le risque de faire la preuve en direct, ce qui en dit plus long qu'une plaquette.
Pour Gensai, c'est un format d'avenir. Les solutions d'IA vocale conçues par le studio reposent sur le même enchaînement : reconnaissance de la parole (STT, pour speech-to-text), raisonnement par un modèle de langage connecté aux données du client, puis synthèse vocale (TTS, pour text-to-speech).
Pourquoi la voix est-elle devenue centrale dans les projets Gensai ?
À la question « pourquoi l'IA vocale est-elle centrale dans votre expertise ? », Sébastien répond par la demande des clients : « nos clients veulent de plus en plus interagir à la voix avec leurs applications » (propos traduits de l'anglais). Une borne dans un lieu public, un guide de visite, un accueil téléphonique : dans tous ces cas, l'écran et le clavier sont un détour, la parole est le chemin direct.
Deux familles de projets illustrent cette bascule. D'un côté, les dispositifs de médiation et d'accueil, où un personnage répond aux visiteurs à l'oral. De l'autre, les agents téléphoniques qui décrochent, renseignent et prennent des messages pour des cabinets et des petites structures. Deux contextes très différents, une même exigence : que la voix soit naturelle et qu'elle arrive vite.
Comment faire parler une IA sans Wi-Fi ? Le cas de l'aquarium
L'exemple le plus parlant de l'entretien est celui d'un aquarium de Val d'Europe, pour lequel Gensai a conçu une créature marine qui dialogue avec le public sur l'océan. La contrainte était radicale : aucune connexion Internet sur place. Impossible donc d'appeler une API de synthèse vocale (TTS) dans le cloud, même excellente.
La réponse a été Phonon, le modèle de synthèse vocale (TTS) embarqué de Gradium. Environ cent millions de paramètres, une exécution entièrement hors ligne sur un simple processeur, une voix qui reste naturelle. Le dispositif complet, reconnaissance vocale (STT), modèle de langage, base de connaissances et synthèse (TTS), tourne sur un Mac Mini, sans cloud ni abonnement à l'usage. L'histoire de ce projet est racontée dans Comment faire parler les océans avec une IA frugale et dans la réalisation Expérience vocale immersive.
Ce choix de l'embarqué dépasse la contrainte technique. Il règle d'un coup la question de la confidentialité des échanges, celle de la robustesse dans un lieu à forte affluence et celle de la sobriété énergétique. Pour la muséographie et l'événementiel, c'est souvent la bonne architecture, pas une solution de repli.
Qu'est-ce qui rend une voix de synthèse naturelle ? Latence et expressivité
Dans l'entretien, Sébastien lie les deux notions : « ce qui rend la voix expressive et naturelle, c'est la latence ». Le délai entre la fin d'une question et le début de la réponse, qui cumule le temps de transcription (STT), le raisonnement du modèle et le premier son produit par le TTS, est le premier signal que perçoit l'utilisateur. Trop long, il répète sa question ou décroche. Assez court, le dialogue s'installe et les hésitations de la voix deviennent des respirations plutôt que des bugs.
L'expressivité vient ensuite : l'intonation, le rythme, la capacité à lire correctement un numéro de téléphone, un sigle ou une adresse e-mail sans trébucher. C'est sur ces cas difficiles que les modèles se distinguent en production, bien plus que sur une phrase de démonstration.
Gradium annonce pour son dernier modèle TTS un premier son en moins de 50 millisecondes, 47 ms en médiane selon ses propres mesures, et un premier audio en 200 ms environ sur son API temps réel. Ce sont les chiffres du fournisseur. Côté Gensai, la règle est plus simple : la latence se mesure sur le dispositif réel, dans les conditions du client, et elle se règle avec les temps de parole de l'agent.
Pourquoi un partenaire français ?
Le troisième critère cité par Sébastien est la souveraineté. Gradium a été fondée en septembre 2025 à Paris par les chercheurs à l'origine de Kyutai, le laboratoire de recherche ouverte connu pour ses systèmes de parole en temps réel, dont Moshi. Ses fondateurs, Neil Zeghidour, Laurent Mazaré, Olivier Teboul et Alexandre Défossez, ont signé une bonne partie des travaux qui ont façonné l'audio génératif moderne, des codecs audio neuronaux aux modèles de langage audio.
Sept mois après son lancement, en juillet 2026, la société a porté son financement d'amorçage à 100 millions de dollars, avec NVIDIA parmi ses nouveaux investisseurs, et ouvert un bureau dans la baie de San Francisco. Elle propose ses modèles en API, en instances dédiées, en auto-hébergement ou sur site, avec une politique de non-conservation des données. Pour un studio qui promet à ses clients une IA responsable, souveraine et frugale, pouvoir choisir où tournent les voix, jusqu'au 100 % local, est un critère de sélection, pas un argument de communication.
Ce qui ressort de l'entretien, c'est la nature de la relation. Gensai a intégré Phonon alors que le modèle était encore en phase de test, dans un dispositif réel et exigeant, et a échangé avec l'équipe de Gradium sur les cas difficiles. Sébastien le dit à sa manière : la qualité des échanges avec l'équipe et le support, et le fait d'avoir « une société comme celle-là à Paris », font partie de ce qui rend Gradium « cool ».
Pour Gensai, ce partenariat apporte une couche vocale de référence, française, disponible du cloud à l'embarqué, et un accès direct à ceux qui conçoivent les modèles. Pour Gradium, un retour de terrain sur des usages où la voix n'est pas un gadget mais le cœur de l'expérience : une borne qui parle aux familles dans un aquarium, un agent qui répond au téléphone d'un cabinet. L'entretien publié par Gradium en est la trace publique.
Comment évaluer un fournisseur d'IA vocale ?
À la dernière question, « que diriez-vous à quelqu'un qui évalue un modèle vocal ? », Sébastien répond d'abord : essayer. Sa liste, complétée par la pratique des projets Gensai, tient en cinq points.
- Essayer sur ses propres cas, pas sur la démonstration du fournisseur : les textes du métier, les noms propres, les chiffres, les sigles.
- Mesurer la latence de bout en bout, STT, modèle et TTS compris, dans les conditions réelles, au téléphone ou sur la borne, avec le réseau du lieu, et pas seulement sur un poste de développement.
- Écouter l'expressivité sur de vrais dialogues : interruptions, reprises, questions ouvertes, changement de langue.
- Vérifier où tournent les modèles : hébergement en France ou en Europe, instance dédiée, auto-hébergement, et l'existence d'une version embarquée quand le lieu l'exige.
- Tester le support avant de signer : la qualité des réponses de l'équipe sur un cas difficile en dit long sur la suite.
La couche vocale est un choix d'architecture
Il est tentant de considérer la synthèse vocale comme une commodité interchangeable, une ligne dans un devis. L'entretien rappelle le contraire : la voix est ce que l'utilisateur perçoit en premier, et son choix engage la latence, la confidentialité, le coût à l'usage et la capacité à fonctionner sans réseau. Le modèle vocal se choisit donc comme on choisit une base de données ou un hébergeur, avec des critères, des tests et une relation dans la durée avec celui qui le fabrique.
Pour aller plus loin : la page IA vocale détaille les agents vocaux, voicebots, callbots et avatars conçus par Gensai, et l'article Agent vocal IA : comment ça marche décrit les briques techniques en jeu.
