Comment choisir un modèle d'IA vocale ? Latence, expressivité, souveraineté : l'entretien de Sébastien Lecocq avec Gradium

Comment choisir un modèle d'IA vocale ? Latence, expressivité, souveraineté : l'entretien de Sébastien Lecocq avec Gradium

Une intelligence artificielle qui interviewe un humain au sujet de l'intelligence artificielle vocale : c'est le format choisi par Gradium pour sa série d'entretiens avec les équipes qui utilisent ses modèles. Le 5 octobre 2026, c'est Sébastien Lecocq, cofondateur de Gensai, qui répond à « Marlo », la voix de synthèse de Gradium. Trois minutes, en anglais.

Ces trois minutes disent beaucoup de l'état de l'IA vocale en 2026, et surtout des critères qui comptent quand on la met en production : la vitesse de réponse, l'expressivité de la voix et la maîtrise de l'endroit où tournent les modèles. Retour sur l'entretien, et sur ce qu'il permet de réutiliser pour évaluer un fournisseur vocal.

L'entretien publié par Gradium le 5 octobre 2026 (en anglais, 3 minutes).

Que se passe-t-il quand l'intervieweuse est une IA ?

Marlo pose ses questions, reformule, remercie, relance. L'échange est fluide, et c'est précisément le point : chez un fournisseur de voix de synthèse, la fluidité de la conversation est le produit lui-même. Une hésitation de deux secondes avant chaque réponse, une intonation plate, et la démonstration tombe. Gradium prend donc le risque de faire la preuve en direct, ce qui en dit plus long qu'une plaquette.

Pour Gensai, c'est un format d'avenir. Les solutions d'IA vocale conçues par le studio reposent sur le même enchaînement : reconnaissance de la parole (STT, pour speech-to-text), raisonnement par un modèle de langage connecté aux données du client, puis synthèse vocale (TTS, pour text-to-speech).

Pourquoi la voix est-elle devenue centrale dans les projets Gensai ?

À la question « pourquoi l'IA vocale est-elle centrale dans votre expertise ? », Sébastien répond par la demande des clients : « nos clients veulent de plus en plus interagir à la voix avec leurs applications » (propos traduits de l'anglais). Une borne dans un lieu public, un guide de visite, un accueil téléphonique : dans tous ces cas, l'écran et le clavier sont un détour, la parole est le chemin direct.

Deux familles de projets illustrent cette bascule. D'un côté, les dispositifs de médiation et d'accueil, où un personnage répond aux visiteurs à l'oral. De l'autre, les agents téléphoniques qui décrochent, renseignent et prennent des messages pour des cabinets et des petites structures. Deux contextes très différents, une même exigence : que la voix soit naturelle et qu'elle arrive vite.

Comment faire parler une IA sans Wi-Fi ? Le cas de l'aquarium

L'exemple le plus parlant de l'entretien est celui d'un aquarium de Val d'Europe, pour lequel Gensai a conçu une créature marine qui dialogue avec le public sur l'océan. La contrainte était radicale : aucune connexion Internet sur place. Impossible donc d'appeler une API de synthèse vocale (TTS) dans le cloud, même excellente.

La réponse a été Phonon, le modèle de synthèse vocale (TTS) embarqué de Gradium. Environ cent millions de paramètres, une exécution entièrement hors ligne sur un simple processeur, une voix qui reste naturelle. Le dispositif complet, reconnaissance vocale (STT), modèle de langage, base de connaissances et synthèse (TTS), tourne sur un Mac Mini, sans cloud ni abonnement à l'usage. L'histoire de ce projet est racontée dans Comment faire parler les océans avec une IA frugale et dans la réalisation Expérience vocale immersive.

Ce choix de l'embarqué dépasse la contrainte technique. Il règle d'un coup la question de la confidentialité des échanges, celle de la robustesse dans un lieu à forte affluence et celle de la sobriété énergétique. Pour la muséographie et l'événementiel, c'est souvent la bonne architecture, pas une solution de repli.

Qu'est-ce qui rend une voix de synthèse naturelle ? Latence et expressivité

Dans l'entretien, Sébastien lie les deux notions : « ce qui rend la voix expressive et naturelle, c'est la latence ». Le délai entre la fin d'une question et le début de la réponse, qui cumule le temps de transcription (STT), le raisonnement du modèle et le premier son produit par le TTS, est le premier signal que perçoit l'utilisateur. Trop long, il répète sa question ou décroche. Assez court, le dialogue s'installe et les hésitations de la voix deviennent des respirations plutôt que des bugs.

L'expressivité vient ensuite : l'intonation, le rythme, la capacité à lire correctement un numéro de téléphone, un sigle ou une adresse e-mail sans trébucher. C'est sur ces cas difficiles que les modèles se distinguent en production, bien plus que sur une phrase de démonstration.

Gradium annonce pour son dernier modèle TTS un premier son en moins de 50 millisecondes, 47 ms en médiane selon ses propres mesures, et un premier audio en 200 ms environ sur son API temps réel. Ce sont les chiffres du fournisseur. Côté Gensai, la règle est plus simple : la latence se mesure sur le dispositif réel, dans les conditions du client, et elle se règle avec les temps de parole de l'agent.

Pourquoi un partenaire français ?

Le troisième critère cité par Sébastien est la souveraineté. Gradium a été fondée en septembre 2025 à Paris par les chercheurs à l'origine de Kyutai, le laboratoire de recherche ouverte connu pour ses systèmes de parole en temps réel, dont Moshi. Ses fondateurs, Neil Zeghidour, Laurent Mazaré, Olivier Teboul et Alexandre Défossez, ont signé une bonne partie des travaux qui ont façonné l'audio génératif moderne, des codecs audio neuronaux aux modèles de langage audio.

Sept mois après son lancement, en juillet 2026, la société a porté son financement d'amorçage à 100 millions de dollars, avec NVIDIA parmi ses nouveaux investisseurs, et ouvert un bureau dans la baie de San Francisco. Elle propose ses modèles en API, en instances dédiées, en auto-hébergement ou sur site, avec une politique de non-conservation des données. Pour un studio qui promet à ses clients une IA responsable, souveraine et frugale, pouvoir choisir où tournent les voix, jusqu'au 100 % local, est un critère de sélection, pas un argument de communication.

Ce qui ressort de l'entretien, c'est la nature de la relation. Gensai a intégré Phonon alors que le modèle était encore en phase de test, dans un dispositif réel et exigeant, et a échangé avec l'équipe de Gradium sur les cas difficiles. Sébastien le dit à sa manière : la qualité des échanges avec l'équipe et le support, et le fait d'avoir « une société comme celle-là à Paris », font partie de ce qui rend Gradium « cool ».

Pour Gensai, ce partenariat apporte une couche vocale de référence, française, disponible du cloud à l'embarqué, et un accès direct à ceux qui conçoivent les modèles. Pour Gradium, un retour de terrain sur des usages où la voix n'est pas un gadget mais le cœur de l'expérience : une borne qui parle aux familles dans un aquarium, un agent qui répond au téléphone d'un cabinet. L'entretien publié par Gradium en est la trace publique.

Comment évaluer un fournisseur d'IA vocale ?

À la dernière question, « que diriez-vous à quelqu'un qui évalue un modèle vocal ? », Sébastien répond d'abord : essayer. Sa liste, complétée par la pratique des projets Gensai, tient en cinq points.

  • Essayer sur ses propres cas, pas sur la démonstration du fournisseur : les textes du métier, les noms propres, les chiffres, les sigles.
  • Mesurer la latence de bout en bout, STT, modèle et TTS compris, dans les conditions réelles, au téléphone ou sur la borne, avec le réseau du lieu, et pas seulement sur un poste de développement.
  • Écouter l'expressivité sur de vrais dialogues : interruptions, reprises, questions ouvertes, changement de langue.
  • Vérifier où tournent les modèles : hébergement en France ou en Europe, instance dédiée, auto-hébergement, et l'existence d'une version embarquée quand le lieu l'exige.
  • Tester le support avant de signer : la qualité des réponses de l'équipe sur un cas difficile en dit long sur la suite.

La couche vocale est un choix d'architecture

Il est tentant de considérer la synthèse vocale comme une commodité interchangeable, une ligne dans un devis. L'entretien rappelle le contraire : la voix est ce que l'utilisateur perçoit en premier, et son choix engage la latence, la confidentialité, le coût à l'usage et la capacité à fonctionner sans réseau. Le modèle vocal se choisit donc comme on choisit une base de données ou un hébergeur, avec des critères, des tests et une relation dans la durée avec celui qui le fabrique.

Pour aller plus loin : la page IA vocale détaille les agents vocaux, voicebots, callbots et avatars conçus par Gensai, et l'article Agent vocal IA : comment ça marche décrit les briques techniques en jeu.

Questions fréquentes

Qu'est-ce qu'un modèle vocal embarqué (on-device) ?

Un modèle de synthèse (TTS) ou de reconnaissance vocale (STT) qui s'exécute directement sur l'appareil, ordinateur, borne, tablette ou téléphone, sans appeler un serveur distant. Il fonctionne sans connexion Internet, ne fait sortir aucune donnée du dispositif et ne coûte rien à l'usage. Phonon, le modèle embarqué de Gradium, tient en une centaine de millions de paramètres et tourne sur un simple processeur.

Que signifient STT et TTS ?

STT (speech-to-text) désigne la reconnaissance vocale : la parole est transcrite en texte pour que le modèle de langage puisse la traiter. TTS (text-to-speech) désigne la synthèse vocale : la réponse écrite est transformée en voix. Un agent vocal enchaîne STT, raisonnement et TTS, et la latence perçue est la somme des trois. Gradium fournit les deux briques, en API temps réel ou en version embarquée pour le TTS.

Pourquoi la latence compte-t-elle autant dans un agent vocal ?

Parce que le silence entre la question et la réponse est le premier signal perçu par l'utilisateur. Plus il est court, plus le dialogue paraît naturel, et plus l'expressivité de la voix devient audible. Quand il s'allonge, l'utilisateur répète, parle par-dessus l'agent ou raccroche. La latence se mesure sur le dispositif réel, dans les conditions du lieu, et se règle avec les temps de parole de l'agent.

Qui est Gradium ?

Une société parisienne fondée en septembre 2025 par les chercheurs à l'origine du laboratoire Kyutai. Elle développe des modèles vocaux temps réel (synthèse, reconnaissance, traduction en direct, clonage et conception de voix, modèle embarqué) proposés en API, en instance dédiée, en auto-hébergement ou sur site. En juillet 2026, elle a porté son financement d'amorçage à 100 millions de dollars, avec NVIDIA parmi ses investisseurs.

Une IA vocale peut-elle être entièrement française ?

Oui, sur toute la chaîne : reconnaissance vocale et synthèse avec des modèles conçus en France, modèle de langage ouvert, hébergement chez un acteur français ou exécution en local sur le dispositif. C'est l'architecture retenue par Gensai quand la confidentialité ou le lieu l'exigent, et un critère de choix dès la sélection des fournisseurs.

Un projet IA en tête ?

Chatbot, agent IA, moteur de réponses ou premier quick win : Gensai étudie chaque besoin et propose une réponse adaptée.

Services associés : IA vocale

55 boulevard de Strasbourg, 75010 Paris
Informations utilisées uniquement pour répondre à la demande.