• La Tribune
  • La Tribune Dimanche
  • La Tribune Afrique
  • Air&Cosmos
  • |
  • Événements
  • L'instant Sélection
Une du journal La Tribune

Dernière édition

Flèche menu déroulant
Newsletters
Logo La Tribune
  • Économie
  • Finance
  • Tech & IA
  • Énergie & industrie
  • Transports
  • Défense & aérospatiale
  • Climat
Logo La Tribune
  • Économie
  • Finance
  • Tech & IA
  • Énergie & industrie
  • Transports
  • Défense & aérospatiale
  • Climat

Sélectionnez votre région

Logo La Tribune

RECHERCHER

Loupe

LTD
La Tribune Dimanche
Ouvrir dans une nouvelle fenêtre
Air&Cosmos icon
Air&Cosmos
Ouvrir dans une nouvelle fenêtre

À la une
  • Finances publiques
  • Fiscalité
  • Immobilier
  • Consommation
  • Distribution
  • Politique internationale
  • Finances personnelles
  • Banque & assurances
  • Marchés financiers
  • Intelligence artificielle
  • High tech
  • Télécoms
  • Start-up
  • Énergie
  • Politique industrielle
  • Chimie & pharmacie
  • Automobile
  • Mobilités
  • Aéronautique
  • Défense
  • Spatial
  • Environnement
  • Agriculture & agroalimentaire
Idées & débats
Kiosque numériqueNewsletters
La Tribune DimancheLa Tribune AfriqueAir&Cosmos
  • La Tribune Now
  • Votre argent avec Finance Héros
  • Construire les mobilités de demain
  • Fonction Finance 2.0 avec Cegid
  • Transformations durables avec Forvis Mazars
  • Accélérer avec le Cloud par AWS
  • Fisher Investments
  • Au coeur du business
  • VisionAir avec Bpifrance
  • Adaptabilité permanente : Le pouvoir d’agir avec IBM Consulting
  • Succès d'entreprises avec Deloitte
  • L'Œil sur vos Finances
  • Les Rencontres de Roissy Meaux Aéropôle
  • France Travail accompagne le Salon des Maires
  • La CCI Paris Ile-de-France, le réflexe des entrepreneurs
  • #La Tribune Business Interviews
  • #La Tribune Business Dossiers
  • #La Tribune Business TV
  • Instant Sélection
Événements
Technos & MediasInformatique

Accessibilité : comment Google contourne les limites de la reconnaissance vocale

François Manens

Publié le 16 août 2019 à 12:17 - Mis à jour le 23 août 2019 à 14:02

Avec le projet Euphonia, Google veut rendre ses systèmes de reconnaissance vocale accessibles au plus grand nombre.

Avec le projet Euphonia, Google veut rendre ses systèmes de reconnaissance vocale accessibles au plus grand nombre.

Arnd Wiegmann

Le Quotidien Numérique

21 juillet 2026

Photo d'illustration de l'article
LireS'abonner

Les plus lus

  • 1

    Olivier Guérin, professeur de médecine en gériatrie : « Notre mode de vie pèse davantage que notre génétique sur notre espérance de vie »

  • 2

    Petites lignes : Ferromobile teste sa navette autonome près de Bordeaux pour la mettre sur les rails dès 2028

  • 3

    Laurent Delahousse, journaliste : « Mes vacances sont un mélange d’improvisation et d’organisation »

  • 4

    « On se demande ce que ça va être au mois de septembre ou octobre » : les Vendéens tentent de faire face à une « sécheresse extrême »

  • 5

    Au-delà de la vente d’énergie, Alger veut faire de Berlin un tremplin industriel

  • 6

    Fibre Excellence : l'offre de Matthieu Pigasse jugée « crédible » par un rapport d'expertise

Régions

  • Auvergne-Rhône-Alpes
  • Bourgogne-Franche-Comté
  • Bretagne
  • Centre-Val de Loire
  • Corse
  • Grand Est
  • Hauts-de-France
  • Île-de-France
  • Normandie
  • Nouvelle-Aquitaine
  • Occitanie
  • Pays de la Loire
  • Provence-Alpes-Côte d'Azur

La Tribune +

  • Espace abonné
  • Kiosque numérique
  • Annonces légales
  • Déposer vos annonces légales

Services

  • Supplément
  • La Tribune now

Evénements

  • ACT50
  • Aéroforum
  • AIM
  • Bordeaux Solar Summit
  • Family & Business Forum
  • Forum Europe Afrique
  • Impacts Santé
  • Les Lauréates
  • Paris Air Forum
  • Sommet Aéronautique & Spatial de Bordeaux
  • Sommet Économique de la Corse
  • Tech For Future
  • World News Media Congress
  • Tous nos événements en régions

Pour gérer vos consentements,

Suivez-nous sur les réseaux sociaux

YouTube
LinkedIn
Facebook
Instagram
X

Application mobile

App Store
Google Play

  • Nous Contacter
  • Charte d'indépendance et de déontologie
  • Mentions Légales
  • CGU
  • CGU Pro
  • Gestion des cookies
  • Exercez vos droits
  • Politique de confidentialité

Droits de reproduction et de diffusion réservés @LaTribune

Partenaire digital de confiance - Certification de qualité
  • La Tribune
  • La Tribune Dimanche
  • La Tribune Afrique
  • Air&Cosmos
  • |
  • Événements
  • L'instant Sélection
Google icon
Ajouter La Tribune à vos sources préféréesAjouter La Tribune à vos sources préférées
Google a l'une des technologies de reconnaissance vocale les plus performante du marché. Mais malgré ce statut, elle peine à retranscrire correctement les paroles de personnes dont l'élocution sort de la norme. Le géant de la tech a donc monté un projet, Euphonia, pour résoudre cet écueil, et rendre sa technologie accessible au plus grand nombre.

Demandez "quel temps fait-il ?" à Google Assistant, il vous donnera la météo. Mais cette commande ne fonctionne pas pour tout le monde. Dans certains cas, l'intelligence artificielle de l'assistant ne comprend pas la façon de parler de l'utilisateur. Pour fonctionner correctement, les IA nécessitent de grandes masses de données, mais incorporent les biais de ces données. Dans le domaine de la reconnaissance vocale, les IA sont entraînées à partir d'enregistrements de voix, qui correspondent à une norme, représentative de la majorité. En conséquence, les IA ne sont pas préparées à transcrire les propos de personnes ayant de forts accents ou certaines difficultés d'élocutions (liées, par exemple, à des maladies ou des handicaps). Pour ces personnes, certains outils comme les assistants vocaux (Google Assistant, Alexa, Siri ...) sont donc inutilisables, car ils réalisent trop d'erreurs.

Conscient du problème, Google, comme d'autres entreprises Tech, a lancé plusieurs programmes de recherche dédiés à l'accessibilité de la reconnaissance vocale. L'un d'entre eux, le projet Euphonia, va présenter ses premières recherches à l'occasion de la conférence Interspeech en septembre. Dans un billet de blog, deux chercheurs du projet, Joel Shor et Dotan Emanuel, expliquent les méthodes qu'ils ont utilisées pour permettre à leur système de reconnaissance vocale de faire moins d'erreurs. S'il ne s'agit, d'après les propos des auteurs, que de la "pointe de l'iceberg", ce sont des premières pistes vers des technologies de reconnaissance vocale plus inclusives.

"L'utilité d'une technologie dépend de son accessibilité", écrivent-ils.

Contourner le manque de données

Le principal problème auquel se confrontent les chercheurs de Google est le manque de données. Plus le système de reconnaissance vocale aura d'exemples différents, et donc de récurrences, plus il sera performant. Or, il existe très peu de bases d'enregistrements de personnes avec des élocutions atypiques. D'autre part, même entre personnes confrontées à des troubles de l'élocution similaires, les variations dans la façon de parler peuvent être très importantes. Il devient donc difficile, voire quasi impossible, d'obtenir un important volume de données : les personnes concernées sont relativement peu nombreuses dans chaque cas, et peuvent éprouver de la fatigue à parler pendant de longues durées.

Pour contourner ce manque de données, les chercheurs de Google travaillent en deux temps sur leur système de reconnaissance automatique de la parole ("automated speech recognition" ou ASR, en anglais). D'abord, ils entraînent des réseaux neuronaux, dont la performance a été prouvée, sur des milliers heures d'enregistrement de paroles avec une élocution standard, faciles à trouver, voire à construire. Puis, dans un second temps, ils ajustent leur modèle d'intelligence artificielle avec des enregistrements d'une personne ou d'un sous-groupe à l'élocution atypique.

Dans le cadre du projet Euphonia, Google a choisi de s'intéresser aux personnes atteintes de sclérose latérale amyotrophique (SLA). Cette maladie neurodégénérative affecte le contrôle des muscles, notamment ceux du visage. Un des premiers symptômes peut être la déformation de l'élocution, qui s'aggrave avec l'évolution de la maladie. Grâce à un partenariat avec un institut du MIT spécialisé dans la recherche sur la SLA, Google a pu collecter des données spécifiques à ce groupe. Il a ainsi récupéré 36 heures d'enregistrements, énoncées par 67 personnes atteintes de la maladie. La taille de cet échantillon est rare, car difficile à compiler, mais également bien trop insuffisante pour entraîner une IA performante seule. Cependant, cette base suffit aux chercheurs de Google pour adapter leur système de reconnaissance vocale à des personnes atteintes de SLA, grâce leur méthode en deux temps. Leur IA s'est d'abord entrainée sur une base de milliers d'heures d'enregistrements standards, puis sur la base de 36 heures d'enregistrements de personnes atteintes de SLA.

Newsletter

Tech & IA

Chaque jour à 13h, l’essentiel de l’actualité tech.

Illustration de la newsletter Tech & IA

Des résultats encourageants, mais loin d'être suffisants

Les chercheurs ont testé deux architectures de réseaux de neurones différentes pour appliquer leur méthode. Dans les deux cas, ils obtiennent des taux d'erreurs dans la transcription des paroles biens inférieurs avec leur méthode d'ajustement que sans (voir tableau ci-dessous).

Project Euphoria
Photo d'illustration (Crédits : Google AI)

Pour les personnes avec les plus grandes difficultés d'élocution, un des modèles, RNN-T, parvient à n'avoir que 20,9% d'erreurs dans la transcription des mots contre 59,7% sans l'ajustement. Ce taux d'erreur descend à 10,8% pour les personnes dont l'élocution est moins affectée, contre 33,1% sans l'ajustement. Ainsi, leur méthode double presque les performances du système de reconnaissance vocale.

Ces premiers résultats s'avèrent encourageants, et améliorent grandement l'état de l'art. Mais ils ne sont qu'un premier pas, car ils présentent plusieurs limites. D'abord, ces tests ont été effectués sur un vocabulaire simple et limité, et étendre ces résultats à un langage plus général demandera d'autres ressources.

"Les modèles que nous avons entrainés ont été testés sur un vocabulaire et une complexité linguistique relativement limités. Les indicateurs de performance obtenus ne signifient pas nécessairement que le modèle fonctionnera aussi bien sur des tâches plus générales" nuancent les chercheurs dans leur billet de blog.

Ensuite, les taux d'erreurs dans la transcription des paroles en texte, supérieurs à 10% voire à 20%, restent trop élevés pour que la technologie soit utilisable de façon fluide. À titre de comparaison, pour l'anglais classique, Google Assistant a aujourd'hui un taux d'erreur dans la retranscription des paroles inférieur à 5%.

Enfin, Google ne teste sa solution que sur le cas de personnes atteintes de SLA, et ne fait que supposer que la méthode sera applicable à d'autres types d'élocutions "non-standards". Mais l'équipe de recherche a tout de même effectué un premier essai hors de ce cas particulier. Ils ont essayé d'ajuster leur modèle de reconnaissance vocale avec des enregistrements de personnes avec de forts accents. La base de données utilisée, baptisée L2 Artic, contient une heure d'enregistrement de 20 personnes différentes, dont l'anglais n'est pas la langue maternelle. Le modèle testé par Google ne réalisait plus que 8,5% d'erreurs dans la retranscription à l'écrit des paroles, contre 13,3% sans l'ajustement.

À lire également

  • Les biais de l'intelligence artificielle en question
  • Comment Montréal est devenu un « hub » mondial de l'intelligence artificielle
  • La startup de la semaine : AZmed, l'intelligence artificielle qui repère les fractures pour les radiologues
  • L'intelligence artificielle, accélérateur de « fake news »

Le projet Euphonia n'en est donc qu'à ses débuts. Les chercheurs vont tester d'autres hypothèses, et cherchent à collecter plus de données pour améliorer leur système. Mais grâce à ce type d'initiative, à terme, les technologies de la maison connectée pourraient ainsi devenir accessibles à toutes et tous.

François Manens

Sur le même sujet

L'hélium a été classé en juin par Lip-Bu Tan, patron d'Intel, comme l'un des trois goulets d'étranglement majeurs de la production de puces pour l'IA, aux côtés de l'énergie et de la mémoire.

Tensions sur l'hélium : pourquoi la décision de Pékin menace l'industrie et la santé en Europe

L'hélium, gaz irremplaçable pour l'IA et l'imagerie médicale, est au cœur d'une crise mondiale. La suspension des exportations chinoises, sur fond de tensions géopolitiques, révèle la fragilité des chaînes d'approvisionnement et l'urgence pour l'Europe de trouver des alternatives.

Intelligence Artificielle
Olivier Dellenbach, le fondateur de Chapsvision.

« Trump est devenu la face visible d’une relation avec les États-Unis qui a toujours existé » (Olivier Dellenbach, Chapsvision)

ENTRETIEN. Le fondateur de Chapsvision, dont la plateforme d'analyse de données vient d’être retenue par la Sécurité intérieure française, nous partage sa vision de la souveraineté et répond à nos interrogations sur les limites éthiques de ce type d’outils.

Premium
Intelligence Artificielle
Nubia a présenté le NaviX Ultra, équipé de Doubao, l'assistant conversationnel développé par ByteDance, maison mère de TikTok.

Les smartphones à agents IA ouvrent un nouveau front dans la bataille des plateformes

Les fabricants chinois multiplient les smartphones capables d'exécuter des tâches à la place de leurs utilisateurs grâce à des agents d'intelligence artificielle. Une évolution qui pourrait bouleverser l'économie des applications, au point de pousser plusieurs géants du numérique à verrouiller l'accès à leurs services.

Tech & IA
L’IA agentique, qui promet d'automatiser un certain nombre d'usages en ligne dont le shopping, inquiète l'Autorité de la concurrence

« Cet avis est un signal d’alarme » : l'inquiétude de l'Autorité de la concurrence sur les agents IA

Dans un avis présenté comme un « signal d’alarme », l’Autorité française estime que le développement des agents IA, fortement concentrés autour de trois acteurs (OpenAI, Anthropic et Google), ouvre la voie au remplacement ou à la disparition d’acteurs de l'économie numérique.

Premium
Intelligence Artificielle
Yang Zhilin, fondateur de Moonshot AI, lors d'une conférence du forum Zhongguancun 2026, à Pékin.

DeepSeek casse les prix, Moonshot veut tout intégrer : comment l’IA chinoise attaque les modèles américains

DeepSeek a fait irruption avec un modèle open source jusqu’à 85 % moins cher que GPT5.5, pendant que Moonshot AI aligne ses modèles Kimi et K2 pour rivaliser avec ChatGPT et Claude sur le code et le raisonnement. Derrière ce duo de “tigres” de l’IA, Pékin teste une stratégie diplomatique : casser les prix, séduire les entreprises occidentales et proposer au Sud global des alternatives complètes aux services américains.

Premium
Intelligence Artificielle
Alibaba s'est imposé dans l'IA avec sa famille de modèles open source Qwen.

Alibaba, ByteDance, Meituan... Une myriade d'acteurs chinois à la conquête de l'IA

Malgré les restrictions américaines sur les semi-conducteurs, la Chine accélère dans l'intelligence artificielle en s'appuyant sur une nouvelle vague de champions capables de rivaliser avec les géants de la Silicon Valley.

Tech & IA
Au-delà de la bataille industrielle, la Chine cherche également à s'imposer comme un acteur central de la régulation mondiale de l'intelligence artificielle.

Pékin contre Washington : la guerre de l'IA change d'échelle

Le président chinois Xi Jinping a accusé les États-Unis de vouloir monopoliser l'intelligence artificielle et appelé à un nouvel ordre mondial de l'IA, au moment où Pékin accélère sa course pour rattraper son rival technologique.

Tech & IA
Photo d'illustration de l'article

Bouygues Telecom se met en état de marche avant d’absorber SFR

Une réorganisation de l’opérateur est prévue ce mois de septembre. Initiée avant l’accord avec Altice France, elle devrait cependant permettre d’intégrer plus efficacement les actifs de SFR Business si la vente se confirme.

Premium
Télécoms