Blanc SIMI 2 - Blanc - SIMI 2 - Science informatique et applications 2012

Analyse d'erreurs avancée pour la reconnaissance de la parole – VERA

Résumé de soumission

La proposition vise à développer des outils de diagnostic, de localisation et de mesures d'erreurs de transcriptions, en s'appuyant sur un consortium d'acteurs académiques de tout premier plan dans ce domaine. L'objectif est d'étudier en détail (au niveau perceptif, acoustico-phonétique, lexical, syntaxique) les erreurs afin d'apporter un diagnostic précis d'éventuels manques des modèles actuels sur certaines classes de phénomènes langagiers.

Au niveau applicatif, la proposition est motivée par un constat : un nombre élevé d'applications dans le domaine de l'accès par le contenu de données multimédia sont rendues possibles par l'utilisation de transcriptions automatiques de l'oral~: sous-titrage d'émissions vidéo, recherche d'extraits précis dans des archives audiovisuelles, comptes-rendus automatisés de réunions, extraction d'information et structuration d'information (Speech Analytics) dans des contenus multimédia (Web, centres d'appel, ...).
Cependant leur déploiement à grande échelle est souvent freiné par le fait que la transcription automatique de l'oral contient des erreurs à un niveau non négligeable.
La recherche et développement en transcription a porté, avec succès jusqu'à présent, sur l'amélioration des méthodes et des modèles mis en oeuvre dans le processus de transcription, mesurée grâce au taux d'erreur de mots ; cependant, passé un certain niveau de performances, le coût marginal induit pour s'attaquer aux erreurs résiduelles augmente ensuite de façon exponentielle.

Des erreurs de transcriptions persistent donc, qui sont plus ou moins gênantes selon les applications. La recherche d'information est tolérante aux erreurs (jusqu'à 30%), mais des erreurs systématiques sur certaines entités nommées peuvent être rédhibitoires. Au contraire, le sous-titrage ou la transcription de réunions ont une très faible tolérance aux erreurs, et même des taux très faibles par rapport à l'état de l'art (inférieurs à 5%), sont d'un ordre de grandeur trop important pour les utilisateurs finaux.

Le traitement des erreurs ne se limite pas à augmenter l'acceptabilité des applications fondées sur la transcription automatique de la parole. La classification, la mesure de l'impact par
des tests perceptifs, le diagnostic des erreurs des systèmes actuels sont la première étape cruciale afin d'identifier les manques des modèles actuels et de préparer les futures générations de systèmes de transcription.

La proposition vise, par une collaboration étroite entre partenaires complémentaires qui excellent dans leur domaine, à mettre en place une infrastructure de détection, de diagnostic, et de mesure qualitative qui permet de créer un cercle vertueux d'amélioration des systèmes de transcription automatique.

Coordination du projet

Yannick Estève (Laboratoire d'Informatique de l'Université du Maine)

L'auteur de ce résumé est le coordinateur du projet, qui est responsable du contenu de ce résumé. L'ANR décline par conséquent toute responsabilité quant à son contenu.

Partenariat

LIMSI Laboratoire d'Informatique pour la Mécanique et les Sciences de l'Ingénieur
LPP Laboratoire de Phonétique et de Phonologie
LNE Laboratoire National de Métrologie et d'Essais
LIUM Laboratoire d'Informatique de l'Université du Maine

Aide de l'ANR 337 556 euros
Début et durée du projet scientifique : - 36 Mois

Liens utiles

Explorez notre base de projets financés

 

 

L’ANR met à disposition ses jeux de données sur les projets, cliquez ici pour en savoir plus.

Inscrivez-vous à notre newsletter
pour recevoir nos actualités
S'inscrire à notre newsletter