Thèse de François Wieckowiak


Sujet :
Amélioration de la précision de la reconnaissance des expressions mathématiques imprimées pour la publication de brevets

Date de début : 01/09/2023
Date de fin (estimée) : 01/09/2026

Encadrant : Véronique Eglin
Co-encadrant : Stéphane Bres

Résumé :

Pour permettre la publication des brevets auprès de l’Office européen des brevets, l’entreprise Luminess est chargée de normaliser des demandes de brevet reçues dans des formats très hétérogènes en documents XML et PDF standardisés. Ces documents sont ensuite rendus accessibles à l’ensemble de la communauté scientifique et peuvent être facilement recherchés et retrouvés grâce à une annotation précise et normalisée de leur contenu. Cependant, des erreurs de reconnaissance peuvent altérer ces annotations et empêcher la recherche ou la récupération de documents pertinents.

Cette thèse porte sur l’automatisation de la reconnaissance des expressions mathématiques dans les demandes de brevet. Ces expressions, particulièrement complexes à reconnaître automatiquement, sont actuellement transcrites et vérifiées manuellement à plusieurs reprises afin de satisfaire aux exigences de qualité de l’Office européen des brevets. L’objectif de cette thèse est ainsi de réduire la charge associée à leur transcription et à leur vérification, tout en maintenant un niveau de qualité supérieur ou égal à 99,99 %.

Une première contribution consiste en un protocole d’évaluation multimodale permettant d’analyser les performances des systèmes de reconnaissance optique de caractères selon différentes représentations des expressions mathématiques. Cette évaluation met en évidence les limites des approches existantes sur les documents de brevet et conduit à la création de PatentME-600K, un jeu de données de plus de 600 000 expressions mathématiques extraites de brevets. Sur cette base, MML-Net, une architecture Vision Transformer encodeur-décodeur, est proposée pour la reconnaissance directe des expressions mathématiques en MathML. Le modèle atteint un score de similarité de Levenshtein de 93,7 % et dépasse les performances de l’état de l’art sur cette tâche.

Afin de permettre l’intégration de MML-Net dans une chaîne de production industrielle, plusieurs briques complémentaires sont développées. Un ordonnanceur basé sur un Random Forest et des caractéristiques visuelles sélectionne les expressions pour lesquelles le modèle est susceptible de produire une transcription correcte, afin de réserver l’intervention humaine aux cas les plus complexes. Un vérificateur post-OCR, basé sur une architecture siamoise et entraîné spécifiquement sur les erreurs de MML-Net, détecte ensuite automatiquement les prédictions susceptibles d’être incorrectes et les oriente vers une validation humaine. Enfin, une contribution porte sur l’assistance à la saisie et la réduction des erreurs introduites lors des opérations manuelles. Différentes stratégies d’intégration de ces briques dans la chaîne de production de Luminess sont étudiées afin de combiner reconnaissance automatique et validation humaine, d’augmenter le niveau d’automatisation et de préserver les exigences de qualité du processus industriel.


Jury :
M. Coustaty MickaëlMaître de conférenceUniversité de La RochelleRapporteur(e)
M. Mouchère HaroldProfesseur(e)Université de NantesRapporteur(e)
M. Coüasnon BertrandProfesseur(e)Université de RennesExaminateur​(trice)
Mme Eglin VéroniqueProfesseur(e)INSA LyonDirecteur(trice) de thèse
M. Bonnet TonyLuminessCo-directeur (trice)
Mme Rousseau LaëtitiaDocteurLuminessInvité(e)
M. Bres StéphaneMaître de conférenceINSA LyonInvité(e)