Thèse de Gwendal Bernardi


Sujet :
Fusion des modalités et des angles de vue avec des méthodes d’apprentissage profond pour l’inspection des défauts verriers.

Date de début : 01/09/2023
Date de fin (estimée) : 01/09/2026

Encadrant : Emmanuel Dellandréa
Co-encadrant : Mohsen Ardabilian

Résumé :

Cette thèse s’inscrit dans le contexte de l’inspection automatique des défauts dans l’industrie verrière, un environnement particulièrement contraignant caractérisé par des cadences de production élevées, des propriétés optiques complexes du matériau et une grande variabilité des défauts. En raison de la transparence, de la réflectivité et des effets de réfraction du verre, certains défauts ne sont visibles que sous des conditions d’éclairage ou des angles de vue spécifiques. Les systèmes modernes d’inspection reposent ainsi sur des configurations multi-vues et multi-modales, générant des données hétérogènes difficiles à exploiter efficacement avec les approches classiques. \\
L’objectif principal de cette thèse est d’étudier comment la fusion d’images multi-modales et multi-vues basée sur l’apprentissage profond peut améliorer la fiabilité, la robustesse et l’interprétabilité des systèmes d’inspection automatique, tout en respectant les contraintes industrielles telles que le temps réel et l’incomplétude des données.
Dans un premier temps, un état de l’art approfondi des méthodes de fusion d’images est proposé, accompagné d’une nouvelle taxonomie permettant d’unifier les paradigmes supervisés, non supervisés et orientés tâche. Cette classification introduit également la distinction entre méthodes mono-catégorie et multi-catégorie, mettant en évidence les limites des approches existantes et la nécessité de modèles génériques capables de traiter simultanément plusieurs modalités et points de vue. La contribution principale de cette thèse est l’introduction de EDIF (End-to-End Detection-Driven Image Fusion), une méthode de fusion orientée détection pour les données multi-vues et multi-modales. EDIF s’appuie sur des réseaux de neurones à attention sur graphe afin de modéliser les relations entre des points caractéristiques extraits de différentes images. Cette approche permet de raisonner explicitement sur les correspondances inter-vues et inter-modales, et d’unifier dans une même architecture l’extraction de caractéristiques, leur mise en correspondance et la détection des défauts. Une stratégie d’apprentissage en plusieurs étapes est proposée afin d’optimiser conjointement la correspondance, la localisation et la classification. Afin de valider ces approches, un nouveau jeu de données industriel, MMDOD, est développé. Il regroupe plusieurs milliers d’images annotées acquises selon différentes modalités et angles de vue, constituant un benchmark réaliste pour l’évaluation de méthodes de détection en conditions industrielles. Une seconde contribution consiste en un modèle de complétion de points clés basé sur des graphes, permettant de traiter les cas de données manquantes, fréquents dans les contextes industriels. En exploitant des contraintes de cohérence multi-vues et multi-modales via des mécanismes de propagation dans le graphe, cette méthode permet de maintenir des performances élevées même en présence d’informations partielles.Enfin, une architecture compacte basée sur les modèles à états d’espace de type Mamba est proposée pour la détection de marques d’usure de surface sur des contenants en verre réutilisables. Ces défauts, caractérisés par des patterns d’abrasion progressive induits par les cycles d’utilisation industrielle, présentent une forte dépendance au point de vue et constituent un cas particulièrement difficile à modéliser. Cette approche offre un compromis intéressant entre performance et coût computationnel, la rendant compatible avec les contraintes de production en temps réel. Ce travail montre que les approches de fusion orientées tâche et basées sur des graphes permettent d’améliorer significativement la détection de défauts dans des environnements industriels complexes. Il propose à la fois des contributions méthodologiques et des solutions applicatives visant à rapprocher les avancées en fusion d’images de leur déploiement en production.


Jury :
M. Jean-Yves RamelProfesseur(e)Université Savoie Mont BlancRapporteur(e)
Mme Valérie Gouet-BrunetDirecteur(trice) de rechercheIGN-ENSGRapporteur(e)
M. Emmanuel DELLANDREAMaître de conférenceEcole Centrale de LyonDirecteur(trice) de thèse
M. Mohsen ArdabilianProfesseur(e) associé(e)Ecole Centrale de LyonCo-directeur (trice)
Mme Anissa MokraouiProfesseur(e)Université Sorbonne Paris NordExaminateur​(trice)
M. Godefroy BrisebarreDocteurTiamaCo-encadrant(e)
M. Alexandre BenoitProfesseur(e)Polytech Annecy-ChambéryExaminateur​(trice)
M. Sébastien RomanTiamaInvité(e)