Thèse de Alexandre Chapin
Sujet :
Date de début : 01/10/2022
Date de fin (estimée) : 01/10/2025
Encadrant : Liming Chen
Co-encadrant : Emmanuel Dellandréa
Résumé :
Cette thèse étudie le rôle des représentations visuelles dans les capacités d'apprentissage et de généralisation des politiques de manipulation robotique. Alors que les méthodes de l'état de l'art s'appuient généralement sur des caractéristiques globales ou denses extraites de modèles de fondation visuelle à grande échelle, ces représentations mélangent souvent les informations pertinentes avec le bruit issu de l'arrière-plan. Pour pallier cette limite, nous proposons une transition vers les représentations centrées sur l'objet (OCR), une alternative structurée qui décompose les scènes visuelles en « slots » discrets et interactifs. Nos recherches établissent une progression en trois étapes vers une perception robotique généralisable. Premièrement, nous démontrons d'abord les avantages fondamentaux des biais inductifs centrés sur l'objet par rapport aux représentations holistiques dans les scènes multi-objets, en soulignant leur robustesse supérieure face aux couleurs et textures perturbatrices. Deuxièmement, nous introduisons les représentations centrées sur l'objet basées sur des slots en robotique réelle, à travers une comparaison systématique à grande échelle sur des environnements simulés (MetaWorld, LIBERO) et réels. Nous démontrons que le pré-entraînement de ces modèles sur des ensembles de données robotiques établit une base perceptive robuste, surpassant considérablement les caractéristiques conventionnelles. Cependant, nous identifions un compromis critique entre capacité et généralisation lors de l'introduction de nouveaux objets distracteurs, nécessitant un équilibre précis entre le nombre de slots alloués et les performances finales. Pour surmonter ce compromis, nous proposons trois cadres spécifiques. Premièrement, nous présentons STORM, un module léger qui ancre sémantiquement les slots à l'aide d'instructions en langage naturel via une stratégie d'adaptation multi-phases. Deuxièmement, nous introduisons Slot-RAE, un modèle génératif de diffusion centré sur l'objet utilisant des auto-encodeurs de représentation directs. Cette approche permet non seulement de simplifier le processus d'apprentissage en évitant les lourds biais génératifs, mais elle débloque également de véritables capacités compositionnelles directement au sein de l'espace des caractéristiques continues des modèles de fondation visuelle (VFM). Enfin, à titre de travail exploratoire, nous présentons ARMOR, un pipeline conceptuel d'augmentation de données dans l'espace latent qui extrait des tokens invariants aux permutations à partir d'images extérieures et les injecte dynamiquement pour renforcer la robustesse des politiques robotiques face au bruit visuel. Ces travaux posent les bases d'une perception structurée et symbolique dans l'apprentissage robotique, comblant ainsi le fossé entre les entrées visuelles de bas niveau et le raisonnement neuro-symbolique de haut niveau.
Jury :
| M. Marchand Eric | Professeur(e) | Université de Rennes | Président(e) |
| M. Vu Ngoc Son | Professeur(e) | Université de technologie de Troyes | Rapporteur(e) |
| M. Demonceaux Cédric | Professeur(e) | IUT Le Creusot, Université Bourgogne Europe | Rapporteur(e) |
| Mme. Teulière Céline | Professeur(e) | Université Clermont Auvergne | Examinateur(trice) |
| M. Chen Liming | Professeur(e) | Ecole Centrale de Lyon | Directeur(trice) de thèse |
| M. Dellandréa Emmanuel | Maître de conférence | Ecole Centrale de Lyon | Co-encadrant(e) |