Thèse de Timon Deschamps
Sujet :
Date de début : 07/11/2023
Date de fin (estimée) : 07/11/2026
Encadrant : Laetitia Matignon
Co-encadrant : Mathieu Guillermin, Rémy Chaput
Résumé :
À toute issue mène une trajectoire, une série de décisions façonnées par des compromis entre plusieurs objectifs souvent en conflit. L'apprentissage par renforcement multi-objectif (MORL) constitue un formalisme naturel pour modéliser cette prise de décision séquentielle, permettant d'entraîner des agents artificiels autonomes à suivre les préférences de leur utilisateur et à composer avec ces finalités en tension. Cependant, le comportement de ces agents est très sensible à l'objectif qu'ils cherchent à maximiser. Quand cet objectif est mal défini, ou lorsque l'utilisateur et l'agent n'ont pas accès aux mêmes informations, le déploiement de ces agents peut avoir des conséquences imprévues, risquant d'entraîner des compromis indésirables ou des comportements dangereux. Cela soulève les questions de ce que cela signifie, pour un agent, d'être aligné sur son utilisateur, et de la manière de développer de tels agents, questions motivant les trois contributions de cette thèse.
La première traite de ce qui caractérise un agent éthiquement aligné. À travers une revue des domaines du MORL et de l'éthique des machines, nous examinons comment l'apprentissage par renforcement multi-objectif contribue à ce but, et quelles propriétés supplémentaires sont nécessaires. Nous discutons également de la difficulté d'évaluer l'alignement éthique, en l'illustrant via une étude de cas sur un simulateur de réseau électrique intelligent. Les deux contributions suivantes prennent racine dans cette revue, dont elles approfondissent deux points en particulier. Toutes deux se concentrent sur le cas des fonctions d'utilité non linéaires, qui reflètent plus fidèlement les préférences des utilisateurs, mais sont considérablement plus complexes à traiter. La deuxième contribution aborde l'adaptation continue à ce type de préférences lorsqu'elles sont amenées à changer au cours du temps, en formalisant ce cadre et en étendant des métriques existantes pour l'évaluer. Nous traitons ce problème en proposant une méthode exploitant les similarités entre fonctions d'utilité afin de transférer des connaissances entre elles, et la comparons avec des méthodes de référence sur quatre environnements standard de MORL. Les fonctions d'utilité non linéaires sont particulièrement difficiles à optimiser quand chaque résultat compte pour l'utilisateur et que ces résultats ne peuvent pas se compenser entre eux. Les méthodes existantes souffrent généralement d'une forte variance ou nécessitent des représentations dont la taille croît exponentiellement avec le nombre d'objectifs, empêchant leur utilisation lorsque de nombreux objectifs doivent être pris en compte simultanément. La troisième contribution s'attaque à ces limitations, et montre que des représentations plus compactes peuvent être suffisantes pour estimer et optimiser l'utilité de l'utilisateur, arrivant à égaler ou améliorer les résultats de méthodes existantes, tout en se limitant à une croissance quadratique.
Ensemble, ces contributions suggèrent que le MORL est une base adaptée à la création d'agents agissant en accord avec les valeurs et préférences de leur utilisateur, bien qu'il doive être complété par des propriétés supplémentaires pour construire des agents éthiquement alignés. Les agents autonomes tracent des trajectoires pour le compte d'êtres humains, et le feront de plus en plus à mesure que leur adoption s'étend. L'objectif de cette thèse est de contribuer à ce que les choix faits au fil du chemin, et là où ils mènent, soient des choix que leur utilisateur approuverait.
Jury :
| M. Vamplew Peter | Professeur(e) | Federation University Australia | Rapporteur(e) |
| Mme Beynier Aurélie | Professeur(e) | Sorbonne Université | Rapporteur(e) |
| Mme Rădulescu Roxana | Maître de conférence | Utrecht University | Examinateur(trice) |
| M. Vercouter Laurent | Professeur(e) | INSA Rouen Normandie | Examinateur(trice) |
| M. Meyer Alexandre | Professeur(e) | Université Claude Bernard Lyon 1 | Examinateur(trice) |
| Mme Matignon Laetitia | Maître de conférence | Université Claude Bernard Lyon 1 | Directeur(trice) de thèse |
| M. Rémy Chaput | Maître de conférence | CPE Lyon | Co-encadrant(e) |