Thèse de Amedeo Pachera


Sujet :
Data Quality and Reasoning in Graph Databases : Human-in-the-Loop, Machine Learning, and Causal Approaches

Date de début : 01/10/2023
Date de fin (estimée) : 01/10/2026

Encadrant : Angela Bonifati
Co-encadrant : Andrea Mauri

Résumé :

Les graphes de propriétés se sont imposés comme le modèle dominant pour les données interconnectées, mais les systèmes construits autour d'eux restent cantonnés à un raisonnement associationnel, sur des données dont la qualité est présupposée. Cette thèse s'attaque à ces deux limites en traitant le nettoyage des données et le raisonnement causal comme deux facettes d'un même problème : rendre les bases de données de graphes suffisamment fiables pour étayer des décisions.

La première partie étudie le nettoyage des graphes de propriétés sous contraintes de déni, dans des contextes où la connaissance nécessaire à la réparation d'une incohérence réside chez les utilisateurs plutôt que dans les contraintes elles-mêmes. Nous introduisons d'abord un modèle de réparation interactive centré sur l'utilisateur, où les violations sont détectées par requête et organisées en un graphe de dépendance des réparations, dont les ensembles indépendants fournissent des affectations sans conflit à plusieurs utilisateurs ; nous en établissons les garanties de sûreté et de convergence et le validons auprès d'utilisateurs réels, non oracles. Nous levons ensuite l'hypothèse d'utilisateurs interchangeables, infaillibles et disponibles sans limite. Un réseau de neurones sur graphes estime la difficulté de chaque violation et résout automatiquement les plus faciles, ces réparations commutant, comme nous le démontrons, avec les réparations humaines ; les autres sont affectées à des utilisateurs hétérogènes, aux compétences, coûts et capacités cognitives distincts. Le problème d'affectation sous budget qui en résulte est NP-difficile ; nous proposons un algorithme fondé sur une relaxation lagrangienne, assorti d'une borne duale en forme close certifiant la qualité des solutions.

La seconde partie passe de la réparation des graphes au raisonnement sur ceux-ci. Nous formalisons la requête « what-if » sur un GNN entraîné, soit l'évaluation d'une requête de graphe sous une mise à jour hypothétique, et y répondons en traitant celle-ci comme une surcouche appliquée à un état du modèle mis en cache, propagée sous forme de correction de rang faible pour les attributs, ou de recalcul borné par la localité pour la topologie. La maintenance est exacte et se compose, de sorte qu'une exploration enchaînée, ramifiée et réversible ne coûte que l'incrément entre deux mises à jour ; le problème inverse, trouver une mise à jour minimale qui renverse une prédiction, est NP-difficile.

Les requêtes interventionnelles sur un modèle appris demeurent toutefois détachées de toute hypothèse causale explicite. Le dernier chapitre rend donc la base de données elle-même consciente de la causalité, en intégrant un modèle causal structurel au sein du graphe de propriétés plutôt qu'à côté de lui. Nous proposons l'hypergraphe orienté acyclique causal, dans lequel des hypersommets associent des sous-graphes de données observationnelles à des variables causales, et où des méta-propriétés portent les équations structurelles et les distributions conditionnelles et interventionnelles. Nous identifions les extensions requises par GQL et SQL/PGQ, à savoir une sémantique fondée sur les chemins, un opérateur EXTRACT pour la dérivation des variables causales et un opérateur DO-CALCULUS, afin d'exprimer de façon déclarative les requêtes de chemins de confusion, de médiation et de collision, les interventions et les contrefactuels. Un prototype sur Neo4j montre que ces requêtes passent à l'échelle selon la taille du DAG causal, tout en restant largement insensibles au volume des données observationnelles.

La thèse défend ainsi l'idée que la connaissance humaine, les modèles appris et la structure causale sont des citoyens de première classe de la gestion de données en graphes, et que les traiter de façon déclarative transforme la base de données en un instrument pour raisonner sur les relations qu'elle stocke.


Jury :
Gianmaria SilvelloProfesseur(e)University of PaudaRapporteur(e)
Evaggelia PitouraProfesseur(e)University of IoanninaRapporteur(e)
Oscar RomeroProfesseur(e)Polytechnic University of CataloniaExaminateur​(trice)
Hamida SebaProfesseur(e)Université Claude Bernard Lyon 1Examinateur​(trice)