Thèse de Mathilde Marcy


Sujet :
Les clés artificielles, bénédiction et malédiction pour la qualité des données : Application à la science des données dans le secteur du transport sous température dirigée

Date de début : 01/11/2022
Date de fin (estimée) : 01/11/2025

Encadrant : Jean-Marc Petit
Co-encadrant : Jocelyn Bonjour, Vasile-Marian Scuturici

Résumé :

L'intégration de la science des données dans les processus métiers du transport sous température dirigée représente une opportunité considérable pour le secteur d'améliorer sa performance et réduire son empreinte environnementale. Ce potentiel reste toutefois largement inexploité : le déploiement de la science des données au sein des entreprises du secteur se heurte à de nombreux obstacles, dont les problèmes de qualité des données qui empêchent toute valorisation sans un investissement préalable pour les résoudre. Parmi eux, l'unicité artificielle, une forme de redondance dissimulée par les clés artificielles et les clés étrangères artificielles qui leur sont associées, s'avère particulièrement pénalisante.

 

Puisqu'à notre connaissance le problème de l'unicité artificielle n'avait encore jamais été étudié par la communauté de recherche en bases de données, nous commençons par le définir formellement. De plus, les techniques conventionnelles de détection et de correction de doublons ne permettant pas d'y remédier efficacement, nous proposons une nouvelle approche pour détecter et supprimer l'unicité artificielle au sein des bases de données relationnelles. Sa nouveauté réside dans l'exploitation d'éléments généralement écartés des méthodes existantes : les clés artificielles, les clés étrangères artificielles qui leur sont associées, et le schéma de la base de données. Concrètement, la méthode parcourt l'ensemble des relations situées le long du chemin de jointure formé par ces clés, en suivant un ordre spécifique et une séquence d'étapes prédéfinies pour chaque relation. En plus d'offrir de meilleurs résultats que les approches conventionnelles de détection de doublons, grâce, entre autres, à un partitionnement des tuples (« blocking ») amélioré par l'utilisation d'attributs préalablement nettoyés, notre approche supprime l'unicité artificielle sur l'ensemble de la base de données étudiée, ou un sous-ensemble pertinent de celle-ci, en une seule opération, permettant de réutliser ses résultats dans plusieurs projets analytiques, plutôt que d’exécuter une détection de doublons pour chacun d’eux.

 

Comme la plupart des techniques d'évaluation de la qualité des données existantes, la nôtre suppose de disposer des listes de clés artificielles et naturelles, qui ne sont pas toujours disponibles. Puisque les techniques de découverte automatique peinent à les identifier, leurs résultats étant biaisés par l'unicité artificielle, nous proposons une méthode d'élicitation des clés impliquant des experts du domaine, fondée sur des abstractions simples et facilement visualisables : le profil de redondance de chaque relation, calculable en temps quasi-linéaire.

 

Ancrée dans un contexte industriel, cette recherche vise à faciliter l'adoption de la science des données par les organisations du secteur du transport sous température dirigée. C'est dans cette optique que nous avons développé RED2Hunt, un « framework human-in-the-loop » couvrant l'ensemble du processus de nettoyage des bases de données opérationnelles. Il combine la méthode d'élicitation des clés et l'approche de détection et de suppression de l'unicité artificielle proposées dans cette thèse, ainsi que plusieurs techniques conventionnelles de fusion et de correction de données. RED2Hunt a été développé sous forme de librairie Python fonctionnant avec PostgreSQL.

 

Aucune base de données publique ne présentant d'unicité artificielle, et les bases industrielles concernées ne pouvant être divulguées pour des raisons de confidentialité, nous avons développé SODGAUP, un logiciel de génération et de pollution de bases de données synthétiques reproduisant les caractéristiques structurelles et de pollution couramment observées dans les bases de données opérationnelles, y compris l'unicité artificielle. La base de données FrigoTruck, utilisée pour l'ensemble des expérimentations présentées dans cette thèse, a été générée avec SODGAUP.