Image de couverture pour Éclairages recherche – Apprendre avec des données biaisées : quels risques et quelles solutions en pratique ?
Image de couverture pour Éclairages recherche – Apprendre avec des données biaisées : quels risques et quelles solutions en pratique ?
Avatar for datacraft
Présenté par
datacraft
Le club des data scientists, chercheurs et ingénieurs en IA
Organisé par

Éclairages recherche – Apprendre avec des données biaisées : quels risques et quelles solutions en pratique ?

Inscription
Bienvenue ! Veuillez choisir le type de billet souhaité :
À propos de l'événement

par Stéphan Clémençon, professeur à Télécom Paris, spécialiste du machine learning et des statistiques.

Que se passe-t-il lorsque les données utilisées pour entraîner un modèle ne ressemblent pas vraiment aux données sur lesquelles il sera ensuite utilisé ?

C’est une situation fréquente en data science : échantillons non représentatifs, données censurées ou tronquées, données issues d’enquêtes, collecte qui évolue dans le temps, populations différemment représentées, ou encore données réparties entre plusieurs sources. Dans tous ces cas, un modèle peut afficher de bonnes performances pendant son développement tout en se comportant très différemment une fois déployé. Le problème est particulièrement visible dans des applications telles que la reconnaissance faciale ou les outils d’aide au diagnostic médical.

Lors de cette intervention, Stéphan Clémençon présentera, à partir de ses travaux de recherche et d’exemples concrets, les principaux types de biais qui peuvent affecter l’apprentissage statistique et les approches permettant d’y répondre.

Nous aborderons notamment les situations suivantes :

  • Entraîner un modèle sur un échantillon biaisé : comment adapter l’apprentissage lorsque la distribution des données d’entraînement diffère de celle rencontrée en production ?

  • Travailler avec des données censurées, tronquées ou issues d’échantillonnages complexes : quelles informations supplémentaires sont nécessaires pour corriger le biais lié au processus de collecte ?

  • Évaluer des performances très différentes selon les sous-populations : comment distinguer un problème de représentativité des données d’une difficulté intrinsèque du problème prédictif, et quels compromis entre équité et précision faut-il envisager ?

  • Gérer des biais qui apparaissent dans le temps : comment raisonner lorsque le mécanisme de sélection évolue de manière séquentielle ?

  • Apprendre à partir de données distribuées sur un réseau : quels problèmes spécifiques apparaissent lorsque les observations ne sont pas réparties uniformément entre différentes sources ?

  • S’intéresser aux événements rares et aux extrêmes : comment adapter l’apprentissage lorsque ce sont les queues de distribution et les risques rares qui comptent le plus ?

Un atelier pour mieux comprendre les limites des pipelines d’apprentissage classiques et identifier les méthodes adaptées lorsque les données disponibles ne constituent pas un échantillon idéal du monde réel.

Lieu
3 Rue Rossini
75009 Paris, France
3 rue Rossini, 75009 Paris
Avatar for datacraft
Présenté par
datacraft
Le club des data scientists, chercheurs et ingénieurs en IA
Organisé par