CE23 - Intelligence artificielle et science des données 2024

Encourager la diversité dans l'apprentissage avec peu d'exemples annotés – ENDIVE

ENDIVE

ENcouraging DIVErsity in Few-Shot Learning

Apprendre davantage avec moins de données annotées, en misant sur leur diversité

L'apprentissage automatique moderne repose sur des volumes de données considérables, et les lois d'échelle indiquent qu'un modèle s'améliore généralement lorsqu'on lui en fournit davantage. Beaucoup de domaines n'ont pourtant pas accès à cette abondance : en santé, chaque annotation mobilise un praticien, et le budget porte sur le nombre d'exemples étiquetés plutôt que sur la puissance de calcul. Dans ce régime, ce qu'apporte un nouvel exemple ne dépend plus seulement de sa qualité propre, mais de ce qui le distingue de ceux déjà vus. Le projet ENDIVE part de cette observation. Lorsqu'un échantillonnage aléatoire est nécessaire, l'approche par défaut est un tirage i.i.d., où chaque point a une chance indépendante d'être sélectionné ; rien n'empêche alors les points retenus de se concentrer dans les régions denses et de se répéter les uns les autres. Les processus ponctuels déterminantaux (DPP) offrent une alternative : leur matrice de noyau encode à la fois la pertinence des points et leur similarité, ce qui produit une forme diverse d'échantillonnage d'importance, couvrant mieux la distribution et estimant ses statistiques avec une variance plus faible. L'objectif initial du projet était d'étudier les bénéfices de la diversité induite par les DPP pour l'apprentissage avec peu d'exemples annotés (« few-shot learning », FSL). Si les DPP ont été étudiés à divers stades de l'apprentissage profond (diversité des lots, apprentissage actif), très peu de travaux les avaient considérés pour le FSL, et aucun, à notre connaissance, n'avait examiné l'apport de la diversité elle-même dans ce cadre. Le projet poursuit cet objectif sur deux plans complémentaires : la diversité des données, soit le choix des exemples que l'on annote, conserve ou présente au modèle ; et la diversité des représentations, soit le choix des descripteurs, des contextes et des modèles que l'on exploite ou combine. Depuis le dépôt du projet, le FSL a largement cessé d'être un paradigme autonome pour devenir un régime d'adaptation des modèles de fondation. Cette évolution ne change pas les objectifs du projet, mais elle a conduit à les étudier sur ces modèles, et en particulier sur les grands modèles de langue à diffusion discrète, encore relativement peu explorés par les grands acteurs du domaine. L'enjeu final reste identique : rendre l'apprentissage plus économe en données annotées, au bénéfice des domaines qui ne peuvent pas en produire massivement.

Le socle méthodologique du projet est l'échantillonnage aléatoire à garanties de diversité. Un DPP est défini par une matrice de noyau qui exprime les corrélations entre points ; en tirer un sous-ensemble revient à favoriser conjointement des points pertinents et mutuellement dissemblables. Le projet mobilise plusieurs variantes de ces objets : DPP à taille fixe (k-DPP) lorsque le budget d'annotation est imposé, inférence du sous-ensemble le plus probable (MAP) lorsqu'une décision déterministe est requise, et solveurs gloutons rapides lorsque le tirage doit rester compatible avec le passage à l'échelle. L'expertise sur ces modèles est apportée par Nicolas Tremblay (Gipsa-lab, Grenoble) et Rémi Bardenet (CRIStAL, Lille), partenaires du projet.

 

Ces outils sont appliqués à trois endroits distincts de la chaîne d'apprentissage. En amont, pour la curation : sélectionner les exemples d'entraînement ou d'annotation en combinant qualité et diversité, la sélection sur la seule qualité individuelle produisant des sous-ensembles très redondants. À l'inférence : choisir, parmi plusieurs hypothèses produites en parallèle, un ensemble à la fois plausible et varié. Dans l'espace des représentations, enfin : identifier les descripteurs, contextes ou modèles qui apportent une information complémentaire plutôt que redondante.

 

Le choix du noyau est l'élément central de ces trois usages, puisque c'est lui qui encode la notion de diversité recherchée. Une part importante du travail consiste donc à construire des noyaux à partir de quantités internes aux modèles (logits, états cachés) de façon à ce que la procédure reste autonome, sans vérificateur ni modèle auxiliaire externe.

 

Rendre la diversité des représentations mesurable demande des outils supplémentaires, empruntés à la mechanistic interpretability : décodage des états intermédiaires à travers la matrice d'embedding, et décomposition des représentations en descripteurs par autoencodeurs parcimonieux. Ces analyses fournissent les grandeurs sur lesquelles un critère de diversité peut ensuite être défini.

 

Les évaluations s'appuient sur des jeux de données et des tâches publics : génération de texte libre, questions-réponses et raisonnement mathématique pour les modèles de langue ; tâches aval d'électroencéphalographie pour le volet signaux physiologiques. Au-delà de la qualité moyenne, les mesures portent sur la couverture de l'espace des réponses et sur le coût calculatoire, la diversité n'ayant d'intérêt que si elle ne se paie pas en performance.

Le projet a recruté Jonathan Lys en thèse (2024-2027), dont les travaux constituent l'essentiel des résultats obtenus à ce stade.

 

Le résultat le plus directement lié aux objectifs du projet est D5P4, un cadre de décodage pour les modèles de langue à diffusion discrète. Ces modèles raffinent des séquences entières en parallèle au lieu d'étendre un préfixe, ce qui rend malaisée l'application de la recherche en faisceau usuelle et laisse peu de contrôle sur la diversité des hypothèses conservées. D5P4 formule la sélection, à chaque étape de diffusion, comme une inférence MAP sur un DPP partitionné dont le noyau combine le signal de qualité porté par les logits et un signal de diversité calculé sur les états cachés du modèle : la procédure reste ainsi interne au modèle, sans vérificateur externe. La contrainte de partition empêche les hypothèses de converger vers une même trajectoire, et le solveur glouton employé reste compatible avec une inférence distribuée multi-GPU, son surcoût étant plus que compensé par une réduction d'environ 40 % du pic de mémoire. Les expériences, sur génération libre, questions-réponses et raisonnement mathématique, montrent une amélioration nette de la diversité et de la couverture des réponses, à qualité de génération égale ou supérieure aux méthodes de référence. Ce travail est en cours d'évaluation.

 

Deux contributions complémentaires portent sur les représentations des modèles pré-entraînés et ont été acceptées à EUSIPCO 2026. La première propose une manière d'allouer du calcul supplémentaire à l'inférence dans un transformeur gelé, en réappliquant une plage de ses propres blocs ; appliqué naïvement, ce bouclage dégrade la performance, et la contribution est la régularisation qui ramène les activations sur la variété rencontrée en inférence standard. Les gains sont modestes et inégaux selon les modèles, ce qui borne utilement ce que la profondeur seule permet de récupérer. La seconde localise la profondeur à laquelle les états cachés cessent d'encoder le token courant pour encoder celui à prédire, et propose d'atténuer la branche résiduelle à cet endroit ; ce résultat fournit une information dont le volet « représentations » du projet avait besoin, à savoir où lire une représentation dans un réseau.

 

Le doctorant recruté sur le projet a par ailleurs co-signé REVE (NeurIPS 2025), un modèle de fondation pour l'électroencéphalographie pré-entraîné sur 92 jeux de données et environ 25 000 sujets. L'important effort de curation qu'a demandé cet assemblage alimente directement le volet « données » du projet, et pourra servir de base pour l'étude de l'échantillonnage de celles-ci.

Le volet « données » se concentrera sur la curation orientée diversité pour les modèles de langue à diffusion. Les critères de curation existants ont été conçus pour la prédiction du token suivant : ils notent un exemple par ce qu'il enseigne sur la continuation d'un préfixe, alors que l'objectif de débruitage masqué supervise toutes les positions d'une séquence à la fois et à plusieurs niveaux de corruption. La quantité qui rend un exemple informatif n'est donc pas la même, et aucun de ces travaux ne mobilise de DPP : comparer et combiner ces deux lignes de travail est l'étape suivante. Une seconde question, plus exploratoire, porte sur la manière dont la diversité des données d'entraînement façonne le comportement des modèles, leurs trajectoires de décodage comme la diversité des mécanismes internes auxquels elles donnent lieu. Rendre cette seconde notion mesurable fait partie de la question : le recouvrement des descripteurs retrouvés par des autoencodeurs parcimonieux entraînés sur des modèles nourris de régimes de données différents, et leur stabilité d'un entraînement à l'autre, en sont deux approximations possibles.

 

Le volet « représentations » poursuivra trois questions. Quels descripteurs sont pertinents, et un critère de diversité permet-il d'en retenir une couverture plus compacte que la seule importance individuelle ? Comment exploiter la diversité des contextes, l'invite et la recherche documentaire produisant plusieurs représentations d'une même entrée, donc plusieurs interprétations complémentaires plutôt qu'un unique contexte optimal ? La diversité entre modèles de fondation peut-elle servir de critère pour les sélectionner et les combiner, des modèles aux prédictions proches n'apportant que peu d'information supplémentaire ?

 

Sur le plan humain, le projet prévoit le recrutement d'un post-doctorant pour 18 mois à partir du début 2027, ainsi que d'un stagiaire de Master 2 pour 6 mois. Ils travailleront principalement sur les questions de mechanistic interpretability, axe qui apparaît aujourd'hui comme le plus prometteur, et en interaction avec deux autres doctorants de l'équipe travaillant sur les modèles à diffusion.

 

À plus long terme, une direction identifiée relie le projet à la prédiction conforme : sous budget d'annotation, l'ensemble de calibration devient un objet que l'on choisit plutôt que l'on reçoit, et un tirage par k-DPP y dépenserait le budget sur des cas qui se repoussent. Un tel tirage rompt toutefois l'échangeabilité sur laquelle repose la garantie de couverture ; savoir si la validité peut être rétablie en pondérant les scores par la loi d'échantillonnage, comme sous décalage de covariables, est une question ouverte. Les retombées applicatives visées restent celles des domaines où l'annotation est coûteuse, en particulier la santé.

De nombreuses applications nécessitent un échantillonnage aléatoire, où une première approche naturelle consiste à utiliser un échantillonnage i.i.d., supposant que tous les points/données ont une chance indépendante d'être sélectionnés. Cependant, dans de nombreux cas (systèmes de recommandation, résumé automatique...) on souhaite échantillonner des points divers pour fournir une gamme plus large de réponses à une requête.

Les Processus Ponctuels Déterminantaux (DPP) sont des modèles probabilistes qui représentent la distribution des points dans un espace via une matrice de noyau capturant leurs corrélations. Avec un DPP, on peut alors échantillonner des points aléatoires avec des garanties de diversité entre les échantillons. Ces modèles ont une application directe à de nombreux aspects de l'apprentissage automatique, et plus spécifiquement du "deep learning", par exemple pour la diversité des batchs, l'apprentissage actif...

Dans ce projet, nous souhaitons étudier les avantages de la diversité induite par les DPP pour le "Few-Shot Learning" (FSL). En FSL, les données se composent généralement de quelques échantillons annotés par classe (généralement de 1 à 5). Les données non annotées peuvent être indisponibles au départ (contexte inductif), ou abondantes mais coûteuses à étiqueter (contexte transductif). Des approches communes pour le FSL incluent le "meta-learning" et le "metric learning", mais les plus efficaces pour le FSL utilisent du "transfert learning", où un modèle (pris sur l'étagère ou adapté avec des régularisations spécifiques au FSL) est entraîné sur un jeu de données tiers, puis utilisé pour générer un espace latent pour les données.

Bien que les DPP soient étudiés à divers stades du deep learning, peu de travaux ont été réalisés pour le FSL. Quelques travaux analysent les DPPs pour du meta-learning, du transfert au sens large, ou des applications. Toutefois, il semble qu'aucun travail n'ait étudié les avantages de la diversité pour le FSL.

Coordination du projet

Bastien Pasdeloup (Laboratoire des Sciences et Techniques de l'Information, de la Communication et de la Connaissance)

L'auteur de ce résumé est le coordinateur du projet, qui est responsable du contenu de ce résumé. L'ANR décline par conséquent toute responsabilité quant à son contenu.

Partenariat

LAB-STICC Laboratoire des Sciences et Techniques de l'Information, de la Communication et de la Connaissance

Aide de l'ANR 293 965 euros
Début et durée du projet scientifique : octobre 2024 - 48 Mois

Liens utiles

Explorez notre base de projets financés

 

 

L’ANR met à disposition ses jeux de données sur les projets, cliquez ici pour en savoir plus.

Inscrivez-vous à notre newsletter
pour recevoir nos actualités
S'inscrire à notre newsletter