CE23 - Intelligence artificielle et science des données 2024

Analyse et Synthèse de la forme Humaine en 4D – 4DSHAPE

D’un scan au mouvement : comment l’IA réinvente l’humain numérique

Perfectionner la synthèse de mouvements humain réalistes constitue une avancée essentielle pour diverses applications d’interaction humain-machine, de réalité virtuelle, de jeux vidéo et de robotique sociale.

L’objectif général de 4DSHAPE est de générer des surfaces de corps et de visages humains, indépendamment de leur paramétrisation ou de leur discrétisation.

(1) Notre premier objectif concerne le développement d’un cadre de recalage et de reconstruction 3D-to-3D, invariant à la discrétisation, adapté aux formes du corps humain au moyen d’un espace latent commun. (2) Objectif 2 : 3D-to-4D. Dans le deuxième objectif, nous prévoyons d’étudier l’extension de données statiques 3D vers des données dynamiques dans le temps 4D. L’ingrédient central de cette partie de la recherche sera la construction d’une structure non linéaire sur les espaces latents de formes humaines, qui nous permettra de modéliser avec précision la nature complexe des mouvements et des déformations du corps humain dans des situations réelles. Notre approche combinera des méthodes guidées par les données et des énergies de déformation élastique motivées par la physique. (3) Objectif 3 : prompt-to-3D/4D. Dans notre troisième et dernier objectif, nous visons à apprendre une application depuis plusieurs espaces de prompts vers l’espace des formes humaines. Ici, l’espace de prompts peut être simplement un espace d’entrées textuelles, mais aussi un espace plus complexe, tel qu’un enregistrement vocal, voire une esquisse humaine animée.

(1) L’apprentissage profond géométrique est la branche du deep learning qui conçoit des architectures neuronales pour des données définies sur des domaines non euclidiens, graphes, maillages, variétés, nuages de points, groupes en exploitant la structure géométrique et le groupe de symétries des données afin d’imposer, comme biais inductif, des propriétés d’invariance ou d’équivariance.

Dans notre travail, afin de surmonter le problème du remaillage, nous proposons d’utiliser DiffusionNet comme extracteur de caractéristiques par face sur le maillage source. La diffusion de chaleur est utilisée pour définir un réseau neuronal de type convolutionnel, robuste au remaillage, et dont l’efficacité pour le calcul de caractéristiques géométriques locales est démontrée. Le générateur de déformations utilise également des champs jacobiens neuronaux : il apprend, pour chaque face, des candidats aux matrices jacobiennes du champ de déformation final.

 

(2) Varifolds.

Nous considérons les surfaces du corps humain comme des varifolds, ce qui nous fournit une représentation invariante par paramétrisation, pouvant être plongée dans un espace euclidien de dimension infinie à l’aide d’un espace de Hilbert à noyau reproduisant (Reproducing Kernel Hilbert Space, RKHS).

(1) Génération de têtes parlantes 3D guidées par la parole : ScanTalk.

ScanTalk est le premier cadre capable d’animer des visages 3D indépendamment de leur topologie. Il est conçu pour être polyvalent et peut prendre en charge n’importe quelle topologie de maillage, y compris celles issues de véritables scans 3D de visages. En préservant la fidélité et la cohérence entre différentes topologies, ScanTalk garantit des animations faciales réalistes et expressives malgré les variations de structure du maillage.

 

(2) Modélisation apprenable de l’interpolation de formes : PaNDaS.

PaNDaS est un nouveau cadre d’apprentissage profond dédié aux déformations partielles non rigides et aux interpolations de surfaces (Partial Non-Rigid Deformations and Interpolations of Surfaces). Il apprend un champ de caractéristiques par face sur le maillage source et le fusionne avec un encodage global de la cible.

 

(3) Prédiction et transfert de mouvement pour des maillages corporels non enregistrés : ScanMove.

ScanMove est un cadre fondé sur l’apprentissage, conçu pour prédire automatiquement les déformations de maillages surfaciques non enregistrés.

 

(4) Raffinement de formes corporelles 3D : VaRefine.

VaRefine combine plusieurs méthodes visant à améliorer le recalage dense de scans corporels à partir de modèles paramétrés. Il utilise des distances de varifold pour recaler une surface cible à maillage arbitraire sur une estimation initiale paramétrée connue, et propose différentes stratégies pour décoder ce signal sous forme de corrections à la fois latentes et par sommet.

L’un des verrous structurants de 4DSHAPE demeure l’accès à des données 4D, c’est-à-dire des séquences temporelles de surfaces humaines, en quantité et en diversité suffisantes. Si les données 3D statiques sont aujourd’hui largement accessibles grâce aux progrès des scanners et de l’estimation de forme, la capture 4D repose encore sur des dispositifs de motion capture ou de scan dynamique coûteux, relativement rares, et couvrant mal la longue traîne des mouvements humains réels. Or les Objectifs 2 (3D-to-4D) et 3 (prompt-to-4D) supposent précisément de modéliser la richesse des déformations humaines naturelles, et se heurtent donc directement à cette rareté.

Une direction prometteuse, illustrée par des travaux récents sur l’animation de maillages humanoïdes à partir de modèles de diffusion vidéo, consiste à déplacer la source de supervision plutôt qu’à chercher à compenser le manque de données 4D capturées. Dans ce paradigme, la connaissance du mouvement n’est plus apprise à partir d’un corpus 4D, mais empruntée à un modèle vidéo génératif pré-entraîné, dont les a priori temporels ont été distillés à partir de l’immense réservoir de vidéos 2D disponibles. La rareté des données 4D est ainsi contournée en les remplaçant par une ressource abondante, la vidéo 2D, tandis que le passage du 2D vers le 3D/4D est assuré par une optimisation géométrique utilisant un modèle de corps comme proxy de déformation.

Ces dernières années, on observe un intérêt croissant pour l'analyse et la génération de la forme et du mouvement des humains en 3D (corps et visage). Les avancées dans les algorithmes d'estimation de la forme humaine en 3D, la technologie de numérisation 3D, les graphiques 3D accélérés par matériel, et les outils connexes, permettent l'accès à des données de forme corporelle humaine en 3D à grande échelle. Ces données se présentent généralement sous la forme de maillages de surface 3D qui, en général, ne correspondent pas à des discrétisations cohérentes, c'est-à-dire que la même surface peut être représentée par de nombreux maillages triangulaires différents avec une connectivité variable et un nombre variable de sommets. Ainsi, les méthodes conçues pour l'analyse de forme 3D/4D de surfaces paramétrées et l'apprentissage profond rencontrent des limitations lorsqu'elles sont appliquées à de telles données réelles. Notre objectif est de générer un ensemble diversifié de dynamiques plausibles de mouvement du corps humain et du visage en 3D directement à partir de données de numérisation 3D ou même à partir d'un espace d'entrée tel que du texte ou de l'audio. Le résultat attendu de 4DSHAPE est d'identifier, de développer et de perfectionner un cadre naturel où l'on peut à la fois incorporer et générer des surfaces de corps humain et de visages indépendamment de la manière dont elles sont paramétrées/discrétisées, y compris les numérisations brutes, de manière à capturer et reproduire à la fois l'identité du sujet et les mouvements naturels qu'ils peuvent effectuer. Il est articulé autour de 3 objectifs principaux:

Objectif 1 : 3D-vers-3D. Notre premier objectif concerne le développement d'un cadre de recalage et de reconstruction 3D-vers-3D invariante à la discrétisation, adapté aux formes corporelles humaines, basé sur un espace latent commun et un modèle auto-encodeur.
Objectif 2 : 3D-vers-4D. Dans le deuxième objectif, nous prévoyons d'étudier l'extension des données statiques dans le temps (3D) aux données dynamiques dans le temps (4D). L'ingrédient central de cette partie de la recherche sera la construction d'une structure non linéaire sur l'espace latent de la forme humaine, ce qui nous permettra de modéliser avec précision la nature complexe des mouvements et déformations du corps humain dans la vie réelle. Notre approche utilisera une combinaison de méthodes basées sur les données et motivées physiquement, avec des énergies de déformation élastiques.
Objectif 3 : prompt-vers-3D/4D. Dans notre troisième et dernier objectif, nous visons à apprendre une correspondance de plusieurs espaces de prompts vers l'espace des formes humaines ; ici, l'espace de prompt pourrait être simplement un espace d'entrée de texte, mais aussi un espace plus compliqué tel qu'un enregistrement vocal, ou même un croquis humain animé.

Coordination du projet

Mohammed Daoudi (Ecole Nationale Supérieure Mines - Télécom Lille Douai)

L'auteur de ce résumé est le coordinateur du projet, qui est responsable du contenu de ce résumé. L'ANR décline par conséquent toute responsabilité quant à son contenu.

Partenariat

CERI SN Ecole Nationale Supérieure Mines - Télécom Lille Douai
Florida State University
Université de Lille (EPE)
University of Houston

Aide de l'ANR 246 839 euros
Début et durée du projet scientifique : décembre 2024 - 36 Mois

Liens utiles

Explorez notre base de projets financés

 

 

L’ANR met à disposition ses jeux de données sur les projets, cliquez ici pour en savoir plus.

Inscrivez-vous à notre newsletter
pour recevoir nos actualités
S'inscrire à notre newsletter