Edge IA - Edge IA 2023

Segmentation sémantique de scènes sonores complexes dans un système embarqué – CONFLUENCE

CONFLUENCE : comprendre et séparer les sons grâce à l'IA embarquée

Un projet franco-japonais qui développe la segmentation sémantique du son : reconnaître les événements sonores et isoler les sources d'une scène acoustique complexe, directement sur des dispositifs embarqués (edge). En réunissant l'expertise scientifique et industrielle de NTT, TMU, Sonaide, CEA-List et de l'Université de Lorraine, CONFLUENCE vise la communication immersive et la téléassistance à domicile respectueuse de la vie privée.

La segmentation sémantique du son sur dispositifs embarqués

Dans la vie quotidienne, nous sommes immergés dans des scènes sonores où de multiples sources se mélangent : musique, conversations, bruits domestiques. La segmentation sémantique du son consiste à identifier les différentes sources présentes dans un enregistrement, à leur associer une classe (parole, alarme, etc.) et à fournir des métadonnées comme leur direction d'arrivée. C'est l'équivalent audio de la segmentation sémantique d'images, un domaine majeur de l'IA.<br />Résoudre ce problème ouvre de nombreuses applications. Pour la téléassistance à domicile, il permet de détecter des situations anormales (chute d'une personne âgée, bris de vitre) et de suivre les habitudes pour prévenir la perte d'autonomie. Pour la communication immersive (visioconférence, XR), il permet un rendu spatial riche d'un environnement distant et des sessions hybrides fluides. Il permet aussi de filtrer les bruits gênants tout en laissant passer les sons importants.<br />Beaucoup de ces usages exigent un traitement directement sur de petits dispositifs (edge computing) : pour préserver la vie privée (aucun son ne quitte le domicile sauf en cas d'urgence), pour réduire la consommation d'énergie et de réseau, et pour respecter des contraintes de latence.<br />Objectifs du projet CONFLUENCE :<br />1) développer la séparation de sources et l'extraction de sons cibles comme socle de la segmentation sémantique ;<br />2) implémenter ces algorithmes en open source et sur des dispositifs embarqués contraints (mémoire, puissance, latence) ;<br />3) diffuser la technologie via la normalisation internationale des télécommunications mobiles (3GPP) et le déploiement sur des dispositifs de téléassistance respectueux de la vie privée ;<br />4) accélérer la recherche académique en publiant les données acquises et en organisant des challenges internationaux (DCASE).

La segmentation sémantique de scènes sonores combine plusieurs tâches du traitement audio. CONFLUENCE s'articule autour de cinq lots de travail (WP).
Séparation de sources et extraction de sons cibles (WP1, WP2) : à partir d'un mélange capté par un ou plusieurs microphones, on isole les signaux des différentes sources. Deux familles d'approches sont étudiées et combinées : la séparation aveugle (ICA, IVA, ILRMA), qui exploite les caractéristiques spatiales des sources, et les approches par apprentissage profond. L'extraction de son cible (modèle SoundBeam de NTT) extrait une source désirée à partir d'indices sur sa classe. L'usage de réseaux de microphones distribués étend la couverture spatiale, ce qui impose de résoudre la synchronisation entre appareils.
Détection d'événements sonores et représentations audio (WP1) : détection des classes de sons et de leur localisation, appuyée sur des représentations audio génériques pré-entraînées (modèle de fondation M2D de NTT).
IA embarquée (WP3) : le framework open source N2D2/Aidge du CEA-List est étendu au traitement de signaux 1D (son). Des outils d'analyse simulent le comportement des réseaux quantifiés sur cible embarquée (mémoire, calcul, latence) et permettent de les optimiser (élagage, quantification jusqu'à 4 à 8 bits, distillation).
Cas d'usage et validation (WP4) : deux cas d'usage (communication immersive et téléassistance à domicile) fournissent les spécifications en début de projet et les démonstrateurs testés en conditions réelles en fin de projet. La collecte et l'annotation de données alimentent l'entraînement et l'évaluation des systèmes.

Bilan à mi-parcours (janvier 2026).
Production scientifique : 2 articles de revue internationale, 17 articles en conférence internationale à comité de lecture (dont 1 co-publication France-Japon et 1 français), 10 communications nationales et 1 séminaire invité.
Avancées techniques principales :
- WP2, extraction de son cible : deux améliorations du modèle SoundBeam de NTT, une fonction de coût préservant les indices spatiaux pour l'extraction binaurale (IWAENC 2024) et l'exploitation du modèle de fondation audio M2D (SoundBeam meets M2D, ICASSP 2025), avec un gain d'environ 1 dB sur toutes les classes de sons.
- WP1 et WP4, tâche S5 : proposition de la tâche Spatial Semantic Segmentation of Sound Scenes (S5), nouvelle métrique d'évaluation CA-SDRi, système de référence, et jeu de données collecté et publié.
- Organisation du DCASE2025 Challenge Task 4 (S5) : 8 équipes, 24 systèmes soumis, dont 7 améliorant la référence.
- WP2, dispositif de conversion son-lumière Blinky : optimisation par apprentissage de bout en bout et première reconnaissance de scène par conversion son-lumière.
- Travaux connexes : séparation par requête langagière multicanale, séparation avec appareils non synchronisés, estimation de flux de personnes par le son.
Animation de la communauté : organisation du DCASE2024 Workshop (Tokyo, octobre 2024) et du DCASE2025 Challenge ; session spéciale au 6th ASA-ASJ Joint Meeting (Honolulu) ; deux réunions de consortium (Kyoto/Tokyo, octobre 2024 ; Barcelone, octobre 2025).
Distinction : 2e place au APSIPA ASC 2025 Grand Challenge (T. Kawamura, M. Sera, N. Ono, octobre 2025).

Suite du projet et prochaines étapes.
- Spatial Semantic Segmentation of Sound Scenes (S5), Phase 2 : passage à un fonctionnement en ligne et en temps réel (causalisation), prise en charge du fonctionnement continu de longue durée et prise en compte des sources sonores en mouvement, avec la collecte de données associée.
- Organisation du DCASE2026 Challenge et création d'une démonstration fonctionnant en ligne.
- Implémentation embarquée : évaluation de la version en virgule fixe et poursuite du portage des algorithmes sur dispositifs edge (WP3), vers les démonstrateurs des cas d'usage (WP4).
- Normalisation : proposition de contributions à la standardisation 3GPP. Le calendrier IVAS du 3GPP ayant pris du retard (implémentation en virgule fixe et évaluation de performance repoussées à octobre 2025), le volet standardisation est décalé d'environ un an et l'accent est mis pour l'instant sur les activités de diffusion.
- Cas d'usage : poursuite de la collecte et de l'annotation de données, et intégration des briques technologiques dans les démonstrateurs de communication immersive et de téléassistance à domicile testés en conditions réelles.

Productions à mi-parcours : 2 articles de revue internationale et 17 articles en conférence internationale à comité de lecture (dont 1 co-publication France-Japon et 1 français), 10 communications nationales et 1 séminaire invité. Aucun brevet déposé à ce stade.
Revues :
- Y. Kinoshita, N. Ono, End-to-End Training of Acoustic Scene Classification Using Distributed Sound-to-Light Conversion Devices, EURASIP J. on Audio, Speech, and Music Processing, vol. 46, sept. 2024.
- T. Kawamura, Y. Kinoshita, N. Ono, R. Scheibler, Acoustic Scene Classification Using Inter- and Intra-subarray Spatial Features in Distributed Microphone Array, EURASIP J. on Audio, Speech, and Music Processing, no. 65, déc. 2024.
Sélection de conférences :
- C. Hernandez-Olivan et al., Interaural time difference loss for binaural target sound extraction, IWAENC 2024.
- C. Hernandez-Olivan et al., SoundBeam meets M2D: Target Sound Extraction with Audio Foundation Model, ICASSP 2025.
- B. T. Nguyen et al., Baseline Systems and Evaluation Metrics for Spatial Semantic Segmentation of Sound Scenes, EUSIPCO 2025.
- M. Yasuda et al., Description and Discussion on DCASE 2025 Challenge Task 4: Spatial Semantic Segmentation of Sound Scenes, DCASE 2025.
- F. Chersi et al., Aidge: a new framework for DNN development, training and deployment on the Edge, EEAI 2024.
Organisation de challenges et workshops : DCASE2024 Workshop (Tokyo), DCASE2025 Challenge Task 4 (S5). Distinction : 2e place, APSIPA ASC 2025 Grand Challenge.

Le projet CONFLUENCE vise à développer des technologies d'intelligence artificielle (IA) pour la segmentation sémantique des signaux sonores qui peuvent reconnaître les événements sonores et séparer/isoler les sources sonores formant des entités sémantiques. Cela peut être considéré comme une extension audio de la tâche de segmentation sémantique d'images qui a reçu beaucoup d'attention dernièrement. L'objectif est de concevoir des systèmes d'IA embarqué capable de mettre en œuvre ces
technologies pour la communication immersive et les dispositifs de téléassistance et d’actimétrie. En analysant, en séparant et en augmentant les signaux séparés avec des métadonnées telles que des informations de localisation, il sera possible de transmettre uniquement les sons pertinents d'une scène sonore et de recréer spatialement cette scène dans un endroit éloigné, ou de comprendre ce qui se passe à distance. La ségmentation sématique pourra être appliquée aux systèmes de conférence en
ligne respectueux de la vie privée, aux appareils d’assistance à domicile, qui ne transmettent que les sons importants, ou à de nouveaux systèmes de communication inclusifs qui permettraient aux participants locaux et distants de se sentir dans le même lieu. Dans ce projet, nous aborderons : (1) le développement de la séparation de sources sonores et de l'extraction des sons cibles comme base de la ségmentation sémantique, (2) l'implémentation open source des algortihmes développés et l'implémentation dans des dispositifs embarqués, (3) la diffusion de la technologie par le biais d'une proposition à la normalisation internationale des systèmes de communication mobile (3GPP) et le déploiement dans des dispositifs de téléassistance préservant la vie privée, (4) la contribution à l'accélération du domaine académique en distribuant les données acquises dans ce projet et en organisant des challenges internationaux. Grâce à la combinaison de l'expertise scientifique et industrielle de partenaires français et japonais, le projet CONFLUENCE développera des solutions innovantes et embarquées de segmentation du son.

Coordination du projet

Nicolas Turpault (Sonaide)

L'auteur de ce résumé est le coordinateur du projet, qui est responsable du contenu de ce résumé. L'ANR décline par conséquent toute responsabilité quant à son contenu.

Partenariat

SON Sonaide
LORIA Laboratoire lorrain de recherche en informatique et ses applications
LIST Laboratoire d'Intégration des Systèmes et des Technologies

Aide de l'ANR 419 708 euros
Début et durée du projet scientifique : novembre 2023 - 48 Mois

Liens utiles

Explorez notre base de projets financés

 

 

L’ANR met à disposition ses jeux de données sur les projets, cliquez ici pour en savoir plus.

Inscrivez-vous à notre newsletter
pour recevoir nos actualités
S'inscrire à notre newsletter