CE45 - Mathématiques et sciences du numérique pour la biologie et la santé 2020

Ensembles de Réseaux Booléens Prédictifs – BNeDiction

Le projet BNeDiction s'appuie en premier lieu sur la programmation logique par ensembles de réponses (ASP) pour la synthèse d'ensembles réseaux booléens (BN) compatibles avec une architecture de réseau et des propriétés dynamiques définies a priori. Avec cette approche, l' ensemble des contraintes est représenté par un seul programme logique, de sorte que chaque solution correspond à un réseau booléens distinct qui satisfait les contraintes souhaitées. Notre approche vise à s'appliquer à des réseaux comportant des centaines ou des milliers de nœuds, en fonction des contraintes spécifiques et de l' architecture du réseau.

Cette approche logique se couplera avec des méthodes statistiques faisant le pont entre données quantitatives (mesures expérimentales de l'état cellulaire) et l'état qualitatif des modèles.

Le projet BNeDiction s'est attelé à la construction automatiques d'ensembles de réseaux booléens à partir d'une spécification sur leur structure (régulations géniques autorisées), et leur dynamique (comportements attendus). Notre méthode repose sur la programmation logique et le raisonnement symbolique automatique pour découvrir les réseaux booléens répondant à ces spécifications.

 

Le logiciel BoNesis (https://bnediction.github.io/bonesis) implémente cette approche, en proposant un langage de haut niveau pour modéliser le problème d'inférence, et des algorithmes pour explorer et évaluer l'ensemble des solutions.

 

Outre des progrès important sur la richesse des comportements qui peuvent être spécifiés (p ex doi.org/10.1007/978-3-031-42697-1_11), le projet s'est focalisé sur des méthodes pour mieux échantillonner et analyser les ensembles de réseaux booléens répondant à la spécification (https://doi.org/10.1038/s41540-025-00569-z, theses.hal.science/tel-05493556v1 ).

 

Enfin, différents résultats théoriques ont été obtenus sur la complexité computationnelle de certaines tâches d'inférence (https://doi.org/10.1137/23M1553248) et de prédiction des cibles moléculaire de contrôle (https://doi.org/10.24072/pcjournal.255).

 

Tout au long du projet, les méthodologies et outils développés ont été confrontés à leur mise en œuvre pour des cas d'études réels, en biologie et en écologie, via des collaborations interdisciplinaires (p. ex. doi.org/10.1038/s41540-025-00569-z, doi.org/10.1111/2041-210x.70090)

 

Un challenge primordial est alors de faire le pont entre des données expérimentales quantitatives et les modèles logiques qualitatifs.

Nous avons ainsi développé scBoolSeq (https://github.com/bnediction/scBoolSeq) qui implémente des méthodes statistiques pour classifier l'activité d'un gène à partir de données scRNA-seq. scBoolSeq permet également le chemin inverse : étant donné un réseau booléen et une suite d'état possibles, notre méthode permet de générer des jeux de données quantitatifs fictifs, mais ressemblant aux jeux de données réels. Savoir générer de telles données est précieux pour valider en profondeur les méthodes d'analyse de données RNA-Seq, car la vérité terrain est alors connue.

Le projet BNeDiction a abouti à un ensemble de méthodes et d'outils rendant possible la construction automatique d'ensemble de modèles mathématiques reproduisant des comportements biologiques observés. Ces ensembles de modèles apportent ainsi des hypothèses sur les mécanismes biologiques sous-jacents, et servent de base à la prédiction de cibles moléculaires pour contrôler le comportement des cellules.

 

Les outils et leurs applications à des cas concrets en biologie démontrent la faisabilité et le passage à l'échelle de cette démarche.

 

Ces résultats ouvrent différentes perspectives :

 

- théoriques, avec la mise au point de nouveaux algorithmes pour prédire des cibles moléculaires modifiant le comportement cellulaire à partir des ensembels de réseaux booléens, et l'étude de contraintes supplémentaires pour la prédiction des comportements possibles d'un réseau booléen

 

- méthodologiques, avec la création de jeux de données fictifs dont la vérité terrain est connue afin d'évaluer en profondeur les méthodes d'inférence de réseaux booléens basées sur les données quantitatives.

 

- logiciels, avec l'ajout de nouvelles fonctionnalités au sein de BoNesis, pour permettre la prise en compte de propriétés dynamiques encore plus riches, et faciliter son utilisation

 

- applicatives, avec l'utilisation de la méthodologie et des logiciels développés pour aborder de nouveaux cas d'étude de modélisation en biologie, santé, et écologie.

En reliant les systèmes dynamiques et leurs observations partielles, les modèles informatiques des processus biologiques visent à découvrir des mécanismes clés gouvernant les dynamiques cellulaires, et in fine prédire leur comportement dans de nouvelles conditions.
Les modèles de réseaux d'interaction moléculaire sont généralement construits à partir de données sur la structure du système biologique, comme les interactions connues, et des données relative à leur dynamique, comme des mesures d'expression de gènes, ou l'activité de protéines à différents moments ou conditions. Cependant, malgré les avancés considérables des technologies expérimentales, les observations des processus biologiques restent très partielles, soit en termes de résolution temporelle, de nombre d'observables, de synchronisation entre différentes observtations, ou encore en termes de variété des conditions cellulaires. Combiné à une structure complexe d'interaction moléculaire, le problème de construction de modèle est alors largement sous-spécifié, amenant trop de candidats potentiels.

Les réseaux booléens (RB), et les modèles logiques en général, sont largement adoptés pour la modélisation des voix de signalisation et les réseaux de gènes et de facteurs de transcription, car ils ne demandent pas de connaissance précise sur les paramètres quantitatifs des interactions sélectionnées. Avec les RB, l'activité des composants est caricaturées à "faux" et "vrai", et leur évolution est calculée en suivant des règles logiques.
Cependant, en pratique, les données biologiques se traduisent encore par des multitudes de modèles candidats. Des choix arbitraires de modélisation doivent alors être faits, ce qui peut introduire des biais considérables dans les prédictions sous-jacentes.

Le projet BneDiction vise à produire une méthodologie générale pour le calcul de prédictions à partir de données sur la structure et la dynamique du système, en reposant sur des ensembles de RB.

Basés sur la constitution d’ensembles de modèles, nous cherchons à rendre compte de la diversité des modèles admissibles, et ainsi de réduire des bias pour la sélection d’un « meilleur » modèle par des critères arbitraires. Partant d'avancées récentes sur la caractérisation symbolique des modèles candidats par programmation logique, les défis majeurs résident autour de l'échantillonnage d'un ensemble de modèles divers, et le calcul et la maximisation de leur capacité prédictive, avec une évaluation approfondie du pipeline.

La modélisation par ensemble a le potentiel d’améliorer la robustess des prédictions en tenant compte de la variabilité et de l’incertutde potentielle des modèles. Nous prévoyons de démontrer l’application du pipeline BneDiction pour la modélisation par ensembles de l’hématopoïèse chez la souris à partir de données single-cell RNA-seq de différentiation, disponibles avec plusieurs contextes de mutation. Ce type de données apporte de fortes contraintes dynamiques pour l’inférence de modèle, et les différentes conditions de mutation permettent de constituer des jeux de données d’entraînement et de test afin d’évaluer la capacité prédicitive des ensembles de RB constitués par le pipeline.

Le projet aspire à produire une méthodologie convaincante pour l'apprentissage automatique de modèles logiques à partir de données expérimentales, une question clé à l'intersection entre intelligence artificielle et des sciences de la vie.

Coordination du projet

Loïc Paulevé (Laboratoire Bordelais de Recherche en Informatique)

L'auteur de ce résumé est le coordinateur du projet, qui est responsable du contenu de ce résumé. L'ANR décline par conséquent toute responsabilité quant à son contenu.

Partenariat

LaBRI Laboratoire Bordelais de Recherche en Informatique

Aide de l'ANR 250 992 euros
Début et durée du projet scientifique : février 2021 - 48 Mois

Liens utiles

Explorez notre base de projets financés

 

 

L’ANR met à disposition ses jeux de données sur les projets, cliquez ici pour en savoir plus.

Inscrivez-vous à notre newsletter
pour recevoir nos actualités
S'inscrire à notre newsletter