Méthodes statistiques pour caractériser les interactions entre la plante et son environnement – Stat4Plant
Méthodes statistiques pour caractériser les interactions entre la plante et son environnement : intégrer l'hétérogénéité des populations végétales et les variations de l'environnement
Développer de nouvelles méthodes statistiques et de nouveaux outils algorithmiques pour modéliser et analyser la variabilité génétique et les interactions entre la plante et son environnement dans un contexte de changement climatique.
Prédire les performances des cultures dans des environnements changeants et améliorer la sélection variétale au sein de populations hétérogènes via des méthodes numériques
L’agriculture doit actuellement relever des défis majeurs liés à la nécessité d'’augmenter la production alimentaire mondiale malgré la raréfaction des ressources en sol et en eau, et l’intensification des impacts du changement climatique, tels que vagues de chaleur, sécheresse et attaques de ravageurs. Ces contraintes affectent fortement les développements des plantes et les rendements, comme l’illustre la stagnation des grandes cultures en Europe. Les interactions génotype-environnement jouent un rôle clé : une variété donnée peut se développer différemment selon les conditions, et différentes variétés peuvent réagir différemment dans un même environnement. Ces interactions offrent l’opportunité de sélectionner des variétés mieux adaptées et plus résilientes. Pour exploiter ce potentiel, de nouvelles stratégies doivent intégrer l’incertitude des conditions environnementales, la variabilité génétique et la dynamique du développement végétal. Les approches prédictives combinant écophysiologie, génétique et modélisation mathématique sont prometteuses, permettant d’explorer de nombreux scénarios environnementaux sans tester toutes les combinaisons de façon expérimentale. Les modèles dynamiques non linéaires permettent de représenter précisément les processus de croissance et les interactions génotype-environnement, mais posent des défis statistiques et computationnels importants. Il faut prendre en compte : (i) l’interaction de dynamiques non linéaires complexes (plante, climat, ravageurs), (ii) l’influence de covariables hétérogènes et de grande dimension, et (iii) différents niveaux de variabilité, notamment génétique. Ces modèles comportent de nombreux paramètres à estimer à partir de données complexes, nécessitant des outils adaptés pour l’estimation, la sélection de variables et la comparaison de modèles afin d’identifier les principales sources de variabilité. Le projet Stat4Plant vise à développer ces méthodes originales et à analyser des données culturales dynamiques issues de multiples environnements et conditions. Il ambitionne de fournir des outils prédictifs innovants pour améliorer les performances des cultures face au changement climatique. Ses quatre objectifs principaux sont : identifier les paramètres dépendant du génotype régissant le développement des plantes ; modéliser conjointement la floraison et certains traits phénotypiques dynamiques ; identifier les covariables influentes parmi un ensemble de grande dimension ; et proposer des critères de sélection variétale intégrant l’incertitude environnementale. Ces méthodologies seront génériques et applicables à d’autres modèles dynamiques, avec un impact potentiel dans d’autres domaines appliqués, comme la médecine.
La plupart des travaux combinent des modèles statistiques à effets mixtes et des modèles mathématiques mécanistes pour mieux quantifier la variabilité existante au sein d'une population hétérogène de variétés. Plus précisément nous considérons les modèles à effets mixtes non linéaires qui sont largement utilisés en agronomie ou en pharmacologie pour intégrer différents niveaux de variabilité dans des données répétées, en particulier les variabilités intra-individuelle et inter-individuelle. Ces modèles combinent des effets fixes, partagés par tous les individus, et des effets aléatoires, propres à chaque individu. La modélisation précise de ces effets est essentielle pour l’estimation des paramètres et la prédiction. Dans le cadre des modèles de croissance des plantes, la variabilité intra-individuelle est capturée par le modèle mécaniste non linéaire, tandis que la variabilité inter-individuelle est représentée par des paramètres individuels considérés comme effets aléatoires, ces derniers étant des variables latentes. Pour les génotypes, cette variabilité inter-individuelle correspond à la variabilité inter-génotype. Un des objectifs est de quantifier et caractériser cette variabilité inter-individuelle. On cherche ainsi à évaluer la façon dont les paramètres individuels varient ou non dans la population. On cherche également à caractériser cette variation par des covariables descriptives des variétés, potentiellement dans un contexte de grande dimension. Nous considérons également des modèles joints pour des données longitudinales de traits phénotypiques d'intérêt et des données de temps de survie. Ces modèles combinent des modèles statistiques à effets mixtes, des modèles mathématiques mécanistes et des modèles d'analyse de survie. Les approches développés pour l'inférence reposent sur des méthodes d'estimation, de sélection de variables et de prédiction. Elles font également appel à des outils récents d'optimisation numérique. Nous développons également de nouvelles approches multi-critères pour optimiser de façon simultanée plusieurs traits d'intérêt au sein d'une population de génotypes en intégrant les incertitudes des conditions environnementales.
Le projet Stat4Plant a permis de développer un ensemble de travaux récents visant à mieux analyser des données complexes, en combinant des avancées en modélisation, statistique et en intelligence artificielle.
Nous avons ainsi développé une nouvelle méthode de test statistique, plus fiable que les approches classiques, même dans des modèles très complexes, pour identifier les variabilités au sein d'un modèle à effets mixtes. Cette méthode permet notamment de tenir compte de facteurs de nuisance qui étaient difficiles à intégrer auparavant. Elle repose sur une technique dite “bootstrap”, qui améliore la robustesse des résultats. Nous avons également proposé un nouvel algorithme efficace pour effectuer le calcul numérique de quantités mathématiques très difficiles à évaluer, dans le cadre de cette procédure. Cet algorithme est plus précis et plus stable que les méthodes existantes, même dans des situations où les données sont hétérogènes. Ses propriétés théoriques ont été étudiées, garantissant sa fiabilité à long terme.
En parallèle, une nouvelle méthode de machine learning a été conçue pour estimer des paramètres dans des modèles complexes à variables latentes. Elle permet non seulement d’obtenir des estimations précises, mais aussi d’évaluer leur incertitude. Cette approche est flexible, efficace et applicable à de nombreux types de modèles.
Les deux premiers développements ont été utilisés pour analyser la variabilité génotypique d’Arabidopsis Thaliana à partir du modèle biologique de plante, appelé ARNICA.
Nous avons aussi développé des modèles joints capables de relier des données qui évoluent dans le temps à des événements d'intérêt. Ces modèles peuvent intégrer un grand nombre de variables. Nous avons développé des méthodes permettant d'identifier celles qui ont réellement un impact. Elles mobilisent des techniques modernes d’optimisation pour gérer la complexité des données. Ces outils ont été appliqués à des problématiques concrètes en agriculture.
Ils ont permis d’étudier l’impact de ravageurs sur le développement du maïs. Ils ont également servi à identifier des facteurs biologiques liés à la résistance des plantes.
De nouvelles méthodes ont été développées pour sélectionner les variables les plus importantes lorsque leur nombre est très élevé, comme en génétique. Ces approches, à la fois bayésiennes et fréquentistes, permettent de mieux cibler les facteurs ayant un impact. Leur efficacité a été démontrée sur des données simulées et réelles. Des résultats théoriques solides ont aussi été obtenus, montrant que ces méthodes restent fiables même dans des contextes très complexes et en grande dimension.
Enfin, des méthodes d’optimisation multicritère ont été proposées pour aider à sélectionner les meilleures variétés de plantes. Elles permettent de prendre en compte plusieurs objectifs à la fois, comme le rendement et la qualité. Ces approches intègrent également les incertitudes liées aux conditions environnementales.
Les travaux menés dans le cadre du projet Stat4Plant ouvrent plusieurs perspectives de recherche prometteuses.
La sélection de variables en grande dimension reste un enjeu majeur. Au cours des tests des performances des outils algorithmiques développés pour intégrer et sélectionner des covariables de grande dimension dans des modèles comportant des effets aléatoires, il est apparu que les corrélations potentielles existant entre les covariables de grande dimension dans les données réelles comme les marqueurs génétiques dégradent fortement les performances en sélection. De nouvelles approches hybrides combinant statistique et deep learning pourraient être explorées.
Les méthodes développées pour tester les composantes de la variance dans les modèles à effets mixtes par bootstrap qui sont adaptée au cas de petits échantillons de données requièrent de longs temps de calcul lors de leurs mises en oeuvre, ce qui peut être limitant en pratique. Une réflexion devrait être menée pour évaluer les possibilités d'accélération via des approches computationnelles encore plus efficace ou de nouvelles approximations numériques.
Les modèles joints pourraient être enrichis pour prendre en compte des interactions plus fines entre processus biologiques et environnementaux, notamment en intégrant une composante spatiale au sein des modèles.
En optimisation multicritère, il serait utile d’intégrer des scénarios climatiques futurs pour anticiper les effets du changement climatique.
Un autre axe consisterait à adapter les méthodes développées à des jeux de données encore plus massifs, issus notamment des technologies de phénotypage à haut débit. L’amélioration de l’efficacité algorithmique sera donc essentielle pour réduire les temps de calcul. Il serait également pertinent de pouvoir intégrer davantage de données hétérogènes (génomiques, environnementales, images) dans les modèles.
Enfin, le transfert de ces méthodes vers des applications opérationnelles représente un enjeu clé. Le développement d’outils d’aide à la décision utilisables facilement constitue en effet un enjeu important pour l'innovation et le valorisation des travaux de recherche. Cela passera par le développement de logiciels accessibles et par des collaborations renforcées avec les acteurs du monde agricole.
L’agriculture est actuellement confrontée à de nouveaux défis pour répondre à la demande croissante d’approvisionnement mondial en nourriture dans un contexte de changement climatique fort et de déclin des ressources naturelles en eau et en sol. Elle doit faire face à des bouleversements majeurs et s’adapter aux nouvelles conditions, en particulier environnementales, en relevant de nombreux challenges. Pour mieux appréhender cette adaptation, il est nécessaire de mieux comprendre des notions clés comme la variabilité génétique des plantes et les interactions entre la plante et son environnement. Dans ce contexte, des approches prédictives basées d’une part sur les connaissances génétiques et écophysiologiques des plantes et d’autre part sur la modélisation mathématique sont très prometteuses.
Le projet Stat4Plant vise à développer de nouvelles méthodes statistiques et de nouveaux outils algorithmiques pour modéliser et analyser la variabilité génétique et les interactions entre la plante et son environnement dans un contexte de changement climatique. Le consortium regroupe des chercheurs en modélisation et en statistiques appliquées ayant une grande expérience de collaborations interdisciplinaires en sciences du végétal et des biologistes spécialistes des relations phénotypes-génotypes chez les plantes. Le projet est décliné en quatre axes de recherche principaux, portés par des collaborations étroites entre statisticiens et biologistes et motivés par des questions concrètes en lien avec des données biologiques.
Le premier axe de recherche vise à développer des méthodes permettant d’identifier les processus biologiques clés du développement de la plante qui sont à l’origine de la variabilité génotypique observée. Les travaux de cet axe combinent des modèles mécanistes écophysiologiques complexes fortement non linéaires du développement de la plante, des modèles statistiques à effets mixtes pour la modélisation de la variabilité génotypique et des outils de tests statistiques, en particulier adaptés aux petits échantillons de données, pour l’identification des dépendances génotypiques des paramètres clés. Ces approches permettront d’identifier des leviers d’action en sélection variétale.
Le deuxième axe est consacré à la modélisation conjointe d’un temps d’intérêt comme la floraison ou la récolte et d’un trait phénotypique dynamique qui dépend du temps comme la biomasse aérienne ou la présence de ravageurs. Les modèles joints considérés combinent un modèle de survie à effets aléatoires intégrant des covariables de grande dimension et un modèle non linéaire à effets mixtes pour le trait phénotypique dynamique. L’objectif est de sélectionner les covariables les plus influentes, d’estimer les paramètres du modèle et de prédire le temps d’intérêt. Ces méthodes permettront en particulier de prédire la date de floraison ou de récolte optimale.
Le troisième axe de recherche consiste à proposer des méthodes permettant d’identifier parmi un grand nombre de covariables les plus influentes pour un trait phénotypique, seul ou conjointement avec un temps d'intérêt. Des modèles non linéaires à effets mixtes combinant des modèles mécanistes de développement et des modèles génétiques intégrant un grand nombre de covariables serviront pour la modélisation de la variabilité génotypique du trait d’intérêt. Des méthodes de sélection de variables adaptées au cadre non linéaire seront développées. Ces méthodes permettront d’identifier les facteurs génétiques importants influençant le trait.
Enfin, le dernier axe de recherche a pour objectif de construire de nouveaux critères de sélection variétale, qui intègrent les aléas des conditions environnementales et prennent en compte simultanément plusieurs objectifs, comme par exemple maximiser le rendement et minimiser la variabilité du rendement. Des méthodes d’optimisation adaptées seront proposées. Ces critères seront des outils nouveaux d’aide à la décision pour les agriculteurs.
Coordination du projet
ESTELLE KUHN (Mathématiques et Informatique Appliquée du Génome à l'Environnement)
L'auteur de ce résumé est le coordinateur du projet, qui est responsable du contenu de ce résumé. L'ANR décline par conséquent toute responsabilité quant à son contenu.
Partenariat
MaIAGE Mathématiques et Informatique Appliquée du Génome à l'Environnement
MIA Mathématiques et Informatique Appliquées
MICS Laboratoire de Mathématiques et Informatique pour la Complexité et les Systèmes
HEUDIASYC Heuristique et diagnostic des systèmes complexes
GQE Génétique quantitative et Evolution - Le Moulon
IJPB Institut Jean-Pierre BOURGIN
Aide de l'ANR 495 249 euros
Début et durée du projet scientifique :
janvier 2021
- 48 Mois