La sémantique pour l'intégration des données du phénotypage végétal

À travers sa thèse, récemment soutenue, Cyril Pommier interroge la manière dont les standards, les bonnes pratiques et les principes FAIR peuvent transformer durablement la production, le partage et la réutilisation des données de phénotypage végétal. 

Contexte

Le phénotypage des plantes consiste à étudier leurs caractéristiques physiques dans divers environnements, tels que les champs, les serres automatisées ou non, les chambres de culture, ou encore les réseaux expérimentaux multi-locaux et multi-annuels. Les observations et mesures produites sont variées, allant de simples mesures de traits (comme la hauteur des plantes) à des images, éventuellement multispectrales, obtenues par drones ou d’autres vecteurs. Ces données sont collectées à différentes échelles, allant du groupe de plantes à l’organe individuel, et sous forme de mesures ponctuelles ou de séries temporelles. Cette discipline produit donc des données très hétérogènes, posant des défis majeurs d’intégration, de sémantique et de partage de connaissances. Cela devient encore plus critique lorsque ces données de phénomique végétale sont liées, intégrées, avec des données génétiques et omiques.

Objectifs des travaux

Les travaux, menés sur plus de dix ans, ont conduit à un modèle de données développé à l’interface entre biologie et informatique, articulant bases de données relationnelles, web sémantique et graphes de connaissances.

L’enjeu central est de permettre aux biologistes de documenter leurs données de phénotypage végétal, à toutes les étapes de leur cycle de vie, dans leur propre langage, tout en les rendant interopérables et exploitables par d’autres, y compris par des approches d’intelligence artificielle. L’objectif final est d’enrichir des graphes de connaissances afin que les scientifiques puissent interroger cette masse de données de manière nouvelle et en extraire des informations inédites. L’essor de l’intelligence artificielle ouvre de nouvelles perspectives et appelle une évolution des standards existants.

Méthodologie

Fil conducteur de la thèse

Le fil conducteur des travaux est la construction d’un modèle de données adapté au phénotypage végétal. Il a été élaboré à travers des consortiums internationaux (MIAPPE, BrAPI, CropOntology) en s’appuyant sur le système d’informations GnplS-Ephesis qui a servi de démonstrateur expérimental et de validateur lors du passage en production à grande échelle. Ces travaux se sont appuyés aussi bien sur les approches classiques de bases de données que celles du web sémantique, des ontologies et des graphes de connaissances.

Outils et technologies mises en oeuvre

La conception de ce modèle de données original s’est appuyée sur les travaux similaires effectués en génomique, à savoir le modèle GMOD CHADO  [1], PhenotypeRCN [2] et Ecological Modeling Language (EML) utilisé par la communauté travaillant sur la biodiversité [3]. Cela a permis de faire émerger un modèle adapté pour la Crop Ontology [4] dans le cadre de collaborations internationales, en particulier avec les CGIAR . Cette dernière a apporté une solution opérationnelle à la description des méthodes de mesures de traits.

Le modèle de données a été conçus et formalisé sous forme de checklist et modèle UML MIAPPE [5], d’ontologie OWL PPEO [6] ainsi que d’API de web service BrAPI [7].

Pour valider l’approche et affiner les paramétrages, des tests utilisateurs ont été réalisés, pour une première version de la fonctionnalité, sur un panel de testeurs ayant des profils variés : curateur Data INRAE, administrateur de collection, Référent Données, déposants de Data INRAE. Ces tests visaient à identifier la façon dont les utilisateurs de Data INRAE interagissent avec le formulaire de saisie de métadonnées et le module de recherche de jeux de données. Des entretiens individuels ont eu lieu en visioconférence dans un format semi-dirigé, c’est-à-dire que des « missions » étaient confiées au testeur, qu’il devait compléter librement (cf. Tableau 1).

Une première version de ce connecteur a été mise en production le 2 octobre 2024, dans la partie Data INRAE de l’entrepôt Recherche Data Gouv.

Résultats obtenus

Ces travaux ont permis de passer d’un système centralisé à une fédération internationale de données, FAIDARE, et d’engager les premières démarches d’intégration inter-ressources par alignement d’ontologies et graphes de connaissances. Ils ont conduit à la production de plusieurs artéfacts sémantiques et d’un système d’information dédié à la gestion des données de phénotypage :

  • Un modèle conceptuel de données pour la phénomique végétale, formalisé à travers les standards MIAPPE et BrAPI.
  • MIAPPE : un standard pragmatique et simple, à destination majoritairement des biologistes, permettant la documentation, la publication et l’échange FAIR de données.
  • BrAPI : une API de web services implémentant MIAPPE, à destination majoritairement des informaticiens souhaitant implémenter des systèmes automatisés.
  • La Crop Ontology, intégrée aux deux précédents standards, et fournissant des vocabulaires contrôlés de variables.
  • L’ entrepôt de données de phénotypage GnpIS-Ephesis.

Perspectives

L’intégration des données, au sens de la recherche de liens entre ressources de données, n’en est encore qu’à ses début, via des approches de graphes de connaissance ou des alignements entre ontologies.

Ces résultats peuvent servir de fondation à différents futurs travaux. Le partage des données de phénotypage est bousculé par les approches d’intelligence artificielle, en particulier en imagerie.  Il est donc souhaitable que les standards et systèmes puissent évoluer pour prendre en compte ces nouveaux besoins. D’autre part, l’intégration de données peut également bénéficier des approches d’intelligence artificielle, en particulier pour faciliter la standardisation des jeux de données et exploiter les graphes de connaissances.

Liens utiles

  • [1] Mungall, C. J., Emmert, D. B., and The FlyBase Consortium (2007). A Chado case study:
    an ontology-based modular schema for representing genome-associated biological
    information. Bioinformatics 23, i337–i346. doi : 10.1093/bioinformatics/btm189
  • [2] Mabee, P., Deans, A., Huala, E., and Lewis, S. E. (2012). Phenotype Ontology Research
    Coordination Network meeting report: creating a community network for comparing
    and leveraging phenotype-genotype knowledge across species. Stand. Genomic Sci. 6,
    440–443. doi : 10.4056/sigs.2926219
  • [3] Jones, M., O’Brien, M., Mecum, B., Boettiger, C., Schildhauer, M., Maier, M., et al. (2019). Ecological Metadata Language version 2.2.0. doi : 10.5063/F11834T2
  • [4] Pietragalla, J.; Valette, L.; Shrestha, R.; Laporte, M.-A.; Hazekamp, T.; Arnaud, E. (2024) Guidelines for creating crop-specific Ontology to annotate phenotypic data: version 2.2. Alliance Bioversity International and CIAT. 47 p.
  • [5] Pommier, C., Arend, D., Fahlgren, N., Krajewski, P., Laporte, M. A., Lange, M., et al. (2025). Minimal Information About Plant Phenotyping Experiment. doi : 10.5281/ZENODO.17303026
  • [6] Plant Phenotype Experiment Ontology (PPEO) sur AgroPortal : https://agroportal.eu/ontologies/PPEO
  • [7] BrAPI, The Breeding API : https://brapi.org/
Retour en haut