Knowledge Flow – kFLOW
|Discover the flow of event relations, beyond causality
|Le projet kFLOW vise à pallier le manque de ressources et de méthodes permettant de saisir les relations subtiles entre les événements dans un texte. Les modèles existants se concentrent principalement sur les liens temporels, laissant de côté les relations causales et contextuelles. En combinant la modélisation ontologique, la création de données à grande échelle et les systèmes d'extraction, kFLOW jette les bases nécessaires à la mise en place d'applications.
|Vers une compréhension fine des relations entre événements
|L'objectif global du projet kFLOW était de permettre aux machines de comprendre, représenter et raisonner sur le flux sémantique des événements dans le langage naturel, en se concentrant sur des relations fines et interprétables. Cet objectif s'inscrit dans l'ambition plus large de combler l'écart entre le traitement automatique des langues basé sur les données et la représentation symbolique des connaissances, afin de soutenir des applications comme la vérification explicable des faits et la génération structurée de récits. Le projet a été guidé par les objectifs scientifiques suivants, chacun correspondant à une question de recherche clé : - Comprendre comment modéliser les relations entre événements de manière unifiée et expressive → Q1 : Comment représenter formellement un ensemble diversifié de relations entre événements dans une ontologie unifiée et lisible par machine ? - Identifier comment construire des ressources de haute qualité pour l'apprentissage des relations entre événements → Q2 : Comment construire un jeu de données annoté à grande échelle et de haute qualité pour les relations fines entre événements ? - Développer des méthodes pour extraire des relations fines entre événements à partir de textes → Q3 : Quelles approches pouvons-nous utiliser pour extraire de manière fiable des relations raffinées entre événements à partir de langage naturel non structuré ? - Évaluer la valeur ajoutée des relations fines entre événements dans des tâches réelles → Q4 : Comment ces relations structurées entre événements peuvent-elles être exploitées dans des applications en aval ? Le projet visait à démontrer l'utilité de la modélisation des relations entre événements à travers deux cas d'usage concrets : la génération de récits et la vérification explicable des faits.
|Pour atteindre ses objectifs, kFLOW a combiné des méthodes issues de l'ingénierie des connaissances, du traitement automatique du langage naturel (TALN) et de l'apprentissage automatique.
- Modélisation ontologique : Une étude des ressources existantes (EventKG, CIDOC CRM, théories du discours) a révélé des lacunes dans les relations fines. Pour y remédier, le projet a développé FARO, une ontologie OWL formalisant 25 relations entre événements (causales, temporelles, comparatives, méreologiques, modales). Des axiomes logiques et des contraintes garantissent la cohérence et le raisonnement.
- Création de jeux de données : Une stratégie hybride a permis de produire un corpus de plus de 500 000 paires d'événements annotées. Les données ont été générées par solicitation de LLM (GPT-3), enrichies avec des ressources de bon sens (ATOMIC), et partiellement validées manuellement. Cela a assuré à la fois l'évolutivité et la qualité.
- Pipelines d'extraction : Deux approches complémentaires ont été mises en œuvre :
(I) Un pipeline modulaire (détection d'événements, résolution de coréférences, classification des relations avec RoBERTa).
(II) Un modèle end-to-end prédisant conjointement les événements et leurs relations.
Les deux systèmes ont montré de bonnes performances, avec des scores de confiance pour les relations extraites.
- Applications et validation : Les méthodes ont été testées dans deux démonstrateurs :
- Un générateur de récits créant des histoires cohérentes à partir de graphes d'événements.
- Un prototype de vérification de faits évaluant la cohérence causale des affirmations.
1. FARO: A Comprehensive Ontology of Event-Event Relations
- A semantically rich OWL ontology formalizing 25 event-event relation types (e.g., causality, enablement, prevention, intention, temporal succession).
- Fully interoperable with RDF and aligned with upper ontologies like DOLCE and PROV-O.
- Openly available at purl.org/faro
2. Large-Scale Dataset of Annotated Event Relations
- Over 500,000 annotated sentences with event pairs and their semantic relations.
- Combines LLM-generated examples (GPT-3), commonsense filtering (ATOMIC), and manual validation.
- Supports supervised learning and few-shot prompting for language models.
- Access:
- Dataset: github.com/ANR-kFLOW/Relation_extraction
- Knowledge Graph: github.com/ANR-kFLOW/knowledge-graph
3. Event Relation Extraction Pipelines
- Implemented two extraction approaches:
- Modular pipeline: Rule-based preprocessing + RoBERTa classification for interpretability and FARO integration.
- End-to-end neural model: Joint extraction of event pairs and relations, with strong performance on causal and intentional relations.
4. Downstream Applications
- Semantic narrative generation: Converts event graphs into coherent summaries using ordering, templates, and simplification.
- Fact-checking demonstrator: Evaluates claim consistency by analyzing causal event flows, improving explainability.
5. Open Science & Dissemination
- Results shared via peer-reviewed publications (ISWC, EKAW), open-source releases (GitHub, Zenodo), and international workshops (SEMMES).
- All resources are publicly available for research and industry use.|1. FARO : Une ontologie complète pour comprendre les liens entre événements
Le projet a créé FARO, une sorte de "dictionnaire intelligent" qui définit précisément 25 types de relations entre événements (comme la cause, l'intention, la succession dans le temps ou la contradiction). FARO est compatible avec les standards du web sémantique et permet aux machines de raisonner logiquement sur ces relations. Toutes les informations sont librement disponibles avec une documentation complète : purl.org/faro.
2. Une base de données géante pour entraîner les intelligences artificielles
Pour apprendre aux machines à reconnaître ces relations, l'équipe a construit un ensemble de plus de 500 000 phrases annotées. Ces exemples ont été :
- Générés automatiquement avec l'aide d'IA (comme GPT-3)
- Filtrés pour garantir leur pertinence
- Vérifiés manuellement pour assurer leur qualité
Cette base de données, la plus grande du genre, permet d'entraîner des systèmes intelligents et est disponible gratuitement :
Jeu de données : github.com/ANR-kFLOW/Relation_extraction
Graphe de connaissances : github.com/ANR-kFLOW/knowledge-graph
3. Des outils intelligents pour extraire les relations entre événements
Deux méthodes complémentaires ont été développées :
- Une approche modulaire qui combine règles logiques et classification avancée pour une compréhension claire et transparente
- Un modèle neuronal qui identifie simultanément les événements et leurs relations, particulièrement performant pour les liens de cause à effet et les intentions
4. Des applications concrètes pour vérifier et raconter
Le projet a créé deux démonstrateurs :
- Un générateur de récits qui transforme des événements en histoires cohérentes
- Un outil de vérification qui analyse la logique entre des affirmations et des preuves
Ces applications montrent comment une compréhension fine des relations entre événements améliore la cohérence et la transparence des systèmes d'intelligence artificielle.
|- Use of LLMs for data augmentation
- At the start of kFLOW, LLMs were not widely adopted for resource creation
- GPT-3 was used to generate large-scale annotated examples of event-event relations
- These examples were filtered and validated, creating a dataset of over 500,000 event pairs
- This approach proved highly effective and became central to the project’s methodology
- LLMs for knowledge generation
- LLMs were used innovatively beyond data augmentation
- Helped formulate competency questions for ontology development and refinement
- Demonstrated potential in supporting knowledge engineering and ontology-driven research
- Event Relation Extraction for specific relations
- Focused on extracting fine-grained, specific event relations (e.g., causality, enablement, prevention)
- Systems aligned with the FARO ontology for semantically precise extraction
- Advanced Event Relation Extraction (ERE) by moving from broad categories to ontology-driven precision
- Narrative generation as a key application
- Narrative generation emerged as an important use case
- Developed methods to transform event graphs into coherent textual stories
- Showed how structured event relations improve narrative flow and consistency
- Laid the foundation for future applications in storytelling, cultural heritage, and education
L'histoire de l'humanité est composée d'un flux continu d'événements. Chacun d'entre eux peut avoir un impact sur les événements suivants et contribuer à l'évolution des connaissances humaines. Les graphes de connaissances tentent d'encoder les informations sur les faits et les événements, mais ne parviennent pas toujours à représenter l'évolution temporelle de ces connaissances et à suivre les flux de cause à effet. kFLOW vise à proposer des stratégies pour représenter, extraire, prédire et utiliser les informations sur les relations entre les événements et l'évolution des connaissances. Pour atteindre ces objectifs, un graphe de connaissances des événements et des faits interconnectés sera réalisé. Ce graphe sera alimenté et exploité en développant des stratégies spécialisées pour la modélisation des données, l'extraction d'informations, la prédiction de liens, la détection de triplets incorrects et la vérification automatique des faits.
Coordination du projet
Pasquale Lisena (EURECOM)
L'auteur de ce résumé est le coordinateur du projet, qui est responsable du contenu de ce résumé. L'ANR décline par conséquent toute responsabilité quant à son contenu.
Partenariat
EURECOM EURECOM
Aide de l'ANR 200 524 euros
Début et durée du projet scientifique :
décembre 2021
- 36 Mois