Les grands modèles de langage savent extraire entités et relations à partir de documents non structurés, mais leur sortie reste souvent instable d’un fichier à l’autre. Le papier “An Ontology-Guided, Deduplication-Aware Extraction Layer for Knowledge Graph Construction from Heterogeneous Documents” propose une réponse orientée production : une couche d’extraction capable d’alimenter un graphe de connaissances aligné sur une ontologie formelle à partir d’un flux documentaire continu.
Le système ingère des métadonnées via Kafka et traite plusieurs formats, dont PDF, feuilles de calcul, documents Office et images, avec des gestionnaires dédiés. L’extraction se fait en deux passes à l’aide d’un modèle Qwen3.5-9B hébergé localement et ajusté sur l’ontologie cible. Le point central de l’architecture est l’extraction guidée par ontologie : au lieu d’injecter un catalogue statique, le système récupère en temps réel la portion pertinente de l’ontologie depuis une base graphe via similarité d’embeddings.
Selon les auteurs, cette récupération dynamique réduit d’environ 94 % la surcharge de catalogue par rapport à des découpes de domaine statiques. Les résultats extraits passent ensuite dans une chaîne de raffinement en cinq étapes : nettoyage déterministe, fusion inter-segments, seconde passe dédiée aux relations, six algorithmes de déduplication ne nécessitant pas d’inférence de modèle, puis un sous-système de résolution par embeddings doté d’un garde-fou empêchant qu’un simple score de similarité ne force une fusion conflictuelle.
L’évaluation, menée sur des corpus liés au renseignement, indique une amélioration du rappel en recherche d’environ 70 % à 95 %, sans fausses fusions signalées. Les auteurs indiquent aussi avoir corrigé sept classes de défauts qualité silencieux, allant d’un bug tronquant le texte source d’un caractère à des duplications systématiques d’entités portant des préfixes de titre. Ces résultats restent à interpréter dans le cadre décrit par l’article, mais ils illustrent un enjeu concret : industrialiser l’extraction LLM sans sacrifier la cohérence des graphes de connaissances.