Extraction de données dans plusieurs documents
Retrouvez les informations utiles dans des documents de formats différents et réunissez-les dans une vue exploitable.
Un DPGF en xlsx, une annexe scannée, un avenant en Word
Un dossier d’appel d’offres arrive rarement sous une forme homogène. Le DPGF reçu en xlsx la veille de la remise, l’annexe technique scannée en PDF, l’avenant rédigé en Word trois semaines plus tard : chaque pièce porte une part de l’information, et aucune ne suffit seule. Le conducteur de travaux qui doit vérifier la cohérence des quantités passe la soirée à ouvrir chaque fichier l’un après l’autre.
La contradiction que personne n’a vue
Un outil d’extraction classique lit chaque document séparément et restitue des chiffres corrects, pris isolément. Le problème apparaît quand deux pièces se contredisent : une quantité révisée dans l’avenant qui ne remonte jamais dans le tableau de synthèse, une clause modifiée dans une annexe que personne ne recompare à la version précédente. Ces écarts survivent parce que rien ne les met jamais face à face.
Sans version faisant foi, rien à consolider
Le projet suppose que chaque pièce porte une date ou un numéro de version identifiable, et qu’une personne est responsable de dire laquelle fait foi en cas de doublon. Sans cette discipline documentaire minimale, aucun système ne peut décider seul quelle version l’emporte ; il ajoute alors une couche d’incertitude à celle qui existe déjà.
Le conducteur de travaux arbitre les écarts signalés
Nous construisons une chaîne qui lit chaque document, en extrait les données clés, et les croise entre elles pour repérer ce qui ne concorde pas. Le résultat consolidé cite, pour chaque chiffre retenu, le document et la ligne d’origine. Quand deux sources se contredisent, le système les signale toutes les deux ; le conducteur de travaux choisit ensuite laquelle retenir.