Capacité techniqueAutomatisation cognitive2026-02-12
Les modèles de pointe ont produit 0 % de sorties valides sur un schéma de reporting financier de 369 champs, et un domaine n'a réussi qu'à 12,5 % malgré 90 % de sorties valides, ont rapporté les auteurs d'ExtractBench
Opérateur de saisiepage du métier →Date de l'événement / signalement
2026-02-12
Stade de la preuve
Capacité techniqueUne démonstration, un référentiel ou un article montre que la tâche peut être faite. Cela met à jour ce que la technologie sait faire — pas ce que les employeurs feront.
Tâches concernées
Contrôler et corriger les enregistrements
Vérifier les données saisies par rapport à la source et corriger les erreurs.
Augmentée✓ Appuyé sur des preuves
Où ceci s'applique
Un banc d'essai d'extraction de données structurées à partir de 35 documents PDF dotés d'étiquettes de référence annotées par des personnes, soit 12 867 champs au total. Les auteurs rapportent que les modèles de pointe restent peu fiables sur des schémas réalistes, que les performances se dégradent fortement avec l'étendue du schéma, jusqu'à 0 % de sorties valides sur un schéma de reporting financier de 369 champs pour tous les modèles testés, et que sur un domaine les modèles atteignent 90 % de sorties valides mais un taux de réussite de seulement 12,5 %. Les auteurs travaillent dans une entreprise qui vend des produits documentaires ; c'est un banc d'essai, non une mesure de la pratique.
Ce que cela veut dire
L'extraction automatique s'effondre sur les formulaires longs et complexes, et une sortie d'apparence valide peut quand même être fausse : c'est pourquoi le contrôle survit à l'automatisation de la saisie.
Ce que cela ne montre pas encore
Un banc d'essai réalisé par une entreprise intéressée ; les modèles progressent, et il ne mesure pas combien de contrôle est effectué en pratique.
Ce que vous pouvez vérifier
Ouvrez l'article ExtractBench sur arXiv (2602.12247) et cherchez « 0% valid output ».
Cela change-t-il l'évaluation ?
Non — et ce stade ne le déplace pas non plus. Un dossier de type « Capacité technique » est une preuve réelle, mais il ne fait pas monter d'un cran un jugement de tâche à lui seul. 1 jugement lié ci-dessus reste là où il était.
Source
Ferguson, Pennington, Beghian, Mohan, Kiela, Agrawal and Nguyen (Contextual AI) — ExtractBench: A Benchmark and Evaluation Methodology for Complex Structured Extraction, arXiv:2602.12247 (submitted 12 Feb 2026) · vérifié 2026-09-30 · Claude (VOLO agent) · interprété 2026-09-30 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.