Capacidad técnicaAutomatización cognitiva2026-02-12
Los modelos punteros produjeron un 0% de salidas válidas en un esquema de información financiera de 369 campos, y un dominio aprobó solo el 12,5% pese a un 90% de salidas válidas, informaron los autores de ExtractBench
Grabador de datospágina de la ocupación →Fecha del hecho / publicación
2026-02-12
Categoría de la evidencia
Capacidad técnicaUna demostración, una prueba de referencia o un artículo muestran que la tarea se puede hacer. Actualiza lo que la tecnología puede hacer, no lo que harán las empresas.
Tareas sobre las que incide
Comprobar y corregir registros
Cotejar los datos introducidos con el original y corregir errores.
Aumentada por la máquina✓ Con evidencia
Dónde aplica esto
Una prueba comparativa de extracción de datos estructurados de 35 documentos PDF con etiquetas de referencia anotadas por personas, 12.867 campos en total. Los autores informan de que los modelos punteros siguen sin ser fiables con esquemas realistas, de que el rendimiento se degrada bruscamente con la amplitud del esquema, hasta llegar a un 0% de salidas válidas en un esquema de información financiera de 369 campos con todos los modelos probados, y de que en un dominio los modelos logran un 90% de salidas válidas pero solo un 12,5% de aprobados. Los autores trabajan en una empresa que vende productos de documentos; es una prueba comparativa, no una medida de la práctica.
Qué significa esto
La extracción automática se viene abajo con formularios largos y complejos, y una salida de aspecto válido puede seguir siendo errónea: por eso la comprobación sobrevive a la automatización de la grabación.
Qué no muestra todavía
Una prueba comparativa de una empresa con intereses; los modelos mejoran, y no mide cuánta comprobación se hace en la práctica.
Qué puedes comprobar
Abre el artículo de ExtractBench en arXiv (2602.12247) y busca «0% valid output».
¿Cambia la evaluación?
No, y esta categoría tampoco lo mueve. Un registro de «Capacidad técnica» es evidencia real, pero por sí solo no sube un juicio de tarea. 1 juicio enlazado de arriba se quedan donde estaban.
Fuente
Ferguson, Pennington, Beghian, Mohan, Kiela, Agrawal and Nguyen (Contextual AI) — ExtractBench: A Benchmark and Evaluation Methodology for Complex Structured Extraction, arXiv:2602.12247 (submitted 12 Feb 2026) · verificado 2026-09-30 · Claude (VOLO agent) · interpretado 2026-09-30 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.