Capacidade técnicaAutomatização cognitiva2026-02-12
Modelos de fronteira produziram 0% de resultados válidos num esquema de relato financeiro com 369 campos, e um domínio só teve 12,5% de aprovação apesar de 90% de resultados válidos, relataram os autores do ExtractBench
Operador de introdução de dadospágina da profissão →Data do facto / publicação
2026-02-12
Categoria da prova
Capacidade técnicaUma demonstração, um referencial ou um artigo mostram que a tarefa pode ser feita. Atualiza o que a tecnologia consegue fazer, não o que as empresas vão fazer.
Tarefas sobre as quais incide
Verificar e corrigir registos
Confrontar os dados introduzidos com a origem e corrigir erros.
Aumentada pela máquina✓ Com prova
Onde é que isto se aplica
Um benchmark de extração de dados estruturados de 35 documentos PDF com etiquetas de referência anotadas por pessoas, 12.867 campos no total. Os autores relatam que os modelos de fronteira continuam pouco fiáveis em esquemas realistas, que o desempenho se degrada fortemente com a amplitude do esquema, culminando em 0% de resultados válidos num esquema de relato financeiro com 369 campos em todos os modelos testados, e que num domínio os modelos atingem 90% de resultados válidos mas uma taxa de aprovação de apenas 12,5%. Os autores trabalham numa empresa que vende produtos de tratamento de documentos; é um benchmark, não uma medida da prática.
O que isto significa
A extração por máquina falha em formulários longos e complexos, e um resultado com aspeto válido pode estar errado — é por isso que a verificação sobrevive à automatização da introdução.
O que ainda não mostra
Um benchmark de uma empresa interessada; os modelos melhoram, e não mede quanta verificação se faz na prática.
O que podes verificar
Abre o artigo do ExtractBench no arXiv (2602.12247) e procura «0% valid output».
Muda a avaliação?
Não, e esta categoria também não o move. Um registo de «Capacidade técnica» é prova a sério, mas por si só não sobe um juízo de tarefa. 1 juízo ligado em cima ficam onde estavam.
Fonte
Ferguson, Pennington, Beghian, Mohan, Kiela, Agrawal and Nguyen (Contextual AI) — ExtractBench: A Benchmark and Evaluation Methodology for Complex Structured Extraction, arXiv:2602.12247 (submitted 12 Feb 2026) · verificado 2026-09-30 · Claude (VOLO agent) · interpretado 2026-09-30 · Claude (VOLO agent)
Fonte primária: publicada pela parte que fez isto, ou pela autoridade de referência. Não precisa de coassinatura.