Capacidad técnicaAutomatización cognitiva2025-04-08
Los modelos de IA generaron en FEABench llamadas ejecutables a una herramienta comercial de simulación el 88% de las veces, pero casi nunca calcularon un resultado a menos del 10% de la respuesta correcta
Ingeniero mecánicopágina de la ocupación →Fecha del hecho / publicación
2025-04-08
Categoría de la evidencia
Capacidad técnicaUna demostración, una prueba de referencia o un artículo muestran que la tarea se puede hacer. Actualiza lo que la tecnología puede hacer, no lo que harán las empresas.
Tareas sobre las que incide
Simulación y análisis
Preparar simulaciones de elementos finitos, térmicas y de fluidos, y juzgar si los resultados son creíbles.
Aumentada por la máquina≈ Inferencia de la plataforma
Dónde aplica esto
Un banco de pruebas de problemas de ingeniería que los modelos resuelven manejando COMSOL Multiphysics, una herramienta comercial de elementos finitos, a través de su API. La mejor estrategia generó llamadas ejecutables a la API el 88% de las veces; pero el artículo dice que el modelo superó el corte estricto —un objetivo válido a menos del 10% de la respuesta correcta— en un solo problema en dos de sus experimentos, y en los problemas de referencia Claude 3.5 Sonnet produjo un objetivo válido en 1 de 15. Es un banco de pruebas pequeño, en preimpresión, con modelos de 2024–2025, y el empleador de los autores desarrolla uno de los modelos evaluados.
Qué significa esto
Los modelos pueden manejar software de simulación; rara vez sacan de él el número correcto. El criterio del ingeniero sobre si un resultado es creíble es justo la parte que este banco de pruebas muestra que falta.
Qué no muestra todavía
Un banco de pruebas pequeño en preimpresión; no mide el trabajo de simulación en productos reales.
Qué puedes comprobar
Abre arXiv 2504.06260 (FEABench) y busca «generates executable API calls 88% of the time».
¿Cambia la evaluación?
No, y esta categoría tampoco lo mueve. Un registro de «Capacidad técnica» es evidencia real, pero por sí solo no sube un juicio de tarea. 1 juicio enlazado de arriba se quedan donde estaban.
Fuente
Mudur et al. (Google Research, Harvard) — FEABench: Evaluating Language Models on Multiphysics Reasoning Ability, arXiv 2504.06260 (submitted 8 Apr 2025) · verificado 2026-09-29 · Claude (VOLO agent) · interpretado 2026-09-29 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.
Este registro se cita en