Capacidad técnicaAutomatización cognitiva2024-10-09
OpenAI construyó un banco de pruebas con 75 competiciones de Kaggle para medir a agentes en ingeniería de aprendizaje automático; el mejor montaje llegó a nivel de medalla de bronce en el 16,9% de ellas
Ingeniero de aprendizaje automáticopágina de la ocupación →Fecha del hecho / publicación
2024-10-09
Categoría de la evidencia
Capacidad técnicaUna demostración, una prueba de referencia o un artículo muestran que la tarea se puede hacer. Actualiza lo que la tecnología puede hacer, no lo que harán las empresas.
Tareas sobre las que incide
Construir un modelo para el problema
Elegir una arquitectura, entrenarla con tus datos, ajustarla hasta que los números se muevan.
Automatizándose≈ Inferencia de la plataforma
Decidir qué cuenta como lo bastante bueno
Construir el conjunto de prueba, elegir la métrica, y decir si esto puede usarse ya con personas reales.
Sigue llevándola una persona≈ Inferencia de la plataforma
Dónde aplica esto
Setenta y cinco competiciones de Kaggle de ingeniería de aprendizaje automático — entrenar modelos, preparar conjuntos de datos, ejecutar experimentos — puntuadas contra las marcas humanas de la clasificación pública de cada competición, así que la comparación es con la gente que de verdad participó. El montaje que mejor rindió en el momento de escribirlo (o1-preview con el andamiaje AIDE) llegó al menos al bronce en el 16,9% de las competiciones; los autores informan además de que escalar los recursos y la contaminación del preentrenamiento cambian ambos el número, y el banco de pruebas es de código abierto, así que cualquiera puede volver a correrlo sobre un modelo más nuevo. Dos límites son estructurales y no accidentales: una competición de Kaggle llega con el problema ya enmarcado, la métrica ya elegida y los datos ya recogidos, que es justo la parte de este trabajo que el banco de pruebas no puede medir en absoluto; y OpenAI construyó el banco de pruebas y vende modelos medidos con él.
Qué significa esto
Ya existe una medición pública y repetible de la parte de este puesto que más se parece a un concurso: un problema enmarcado, una métrica elegida, un conjunto de datos preparado, y una clasificación de participantes reales contra los que perder. En esa parte, a finales de 2024 los agentes llegaban a nivel de bronce en alrededor de una competición de cada seis, y el banco de pruebas es abierto, así que la cifra se mueve en público y no en la diapositiva de un proveedor.
Qué no muestra todavía
El bronce en una competición no es un modelo en producción, y el banco de pruebas no puede ver los pasos que deciden si uno llega ahí: quién enmarcó la pregunta, por qué esta métrica y no la otra, si los datos de entrenamiento se pueden usar así, y qué pasa el día en que la distribución cambia. La cifra tampoco dice nada de la contratación. Lee la fecha junto a ella: es una medición de una generación de modelos, y los propios autores señalan la contaminación del preentrenamiento como algo que la mueve.
Qué puedes comprobar
Coge el último modelo que pusiste en producción y escribe quién eligió la métrica con la que se le califica. Si esa persona fuiste tú, la parte de tu puesto que prueba este banco no es la parte por la que te pagan. Si fue otra persona, merece preguntarle cómo la eligió.
¿Cambia la evaluación?
No, y esta categoría tampoco lo mueve. Un registro de «Capacidad técnica» es evidencia real, pero por sí solo no sube un juicio de tarea. 2 juicios enlazados de arriba se quedan donde estaban.
Fuente
MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering (OpenAI, arXiv:2410.07095) · verificado 2026-09-12 · Claude (VOLO agent) — arXiv abstract page read; the 75-competition count, the 16.9% bronze figure and the AIDE/o1-preview pairing taken from the authors' own abstract · interpretado 2026-09-12 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.