Ingeniero de aprendizaje automático — tareas, una a una
La unidad de análisis es la tarea, no el nombre del puesto. Cada una de las siguientes lleva su dirección, si el juicio se apoya en evidencia o en una inferencia de la plataforma, el razonamiento y lo que no establece.
Todas las tareas de esta página#
Construir un modelo para el problema
Automatizándose≈ Inferencia de la plataformaElegir una arquitectura, entrenarla con tus datos, ajustarla hasta que los números se muevan.
Dos fuerzas, y solo una de ellas es lo que este sitio suele llamar automatización. Las herramientas automatizaron de verdad la búsqueda — elegir arquitectura e hiperparámetros pasó a ser un trabajo que configuras y no que ejecutas. La fuerza mayor es distinta en naturaleza: muchísimos problemas que antes exigían entrenar algo se resuelven ahora llamando a un modelo que entrenó otro. La tarea no se volvió hacedera por una máquina; su producto se volvió comprable.
Las cuatro direcciones de este sitio no distinguen esos dos mecanismos, y la diferencia le importa a quien planifique a partir de esta página: una tarea que se volvió comprable puede dejar de serlo cuando se mueven el precio, la licencia o la capacidad del proveedor, de una forma en que una tarea que una máquina aprendió a hacer no. Tampoco dice nada sobre los dominios donde un modelo comprado no es opción — los estrechos, propietarios, con límite de latencia o regulados — que no son raros.
Decidir qué cuenta como lo bastante bueno
Sigue llevándola una persona✓ Con evidenciaConstruir el conjunto de prueba, elegir la métrica, y decir si esto puede usarse ya con personas reales.
La corrección de un sistema aprendido no se puede definir, solo medir — así que el instrumento de medida es el entregable, y tiene que construirlo alguien que sepa cuánto cuesta aquí un error. Un banco de pruebas que el modelo ya ha visto no mide nada, lo que convierte construir un conjunto de prueba honesto en un trabajo adversario y no de recogida de datos. Esta es la tarea que escaseó más a medida que los modelos mejoraban, porque cuanto más difícil es lo que se juzga, más difícil es juzgarlo.
Un juicio sobre la naturaleza del trabajo, no una medición de cómo se dota de personal. Hay muchos equipos que no hacen esto en absoluto y salen a producción con el resultado de referencia publicado por el proveedor: eso es justamente el fallo que aquí se describe, no una evidencia en contra — pero cuántos son no lo cuenta nadie.
Conseguir datos de los que la cosa pueda aprender
Aumentada por la máquina≈ Inferencia de la plataformaRecoger, etiquetar, limpiar y decidir qué dejar fuera — y notar cuándo los datos dicen algo distinto del mundo.
El etiquetado asistido por modelos y la generación sintética le quitaron a esto casi todo el volumen, y eso es real: lo que antes necesitaba un equipo durante semanas es a menudo una primera pasada en una tarde. Lo que no se transfirió es saber qué ejemplos el método de recogida nunca tuvo ocasión de contener — una ausencia es invisible para cualquier herramienta que solo lee lo que está.
Nada de esto mide cuánto tiempo le lleva a un equipo concreto, y la respuesta difiere en un orden de magnitud entre un equipo con un activo de datos existente y otro que parte de cero. Usar un modelo para etiquetar datos que entrenan un modelo tiene además modos de fallo conocidos que este juicio no pondera.
Cuando deja de funcionar en silencio
Aumentada por la máquina≈ Inferencia de la plataformaDeriva, una entrada que cambió aguas arriba, un patrón estacional que los datos de entrenamiento nunca vieron — y la decisión de reentrenar, revertir o apagarlo.
La detección mejoró de verdad: las herramientas de monitorización sacan a la luz un desplazamiento de distribución mejor y antes que una persona mirando cuadros de mando. Decidir qué hacer al respecto no se movió, porque las opciones se compensan entre sí en términos de negocio — reentrenar cuesta dinero y puede empeorarlo, apagarlo tiene un coste visible hoy, y no hacer nada también es una decisión.
No dice nada sobre si los equipos monitorizan de verdad. Un modelo corriendo sin vigilancia durante un año es habitual y este juicio no lo recoge — donde nadie mira, esta tarea no está conducida por personas, simplemente no se hace.
Diseñar las entradas a mano
Automatizándose≈ Inferencia de la plataformaDiseñar a mano, a partir del conocimiento del dominio, las señales derivadas de las que aprende un modelo.
Esta se acabó en gran medida antes del periodo que mide este sitio. El aprendizaje de representaciones sustituyó a las características diseñadas a mano en visión, habla y texto a lo largo de la década de 2010, y el patrón se ha extendido desde entonces a los problemas tabulares y de secuencias. Está en la página porque sigue siendo lo que enseña buena parte del material de formación, así que la gente llega esperando que sea el oficio.
No es evidencia sobre la ventana 2022-2026 en absoluto; es más antigua que eso y se registra aquí para orientar. El diseño de características específicas de un dominio sigue además soportando carga en algunos entornos regulados donde no se permite una entrada inexplicable, cosa que este juicio no separa.
Responder por lo que le hace a la gente
Tarea nueva✓ Con evidenciaExplicar una decisión que el sistema tomó sobre alguien, demostrar que las entradas eran adecuadas para ese fin, y ser la persona con nombre cuando se impugna.
Es trabajo nuevo, y llega desde la regulación y no desde la capacidad: varios mercados atan ya deberes a los sistemas usados en contratación, crédito, educación y servicios públicos, entre ellos la exigencia de que quien despliega uno se asegure de que sus datos de entrada son pertinentes y suficientemente representativos para ese fin. Un deber con esa forma tiene que recaer en una persona que entienda qué consumió de verdad el modelo, y el sitio tiene una ficha verificada de justo esa cláusula entrando en vigor — colgada de la página de quien despliega, `business-systems-owner`, porque es a quien nombra la cláusula.
La ficha a la que apunta este razonamiento no está colgada de esta ocupación, y a propósito: la obligación nombra a quien despliega, y colgarla aquí afirmaría que recae en los ingenieros cuando en la mayoría de las organizaciones todavía no se les ha dicho que recae en ellos. Así que esto es una inferencia sobre dónde va a estar el trabajo, no evidencia de que ya esté ahí. Los requisitos difieren además mucho según el mercado y según para qué se use el sistema.