Despliegue realAutomatización cognitiva2024-05-16
El equipo de Bing de Microsoft informa de que desde finales de 2022 usa LLM junto con etiquetadores humanos expertos para la mayoría de sus etiquetas de relevancia offline, y de que los encuentra más precisos que los etiquetadores externos
Ingeniero de aprendizaje automáticopágina de la ocupación →Fecha del hecho / publicación
2024-05-16
Categoría de la evidencia
Despliegue realUna empresa lo ha puesto en producción. Puede mover la línea de base, ponderado por la escala y por cuánto se parece ese entorno al tuyo.
Tareas sobre las que incide
Conseguir datos de los que la cosa pueda aprender
Recoger, etiquetar, limpiar y decidir qué dejar fuera — y notar cuándo los datos dicen algo distinto del mundo.
Aumentada por la máquina✓ Con evidencia
Dónde aplica esto
Cuatro investigadores de Microsoft describiendo la propia práctica de etiquetado de Bing en un artículo de congreso revisado por pares. Escriben que Bing lleva usando LLM, junto con etiquetadores humanos expertos, para la mayoría de sus métricas offline desde finales de 2022; que, según su experiencia, las etiquetas de los LLM resultaron más precisas que las de cualquier etiquetador externo, incluido el personal, mucho más rápidas y muchas veces más baratas; y que con el tiempo han tenido que construir conjuntos de referencia más difíciles para poder seguir distinguiendo entre etiquetadores y entre instrucciones. Las etiquetas alimentan sobre todo métricas de evaluación y no datos de entrenamiento, y Microsoft construye y vende los modelos usados, así que tiene interés en el asunto. No dice nada sobre cuántos etiquetadores o ingenieros emplea ese trabajo.
Qué significa esto
Conseguir datos de los que se pueda aprender — aquí, etiquetas de relevancia — pasó en un gran buscador de multitudes de etiquetadores humanos a modelos revisados por expertos. El trabajo del ingeniero se desplaza a construir conjuntos de prueba más difíciles que sigan distinguiendo las etiquetas buenas de las malas.
Qué no muestra todavía
Describe la práctica de un solo equipo, sobre todo para etiquetas de evaluación, contada por la empresa que vende los modelos; no muestra que el etiquetado de datos de entrenamiento vaya por el mismo camino ni ningún cambio de plantilla.
Qué puedes comprobar
Abre arXiv 2309.10621 (v3), «Large Language Models can Accurately Predict Searcher Preferences», y busca «We have been using LLMs, in conjunction with expert human labellers, for most of our offline metrics since late 2022».
¿Cambia la evaluación?
No. El índice de impacto no lo mueve nunca un solo hecho. Lo que sí hizo este registro: 1 juicio de tarea enlazado de arriba se apoyan ahora en evidencia en vez de en inferencia.
Fuente
Paul Thomas, Seth Spielman, Nick Craswell and Bhaskar Mitra (Microsoft) — "Large Language Models can Accurately Predict Searcher Preferences", SIGIR '24 (arXiv 2309.10621v3, 16 May 2024) · verificado 2026-09-27 · Claude (VOLO agent) · interpretado 2026-09-27 · Claude (VOLO agent)
Fuente primaria: publicada por la parte que hizo esto, o por la autoridad de referencia. No necesita cofirma.