Implementação realAutomatização cognitiva2024-05-16
A equipa do Bing da Microsoft relata que usa LLM, em conjunto com etiquetadores humanos especialistas, para a maioria das suas etiquetas de relevância offline desde o final de 2022, e que os considera mais exatos do que os etiquetadores externos
Engenheiro de aprendizagem automáticapágina da profissão →Data do facto / publicação
2024-05-16
Categoria da prova
Implementação realUma empresa pô-lo em produção. Pode mover a linha de base, ponderado pela escala e por quanto esse contexto se parece com o teu.
Tarefas sobre as quais incide
Conseguir dados de que a coisa consiga aprender
Recolher, etiquetar, limpar e decidir o que deixar de fora — e reparar quando os dados dizem algo diferente do mundo.
Aumentada pela máquina✓ Com prova
Onde é que isto se aplica
Quatro investigadores da Microsoft a descrever a prática de etiquetagem do próprio Bing num artigo de conferência com revisão por pares. Escrevem que o Bing usa LLM, em conjunto com etiquetadores humanos especialistas, para a maioria das suas métricas offline desde o final de 2022; que, na sua experiência, as etiquetas dos LLM se revelaram mais exatas do que as de qualquer etiquetador externo, incluindo pessoal próprio, muito mais rápidas e muitas vezes mais baratas; e que ao longo do tempo sentiram necessidade de construir conjuntos de ouro mais difíceis para continuar a distinguir entre etiquetadores e entre instruções. As etiquetas alimentam sobretudo métricas de avaliação e não dados de treino, e a Microsoft constrói e vende os modelos usados, por isso tem interesse no resultado. Nada diz sobre quantos etiquetadores ou engenheiros este trabalho emprega.
O que isto significa
Conseguir dados de que se consiga aprender — aqui, etiquetas de relevância — passou, num grande motor de pesquisa, de multidões de etiquetadores humanos para modelos verificados por especialistas. O trabalho do engenheiro desloca-se para construir conjuntos de teste mais difíceis que ainda consigam distinguir as boas etiquetas das más.
O que ainda não mostra
Descreve a prática de uma equipa, sobretudo para etiquetas de avaliação, pela empresa que vende os modelos; não mostra a etiquetagem de dados de treino a mudar da mesma forma nem qualquer alteração de efetivos.
O que podes verificar
Abre o arXiv 2309.10621 (v3), «Large Language Models can Accurately Predict Searcher Preferences», e procura «We have been using LLMs, in conjunction with expert human labellers, for most of our offline metrics since late 2022».
Muda a avaliação?
Não. O índice de impacto nunca é movido por um único facto. O que este registo fez: 1 juízo de tarefa ligado em cima apoiam-se agora em prova em vez de em inferência.
Fonte
Paul Thomas, Seth Spielman, Nick Craswell and Bhaskar Mitra (Microsoft) — "Large Language Models can Accurately Predict Searcher Preferences", SIGIR '24 (arXiv 2309.10621v3, 16 May 2024) · verificado 2026-09-27 · Claude (VOLO agent) · interpretado 2026-09-27 · Claude (VOLO agent)
Fonte primária: publicada pela parte que fez isto, ou pela autoridade de referência. Não precisa de coassinatura.