Déploiement réelAutomatisation cognitive2024-05-16
L'équipe Bing de Microsoft indique utiliser depuis fin 2022 des LLM, associés à des annotateurs humains experts, pour la plupart de ses étiquettes de pertinence hors ligne, et les juge plus exactes que celles d'annotateurs tiers
Ingénieur en apprentissage automatiquepage du métier →Date de l'événement / signalement
2024-05-16
Stade de la preuve
Déploiement réelUn employeur l'a mis en production. Cela peut déplacer la ligne de base — pondéré par l'échelle et par la ressemblance du cadre avec le vôtre.
Tâches concernées
Obtenir des données dont la chose puisse apprendre
Collecter, annoter, nettoyer et décider ce qu'on laisse de côté — et remarquer quand les données disent autre chose que le monde.
Augmentée✓ Appuyé sur des preuves
Où ceci s'applique
Quatre chercheurs de Microsoft décrivant la pratique d'annotation propre à Bing dans un article de conférence évalué par les pairs. Ils écrivent que Bing utilise des LLM, en association avec des annotateurs humains experts, pour la plupart de ses métriques hors ligne depuis fin 2022 ; que, selon leur expérience, les étiquettes produites par LLM se sont révélées plus exactes que celles de n'importe quel annotateur tiers, personnel interne compris, bien plus rapides et plusieurs fois moins chères ; et qu'ils ont jugé nécessaire de construire au fil du temps des jeux de référence plus difficiles pour continuer à distinguer les annotateurs et les prompts. Les étiquettes alimentent surtout des métriques d'évaluation plutôt que des données d'entraînement, et Microsoft construit et vend les modèles utilisés : l'entreprise a donc un intérêt en jeu. Cela ne dit rien du nombre d'annotateurs ou d'ingénieurs qu'emploie ce travail.
Ce que cela veut dire
Obtenir des données dont on puisse apprendre — ici, des étiquettes de pertinence — est passé, dans un grand moteur de recherche, de foules d'annotateurs humains à des modèles contrôlés par des experts. Le travail de l'ingénieur se déplace vers la construction de jeux de test plus difficiles, capables de distinguer encore les bonnes étiquettes des mauvaises.
Ce que cela ne montre pas encore
Cela décrit la pratique d'une équipe, surtout pour des étiquettes d'évaluation, par l'entreprise qui vend les modèles ; cela ne montre ni que l'annotation des données d'entraînement évolue de la même façon, ni aucun changement d'effectifs.
Ce que vous pouvez vérifier
Ouvrez arXiv 2309.10621 (v3), « Large Language Models can Accurately Predict Searcher Preferences », et cherchez « We have been using LLMs, in conjunction with expert human labellers, for most of our offline metrics since late 2022 ».
Cela change-t-il l'évaluation ?
Non. L'indice d'impact n'est jamais déplacé par un seul événement. Ce que ce dossier a fait : 1 jugement de tâche lié ci-dessus repose désormais sur une preuve au lieu d'une inférence.
Source
Paul Thomas, Seth Spielman, Nick Craswell and Bhaskar Mitra (Microsoft) — "Large Language Models can Accurately Predict Searcher Preferences", SIGIR '24 (arXiv 2309.10621v3, 16 May 2024) · vérifié 2026-09-27 · Claude (VOLO agent) · interprété 2026-09-27 · Claude (VOLO agent)
Source primaire — publiée par la partie qui a fait la chose, ou par l'autorité de référence. Aucune contresignature nécessaire.