実際の導入認知の自動化2024-05-16
MicrosoftのBingチームは、2022年末からオフラインの関連性ラベルの大半に人間の専門ラベラーとともにLLMを使っており、第三者のラベラーより正確だと分かったと報告している
機械学習エンジニア職業のページ →出来事の日付 / 報じられた日
2024-05-16
証拠の段階
実際の導入雇用主がそれを本番に置いた。基準線を動かしうる——規模と、その場がどれだけ似ているかで重みづけされる。
これが関わる業務
学べるデータを用意する
集め、印をつけ、整え、何を除くかを決める——そしてデータが世界と違うことを言っているときに気づく。
増強されつつある✓ 証拠に基づく
どこに当てはまるか
Microsoftの研究者4人が、査読付きの学会論文のなかでBing自身のラベル付けの実務を述べたものである。彼らは、Bingが2022年末から、オフライン指標の大半について、人間の専門ラベラーとともにLLMを使ってきたこと、自分たちの経験ではLLMのラベルが、社員を含むどの第三者のラベラーよりも正確で、はるかに速く、何倍も安いと分かったこと、そしてラベラーとプロンプトを見分け続けるために、時とともにより難しいゴールドセットをつくる必要があったことを書いている。ラベルは主に学習データではなく評価指標に使われており、使われたモデルはMicrosoftがつくって売っているので、利害がある。この仕事がラベラーやエンジニアを何人雇っているかについては何も言っていない。
これが意味すること
学べるデータを用意すること——ここでは関連性のラベル——は、ある主要な検索エンジンで、大勢の人間のラベラーから、専門家が確かめるモデルへ移った。エンジニアの仕事は、良いラベルと悪いラベルをなお見分けられる、より難しいテストセットをつくることへ移る。
これがまだ示していないこと
描いているのは一つのチームの実務で、主に評価用のラベルについてであり、書いているのはそのモデルを売る会社である。学習データのためのラベル付けが同じように動いていることも、人員の変化も示していない。
あなたに確かめられること
arXiv 2309.10621 (v3)「Large Language Models can Accurately Predict Searcher Preferences」を開き、「We have been using LLMs, in conjunction with expert human labellers, for most of our offline metrics since late 2022」を探すこと。
評価を変えるか
いいえ。影響指数は一件の出来事で動くことはありません。この記録がやったのは、上にある1項の紐づいた業務の判断が、推定ではなく証拠の上に立つようになった、ということです。
出典
Paul Thomas, Seth Spielman, Nick Craswell and Bhaskar Mitra (Microsoft) — "Large Language Models can Accurately Predict Searcher Preferences", SIGIR '24 (arXiv 2309.10621v3, 16 May 2024) · 検証 2026-09-27 · Claude (VOLO agent) · 解読 2026-09-27 · Claude (VOLO agent)
一次資料——これを行った当事者、あるいは記録を司る当局が公表したもの。連署は要りません。