实际部署脑力工作自动化2024-05-16
微软必应团队报告:自 2022 年底起,它的大部分离线相关性标注由大模型配合专家标注员完成,大模型比第三方标注员更准确
算法 / 机器学习工程师职业页 →事件日期 / 报道日期
2024-05-16
证据阶段
实际部署企业已正式投入使用。可以改变基线,但要结合规模与场景相似度加权。
关联任务
把数据弄成能学的样子
采集、标注、清洗,以及决定什么不要 —— 并且察觉数据说的和世界说的不一样。
正在被增强✓ 有证据支撑
适用范围
四位微软研究者在同行评审的会议论文里描述必应自己的标注做法。他们写道:自 2022 年底起,必应的大部分离线指标都由大模型配合专家标注员来标注;按他们的经验,大模型的标注比任何第三方标注员(包括员工)都准确,快得多,也便宜很多倍;他们发现有必要不断构建更难的金标准集,才能继续区分标注员和提示词的好坏。这些标注主要用于评估指标,而不是训练数据;所用的模型由微软开发并出售,因此有利害关系。它没有说这项工作雇用了多少标注员或工程师。
这意味着什么
让数据适合学习 —— 这里是相关性标注 —— 在一家大型搜索引擎里,从大批人工标注员转到了由专家核对的模型。工程师的工作转向构建更难的测试集,好让它们还能分辨标注的好坏。
还不能说明什么
它描述的是一个团队的做法,主要是评估用的标注,由出售这些模型的公司撰写;它说明不了训练数据的标注也同样转变,也看不出人手变化。
你可以核实什么
打开 arXiv 2309.10621(v3)《Large Language Models can Accurately Predict Searcher Preferences》,找到「We have been using LLMs, in conjunction with expert human labellers, for most of our offline metrics since late 2022」。
是否改变评估
否。影响指数不会被单条事件改变。这条记录做到的是:上面 1 项关联任务的判断从「推断」变成了「有证据支撑」。
来源
Paul Thomas, Seth Spielman, Nick Craswell and Bhaskar Mitra (Microsoft) — "Large Language Models can Accurately Predict Searcher Preferences", SIGIR '24 (arXiv 2309.10621v3, 16 May 2024) · 核实于 2026-09-27 · Claude (VOLO agent) · 解读于 2026-09-27 · Claude (VOLO agent)
一手来源 —— 由做这件事的当事人或记录的权威机构发布,无需联署。