Apple Machine Learning Research(RSS)
精选
68AI 编辑部评分,满分 100

九位评委,两个有效投票:相关错误削弱LLM评审面板

2026-06-23 08:00· 46天前
AI 导读

苹果机器学习研究团队发现,LLM-as-a-judge面板因模型间高度相关而严重受限。对7个模型家族的9个前沿大语言模型在3个自然语言推理数据集上的测试表明,9位评委实际仅提供约2个独立投票的信息量,面板准确率比独立投票理想值低8–22个百分点,最佳单一模型的表现已匹敌或超越整个面板。增加评委数量或改进聚合算法收效甚微,即使允许算法获取正确答案也仅能缩小至多11%的差距。该结论在多种提示变体、温度设置及偏好任务中均得到验证,瓶颈在于评委间的相关性而非聚合算法。

推荐理由

这篇Apple论文揭示了一个反直觉的事实:在LLM评估面板中,9个法官实际上只提供约2个独立票的信息,因为模型会犯相似错误。这解释了为何简单聚合面板往往不如最佳单模型,做评估的团队必须重视法官相关性。

正文 · AI 翻译

大语言模型作为评委的评审团会汇总多个模型的投票,其预期是多样化的模型能带来更可靠的评估。我们开发了一个框架来衡量此类评审团的真实信息价值,并量化其可靠性距离独立投票的理想状态还有多远。在三个自然语言推理数据集(每个项目有100个人工标注)上,对来自7个模型家族的9个前沿大语言模型组成的评审团进行测试后,我们发现,这9位评委实际上仅提供了大约相当于2张独立投票的信息量。评审团名义上的独立性大约有四分之三因模型在相同项目上犯相同错误而丧失。后果十分显著:该评审团的实际准确率比独立投票所能达到的水平低8到22个百分点,并且在所有条件下,最佳的单一位评委都能与整个评审团的表现持平或更优。增加评委数量或使用更智能的聚合算法都无济于事——即便能获取正确答案,现有方法最多也只能弥补这一差距的11%。我们使用 Kish 有效样本量(n_eff)和一个孔多塞零模型来量化这些发现,并证明这一缺陷在提示词变体、温度参数、思维链推理以及成对偏好任务(RewardBench)中均稳健存在。瓶颈在于评委之间存在相关性,而非聚合算法本身,这意味着扩大评审团规模无法替代真正独立的评估。

相关阅读与更新。

识别物品到物品推荐中的争议性配对

大规模在线市场中的推荐系统对于帮助用户发现新内容至关重要。然而,用于物品到物品推荐任务的最先进系统通常基于浅层的上下文相关性,这使得系统在处理物品关系更为微妙的场景时显得不足。上下文相关的物品配对有时可能存在有问题的关系,这些关系……

基于张量分解的一致性协同过滤

协同过滤是分析用户活动并为商品构建推荐系统的事实标准。在这项工作中,我们开发了切片反对称分解(SAD),这是一种基于隐式反馈的协同过滤新模型。与传统技术需要估计用户(用户向量)和商品(商品向量)的潜在表示不同,SAD 为每个用户和商品引入了一个额外的潜在向量……

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com

九位评委,两个有效投票:相关错误削弱LLM评审面板

Apple Machine Learning Research(RSS)·2026-06-23 08:00·46天前
AI 导读

苹果机器学习研究团队发现,LLM-as-a-judge面板因模型间高度相关而严重受限。对7个模型家族的9个前沿大语言模型在3个自然语言推理数据集上的测试表明,9位评委实际仅提供约2个独立投票的信息量,面板准确率比独立投票理想值低8–22个百分点,最佳单一模型的表现已匹敌或超越整个面板。增加评委数量或改进聚合算法收效甚微,即使允许算法获取正确答案也仅能缩小至多11%的差距。该结论在多种提示变体、温度设置及偏好任务中均得到验证,瓶颈在于评委间的相关性而非聚合算法。

正文 · AI 翻译

大语言模型作为评委的评审团会汇总多个模型的投票,其预期是多样化的模型能带来更可靠的评估。我们开发了一个框架来衡量此类评审团的真实信息价值,并量化其可靠性距离独立投票的理想状态还有多远。在三个自然语言推理数据集(每个项目有100个人工标注)上,对来自7个模型家族的9个前沿大语言模型组成的评审团进行测试后,我们发现,这9位评委实际上仅提供了大约相当于2张独立投票的信息量。评审团名义上的独立性大约有四分之三因模型在相同项目上犯相同错误而丧失。后果十分显著:该评审团的实际准确率比独立投票所能达到的水平低8到22个百分点,并且在所有条件下,最佳的单一位评委都能与整个评审团的表现持平或更优。增加评委数量或使用更智能的聚合算法都无济于事——即便能获取正确答案,现有方法最多也只能弥补这一差距的11%。我们使用 Kish 有效样本量(n_eff)和一个孔多塞零模型来量化这些发现,并证明这一缺陷在提示词变体、温度参数、思维链推理以及成对偏好任务(RewardBench)中均稳健存在。瓶颈在于评委之间存在相关性,而非聚合算法本身,这意味着扩大评审团规模无法替代真正独立的评估。

相关阅读与更新。

识别物品到物品推荐中的争议性配对

大规模在线市场中的推荐系统对于帮助用户发现新内容至关重要。然而,用于物品到物品推荐任务的最先进系统通常基于浅层的上下文相关性,这使得系统在处理物品关系更为微妙的场景时显得不足。上下文相关的物品配对有时可能存在有问题的关系,这些关系……

基于张量分解的一致性协同过滤

协同过滤是分析用户活动并为商品构建推荐系统的事实标准。在这项工作中,我们开发了切片反对称分解(SAD),这是一种基于隐式反馈的协同过滤新模型。与传统技术需要估计用户(用户向量)和商品(商品向量)的潜在表示不同,SAD 为每个用户和商品引入了一个额外的潜在向量……

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS)· machinelearning.apple.com