大语言模型作为评委的评审团会汇总多个模型的投票,其预期是多样化的模型能带来更可靠的评估。我们开发了一个框架来衡量此类评审团的真实信息价值,并量化其可靠性距离独立投票的理想状态还有多远。在三个自然语言推理数据集(每个项目有100个人工标注)上,对来自7个模型家族的9个前沿大语言模型组成的评审团进行测试后,我们发现,这9位评委实际上仅提供了大约相当于2张独立投票的信息量。评审团名义上的独立性大约有四分之三因模型在相同项目上犯相同错误而丧失。后果十分显著:该评审团的实际准确率比独立投票所能达到的水平低8到22个百分点,并且在所有条件下,最佳的单一位评委都能与整个评审团的表现持平或更优。增加评委数量或使用更智能的聚合算法都无济于事——即便能获取正确答案,现有方法最多也只能弥补这一差距的11%。我们使用 Kish 有效样本量(n_eff)和一个孔多塞零模型来量化这些发现,并证明这一缺陷在提示词变体、温度参数、思维链推理以及成对偏好任务(RewardBench)中均稳健存在。瓶颈在于评委之间存在相关性,而非聚合算法本身,这意味着扩大评审团规模无法替代真正独立的评估。
相关阅读与更新。
识别物品到物品推荐中的争议性配对
大规模在线市场中的推荐系统对于帮助用户发现新内容至关重要。然而,用于物品到物品推荐任务的最先进系统通常基于浅层的上下文相关性,这使得系统在处理物品关系更为微妙的场景时显得不足。上下文相关的物品配对有时可能存在有问题的关系,这些关系……
基于张量分解的一致性协同过滤
协同过滤是分析用户活动并为商品构建推荐系统的事实标准。在这项工作中,我们开发了切片反对称分解(SAD),这是一种基于隐式反馈的协同过滤新模型。与传统技术需要估计用户(用户向量)和商品(商品向量)的潜在表示不同,SAD 为每个用户和商品引入了一个额外的潜在向量……