Apple Machine Learning Research(RSS)
精选
72AI 编辑部评分,满分 100

多智能体团队阻碍专家发挥

2026-07-02 08:00· 45天前
AI 导读

在自我组织的多智能体LLM系统中,团队无法有效利用专家成员的专业知识。在多个基准测试中,即使明确告知专家身份,团队表现仍落后于最佳成员(专家智能体)的独立能力,性能损失最高达41.1%。失败主因是未能有效利用专家意见,而非识别专家。对话分析显示,团队倾向于“整合性妥协”——平均化专家与非专家观点,随团队规模增大而加剧,且与表现负相关。这种寻求共识的行为同时提升了对抗恶意智能体的鲁棒性,揭示了协同对齐与专业利用之间的根本性权衡。

推荐理由

这篇研究给多智能体热浇了盆冷水,自组织团队反而拖累专家,瓶颈不在认不认识专家而在会不会用专家,做 Agent 系统的都知道这有多反直觉。如果你是做多智能体的值得看看。

正文 · AI 翻译

多智能体大语言模型系统正越来越多地被部署为自主协作体,其中智能体自由交互,而非执行固定的、预先指定的工作流程。在此类场景中,有效的协调无法完全预先设计,而必须通过交互涌现。然而,以往大多数研究通过固定角色、工作流程或聚合规则来强制实现协调,这留下了一个悬而未决的问题:当协调不受约束时,自组织团队的表现究竟如何。借鉴组织心理学,我们研究了自组织的大语言模型团队能否实现强协同效应,即团队表现达到或超越团队中最优秀的个体成员。在受人类启发的基准测试和前沿机器学习基准测试中,我们发现——与人类团队不同——大语言模型团队始终无法达到其专家智能体的表现水平,即使明确告知他们谁是专家,在机器学习基准测试上性能损失最高可达 41.1%。分解这一失败原因,我们发现,利用专家能力(而非识别专家)是主要的瓶颈。对话分析揭示了一种倾向于整合性妥协的模式——即平均化专家与非专家的观点,而非恰当地权衡专业意见——这种倾向随团队规模增大而增强,并与表现呈负相关。有趣的是,这种寻求共识的行为提高了对对抗性智能体的鲁棒性,这表明在对齐与有效利用专业能力之间存在一种权衡。我们的研究结果揭示了自组织多智能体团队在利用其成员集体专业能力方面存在的显著差距。

  • † 斯坦福大学
  • ‡ 埃默里大学

相关阅读与更新。

AgentBuilder:探索用于原型设计界面智能体用户体验的脚手架

2026年1月9日 研究领域 人机交互

由生成式 AI 模型驱动的界面智能体(以下简称“智能体”)能够根据用户指令自动执行操作。开发智能体的一个重要方面是其用户体验(即智能体体验)。为了让更广泛的群体(而不仅仅是 AI 工程师)能够原型化智能体体验,提供相应的支撑框架的需求日益增长,因为他们能为智能体体验的设计贡献宝贵的视角。在这项工作中,我们探索了……

通过自我对弈学习多智能体谈判

2019 年 1 月 28 日 研究领域 计算机视觉 ICCV 研讨会

做出复杂、稳健且安全的序列决策是智能系统的核心。这在多智能体复杂环境下的规划中尤为关键,因为智能体需要预判其他智能体的意图及可能的未来行动。传统方法将该问题建模为马尔可夫决策过程,但其解决方案往往依赖多种假设,在面对边缘情况时变得脆弱。在……

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS) · machinelearning.apple.com

多智能体团队阻碍专家发挥

Apple Machine Learning Research(RSS)·2026-07-02 08:00·45天前
AI 导读

在自我组织的多智能体LLM系统中,团队无法有效利用专家成员的专业知识。在多个基准测试中,即使明确告知专家身份,团队表现仍落后于最佳成员(专家智能体)的独立能力,性能损失最高达41.1%。失败主因是未能有效利用专家意见,而非识别专家。对话分析显示,团队倾向于“整合性妥协”——平均化专家与非专家观点,随团队规模增大而加剧,且与表现负相关。这种寻求共识的行为同时提升了对抗恶意智能体的鲁棒性,揭示了协同对齐与专业利用之间的根本性权衡。

正文 · AI 翻译

多智能体大语言模型系统正越来越多地被部署为自主协作体,其中智能体自由交互,而非执行固定的、预先指定的工作流程。在此类场景中,有效的协调无法完全预先设计,而必须通过交互涌现。然而,以往大多数研究通过固定角色、工作流程或聚合规则来强制实现协调,这留下了一个悬而未决的问题:当协调不受约束时,自组织团队的表现究竟如何。借鉴组织心理学,我们研究了自组织的大语言模型团队能否实现强协同效应,即团队表现达到或超越团队中最优秀的个体成员。在受人类启发的基准测试和前沿机器学习基准测试中,我们发现——与人类团队不同——大语言模型团队始终无法达到其专家智能体的表现水平,即使明确告知他们谁是专家,在机器学习基准测试上性能损失最高可达 41.1%。分解这一失败原因,我们发现,利用专家能力(而非识别专家)是主要的瓶颈。对话分析揭示了一种倾向于整合性妥协的模式——即平均化专家与非专家的观点,而非恰当地权衡专业意见——这种倾向随团队规模增大而增强,并与表现呈负相关。有趣的是,这种寻求共识的行为提高了对对抗性智能体的鲁棒性,这表明在对齐与有效利用专业能力之间存在一种权衡。我们的研究结果揭示了自组织多智能体团队在利用其成员集体专业能力方面存在的显著差距。

  • † 斯坦福大学
  • ‡ 埃默里大学

相关阅读与更新。

AgentBuilder:探索用于原型设计界面智能体用户体验的脚手架

2026年1月9日 研究领域 人机交互

由生成式 AI 模型驱动的界面智能体(以下简称“智能体”)能够根据用户指令自动执行操作。开发智能体的一个重要方面是其用户体验(即智能体体验)。为了让更广泛的群体(而不仅仅是 AI 工程师)能够原型化智能体体验,提供相应的支撑框架的需求日益增长,因为他们能为智能体体验的设计贡献宝贵的视角。在这项工作中,我们探索了……

通过自我对弈学习多智能体谈判

2019 年 1 月 28 日 研究领域 计算机视觉 ICCV 研讨会

做出复杂、稳健且安全的序列决策是智能系统的核心。这在多智能体复杂环境下的规划中尤为关键,因为智能体需要预判其他智能体的意图及可能的未来行动。传统方法将该问题建模为马尔可夫决策过程,但其解决方案往往依赖多种假设,在面对边缘情况时变得脆弱。在……

Bottom banner

探索机器学习领域的机遇。

来源:Apple Machine Learning Research(RSS)· machinelearning.apple.com