返回
AI 评分 31/100

美团 6 篇 ACL'26 中稿论文解读:从 CoreCodeBench 评测到 MASPO 推理优化

公众号:龙猫LongCat(美团)·2026-06-05 10:24·81天前·龙猫LongCat
AI 导读

美团技术团队将于 6 月 11 日分享被 ACL 顶会收录的 6 篇论文,覆盖大模型评测、复杂流程推理、数学思维优化、强化学习优化与生成式推荐。其中 CoreCodeBench 提出细粒度代码评测基准,有效性达 78.55%;AMO-Bench 显示最强模型在高中数学竞赛中准确率仅 52.4%;MASPO 在多个数学推理基准上取得更优 Avg@32 与 Pass@32。

公众号:龙猫LongCat(美团)
31AI 编辑部评分,满分 100

美团 6 篇 ACL'26 中稿论文解读:从 CoreCodeBench 评测到 MASPO 推理优化

2026-06-05 10:24· 81天前· 龙猫LongCat
AI 导读

美团技术团队将于 6 月 11 日分享被 ACL 顶会收录的 6 篇论文,覆盖大模型评测、复杂流程推理、数学思维优化、强化学习优化与生成式推荐。其中 CoreCodeBench 提出细粒度代码评测基准,有效性达 78.55%;AMO-Bench 显示最强模型在高中数学竞赛中准确率仅 52.4%;MASPO 在多个数学推理基准上取得更优 Avg@32 与 Pass@32。

公众号正文需在微信内阅读,站内仅提供摘要。

在微信中打开原文(在新标签页打开)

来源:公众号:龙猫LongCat(美团)· mp.weixin.qq.com