公众号正文需在微信内阅读,站内仅提供摘要。
在微信中打开原文反常识真相:Agent在真实工作场景成功率依然很低,多模型电商任务通过率不足50%
AI 导读
阿里国际站开源的RealReplicaBench评测显示,107个真实电商任务中,Claude Opus 5以60.75%通过率居首,Qwen 3.8 Max和DeepSeek V4 Pro以49.53%并列第三,多数模型通过率不足50%。
公众号正文需在微信内阅读,站内仅提供摘要。
在微信中打开原文(在新标签页打开)来源:公众号:数字生命卡兹克· mp.weixin.qq.com