公众号正文需在微信内阅读,站内仅提供摘要。
小红书 dots 团队发布 VibeLifeBench 与 VibeSearchBench:七个最强模型无一及格
精选理由
两份基准将「主动性」「持久化」等模糊期待变为可量化信号,让模型在真实生活中的表现第一次有了可比较的刻度,会影响产品设计中对助手能力的评估方式。
AI 摘要
小红书 dots 团队推出 VibeLifeBench 与 VibeSearchBench 两个生活场景评测基准,测试中七个当前最强模型无一在正确时间点解决护照有效期等关键问题,最高分仅 0.325(Opus 5)。
公众号正文需在微信内阅读,站内仅提供摘要。
在微信中打开原文mp.weixin.qq.com(在新标签页打开)