内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态论文 · 371 条
来源全部一手资讯X
类型论文
全部模型产品行业论文教程观点
标签「评测/基准」清除

8月25日周二

11:18Rohan Paul36SWE-bench Science:编码智能体难解科学缺陷
05:18elvis32终端智能体综述:对比为何矛盾

8月24日周一

22:07OpenBMB51清华等提出"表征平等"框架:评估大模型跨国模拟是否均衡
08:48SemiAnalysis64AgentX 推理基准:CUDA 护城河能否守住智能体推理

8月23日周日

07:44Dongxi 东锡 NLP31TRACES:面向发现式智能的基准
01:44DAIR.AI47微软发布Thinkingbox:智能体可靠性基准

8月21日周五

22:24Artificial Analysis66Artificial Analysis 推出 Speech Agent Arena,评测语音到语音模型的对话偏好与任务成功率
22:06Hugging Face:Blog(RSS)69精选测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型"刷分"现象

8月20日周四

08:00HuggingFace Daily Papers(社区热门论文)49FlavourBench:用可执行烹饪基准评测前沿语言模型
04:48Rohan Paul41TRACES:首个衡量探索式AI的基准
02:48Rohan Paul47IBM 新框架 BenchDrift 揭示措辞致 LLM 分数波动 74.7 个百分点
02:44Dongxi 东锡 NLP36TRACES 基准发布:衡量 AI 发现式智能

8月19日周三

02:24The Decoder:AI News(RSS)59新基准 Search Index 评测 AI 智能体搜索 API 的质量、成本与速度

8月18日周二

16:05HuggingFace Daily Papers(社区热门论文)54TRACE-Bench:分解与诊断多参考图像生成
11:05HuggingFace Daily Papers(社区热门论文)49R^3-Bench:LLM 在共享预算下的资源理性推理仍显吃力

8月15日周六

13:53The Decoder:AI News(RSS)47New benchmark confirms AI models still perform poorly at visual perception

8月14日周五

23:51elvis46Meta 新框架揭示 LLM 裁判易被说服改判
05:00DAIR.AI47智能体排行榜信号不足,方差分解揭示真相

8月13日周四

00:17Microsoft Research30MindTopo新基准测试AI拓扑理解

8月12日周三

13:17MarkTechPost(RSS)53小米 MiLM Plus 发布 PROVE:面向感知对齐的目标移除评测指标 RC-S 与 RC-T 及真实世界视频基准
10:58HuggingFace Daily Papers(社区热门论文)54VibeLifeBench:生活智能体能否在动态世界中保持主动与持久?
03:58HuggingFace Daily Papers(社区热门论文)49Cultivar:面向数据污染与本地化鲁棒性探究的对比式翻译基准

8月11日周二

12:17AK51SWE-Bench ProMax:大规模多语言代码重构基准
10:58HuggingFace Daily Papers(社区热门论文)45Sci-VBench:科学领域知识密集型视频生成的评测基准
10:58HuggingFace Daily Papers(社区热门论文)67SWE-Bench ProMax:面向大规模多语言代码重构的智能体评测基准
08:00HuggingFace Daily Papers(社区热门论文)53ENTLORE:面向企业问答中潜在组织推理的图基基准

8月10日周一

01:06DAIR.AI31本周Top AI论文:智能体评估、零token记忆与反思采样

8月9日周日

08:00HuggingFace Daily Papers(社区热门论文)59Business Arena:在真实市场环境中评测 LLM 智能体的商业运营能力

8月7日周五

08:00HuggingFace Daily Papers(社区热门论文)45A^2E:面向智能体框架的端到端审计引擎
08:00HuggingFace Daily Papers(社区热门论文)50零差距并非恢复:基准污染的分层逐题概率评估与逐步缓解
01:41AK36迈向技能原生大模型:长程推理基准新方法

8月6日周四

08:00HuggingFace Daily Papers(社区热门论文)41大模型智能体的人格演化:11 个生活事件后的特质偏移评测

8月5日周三

19:34Hacker News 热门(buzzing.cc 中文翻译)39当人工智能基准测试陷入停滞时:一项关于基准测试饱和度的系统性研究
07:04Hacker News 热门(buzzing.cc 中文翻译)67MirrorCode:AI 能独立完成的最大规模软件项目基准测试

8月4日周二

17:05Rohan Paul31谷歌论文:金融研究智能体预测能力不足
11:54HuggingFace Daily Papers(社区热门论文)53SWE-Touch:当用户修改代码时,编码智能体如何应对
11:54HuggingFace Daily Papers(社区热门论文)66WorldExam:从表观外观到内在反应性的世界模型评测基准
10:54HuggingFace Daily Papers(社区热门论文)66ScrambleToolBench:智能体在自身地图指向下一步时仍会穷举搜索
08:00HuggingFace Daily Papers(社区热门论文)49GDPevo:面向真实业务任务的智能体自我进化评测基准
02:32elvis46Locus 自动后训练 Qwen3 超越官方 Instruct 版
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
论文 · 标签「评测/基准」 · 371 条清除

8月25日

星期二 · 2 条
11:18
Rohan Paul@rohanpaul_ai
AI 评分 36/100
SWE-bench Science:编码智能体难解科学缺陷

新基准 SWE-bench Science 用开源科学仓库的真实缺陷测试编码智能体,发现它们擅长消除可见故障,却难以恢复底层科学逻辑,且领域知识帮助有限。最佳配置 Claude Code 配 Opus-5 通过 96.64% 公开测试,但 Pass@1 仅 47.90%。瓶颈在于验证而非知识:智能体无法将科学解释与可执行证据对照时,会锚定解释而非检验它。

arXiv编码论文/研究评测/基准
05:18
elvis@omarsar0
AI 评分 32/100
一篇关于终端智能体的不错综述。它很好地介绍了终端智能体究竟是什么,以及为什么各种工具(harness)对比的结果总是相互矛盾?论文:https://arxiv.org/abs/2608.20485在我们的学院中追踪更多热门 AI 论文:https://academy.dair.ai/
智能体arXiv论文/研究评测/基准

8月24日

星期一 · 2 条
22:07
OpenBMB@OpenBMB
AI 评分 51/100
清华等提出"表征平等"框架:评估大模型跨国模拟是否均衡

清华等高校提出“表征平等”框架,评估大语言模型作为跨国调查合成受访者时,模拟精度是否在各群体间均衡分布。测试覆盖59国、2420个亚组及9个开源模型,发现模拟不平等是系统性的:模型对澳大利亚、北美、欧洲模拟更准,且国家精度与人均GDP、互联网普及率正相关。

安全/对齐论文/研究评测/基准
08:48
SemiAnalysis@SemiAnalysis_
AI 评分 64/100
AgentX - InferenceXv3:CUDA 护城河在智能体推理中能否守住?开源 300 万美元数据集,100 万+上下文长度,多轮对话,子智能体 95%+ KVCache 命中率,GB300 NVL72,MI355,B200https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat
开源生态推理评测/基准部署/工程

8月23日

星期日 · 2 条
07:44
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 31/100
检验结果,审计过程。面向发现式智能的 benchmark:TRACES

Dongxi 东锡 NLP: http://x.com/i/article/2091196172736073730

数据/训练评测/基准
01:44
DAIR.AI@dair_ai
AI 评分 47/100
微软发布Thinkingbox:智能体可靠性基准

微软发布Thinkingbox,一个用于真实业务流程中智能体可靠性的沙盒环境,配备MCP兼容工具会话,以及涵盖零售、酒店、汽车保险等领域的507个策略条件工作流基准。每项尝试根据智能体留下的后端状态评分,最强模型pass@1达65.36%,pass^20为25.25%。许多失败尝试以有效的状态变更工具调用干净终止,仅观察响应或工具调用难以判断任务是否真正完成。

智能体Microsoft论文/研究评测/基准

8月21日

星期五 · 2 条
22:24
Artificial Analysis@ArtificialAnlys
AI 评分 66/100
Artificial Analysis 推出 Speech Agent Arena,评测语音到语音模型的对话偏好与任务成功率

Artificial Analysis 推出 Speech Agent Arena,通过人类在真实场景中对比语音到语音模型,衡量对话偏好与任务成功率。偏好榜上 Gemini 3.1 Flash Live Preview - Minimal 以 1,046 Elo 居首,任务成功率则由 Grok Voice Think Fast 2.0 High 以 94.7% 领先。

智能体GoogleOpenAI评测/基准
22:06
Hugging Face:Blog(RSS)精选
AI 评分 69/100
测量语音识别中的基准优化:Hugging Face 新测试揭示 ASR 模型"刷分"现象

Hugging Face 最新研究引入三项测试量化语音识别中的基准优化(benchmaxxing)现象。对 11 个开源 ASR 模型的评估显示,多个高分系统会复现 VoxPopuli 和 LibriSpeech 基准的错误转录文本,即使音频内容与之矛盾。部分模型甚至依赖声学线索识别基准来源,导致其得分高估了真实转录能力。

Hugging Face论文/研究评测/基准语音

推荐理由:研究把语音识别中的基准优化现象变成可量化检验,三项探针和开源脚本让模型评估者能区分真实转写提升与仅针对测试集的拟合。

8月20日

星期四 · 4 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
FlavourBench:用可执行烹饪基准评测前沿语言模型

FlavourBench 推出自动化基准,以版本化烹饪系统提供可执行真值,在 534 项任务上评测 27 个前沿模型端点。Grok 4.6 得分最高,为 65.1(95% 置信区间 61.0-69.2),351 对模型对比中 101 对差异显著。基准发布含提示词、评分映射、原始响应及离线验证器,可复现全部结果。

论文/研究评测/基准
04:48
Rohan Paul@rohanpaul_ai
AI 评分 41/100
TRACES:首个衡量探索式AI的基准

Apodex 推出 TRACES,号称全球首个衡量“探索式AI”的基准,将AI评测从“已知答案的检索”转向“无答案问题的完整调查过程”。该基准由创始人陈天桥提出,定义了六项能力,并发布“探索式智能”定义、评估标准及求解者招募。

Apodex: Most AI benchmarks test retrieval — can a model find the known answer? However, the hardest problems in science require ...

推理评测/基准
02:48
Rohan Paul@rohanpaul_ai
AI 评分 47/100
IBM 新框架 BenchDrift 揭示措辞致 LLM 分数波动 74.7 个百分点

IBM 新论文提出 BenchDrift 审计框架,通过在不改变答案的前提下系统改写同一问题,衡量模型分数因措辞产生的波动。在 8 个模型和 3 个基准测试中,最佳与最差准确率平均差距达 74.7 个百分点,且更强模型受影响更大。即便在最高置信度区间,改写后仍有 18.5% 的正确回答丢失。

论文/研究评测/基准
02:44
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 36/100
Apodex_AI 发布全球首个衡量"发现式智能"的基准 TRACES,由创始人陈天桥提出并定义六项能力,测试 AI 在无答案密钥的问题上通过证据、假设检验得出可验证结论的能力。主推文强调,发现过程可分解为"雄心→构想→行动→观察→验证→修复",这一分解比任何单一基准分数更重要。同日还发布了"发现式智能"定义、区分可靠调查与侥幸猜测的评分标准,并公开征集解题者与问题。

Apodex: Most AI benchmarks test retrieval — can a model find the known answer? However, the hardest problems in science require ...

推理数据/训练评测/基准

8月19日

星期三 · 1 条
02:24
The Decoder:AI News(RSS)
AI 评分 59/100
新基准 Search Index 评测 AI 智能体搜索 API 的质量、成本与速度

Artificial Analysis 发布 Search Index 基准,在统一智能体设置下用 GPT-5.6 Luna 评测 Parallel、Exa、Firecrawl 等 7 家搜索 API 提供商。

智能体搜索评测/基准

8月18日

星期二 · 2 条
16:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
TRACE-Bench:分解与诊断多参考图像生成

TRACE-Bench 将多参考图像生成任务形式化为 Anchor、Disentangle、Apply、Compose 四种原子操作,并据此构建约 1,600 个评测案例(覆盖 1–8 个操作槽位,源自 631 个公式模板与约 4,000 张参考图)。对 9 个领先模型的评测显示,主要瓶颈在于解耦与属性绑定而非场景级组合,最佳模型属性保真度得分仅 0.74。

图像生成多模态论文/研究评测/基准
11:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
R^3-Bench:LLM 在共享预算下的资源理性推理仍显吃力

新基准 R^3-Bench 在数学、竞赛编程和抽象推理中,以共享预算评估六题套件,覆盖无工具与智能体两种场景。对六款模型的 72 个主表单元,离线经验 oracle 均值在所有单元达到或超过竞赛均值,其中 71 个单元严格更高;中等无工具压力下,四款模型的均等分配回放也超过竞赛表现。轨迹诊断显示策略更新有限且失败模式随压力变化,揭示模型在共享预算下实现能力与表现之间存在持续差距。

智能体推理论文/研究评测/基准

8月15日

星期六 · 1 条
13:53
The Decoder:AI News(RSS)
AI 评分 47/100
New benchmark confirms AI models still perform poorly at visual perception
多模态数据/训练评测/基准

8月14日

星期五 · 2 条
23:51
elvis@omarsar0
AI 评分 46/100
Meta 新框架揭示 LLM 裁判易被说服改判

Meta 发布 Wiggle 框架,对 9 个前沿模型在 14 项裁判任务中施压测试,发现所有模型都会“摇摆”:静态反驳下改判率 25-71%,对抗性说服下高达 62-91%。改变裁判判决的压力几乎总是损害其相对真实答案的准确性,而基线陪审团多数优势是预测哪些项目会变动的最佳单一指标。

Meta论文/研究评测/基准
05:00
DAIR.AI@dair_ai
AI 评分 47/100
智能体排行榜信号不足,方差分解揭示真相

DAIR.AI 分享的一项研究对 TheAgentCompany、tau-squared-bench 和 AppWorld 进行四方面方差分解,发现智能体主效应仅占总方差不到 3%,智能体-任务交互效应占 7%-23%,排行榜实际衡量的是特化程度。

智能体arXiv论文/研究评测/基准

8月13日

星期四 · 1 条
00:17
Microsoft Research@MSFTResearch
AI 评分 30/100
一条路径、一道围栏、一个绳结。MindTopo 为测试 AI 如何理解拓扑关系设立了新基准,并凸显了加强空间推理与规划的新机遇。https://msft.it/6011aH02S
Microsoft推理评测/基准

8月12日

星期三 · 3 条
13:17
MarkTechPost(RSS)
AI 评分 53/100
小米 MiLM Plus 发布 PROVE:面向感知对齐的目标移除评测指标 RC-S 与 RC-T 及真实世界视频基准

小米 MiLM Plus 团队发布 PROVE 评测框架,包含 RC-S 与 RC-T 两项感知对齐指标及 PROVE-Bench 真实世界视频基准,已获 ACM MM 2026 接收。

视频论文/研究评测/基准
10:58
HuggingFace Daily Papers(社区热门论文)
AI 评分 54/100
VibeLifeBench:生活智能体能否在动态世界中保持主动与持久?

VibeLifeBench 推出包含 200 个长时程任务的基准,覆盖十个日常生活领域,每个任务在模拟 22 项服务的动态世界中运行数周。评测发现七个前沿模型得分均低,凸显当前智能体与真实生活辅助之间的差距。全部任务、环境与评测框架将开源。

智能体论文/研究评测/基准
03:58
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
Cultivar:面向数据污染与本地化鲁棒性探究的对比式翻译基准

Cultivar 是 FLORES 的本地化子集,用于评估模型在不同文化语境下的翻译表现,并与非本地化版本对比以探测数据污染和本地化鲁棒性。研究评测了 32 个开源权重模型,发现机器翻译专用模型鲁棒性较差,部分模型可能对 FLORES 过拟合,且模型普遍更擅长翻译美国内容而非其他地区内容。

arXiv数据/训练评测/基准

8月11日

星期二 · 4 条
12:17
AK@_akhaliq
AI 评分 51/100
SWE-Bench ProMax在大规模多语言代码重构上对智能体进行基准测试论文:https://huggingface.co/papers/2608.09802
Hugging Face编码论文/研究评测/基准
10:58
HuggingFace Daily Papers(社区热门论文)
AI 评分 45/100
Sci-VBench:科学领域知识密集型视频生成的评测基准

Sci-VBench 基准包含 1,253 个专家标注示例,覆盖自然科学、医疗健康、人文社科与工程四大领域的 60 个主题,要求模型生成具备科学推理能力的时序视频。评测显示,16 个前沿模型在感知质量上接近,但在提示词接地性与科学因果正确性上差异显著,专有与开源模型间存在明显差距。

arXiv多模态推理评测/基准
10:58
HuggingFace Daily Papers(社区热门论文)
AI 评分 67/100
SWE-Bench ProMax:面向大规模多语言代码重构的智能体评测基准

针对现有编码基准快速饱和及评测质量问题,研究团队推出 SWE-Bench ProMax,一个包含 170 个实例、覆盖七种编程语言(Python、Java、TypeScript、Go、C、C++、Rust)的多语言代码重构基准。

arXivHugging Face编码论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
ENTLORE:面向企业问答中潜在组织推理的图基基准

ENTLORE 是一个图基基准构建框架,从常规文档、组织表和运营记录中重建可审计的企业世界,用于测试模型从语料库中恢复隐含组织关系的能力。该基准包含 2,341 篇文档和 907 个问题,覆盖显式查找、跨源组合与潜在组织推理,已在 56 种模型与访问配置上评估。

检索增强数据/训练论文/研究评测/基准

8月10日

星期一 · 1 条
01:06
DAIR.AI@dair_ai
AI 评分 31/100
本周Top AI论文:智能体评估、零token记忆与反思采样

DAIR.AI 发布本周(8月3日至9日)Top AI 论文。首篇提出智能体评估失败分类法,将41种失败模式归因于模型、工具、环境等组件,最强评判器 Cohen's kappa 达0.76。

智能体推理论文/研究评测/基准

8月9日

星期日 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 59/100
Business Arena:在真实市场环境中评测 LLM 智能体的商业运营能力

研究者推出 Business Arena,一个让 AI 智能体长期经营跨境店铺的受控环境,数据基于真实 Alibaba.com 采购信息与权威市场条件校准。对 15 个前沿模型的评测显示,最终净资产均值相差九倍,即便最佳模型也落后于人类设计的策略,表明商业运营对 LLM 智能体仍具挑战。

智能体论文/研究评测/基准

8月7日

星期五 · 3 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 45/100
A^2E:面向智能体框架的端到端审计引擎

A^2E(Agent Auditing Engine)是一个端到端智能体框架评测引擎,基于新提出的 Agent Task Protocol(ATP)快速集成不同框架的评测任务,并通过自动插桩的 Monitor 捕获标准化执行轨迹。

智能体arXiv论文/研究评测/基准
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 50/100
零差距并非恢复:基准污染的分层逐题概率评估与逐步缓解

论文提出SA-PPG分层逐题概率差距评估法,通过采样估计每题求解概率并与干净模型逐题对比,揭示现有G-AP指标存在缺陷,导致此前污染缓解策略的恢复效果被显著高估。研究还提出RailCap缓解策略,在生成中限制回落到贪心轨迹的下一token为次优选项,在多个受污染模型和基准上取得最低SA-PPG。

数据/训练论文/研究评测/基准
01:41
AK@_akhaliq
AI 评分 36/100
迈向技能原生大语言模型用于基准测试与训练长程推理的技能熵论文:https://huggingface.co/papers/2608.05139
Hugging Face推理论文/研究评测/基准

8月6日

星期四 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 41/100
大模型智能体的人格演化:11 个生活事件后的特质偏移评测

一项新研究系统评测了大模型智能体(PC-Agents)在经历 11 个重大生活事件后的人格特质变化,以大五人格为锚点对照人类心理学纵向数据。结果显示,智能体在有无人类变化方向记录的事件-特质对上表现出相近的偏移率,偏移幅度普遍低于人类效应量,人格离散度较人类样本压缩 3-4 倍。研究推出可复用基准 BFI-Adapt 用于评分事件诱发人格变化的方向保真度,并据此对 14 个模型进行排名。

智能体arXiv论文/研究评测/基准

8月5日

星期三 · 2 条
19:34
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 39/100
当人工智能基准测试陷入停滞时:一项关于基准测试饱和度的系统性研究

一项研究分析了60个语言模型基准测试的饱和度,发现近半数基准已出现饱和,且饱和率随基准年龄增长而上升。研究还发现,基准对饱和的抵抗力受专家策划影响,而非公开测试数据。结果表明,设计选择可延长基准寿命,并为更持久的评估方法提供参考。

论文/研究评测/基准
07:04
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 67/100
MirrorCode:AI 能独立完成的最大规模软件项目基准测试

Anthropic 与 METR 联合推出 MirrorCode 基准,要求 AI 在无源码、无联网条件下端到端重写完整程序。Claude Opus 4.7 用 14 小时、$251 重写了约 16,000 行 Go 代码的生物信息学工具 gotree,而人类工程师预计需 2–17 周。该基准单次运行最高花费 $2,600,AI 连续工作 19 天,目前 22/25 个目标程序已开源。

开源生态论文/研究评测/基准

8月4日

星期二 · 6 条
17:05
Rohan Paul@rohanpaul_ai
AI 评分 31/100
谷歌论文:金融研究智能体预测能力不足

谷歌新论文指出,金融深度研究智能体在重建过去方面远优于预测未来。在17个基线与FinanceHarness上,所有模型在400道专家标注问题上的总体得分均低于40%。使用相同Qwen3.6-27B骨干,从简单搜索循环升级到完整金融工具栈后,总分从25.3%提升至32.4%,而GRPO额外训练仅增加0.4个百分点,表明主要瓶颈在于因果与情景推理能力。

arXivGoogle论文/研究评测/基准
11:54
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
SWE-Touch:当用户修改代码时,编码智能体如何应对

SWE-Touch 是一个通过“反向编辑”压力测试编码智能体在共享工作区中应对用户代码修改能力的框架。在 SWE-bench Verified 上,反向编辑使九款编码模型的平均解决率下降 7.7 个百分点,在更长任务基准上退化同样存在。轨迹分析显示,失败源于智能体对动态工作区感知不足,难以协调冲突编辑并验证修改后代码。

arXiv编码论文/研究评测/基准
11:54
HuggingFace Daily Papers(社区热门论文)
AI 评分 66/100
WorldExam:从表观外观到内在反应性的世界模型评测基准

研究团队提出 WorldExam,一个分层诊断基准,覆盖视觉质量、控制遵循、空间一致性和世界反应性四个层级,含 1,474 个测试用例和八项任务,支持相机、动作和语言三种驱动范式的统一评测。对 20 个代表性模型的评估显示,没有任何模型能同时兼顾广泛任务覆盖与稳定性能,高视觉质量和显式指令遵循并不保证内在反应性。

视频论文/研究评测/基准
10:54
HuggingFace Daily Papers(社区热门论文)
AI 评分 66/100
ScrambleToolBench:智能体在自身地图指向下一步时仍会穷举搜索

ScrambleToolBench 是一个交互式终端基准,通过去除语义线索并引入映射漂移、随机动作失败和时间执行窗口等动态挑战,隔离智能体的行为推理能力。对前沿语言模型的评估显示,初始发现成功并不等于稳健适应:面对结构变化时,智能体无法使用循环追踪等演绎策略,转而表现出信念惯性或退化为穷举搜索。

智能体推理论文/研究评测/基准
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 49/100
GDPevo:面向真实业务任务的智能体自我进化评测基准

GDPevo 是一个面向企业工作流的进化原生基准,通过规则杂交机制将工作流分解为原子业务规则并分配到训练与留出测试任务中,确保测试收益可归因于训练经验。V1 含 12 组 120 个任务,覆盖 CRM、ERP、金融、医疗、法律和数据中心工作流,全自动流水线可在两天内扩展至 V2 的 240 个任务。

智能体arXiv论文/研究评测/基准
02:32
elvis@omarsar0
AI 评分 46/100
Locus 自动研究系统对 Qwen3 基础模型进行后训练,性能超越官方人工调优的 Qwen3 1.7B Instruct 版本,并在 PostTrainBench 上达到 SOTA。在扩展算力预算的 PostTrainBench+ 测试中,Locus 扩展性最佳,其训练模型整体超越人工后训练的 Qwen3 1.7B。此外,Locus 在 Kaggle 实时竞赛中 16 天取得平均排名第 4。

Intology: The models are improving the models. Locus, our automated AI research system, is SOTA on PostTrainBench and post-trains ...

数据/训练论文/研究评测/基准
已加载 40 条