Dongxi 东锡 NLP · @dongxi_nlp · X·2026-08-20 02:21·6天前
AI 导读

Apodex_AI 发布全球首个衡量“发现式智能”的基准 TRACES,由创始人陈天桥提出并定义六项能力,测试 AI 在无答案密钥的问题上通过证据、假设检验得出可验证结论的能力。主推文强调,发现过程可分解为“雄心→构想→行动→观察→验证→修复”,这一分解比任何单一基准分数更重要。同日还发布了“发现式智能”定义、区分可靠调查与侥幸猜测的评分标准,并公开征集解题者与问题。

Dongxi 东锡 NLP@dongxi_nlp
36AI 编辑部评分,满分 100
2026-08-20 02:21· 6天前
AI 导读

Apodex_AI 发布全球首个衡量“发现式智能”的基准 TRACES,由创始人陈天桥提出并定义六项能力,测试 AI 在无答案密钥的问题上通过证据、假设检验得出可验证结论的能力。主推文强调,发现过程可分解为“雄心→构想→行动→观察→验证→修复”,这一分解比任何单一基准分数更重要。同日还发布了“发现式智能”定义、区分可靠调查与侥幸猜测的评分标准,并公开征集解题者与问题。

Discovery becomes an engineered verb

Ambition -> formulation -> action -> observation -> verification -> repair

This decomposition may matter more than any single benchmark result.

TRACES measures whether an AI system can sustain the full arc of investigation, from ambition to evidence, verification, and repair.

ApodexMost AI benchmarks test retrieval — can a model find the known answer? However, the hardest problems in science require discovery, can a system earn an answer n...

来源:Dongxi 东锡 NLP· x.com