Elon Musk · @elonmusk · X·2026-07-09 14:42·48天前
AI 导读

xAI 的 Grok 4.5 在 Zapier 的 AutomationBench-AA 基准测试中取得 51% 分数,排名第一,超越 Claude Fable 5(49%)和 Claude Opus 4.8(48%),每任务成本仅 $0.34,约为竞品四分之一。Grok 4.5 完成 79.9% 的任务目标,严格通过 21.9% 的任务;输出 token 极高效,每任务约 8k,远低于 Claude Opus 4.8 的 32k。在难度最高的金融领域完成 71% 目标,领先所有模型。但每任务违规次数 0.63,高于 Gemini 3.5 Flash 的 0.46。测试涵盖 657 个任务、40 个模拟 SaaS 环境。

Elon Musk@elonmusk
59AI 编辑部评分,满分 100
2026-07-09 14:42· 48天前
AI 导读

xAI 的 Grok 4.5 在 Zapier 的 AutomationBench-AA 基准测试中取得 51% 分数,排名第一,超越 Claude Fable 5(49%)和 Claude Opus 4.8(48%),每任务成本仅 $0.34,约为竞品四分之一。Grok 4.5 完成 79.9% 的任务目标,严格通过 21.9% 的任务;输出 token 极高效,每任务约 8k,远低于 Claude Opus 4.8 的 32k。在难度最高的金融领域完成 71% 目标,领先所有模型。但每任务违规次数 0.63,高于 Gemini 3.5 Flash 的 0.46。测试涵盖 657 个任务、40 个模拟 SaaS 环境。

Cool that Grok 4.5 is #1 in some respects, even with respect to Fable 5

Artificial AnalysisSpaceXAI's Grok 4.5 takes the #1 spot on AutomationBench-AA with a score of 51%, ahead of Claude Fable 5 (49%) and Claude Opus 4.8 (48%) at roughly a quarter of...