STORY · 事件已收束

Grok 4.6 在多项基准测试中登顶

7 个精选信源 · 7 篇报道持续 1最新动态 23天前
最新进展

Grok 4.6 在多项基准测试中登顶,价格不变,已在多平台上线。

DIGEST

事件全貌

AI 综述 · 更新于 22天前

SpaceXAI 发布 Grok 4.6 模型,在多项基准测试中登顶。该模型在 Artificial Analysis 智能指数上得分 61,与 GPT-5.6 Sol 并列前沿,仅次于 Anthropic 的 Claude 系列。在 GDPval-AA v2 上 Elo 达 1753,排名第一;在 AA-Briefcase、Harvey LAB 等基准中也位列第一,在 CursorBench、FrontierCode、APEX-Agents、APEX-SWE 中排名第二。

Grok 4.6 定价与 Grok 4.5 一致,为每百万 token 输入 2 美元、输出 6 美元,成本较 Claude Opus 5 和 GPT-5.6 Sol 低 60% 以上。模型已在 Cursor、grok Build、OpenRouter 全平台上线,首周提供双倍额度。

该模型针对长时间运行的智能体任务进行了强化,提升了跨代码库分析与自我验证能力,并改进了复杂交互和视觉工作。上下文窗口为 500k tokens,每任务成本 0.84 美元。

本综述由 AI 汇总全部报道生成,随事件进展持续更新;下方时间线中的单篇报道保留其发布时的原貌。

TIMELINE

报道时间线

7 条公开报道 · 官方一手 1 条 · 最新在前
  1. SpaceXAI的Grok 4.6在“人工智能分析指数”中获得61分
    Hacker News 热门(buzzing.cc 中文翻译)

    SpaceXAI的Grok 4.6在人工智能分析指数中得分61,与GPT-5.6 Sol持平,仅次于Claude Opus 5和Claude Fable 5。其智能体性能突出,GDPval-AA v2 Elo达1753,定价维持$2/$6每百万token,较Claude Opus 5和GPT-5.6 Sol低60%以上。上下文窗口为500k tokens,每任务成本$0.84。

  2. Cursor 与 SpaceXAI 联合发布 Grok 4.6
    Cursor Blog官方一手精选

    Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。

  3. Grok 4.6发布,多项基准比肩Fable 5与GPT 5.6
    X:Testing Catalog (@testingcatalog)

    BREAKING 🔥: SPACEXAI 发布 GROK 4.6,多项基准测试已与 FABLE 5 和 GPT 5.6 SOL 持平! > 同时以 1553 分位列 Frontend Arena 第 13 名。 > Grok 4.6 即日起在 Cursor 和 Grok Build 中可用,首周包含 2 倍用量。 开测!👀

  4. Grok 4.6 发布:价格不变,智能跃居第一梯队
    X:阿易 AI Notes (@AYi_AInotes)

    Grok 4.6 正式发布,价格与 4.5 完全一致($2/M input、$6/M output),智能大幅跃升,AA智能指数61,与 GPT-5.6 Sol Max 持平,仅比 Fable 5 低1分。模型已在 Cursor、grok Build、OpenRouter 全平台上线,首周双倍额度,并针对长运行 Agent 升级了跨代码库分析与自我验证能力。

  5. 剑指 GPT-5.6 Sol,SpaceXAI 发布 Grok 4.6 模型
    IT之家(RSS)

    SpaceXAI 发布 Grok 4.6,强化长时间运行的智能体任务及复杂交互和视觉工作。在综合 9 项基准测试的 Artificial Analysis Intelligence Index 上,Grok 4.6 与 GPT-5.6 Sol 取得相同成绩。

  6. Grok 4.6 发布,多基准登顶
    X:cb_doge (@cb_doge)

    Grok 4.6 是一次重大升级 🚀 它在所列出的每一项基准测试中都超越了 Grok 4.5 High,目前排名如下: 🥇 #1 GDPVal-AA v2 — 1,753 🥇 #1 AA-Briefcase — 1,577 🥇 #1 Harvey LAB — 15.8% 🥈 #2 CursorBench — 69.9% 🥈 #2 FrontierCode — 61.3% 🥈 #2 APEX-Agents — 57.5% 🥈 #2 APEX-SWE — 56.4% 它在 Artificial Analysis Intelligence Index 上以 61 分的成绩与 GPT-5.6 Sol Max 持平。 Grok 4.6 即日起在 Cursor 和 Grok Build 中可用,首周使用量翻倍。

  7. Grok 4.6 登顶智能前沿,智能体性能亮眼
    X:Artificial Analysis (@ArtificialAnlys)

    SpaceXAI 的 Grok 4.6 在 Artificial Analysis 智能指数上得分 61,与 GPT-5.6 Sol 并列前沿,仅次于 Anthropic 的 Claude 系列。该模型智能体性能突出,GDPval-AA v2 Elo 达 1753,且定价不变($2/$6 每百万 token),成本较 Claude Opus 5 和 GPT-5.6 Sol 低 60% 以上。