Cursor Blog
精选
70AI 编辑部评分,满分 100

Cursor 与 SpaceXAI 联合发布 Grok 4.6

2026-08-12 08:00· 21小时前· Cursor Team
AI 导读

Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。

推荐理由

长程轨迹中出现自检与验证,对需要模型持续执行多步项目的团队,可能减少中途人工纠偏,比单纯基准分更有参考价值。

正文 · AI 翻译

今天我们与 SpaceXAI 联合发布 Grok 4.6。

Grok 4.6 在 Grok 4.5 的基础上构建,特别聚焦于长时间运行的智能体以及更具雄心的交互式和视觉工作。它能够胜任跨多个步骤的复杂任务,无论是研究某个主题、分析信息、跨代码库协作,还是将一个想法打磨成精致的应用或工作成果。

Grok 4.6 在多个智能体编码和知识工作基准测试中达到了前沿智能水平。它在 Artificial Analysis Intelligence Index(九项基准测试的综合得分)上与 GPT-5.6 Sol 持平。

Grok 4.6 benchmark results across coding and knowledge work evaluations

Grok 4.6 即日起在 Cursor 和 Grok Build 中可用。我们将在第一周内为 Cursor 和 Grok Build 用户提供 2 倍的包含用量。

训练 Grok 4.6

Grok 4.6 经历了比 Grok 4.5 更长的补充训练过程,使用了经过筛选的模型生成数据(用于推理和高级技术概念)、高质量的工程数据,以及改进的优化器和训练方案。这为后续的 SFT 和 RL 阶段奠定了更坚实的基础。

随后,我们使用 Grok 4.5 重新生成了跨推理强度、智能体框架以及 STEM、软件工程和知识工作等领域的 SFT 轨迹。我们通过基于模型的检查过滤掉了有问题的轨迹。由此得到的 SFT 检查点展现出强劲的性能和改善的行为表现。

Grok 4.6 在广泛的智能体 RL 任务上进行了训练,包括知识工作、通用编码,以及面向内核优化、Web 开发、计算机辅助设计等领域的专用环境。

将宏大的想法转化为可运行的项目

我们在旨在拓展其能力和多步骤持续工作能力的项目上测试了 Grok 4.6。我们发现该模型在将一个宽泛的产品想法转化为可运行的首个版本方面尤为出色。它能够研究不熟悉的领域、搭建应用结构、实现核心交互,并通过多轮反馈持续完善结果。

在更长的轨迹中,我们也开始看到更多的自我测试和验证行为,模型会在继续推进之前先检查自己的工作。

Grok 4.6 在视觉和交互类项目上的首轮生成质量,明显优于我们此前在 Grok 4.5 上常见的表现。给定一个具体的产品创意,它能够一次性为应用搭建起结构并确立视觉语言。这使得它在那些“先做出一个像样的雏形,再在循环中迭代”是通往好结果最快路径的项目上,显得尤为实用。

安全性与能力

Grok 4.6 的安全防护措施已根据模型能力进行了改进和校准。

我们的安全技术栈旨在合法用例中最大化实用性与安全性,使 Grok 4.6 能够在漏洞修补、加速工程设计周期以及增强 AI 研究等领域提供有用且安全的帮助。

我们的安全评估工作反映了 Grok 4.6 扩展后的能力,包括我们有史以来最广泛的一套部署前能力测试与安全校准,以及部署后大量的第三方测试。

开始使用 Grok 4.6

Grok 4.6 即日起在 Cursor 和 Grok Build 中可用。它也通过 SpaceXAI API 以及包括 OpenRouter、Vercel 和 Cloudflare 在内的合作伙伴提供。

定价为每百万输入 token 2 美元,每百万输出 token 6 美元。另提供速度更快的版本,价格为前者的两倍。

在 Cursor 和 Grok Build 中,我们将在第一周提供 2 倍用量。

来源:Cursor Blog · cursor.com

同一事件 · 1

Cursor 与 SpaceXAI 联合发布 Grok 4.6

Cursor Blog·2026-08-12 08:00·21小时前·Cursor Team
AI 导读

Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。

正文 · AI 翻译

今天我们与 SpaceXAI 联合发布 Grok 4.6。

Grok 4.6 在 Grok 4.5 的基础上构建,特别聚焦于长时间运行的智能体以及更具雄心的交互式和视觉工作。它能够胜任跨多个步骤的复杂任务,无论是研究某个主题、分析信息、跨代码库协作,还是将一个想法打磨成精致的应用或工作成果。

Grok 4.6 在多个智能体编码和知识工作基准测试中达到了前沿智能水平。它在 Artificial Analysis Intelligence Index(九项基准测试的综合得分)上与 GPT-5.6 Sol 持平。

Grok 4.6 benchmark results across coding and knowledge work evaluations

Grok 4.6 即日起在 Cursor 和 Grok Build 中可用。我们将在第一周内为 Cursor 和 Grok Build 用户提供 2 倍的包含用量。

训练 Grok 4.6

Grok 4.6 经历了比 Grok 4.5 更长的补充训练过程,使用了经过筛选的模型生成数据(用于推理和高级技术概念)、高质量的工程数据,以及改进的优化器和训练方案。这为后续的 SFT 和 RL 阶段奠定了更坚实的基础。

随后,我们使用 Grok 4.5 重新生成了跨推理强度、智能体框架以及 STEM、软件工程和知识工作等领域的 SFT 轨迹。我们通过基于模型的检查过滤掉了有问题的轨迹。由此得到的 SFT 检查点展现出强劲的性能和改善的行为表现。

Grok 4.6 在广泛的智能体 RL 任务上进行了训练,包括知识工作、通用编码,以及面向内核优化、Web 开发、计算机辅助设计等领域的专用环境。

将宏大的想法转化为可运行的项目

我们在旨在拓展其能力和多步骤持续工作能力的项目上测试了 Grok 4.6。我们发现该模型在将一个宽泛的产品想法转化为可运行的首个版本方面尤为出色。它能够研究不熟悉的领域、搭建应用结构、实现核心交互,并通过多轮反馈持续完善结果。

在更长的轨迹中,我们也开始看到更多的自我测试和验证行为,模型会在继续推进之前先检查自己的工作。

Grok 4.6 在视觉和交互类项目上的首轮生成质量,明显优于我们此前在 Grok 4.5 上常见的表现。给定一个具体的产品创意,它能够一次性为应用搭建起结构并确立视觉语言。这使得它在那些“先做出一个像样的雏形,再在循环中迭代”是通往好结果最快路径的项目上,显得尤为实用。

安全性与能力

Grok 4.6 的安全防护措施已根据模型能力进行了改进和校准。

我们的安全技术栈旨在合法用例中最大化实用性与安全性,使 Grok 4.6 能够在漏洞修补、加速工程设计周期以及增强 AI 研究等领域提供有用且安全的帮助。

我们的安全评估工作反映了 Grok 4.6 扩展后的能力,包括我们有史以来最广泛的一套部署前能力测试与安全校准,以及部署后大量的第三方测试。

开始使用 Grok 4.6

Grok 4.6 即日起在 Cursor 和 Grok Build 中可用。它也通过 SpaceXAI API 以及包括 OpenRouter、Vercel 和 Cloudflare 在内的合作伙伴提供。

定价为每百万输入 token 2 美元,每百万输出 token 6 美元。另提供速度更快的版本,价格为前者的两倍。

在 Cursor 和 Grok Build 中,我们将在第一周提供 2 倍用量。

来源:Cursor Blog· cursor.com

同一事件 · 1