Z.ai 今日发布 GLM-5.3,目前仅限编程套餐使用,API 即将上线,两周后开源权重至 Hugging Face。该模型在多项基准上超越 Moonshot AI 的 Kimi K3,部分指标超过 Claude Fable 5 或 GPT-5.6-Sol,仅约 750B 参数,为 Kimi K3 的三分之一。
同一事件,精选展示《GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力》Z.ai 今日发布 GLM-5.3,目前仅限编程套餐使用,API 即将上线,两周后开源权重至 Hugging Face。该模型在多项基准上超越 Moonshot AI 的 Kimi K3,部分指标超过 Claude Fable 5 或 GPT-5.6-Sol,仅约 750B 参数,为 Kimi K3 的三分之一。
同一事件,精选展示《GLM-5.3 发布:编程能力开源第一,并涌现网络安全能力》Cursor 已被 SpaceX 正式收购,完成自 4 月启动的收购流程。合并后 Cursor 将获得全球最大 GPU 集群,以构建更强且运行成本更低的模型,从而以更低价格向客户提供更强大的模型。本周三发布的 Grok 4.6 是双方合作成果的早期体现。
另有 12 家信源报道X:Lee Robinson (@leerob)X:SpaceXAI (@SpaceXAI)IT之家(RSS)X:Eric Zakariasson (@ericzakariasson)Hacker News 热门(buzzing.cc 中文翻译)X:Kim (@kimmonismus)X:阿易 AI Notes (@AYi_AInotes)a16z:News(RSS)X:Michael Truell (@mntruell)X:Rohan Paul (@rohanpaul_ai)X:Testing Catalog (@testingcatalog)TechCrunch:AI(RSS)Claude Code 的 token 成本由模型、输入/输出 token 和提示缓存三因素决定,输出 token 价格约为输入的 5 倍。任务间运行 /clear 可减少无关上下文回传,降低 token 用量;会话中途切换模型或 effort 级别会破坏提示缓存,增加成本。
智谱发布GLM-5.3,基于与GLM-5.2相同的基座,通过极致的后训练Scaling提升智能上界,编程能力较前代提升50%,在Terminal Bench 3.0等公开基准中取得开源第一,并接近Claude Fable 5。模型在白盒代码审查等安全任务中表现持平Mythos 5,在CyberGym测试中得分84.5%。模型权重将在两周后开源,即日起上线ZCode、AutoClaw等工具。
另有 8 家信源报道X:智谱 Z.ai (@Zai_org)X:Testing Catalog (@testingcatalog)X:Rohan Paul (@rohanpaul_ai)MarkTechPost(RSS)The Decoder:AI News(RSS)X:SemiAnalysis (@SemiAnalysis_)X:Kim (@kimmonismus)IT之家(RSS)Claude Code v2.1.232 默认启用 subagent forking,子代理可继承完整对话与提示缓存,交互会话中的非队友代理默认后台运行。新增 GitLab token 密钥脱敏、插件市场 GitLab 仓库克隆支持,并修复 PowerShell 与 Windows 权限绕过、嵌套 git 仓库信任继承等多项安全漏洞。
JetBrains CTO Vladislav Tankov 详解其团队如何用私有仓库评测前沿模型,并决定何时采用 Claude Fable 5。该模型在其评测中 Python 通过率达 44.3%,较 Opus 4.8 的 28.2% 提升 16 个百分点,且解题步骤减少约 22%。JetBrains 将安全与数据保留视为部署核心,偏好零数据保留,但接受为调查最严重问题而进行的有限审查。
Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍;智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错时不会影响运行。8 月 17 日起所有环境默认启用 builds,无需额外费用。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。
另有 16 家信源报道X:Logan Kilpatrick (@OfficialLoganK)IT之家(RSS)X:Ammaar Reshi (@ammaar)X:Rohan Paul (@rohanpaul_ai)Ars Technica:AI(RSS)X:Demis Hassabis (@demishassabis)MarkTechPost(RSS)X:Gemini (@GeminiApp)X:Google AI for Developers (@googleaidevs)X:Google AI (@GoogleAI)X:Google DeepMind (@GoogleDeepMind)X:Sundar Pichai (@sundarpichai)The Decoder:AI News(RSS)X:Elvis Saravia (@omarsar0, DAIR.AI)X:Artificial Analysis (@ArtificialAnlys)X:fofr (@fofrAI)Cursor 通过独立审查与对抗性测试,正式获得 AIUC-1 认证,该标准由 100 多家财富 500 强 CISO 参与制定,并获 MITRE、云安全联盟及斯坦福研究者的技术支持。测试覆盖 IDE 和云端智能体,涉及规则、hooks 与 Auto-review 等防护机制,Cursor 在数千个场景中通过全部要求。维持认证需至少每季度复测一次,并每年接受全面审计。
亚信与火山引擎合作,通过TRAE IDE将AI Coding融入研发交付全链路,已实现6000+研发席位规模化部署,研发团队AI编码贡献率达32%,SDLC整体提效15%,核心团队代码缺陷逃逸率下降69%~71%。双方还基于TRAE打造“天枢·元衡”Token ERP,构建精准计量、分级计费、智能核算的三层度量体系,实现Token成本可算、可控、可审计。
Anthropic 发布 Claude Code v2.1.231。该版本为终端内的智能体编码工具,可通过自然语言指令执行日常任务、解释复杂代码并处理 git 工作流,帮助开发者提升编码速度。
OpenRouter 发布工具调用指南,展示如何用同一套代码在 Claude、GPT 和开源权重模型间切换,仅需更改模型字符串。指南涵盖定义工具、发送请求、读取 tool_calls 响应、执行函数并返回结果的完整循环,支持 OpenAI 兼容的 JSON schema,并提供 cURL、Python 和 JavaScript/TypeScript 示例。
Claude Code v2.1.229 发布,新增远程控制会话恢复、自托管 runner 的服务器端 hook 支持,以及插件市场命令源。修复了长响应流式输出丢失、窄终端渲染崩溃、Windows 扩展路径崩溃等问题。改进工作流扇出以复用缓存提示前缀,并调整 /commit-push-pr 对危险 git/gh 命令不再自动批准。
GitHub Copilot 应用发布入门指南,教用户写出第一条提示词,并学会选择合适的上下文与模型,从而自信地开启首个任务。该指南面向 Copilot 应用的新手用户,帮助其快速上手提示词编写。
Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。
另有 6 家信源报道IT之家(RSS)X:阿易 AI Notes (@AYi_AInotes)Hacker News 热门(buzzing.cc 中文翻译)X:Artificial Analysis (@ArtificialAnlys)The Decoder:AI News(RSS)X:cb_doge (@cb_doge)xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。
另有 9 家信源报道X:Testing Catalog (@testingcatalog)X:Elon Musk (@elonmusk, xAI)IT之家(RSS)X:Lee Robinson (@leerob)X:阿易 AI Notes (@AYi_AInotes)X:Kim (@kimmonismus)The Decoder:AI News(RSS)X:cb_doge (@cb_doge)MarkTechPost(RSS)Claude Code v2.1.228 发布,修复了交互会话在内部布局错误后停止重绘、Windows 下从 Git 安装父目录启动时无法找到 git/Git Bash、/tui 在 /model 更改后回退到旧模型等问题。
Databricks 开源 Metals v2,这是其面向数百万行代码库的 Java 和 Scala 语言服务器。Metals v2 专为智能体驱动的开发场景设计,旨在提升大规模代码库中的编辑与导航性能。目前 Databricks 的大部分代码已由智能体编写,该工具服务于工程师仍需要手动介入的环节。
Go 凭借严格的编译器、集成工具链和毫不妥协的可读性,为 AI 编码助手提供确定性护栏,帮助模型自我纠错并生成高度标准化的代码。通过强制生态一致性和严格向后兼容,Go 平台让工程团队能在生产环境中高效验证、优化和维护高速 AI 生成代码。
ZCode针对GLM深度优化,今日上线Goal、Subagents、Remote Control与闲时任务四大功能。在Z.ai Code Bench测试中,GLM-5.2搭配ZCode较搭配Claude Code任务整体通过率高2.39%;ZCode缓存命中率超98%,叠加1.5倍限时额度加成后,GLM Coding Plan整体使用量接近常规额度的1.8倍。
另有 1 家信源报道IT之家(RSS)Claude Code v2.1.227 修复了会话以过期登录 token 启动时功能标志未按用户订阅层级评估的问题,该问题曾错误提示 Max 计划用户为 Fable 启用用量积分。
GitHub 推出 Copilot SDK for Java,企业 Java 开发者可通过注解和虚拟线程等惯用 Java 代码直接驱动 GitHub Copilot。该 SDK 将 Copilot 能力嵌入 Java 开发流程,支持以原生方式集成 AI 编程助手功能。
OpenRouter 基于每周超 55T token 的社区消费数据,推出新版 Auto 路由器(openrouter/auto),其模型选择在多数任务和成本档位上优于旧版。新路由器按约 30 种任务类型匹配近 7 天社区实际消费的模型,支持 cost_tier 参数(low 至 max)并遵循账户隐私设置。在 MMLU Pro 等基准上,新默认档位在多数领域以更低成本达到旧版同等性能。
另有 1 家信源报道X:OpenRouter (@OpenRouter)Anthropic 发布 Claude Code v2.1.226。该版本为终端内的智能体编码工具,可通过自然语言指令执行日常任务、解释复杂代码并处理 git 工作流,帮助开发者加速编码。
Databricks 分享了规模化管控 AI 编程成本的方法,其智能体编程已带来可衡量的价值提升。文章重点探讨了在团队规模扩大时,如何通过成本追踪、工具选型与使用策略,在维持代码质量与开发效率的同时,控制 AI 编程工具带来的支出增长。
GitHub Copilot 应用中的斜杠命令可帮助管理会话、导航项目和自定义 Copilot 工作流。与 CLI 版不同,应用版命令更侧重工作流,如 /plan 用于编码前规划、/spar 用于挑战方案假设、/autopilot 用于自动执行实现。/clear 和 /model 在 CLI 和应用中均可用。
Cursor Router 通过 Compass 复杂度预测器和基于真实开发者流量的任务分类法,为每个对话轮次匹配最合适的模型。Auto Intelligence 模式在用户满意度超过 Fable 的同时成本降低 68%,Auto Balance 模式以低于 Opus 4.8 成本 41% 实现更优表现。系统从实时流量中学习模型在不同任务类别上的表现差异,以数据驱动方式替代基准分数推断。
火山引擎升级 Doubao-Seed-Evolving,聚焦 Coding 与 Agent 能力,提升复杂仓库修复、跨文件修改等工程任务稳定性,增强信息检索、缺失召回与多工具并行调用能力,并改善幻觉控制以减少基于错误检索结果的作答。该模型已上线火山 Agent Plan,单月套餐限时 9.9 元起,参与「体验奖励计划」调用成本立减 20%。
Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。
另有 7 家信源报道X:通义千问 / Qwen (@Alibaba_Qwen)IT之家(RSS)X:Nathan Lambert (@natolambert)X:阿易 AI Notes (@AYi_AInotes)X:Kim (@kimmonismus)X:Testing Catalog (@testingcatalog)公众号:数字生命卡兹克LangChain 构建了 ReviewBench,一个用于评测代码审查智能体的基准,其评估依据来自可信审查者对真实 PR 的反馈。该基准旨在衡量智能体在代码审查任务中的表现,为开发者提供更贴近实际场景的评测标准。
GitHub 为代码搜索引擎 Blackbird 优化大小写折叠性能,该引擎索引超 1.8 亿个仓库、480TB 源码。团队发现移除提前退出分支比保留优化更快,最终在 Apple M4 上实现超 45 GiB/s 吞吐,接近内存带宽。结果已开源为 Rust crate casefold,仅实现简单(1 对 1)折叠,与 ripgrep 等工具保持一致。
GitHub Copilot 应用推出堆叠会话功能,允许用户在同一个仓库中创建一系列相互承接的任务,每个会话可基于前一个会话的成果继续工作。作者通过一个十余年历史的个人项目演示了该功能:先使用 Plan 模式制定前端现代化计划,再通过堆叠会话将 React-Bootstrap 替换工作拆分为独立会话,并自动为每个会话创建对应的拉取请求,避免范围蔓延。
DeepSeek-V4-Flash 正式版 API 上线公测,模型名设为 deepseek-v4-flash 即可使用,调用方式不变。其 Agent 能力大幅增强,Terminal Bench 2.1 得分 82.7,NL2Repo 54.2,Toolathlon verified 70.3,DSBench-Hard 59.6,多项基准远超 V4-Pro-Preview。
另有 5 家信源报道X:DeepSeek (@deepseek_ai)X:阿易 AI Notes (@AYi_AInotes)X:Emad Mostaque (@EMostaque)X:Rohan Paul (@rohanpaul_ai)IT之家(RSS)Cursor 将开发环境本身作为面向智能体的产品来构建,使云智能体能测试代码变更。团队通过统一跨平台工具链、开发 CLI 工具 anydev 简化构建命令,并构建 Cursor Cloud MCP 实现环境自愈。目前,云智能体在 Cursor 单体仓库中提交的合并 PR 占比已从去年 12 月的约十分之一升至过半。
Endor Labs 测试发现,同一模型在不同框架(Harness)上性能差异巨大:OpenAI 的 GPT-5.5 在原生 Codex 框架上功能正确率为 61.5%,在 Cursor 上达 87.2%;Anthropic 的 Opus 4.7 在 Claude Code 上为 87.2%,在 Cursor 上为 91.1%。
Databricks 通过 Unity AI Gateway Budgets 管理内部编码智能体的 API 调用成本,为不同团队设置预算上限并实时监控支出。该系统支持按项目、用户或模型分配额度,超出阈值时自动触发告警或限流。此举旨在控制 AI 工具使用成本,同时避免影响开发效率。
7月28日,Unity中国发布团结引擎2.0,围绕核心引擎能力、跨平台部署、AI原生架构三大方向升级,其中可独立执行游戏开发任务的AI Agent“团结Codely”正式亮相。该Agent覆盖代码搜索、代码生成、IDE智能编辑等能力,基于百度百舸AI计算平台和昆仑芯P800等异构算力完成私有化部署验证,支持GLM、Kimi等开源模型推理适配,实现数据不出内网、模型服务可控的AI研发产线。
另有 1 家信源报道IT之家(RSS)Unity中国7月28日发布团结引擎2.0,围绕核心引擎能力、跨平台部署、AI原生架构三大方向升级,并推出可独立执行游戏开发任务的AI Agent“团结Codely”。该Agent覆盖Web、IDE、命令行等场景,提供代码搜索、生成、智能编辑及引擎开发辅助能力。百度智能云基于百舸平台与昆仑芯P800国产算力,协助完成GLM、Kimi等开源模型的推理适配与私有化部署验证。