ginobefun@hongming731
34AI 编辑部评分,满分 100

GLM-5.3 扩展编程与安全边界,循环工程重写 Agent 协同

2026-08-15 08:49· 32分钟前
AI 导读

智谱发布 GLM-5.3,基于与 GLM-5.2 相同基座经更长后训练,在 Terminal-Bench 3.0 上由 4.6 提升至 28.3,DeepSWE v1.1 上由 46.2 提升至 66.9;网络安全方面,CyberGym 得分 84.5%,ExploitBench 为 54.4%,仍低于 Mythos 5 的 78.0%。

https://x.com/i/article/2088426893192421376

BestBlogs 早报 · 08-15|GLM-5.3 扩展编程与安全边界,循环工程和知识底座重写 Agent 协同

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。

导语

当 Agent 从一次对话走向持续工作,真正难的并不是让它多运行几轮,而是回答三个逐层放大的问题:模型的能力到了哪里、一次任务怎样知道该停、团队又凭什么让不同 Agent 获得正确且持续更新的业务知识。今天的三篇精讲刚好落在这三个尺度上。

GLM-5.3 展示同一基座经过更大规模后训练后,编程能力怎样迁移到代码审查与漏洞发现;Addy Osmani 把长时工作拆成有界的 goal 与定时的 loop,并要求执行者之外再有独立验证;大淘宝技术则把视角拉到组织,指出单点编码提速无法自动消除需求、研发、运维与运营之间的人工接力。

这不是一条已经被证明的统一路线。模型跑分来自厂商口径,循环工程是实践经验,AI Native 团队仍是方向性框架。但把三者连起来读,可以得到一套更诚实的生产检查表:能力要分任务链条看,自治要先写完成和停止条件,组织改造则要先解决知识从哪里来、怎样保鲜、谁对例外负责。

★ 精讲一:GLM-5.3:前沿编程能力与涌现的网络安全能力

来源:智谱 · BestBlogs 评分:93

GLM-5.3 最值得注意的地方,不是一个全新的基座模型,而是智谱称其在与 GLM-5.2 相同基座上,通过数十倍长程任务环境、更丰富的环境类型和更长后训练,把能力上界继续向外推。这个对照把「模型能力」拆成了两层:预训练决定基座拥有什么潜力,后训练则决定它能否在复杂环境中发现问题、操作工具、实施并验证。对工程团队而言,这意味着评估一次升级时,不能只问参数规模有没有变化,也要问训练任务是否更接近真实工作链路。

公开结果显示,GLM-5.3 在 Terminal-Bench 3.0 上由 4.6 提升到 28.3,在 DeepSWE v1.1 上由 46.2 提升到 66.9,在 Agents' Last Exam 上由 23.8 提升到 28.5。智谱自建的 Z.ai Code Bench 还报告,High 档位准确率为 31.4%,每项任务平均输出约 5 万 tokens;对照中的 Claude Opus 4.8 为 29.5% 和约 12 万 tokens。后面这组是厂商自测,不宜当作跨平台定论,但它提出了一个有用维度:长程 Agent 不仅要完成任务,还要看完成路径、token 利用和返工成本。

网络安全部分更需要分层读。CyberGym 从白盒源代码出发识别和验证漏洞,GLM-5.3 得分 84.5%,略高于文中列出的 Mythos 5 与 GPT-5.6 Sol;到了需要理解成因并完成利用的 ExploitBench,它得到 54.4%,虽比 GLM-5.2 的 24.4% 高出一倍多,却仍低于 Mythos 5 的 78.0% 与 GPT-5.6 Sol 的 76.5%。ExploitGym 的限时吞吐也呈现相同方向:进步明显,但完整利用链仍有差距。因而更准确的判断是,能力增量首先集中在代码审查、异常定位和漏洞验证的前半段,而不是已经获得不受约束的全链攻击能力。

智谱与合作安全团队还披露,自 GLM-5.2 发布以来累计发现 2,436 个经初筛和去重的漏洞,其中 1,097 个为中高危,覆盖 269 个项目;公开披露账本只展示已协调修复的细节,对仍在流程中的漏洞保留哈希。这里同时存在两种信息:一方面,长上下文、逆向分析和跨日志关联确实可能放大防守者的调查能力;另一方面,漏洞数量、经济价值与影响范围主要由厂商及合作方报告,尚不能替代独立复现与漏洞库的逐项确认。

开放权重因此不是普通的发布时间表。智谱计划在发布两周后、完成安全评估和加固后开放完整权重,并设计外层分类器、推理监控器和模型内部安全对齐的多层防护。需要区分的是,前两层依赖托管环境,权重离线部署后仍能保留的主要是模型内部对齐;而研究、防守、教学与恶意利用在字面上高度相似,安全系统能否根据意图和授权做准确分级,仍要接受持续红队检验。

读这篇发布时,最有用的不是记住一个总分,而是保留四个问题:模型在哪一段任务链上变强,评测由谁完成,漏洞如何负责任披露,权重开放后哪些控制仍然有效。GLM-5.3 给出了编程能力向安全能力迁移的强信号,也把同一个事实的另一面摆上台面:能力越接近真实环境,治理就越不能停留在 API 层的一次拒绝。

★ 精讲二:实用循环工程

来源:Elevate · BestBlogs 评分:91

Addy Osmani 的核心贡献,是把容易被笼统称为「让 Agent 一直做下去」的工作拆成两种原语。goal 面向一个有界任务:给出可测量的终点,让 Agent 反复尝试,直到评估器确认条件满足或达到最大轮数。loop 面向不断变化的外部状态:按固定间隔重新检查日志、PR、Issue 或消息,再对新增情况采取动作。前者问「这件事做完了吗」,后者问「外部世界有没有发生需要处理的变化」。

这个区分会直接改变提示词。把「把页面优化好」交给 goal,评估器无法知道什么叫好;改成 Lighthouse 分数至少达到 92、LCP 低于 1.8 秒、不改变公开 API、连续两轮没有改善就中止,并限制最多 10 轮,系统才拥有可执行的完成条件和停机条件。评估器检查的是硬规则是否满足,不会自动判断视觉品味、架构是否简洁或改动是否值得,这也是为什么数字通过不等于作品优秀。

loop 则更像调度器。作者用定期检查 GitHub 新 Issue、汇总紧急程度,以及轮询 PR 评论和失败 CI 为例。它适合输入持续变化、动作模式稳定的工作;如果每次都需要重新理解模糊目标,定时触发只会稳定地产生不确定结果。goal 与 loop 可以组合:loop 发现带有 bug 标签的问题,goal 再负责把修复推进到本地测试通过。但组合越长,越需要明确权限、预算、失败退出和不可逆操作的人工确认。

文章里最重要的经验并不在命令本身,而在执行与验证分离。作者每天并行使用多个 Agent,但不会让完成工作的那个 Agent 同时裁定自己是否合格。一个 Agent 起草,另一个从不同维度验证,例如不仅测桌面性能,也检查移动端、浏览器控制台和真实交互。独立验证仍可能漏错,却能减少执行者围绕自己的路径自证成功,也更容易暴露规格里没有写出的盲区。

人类判断的边界同样具体。作者曾让 Agent 研究竞品并生成弥补差距的本地改动,研究看起来合理,实施却会给用户增加大量复杂性。问题不是任务没有完成,而是他差点把「是否值得做」一起委派出去。涉及审美、产品取舍、架构、安全、认证或财务的任务,即便有清晰规格,也需要更近距离复核;一个没有真实用户的绿地项目,与积累多年规则的银行代码库,也不该获得相同自治程度。

循环工程因此不是把监督从流程里删除,而是把监督写进流程。实用顺序可以很朴素:先选一个结果可客观验证的窄任务,定义成功、失败与停止,再决定是一次 goal 还是周期 loop;把验证交给独立角色,保留人对风险和价值的判断;最后才扩大并行度。若同一命令第三次执行仍没有比第二次产生变化,那不是坚持,而是系统正在原地旋转。

★ 精讲三:重构协同:关于 AI Native 团队的思考

来源:大淘宝技术 · BestBlogs 评分:92

大淘宝技术这篇文章把一个常见误区说得很直接:编码变快,不等于业务交付链路同比例变快。需求从业务传给产品,产品转成方案,研发再翻代码与历史决策,测试、发布、运维、客服和运营继续靠人同步上下文。若这些接力仍由会议、群聊、表单和手工录入完成,在某个节点增加 AI 助手,只是旧流程中的局部加速。

作者由此区分 AI 辅助与 AI Native。前者保留「人是串联者」的流程骨架,后者尝试让 Agent 承担传递、判断与衔接,再围绕这个前提重建生产侧。消费侧的终点仍然是人,变化主要发生在交互;生产侧却是技术塑造出来的组织形式,表单、报表、审批流和大量内部系统,本来就是为了帮助人完成串联。当串联者变化,这些软件不会一夜消失,但其中等待人点下一步的环节需要重新审视。

文章设想的理想业务单元有三层:底层是业务规则、流程、领域知识和数据构成的知识底座;中间是按知识范围、工具权限和风险边界拆分的专业 Agent;上层是定方向、做判断、处理例外并把新知识沉淀回去的人。运维 Agent 可以读取代码并调用诊断工具,内部答疑 Agent 可以暴露更具体的定位,外部客服 Agent 则需要不同知识范围与表达规范。拆分的理由不是角色命名,而是权限、上下文与出错代价确实不同。

这里最有启发的判断是「软件是被固化的知识」。业务规则和流程可以被 Agent 动态解释,但确定性、性能、成本、安全与合规审计仍要求其中一部分固化成产品规则和代码。AI Coding 只是把知识固化成软件的一段流程;真正的上游是知识是否准确、边界是否清楚,以及新决策能否回到权威来源。因此,交付物未来可能同时包含软件、可供 Agent 使用的知识与 Skill,而不是只交一套界面。

困难主要落在存量业务。关键规则往往散在代码、配置、数据、旧文档和资深成员脑中,字段和系统边界还保留历次组织变化的痕迹。文章提出一个可靠原则:凡是能从代码、配置和数据自动生成或校验的知识,不要改由人手维护;越接近人的经验与例外,越要设计专门的外化和确认机制。知识是否能自治,很大程度取决于它离权威事实来源有多近。

底座的范围也是现实约束。划得太大,规则和流程难以收敛;划得太小,Agent 一执行就跨出边界,又退回人去对接。知识还必须能「活下去」:如果更新只依赖某位架构师的责任心,文档终会再次脱离代码。自动提取、变更检测、人工确认、版本追踪和权限审计,都是比一次性整理更重要的持续机制。

作者明确承认,公司内尚未出现成熟的最佳实践,所以这套三层结构不应被当作已经验证的组织因果模型。它更像一个诊断框架:当 AI 提效停滞时,先看瓶颈是否其实位于隐性知识和跨角色协同;当准备部署 Agent 时,先问它使用什么权威知识、能调用什么工具、谁处理不确定答案。Agent 能跑多远,最终受限于团队把自身业务讲清楚并持续校正的能力。

速览

开放模型现状:2026 年夏季观察

来源:Hugging Face - Blog · BestBlogs 评分:91

__XPOSTER_otgvz_IMAGE_4__

Hugging Face 用 2026 年前七个月的 Hub 数据,分别观察发布规模、下载、点赞、许可、衍生模型、本地运行格式和 Agent 流量。报告显示,开放模型的注意力中心向中国实验室移动,但美国硬件与基础设施公司仍通过模型发布和转换参与生态。

最能纠正直觉的数据是,下载前 25 与点赞前 25 的仓库只有一个重合:点赞反映发布时的关注,下载更像已经嵌入稳定管线的依赖。Qwen 在 Hub 上形成 151,448 个衍生模型,而小于 1B 的模型仍占声明规模模型历史下载量的 83%。

Hub 数据不包含私有部署、外部 API 和其他分发渠道,不能直接等同于质量、市场份额或商业采用。阅读时应把「谁获得注意」「谁被持续调用」「谁成为社区基础设施」分开判断。

网页自动化的暗黑技法:让智能体像人一样使用网站

来源:AI Engineer · BestBlogs 评分:90

__XPOSTER_otgvz_IMAGE_5__

Corey Gallon 把网页自动化设计成「感知-行动-验证」循环:先读 DOM、可访问性树、网络或截图,做一个动作,再用不同信号确认结果,而不是让一次点击自己证明成功。

他的三层梯子从便宜的页面 API 与合成事件开始,必要时升级到 CDP trusted input,只有确实需要时才使用视觉和更接近人类的输入轨迹。最终系统由确定性代码高速驱动浏览器,Agent 只承担图像判断,避免每次点击都经过模型往返。

演示包含绕过反自动化挑战的双重用途技术,作者也强调只在自有基础设施和自有账户上运行。可复用的工程结论是缩小模型参与范围,而不是把规避网站控制当作默认能力;真实部署必须先满足授权、服务条款和合规要求。

计算机使用智能体评测:别让可重放轨迹伪装成能力

来源:AI Engineer · BestBlogs 评分:89

确定性的计算机使用基准可能让模型记住并重放固定操作轨迹,在界面略有变化时却无法适应。这样的高分测到的是对测试环境的熟悉,而非在真实桌面上恢复和调整的能力。

研究建议引入环境变体、结果级验证和更可靠的不确定性估计,让智能体不能只靠固定坐标或步骤序列过关。评测还要区分任务最终成功与中间轨迹看起来相似,避免把测试泄漏包装成泛化。

它提醒团队在部署前主动改变窗口、数据和交互路径,并观察失败后的恢复,而不是只复跑公开基准。变体测试不能覆盖所有真实环境,但比单一可重放轨迹更接近实际风险。

dots3-note Preview:迈向服务真实生活的长程智能体,坚定的第一步

来源:小红书技术REDtech · BestBlogs 评分:88

REDtech 发布 280B 参数多模态模型 dots3-note Preview,同时给出 TEMPO 长程强化学习方法,以及 VibeSearchBench 与 VibeLifeBench 两套面向真实生活任务的评测。

这组发布把模型、训练方法和任务环境放在一起:长程智能体不仅需要一次回答正确,还要在搜索、生活决策和多步骤执行中维持目标、处理反馈并完成验证。

Preview 表明的是研究方向和初步能力,不等同于已经成熟的生产服务。更值得观察的是后续开放材料、评测可复现性,以及模型在失败恢复和安全交接上的表现。

34K Star 的 DeepTutor,不只是 AI 家教:它在做一套 Agent 学习操作系统

来源:山行AI · BestBlogs 评分:91

DeepTutor 把统一 Agent Loop、RAG、Skills、外部 Agent 和三层长期记忆组合在一起,目标不是回答一道题,而是让学习任务能够跨会话延续,并复用此前形成的知识与过程。

架构上的信息增量在于,资料检索、工具调用、任务计划和记忆不再是孤立功能,而是围绕学习状态持续更新。外部 Agent 与 Skill 也提供扩展入口,使系统能接入不同学科与工作流。

34K Star 说明项目获得广泛关注,却不能替代教学效果、错误率和隐私安全评估。准备采用时,应重点检查记忆怎样纠错、来源怎样追溯,以及长期记录是否真的改善学习而非积累误解。

守护前沿:JetBrains 如何评估并部署 Claude Fable 5

来源:Claude Blog · BestBlogs 评分:91

JetBrains 没有只依据公共榜单选择 Claude Fable 5,而是把模型放入私有代码库的真实任务中,评估准确性、完成步骤、推理效率与部署适配。

案例同时讨论安全套件、白盒测试与数据保留,说明企业评估的对象不仅是模型回答,还包括它接触什么代码、留下什么数据、怎样进入已有开发流程。

这是供应商发布的客户案例,结果不能自动外推到其他代码库。可复用的方法是建立自己的任务集与风险门,并把质量、效率和数据治理放在同一张评估表里。

分享一些 insights | 我们为什么会做 dLLM,又能否取代 AR?

来源:青稞AI · BestBlogs 评分:89

离散扩散语言模型尝试用并行生成挑战逐 token 的自回归路线,潜在优势是允许多个位置共同修订,而不是把所有生成都锁在从左到右的单一路径上。

文章同时解释,并行并不自动带来质量与速度优势:生成调度、迭代步数、训练目标和长文本一致性都会限制实际收益,现有工具与推理生态也主要围绕 AR 构建。

因此 dLLM 更适合被理解为另一种生成与计算权衡,而不是已经确定的替代者。判断其位置要看具体任务的延迟、质量和可控性,而不是只比较理论并行度。

补充阅读

X 开源「为你」算法,披露详细评分机制

来源:Elon Musk(@elonmusk) · BestBlogs 评分:92

X 开源 For You 排序算法,公开帖子评分与互动权重,让外界可以更具体地讨论推荐系统怎样组合候选和反馈;代码透明仍不等于线上数据、实验配置与实际运行完全透明。

Unify 如何在两周内将 AI 智能体成本降低 95%

来源:LangChain · BestBlogs 评分:90

Unify 把 Agent 架构当作经济系统,通过缓存、评测纪律和工具调用优化,将运行成本降低约 90% 至 95%;这是团队案例,适合借鉴诊断顺序,不宜机械套用降本比例。

科技爱好者周刊(第 408 期): 你需要知道的 AI 缓存知识

来源:阮一峰的网络日志 · BestBlogs 评分:91

本期周刊解释大模型输入 Token 缓存怎样影响延迟与价格,帮助读者理解为什么稳定前缀、上下文排列和缓存命中率会成为 Agent 成本设计的一部分。

InstEmb:面向 Oxygen AIIC 商品知识表征的未来感知指令嵌入

来源:京东技术 · BestBlogs 评分:88

京东 InstEmb 用可学习的 look-ahead tokens 自蒸馏未来输出语义,让一次前向得到更符合指令的混合表示,并在多个检索与句向量基准上超过文中强基线。

从 DeepSeek、Kimi 到"黄仁勋联盟":AI 模型开源,到底"开"了什么?

来源:硅谷101 · BestBlogs 评分:90

文章区分开放权重与训练代码、数据、许可和治理都开放的完整开源,并借中美生态说明「可下载」背后仍有不同商业模式与安全取舍。

ChatGPT 中的 Computer History

来源:OpenAI · BestBlogs 评分:88

ChatGPT macOS 客户端的 Computer History 记录交互事件形成跨任务记忆,使助手能理解不同应用中的工作连续性,也把用户控制、敏感信息范围和记忆纠错推到产品中心。

CaaS 崛起:为 Agent 构建可复用的上下文服务

来源:AI Engineer · BestBlogs 评分:88

CaaS 把重复知识工作需要的结构化 Web 上下文沉淀为可复用服务,适用于数据新鲜度和提取逻辑值得长期维护的场景,而非所有一次性检索都要另建平台。

Cursor 收购 Firetiger:构建可投入生产的 AI 智能体

来源:Cursor(@cursor_ai) · BestBlogs 评分:90

Cursor 宣布收购 Firetiger,继续建设能够处理生产工作流并自主解决问题的 Agent;真正的产品增量仍要看整合后的权限、可观察性和故障恢复能力。

LTX-2.5 开源:22B 音画生成模型,原生多镜头、自动时长与 4K HDR

来源:魔搭ModelScope社区 · BestBlogs 评分:87

Lightricks 开放 22B 参数 LTX-2.5 权重,新增原生多镜头、自动时长预测与 4K HDR,并同时提供适合微调的 Dev 和固定 8 步推理的 Distilled 版本。

计算机使用模型将让网页走向智能体化,而非等待 API 普及

来源:AI Engineer · BestBlogs 评分:90

Dhruv Batra 判断,长尾网站很难等到统一 API 覆盖,计算机使用模型会直接操作面向人的界面;这扩大了可达范围,也要求更严格的授权、验证和失败恢复。

延伸探索

今天的补充区可以按三条线继续读。模型与开源一侧包括 DeepSeek-V4-Pro、Gemini 3.7 Flash、Grok 4.6、模型路由和 Claude Code 成本;Agent 工程一侧集中在企业 Harness、DeepSeek Harness、多智能体交易研究、网页运行框架和安全电脑操作,能继续补足「循环如何获得上下文、工具与评测」的问题。

另一条线把视角拉到组织与产品:WorkBuddy 的 AI 原生资料库、游戏开发者对执行提速的反思、Google 开发者大会,以及实体产业的软件化,都在讨论同一个边界--执行更快之后,知识、判断、基础设施和业务闭环是否同步改变。可把这些材料作为三篇精讲的对照,而不必逐条追赶所有发布。

今日阅读路径

如果只有 15 分钟,先读「实用循环工程」,把 goal、loop、验证者和停止条件变成可立即使用的工作框架;再读 GLM-5.3 的网络安全部分,练习按审查、验证和利用链分层理解模型能力;最后读 AI Native 团队的知识底座章节,把个人工作流放回组织协同中检查。

读完可以追问两个问题:你正在委派的是任务,还是连价值判断也一起委派了?团队最依赖的业务规则,究竟锚定在代码、配置、数据,还是仍只存在于某个人的记忆里?欢迎打开原文继续阅读,也把你的实践和疑问留在评论区。

👉 近期早报

• BestBlogs 早报 · 2026-08-14

• BestBlogs 早报 · 2026-08-13

• BestBlogs 早报 · 2026-08-12

• BestBlogs.dev 第 108 期:智能的执行层

• BestBlogs.dev 第 107 期:个人 AGI

• BestBlogs.dev 第 106 期:1% 法则

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

来源:ginobefun · x.com

GLM-5.3 扩展编程与安全边界,循环工程重写 Agent 协同

ginobefun · @hongming731 · X·2026-08-15 08:49·32分钟前
AI 导读

智谱发布 GLM-5.3,基于与 GLM-5.2 相同基座经更长后训练,在 Terminal-Bench 3.0 上由 4.6 提升至 28.3,DeepSWE v1.1 上由 46.2 提升至 66.9;网络安全方面,CyberGym 得分 84.5%,ExploitBench 为 54.4%,仍低于 Mythos 5 的 78.0%。

https://x.com/i/article/2088426893192421376

BestBlogs 早报 · 08-15|GLM-5.3 扩展编程与安全边界,循环工程和知识底座重写 Agent 协同

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。

导语

当 Agent 从一次对话走向持续工作,真正难的并不是让它多运行几轮,而是回答三个逐层放大的问题:模型的能力到了哪里、一次任务怎样知道该停、团队又凭什么让不同 Agent 获得正确且持续更新的业务知识。今天的三篇精讲刚好落在这三个尺度上。

GLM-5.3 展示同一基座经过更大规模后训练后,编程能力怎样迁移到代码审查与漏洞发现;Addy Osmani 把长时工作拆成有界的 goal 与定时的 loop,并要求执行者之外再有独立验证;大淘宝技术则把视角拉到组织,指出单点编码提速无法自动消除需求、研发、运维与运营之间的人工接力。

这不是一条已经被证明的统一路线。模型跑分来自厂商口径,循环工程是实践经验,AI Native 团队仍是方向性框架。但把三者连起来读,可以得到一套更诚实的生产检查表:能力要分任务链条看,自治要先写完成和停止条件,组织改造则要先解决知识从哪里来、怎样保鲜、谁对例外负责。

★ 精讲一:GLM-5.3:前沿编程能力与涌现的网络安全能力

来源:智谱 · BestBlogs 评分:93

GLM-5.3 最值得注意的地方,不是一个全新的基座模型,而是智谱称其在与 GLM-5.2 相同基座上,通过数十倍长程任务环境、更丰富的环境类型和更长后训练,把能力上界继续向外推。这个对照把「模型能力」拆成了两层:预训练决定基座拥有什么潜力,后训练则决定它能否在复杂环境中发现问题、操作工具、实施并验证。对工程团队而言,这意味着评估一次升级时,不能只问参数规模有没有变化,也要问训练任务是否更接近真实工作链路。

公开结果显示,GLM-5.3 在 Terminal-Bench 3.0 上由 4.6 提升到 28.3,在 DeepSWE v1.1 上由 46.2 提升到 66.9,在 Agents' Last Exam 上由 23.8 提升到 28.5。智谱自建的 Z.ai Code Bench 还报告,High 档位准确率为 31.4%,每项任务平均输出约 5 万 tokens;对照中的 Claude Opus 4.8 为 29.5% 和约 12 万 tokens。后面这组是厂商自测,不宜当作跨平台定论,但它提出了一个有用维度:长程 Agent 不仅要完成任务,还要看完成路径、token 利用和返工成本。

网络安全部分更需要分层读。CyberGym 从白盒源代码出发识别和验证漏洞,GLM-5.3 得分 84.5%,略高于文中列出的 Mythos 5 与 GPT-5.6 Sol;到了需要理解成因并完成利用的 ExploitBench,它得到 54.4%,虽比 GLM-5.2 的 24.4% 高出一倍多,却仍低于 Mythos 5 的 78.0% 与 GPT-5.6 Sol 的 76.5%。ExploitGym 的限时吞吐也呈现相同方向:进步明显,但完整利用链仍有差距。因而更准确的判断是,能力增量首先集中在代码审查、异常定位和漏洞验证的前半段,而不是已经获得不受约束的全链攻击能力。

智谱与合作安全团队还披露,自 GLM-5.2 发布以来累计发现 2,436 个经初筛和去重的漏洞,其中 1,097 个为中高危,覆盖 269 个项目;公开披露账本只展示已协调修复的细节,对仍在流程中的漏洞保留哈希。这里同时存在两种信息:一方面,长上下文、逆向分析和跨日志关联确实可能放大防守者的调查能力;另一方面,漏洞数量、经济价值与影响范围主要由厂商及合作方报告,尚不能替代独立复现与漏洞库的逐项确认。

开放权重因此不是普通的发布时间表。智谱计划在发布两周后、完成安全评估和加固后开放完整权重,并设计外层分类器、推理监控器和模型内部安全对齐的多层防护。需要区分的是,前两层依赖托管环境,权重离线部署后仍能保留的主要是模型内部对齐;而研究、防守、教学与恶意利用在字面上高度相似,安全系统能否根据意图和授权做准确分级,仍要接受持续红队检验。

读这篇发布时,最有用的不是记住一个总分,而是保留四个问题:模型在哪一段任务链上变强,评测由谁完成,漏洞如何负责任披露,权重开放后哪些控制仍然有效。GLM-5.3 给出了编程能力向安全能力迁移的强信号,也把同一个事实的另一面摆上台面:能力越接近真实环境,治理就越不能停留在 API 层的一次拒绝。

★ 精讲二:实用循环工程

来源:Elevate · BestBlogs 评分:91

Addy Osmani 的核心贡献,是把容易被笼统称为「让 Agent 一直做下去」的工作拆成两种原语。goal 面向一个有界任务:给出可测量的终点,让 Agent 反复尝试,直到评估器确认条件满足或达到最大轮数。loop 面向不断变化的外部状态:按固定间隔重新检查日志、PR、Issue 或消息,再对新增情况采取动作。前者问「这件事做完了吗」,后者问「外部世界有没有发生需要处理的变化」。

这个区分会直接改变提示词。把「把页面优化好」交给 goal,评估器无法知道什么叫好;改成 Lighthouse 分数至少达到 92、LCP 低于 1.8 秒、不改变公开 API、连续两轮没有改善就中止,并限制最多 10 轮,系统才拥有可执行的完成条件和停机条件。评估器检查的是硬规则是否满足,不会自动判断视觉品味、架构是否简洁或改动是否值得,这也是为什么数字通过不等于作品优秀。

loop 则更像调度器。作者用定期检查 GitHub 新 Issue、汇总紧急程度,以及轮询 PR 评论和失败 CI 为例。它适合输入持续变化、动作模式稳定的工作;如果每次都需要重新理解模糊目标,定时触发只会稳定地产生不确定结果。goal 与 loop 可以组合:loop 发现带有 bug 标签的问题,goal 再负责把修复推进到本地测试通过。但组合越长,越需要明确权限、预算、失败退出和不可逆操作的人工确认。

文章里最重要的经验并不在命令本身,而在执行与验证分离。作者每天并行使用多个 Agent,但不会让完成工作的那个 Agent 同时裁定自己是否合格。一个 Agent 起草,另一个从不同维度验证,例如不仅测桌面性能,也检查移动端、浏览器控制台和真实交互。独立验证仍可能漏错,却能减少执行者围绕自己的路径自证成功,也更容易暴露规格里没有写出的盲区。

人类判断的边界同样具体。作者曾让 Agent 研究竞品并生成弥补差距的本地改动,研究看起来合理,实施却会给用户增加大量复杂性。问题不是任务没有完成,而是他差点把「是否值得做」一起委派出去。涉及审美、产品取舍、架构、安全、认证或财务的任务,即便有清晰规格,也需要更近距离复核;一个没有真实用户的绿地项目,与积累多年规则的银行代码库,也不该获得相同自治程度。

循环工程因此不是把监督从流程里删除,而是把监督写进流程。实用顺序可以很朴素:先选一个结果可客观验证的窄任务,定义成功、失败与停止,再决定是一次 goal 还是周期 loop;把验证交给独立角色,保留人对风险和价值的判断;最后才扩大并行度。若同一命令第三次执行仍没有比第二次产生变化,那不是坚持,而是系统正在原地旋转。

★ 精讲三:重构协同:关于 AI Native 团队的思考

来源:大淘宝技术 · BestBlogs 评分:92

大淘宝技术这篇文章把一个常见误区说得很直接:编码变快,不等于业务交付链路同比例变快。需求从业务传给产品,产品转成方案,研发再翻代码与历史决策,测试、发布、运维、客服和运营继续靠人同步上下文。若这些接力仍由会议、群聊、表单和手工录入完成,在某个节点增加 AI 助手,只是旧流程中的局部加速。

作者由此区分 AI 辅助与 AI Native。前者保留「人是串联者」的流程骨架,后者尝试让 Agent 承担传递、判断与衔接,再围绕这个前提重建生产侧。消费侧的终点仍然是人,变化主要发生在交互;生产侧却是技术塑造出来的组织形式,表单、报表、审批流和大量内部系统,本来就是为了帮助人完成串联。当串联者变化,这些软件不会一夜消失,但其中等待人点下一步的环节需要重新审视。

文章设想的理想业务单元有三层:底层是业务规则、流程、领域知识和数据构成的知识底座;中间是按知识范围、工具权限和风险边界拆分的专业 Agent;上层是定方向、做判断、处理例外并把新知识沉淀回去的人。运维 Agent 可以读取代码并调用诊断工具,内部答疑 Agent 可以暴露更具体的定位,外部客服 Agent 则需要不同知识范围与表达规范。拆分的理由不是角色命名,而是权限、上下文与出错代价确实不同。

这里最有启发的判断是「软件是被固化的知识」。业务规则和流程可以被 Agent 动态解释,但确定性、性能、成本、安全与合规审计仍要求其中一部分固化成产品规则和代码。AI Coding 只是把知识固化成软件的一段流程;真正的上游是知识是否准确、边界是否清楚,以及新决策能否回到权威来源。因此,交付物未来可能同时包含软件、可供 Agent 使用的知识与 Skill,而不是只交一套界面。

困难主要落在存量业务。关键规则往往散在代码、配置、数据、旧文档和资深成员脑中,字段和系统边界还保留历次组织变化的痕迹。文章提出一个可靠原则:凡是能从代码、配置和数据自动生成或校验的知识,不要改由人手维护;越接近人的经验与例外,越要设计专门的外化和确认机制。知识是否能自治,很大程度取决于它离权威事实来源有多近。

底座的范围也是现实约束。划得太大,规则和流程难以收敛;划得太小,Agent 一执行就跨出边界,又退回人去对接。知识还必须能「活下去」:如果更新只依赖某位架构师的责任心,文档终会再次脱离代码。自动提取、变更检测、人工确认、版本追踪和权限审计,都是比一次性整理更重要的持续机制。

作者明确承认,公司内尚未出现成熟的最佳实践,所以这套三层结构不应被当作已经验证的组织因果模型。它更像一个诊断框架:当 AI 提效停滞时,先看瓶颈是否其实位于隐性知识和跨角色协同;当准备部署 Agent 时,先问它使用什么权威知识、能调用什么工具、谁处理不确定答案。Agent 能跑多远,最终受限于团队把自身业务讲清楚并持续校正的能力。

速览

开放模型现状:2026 年夏季观察

来源:Hugging Face - Blog · BestBlogs 评分:91

__XPOSTER_otgvz_IMAGE_4__

Hugging Face 用 2026 年前七个月的 Hub 数据,分别观察发布规模、下载、点赞、许可、衍生模型、本地运行格式和 Agent 流量。报告显示,开放模型的注意力中心向中国实验室移动,但美国硬件与基础设施公司仍通过模型发布和转换参与生态。

最能纠正直觉的数据是,下载前 25 与点赞前 25 的仓库只有一个重合:点赞反映发布时的关注,下载更像已经嵌入稳定管线的依赖。Qwen 在 Hub 上形成 151,448 个衍生模型,而小于 1B 的模型仍占声明规模模型历史下载量的 83%。

Hub 数据不包含私有部署、外部 API 和其他分发渠道,不能直接等同于质量、市场份额或商业采用。阅读时应把「谁获得注意」「谁被持续调用」「谁成为社区基础设施」分开判断。

网页自动化的暗黑技法:让智能体像人一样使用网站

来源:AI Engineer · BestBlogs 评分:90

__XPOSTER_otgvz_IMAGE_5__

Corey Gallon 把网页自动化设计成「感知-行动-验证」循环:先读 DOM、可访问性树、网络或截图,做一个动作,再用不同信号确认结果,而不是让一次点击自己证明成功。

他的三层梯子从便宜的页面 API 与合成事件开始,必要时升级到 CDP trusted input,只有确实需要时才使用视觉和更接近人类的输入轨迹。最终系统由确定性代码高速驱动浏览器,Agent 只承担图像判断,避免每次点击都经过模型往返。

演示包含绕过反自动化挑战的双重用途技术,作者也强调只在自有基础设施和自有账户上运行。可复用的工程结论是缩小模型参与范围,而不是把规避网站控制当作默认能力;真实部署必须先满足授权、服务条款和合规要求。

计算机使用智能体评测:别让可重放轨迹伪装成能力

来源:AI Engineer · BestBlogs 评分:89

确定性的计算机使用基准可能让模型记住并重放固定操作轨迹,在界面略有变化时却无法适应。这样的高分测到的是对测试环境的熟悉,而非在真实桌面上恢复和调整的能力。

研究建议引入环境变体、结果级验证和更可靠的不确定性估计,让智能体不能只靠固定坐标或步骤序列过关。评测还要区分任务最终成功与中间轨迹看起来相似,避免把测试泄漏包装成泛化。

它提醒团队在部署前主动改变窗口、数据和交互路径,并观察失败后的恢复,而不是只复跑公开基准。变体测试不能覆盖所有真实环境,但比单一可重放轨迹更接近实际风险。

dots3-note Preview:迈向服务真实生活的长程智能体,坚定的第一步

来源:小红书技术REDtech · BestBlogs 评分:88

REDtech 发布 280B 参数多模态模型 dots3-note Preview,同时给出 TEMPO 长程强化学习方法,以及 VibeSearchBench 与 VibeLifeBench 两套面向真实生活任务的评测。

这组发布把模型、训练方法和任务环境放在一起:长程智能体不仅需要一次回答正确,还要在搜索、生活决策和多步骤执行中维持目标、处理反馈并完成验证。

Preview 表明的是研究方向和初步能力,不等同于已经成熟的生产服务。更值得观察的是后续开放材料、评测可复现性,以及模型在失败恢复和安全交接上的表现。

34K Star 的 DeepTutor,不只是 AI 家教:它在做一套 Agent 学习操作系统

来源:山行AI · BestBlogs 评分:91

DeepTutor 把统一 Agent Loop、RAG、Skills、外部 Agent 和三层长期记忆组合在一起,目标不是回答一道题,而是让学习任务能够跨会话延续,并复用此前形成的知识与过程。

架构上的信息增量在于,资料检索、工具调用、任务计划和记忆不再是孤立功能,而是围绕学习状态持续更新。外部 Agent 与 Skill 也提供扩展入口,使系统能接入不同学科与工作流。

34K Star 说明项目获得广泛关注,却不能替代教学效果、错误率和隐私安全评估。准备采用时,应重点检查记忆怎样纠错、来源怎样追溯,以及长期记录是否真的改善学习而非积累误解。

守护前沿:JetBrains 如何评估并部署 Claude Fable 5

来源:Claude Blog · BestBlogs 评分:91

JetBrains 没有只依据公共榜单选择 Claude Fable 5,而是把模型放入私有代码库的真实任务中,评估准确性、完成步骤、推理效率与部署适配。

案例同时讨论安全套件、白盒测试与数据保留,说明企业评估的对象不仅是模型回答,还包括它接触什么代码、留下什么数据、怎样进入已有开发流程。

这是供应商发布的客户案例,结果不能自动外推到其他代码库。可复用的方法是建立自己的任务集与风险门,并把质量、效率和数据治理放在同一张评估表里。

分享一些 insights | 我们为什么会做 dLLM,又能否取代 AR?

来源:青稞AI · BestBlogs 评分:89

离散扩散语言模型尝试用并行生成挑战逐 token 的自回归路线,潜在优势是允许多个位置共同修订,而不是把所有生成都锁在从左到右的单一路径上。

文章同时解释,并行并不自动带来质量与速度优势:生成调度、迭代步数、训练目标和长文本一致性都会限制实际收益,现有工具与推理生态也主要围绕 AR 构建。

因此 dLLM 更适合被理解为另一种生成与计算权衡,而不是已经确定的替代者。判断其位置要看具体任务的延迟、质量和可控性,而不是只比较理论并行度。

补充阅读

X 开源「为你」算法,披露详细评分机制

来源:Elon Musk(@elonmusk) · BestBlogs 评分:92

X 开源 For You 排序算法,公开帖子评分与互动权重,让外界可以更具体地讨论推荐系统怎样组合候选和反馈;代码透明仍不等于线上数据、实验配置与实际运行完全透明。

Unify 如何在两周内将 AI 智能体成本降低 95%

来源:LangChain · BestBlogs 评分:90

Unify 把 Agent 架构当作经济系统,通过缓存、评测纪律和工具调用优化,将运行成本降低约 90% 至 95%;这是团队案例,适合借鉴诊断顺序,不宜机械套用降本比例。

科技爱好者周刊(第 408 期): 你需要知道的 AI 缓存知识

来源:阮一峰的网络日志 · BestBlogs 评分:91

本期周刊解释大模型输入 Token 缓存怎样影响延迟与价格,帮助读者理解为什么稳定前缀、上下文排列和缓存命中率会成为 Agent 成本设计的一部分。

InstEmb:面向 Oxygen AIIC 商品知识表征的未来感知指令嵌入

来源:京东技术 · BestBlogs 评分:88

京东 InstEmb 用可学习的 look-ahead tokens 自蒸馏未来输出语义,让一次前向得到更符合指令的混合表示,并在多个检索与句向量基准上超过文中强基线。

从 DeepSeek、Kimi 到"黄仁勋联盟":AI 模型开源,到底"开"了什么?

来源:硅谷101 · BestBlogs 评分:90

文章区分开放权重与训练代码、数据、许可和治理都开放的完整开源,并借中美生态说明「可下载」背后仍有不同商业模式与安全取舍。

ChatGPT 中的 Computer History

来源:OpenAI · BestBlogs 评分:88

ChatGPT macOS 客户端的 Computer History 记录交互事件形成跨任务记忆,使助手能理解不同应用中的工作连续性,也把用户控制、敏感信息范围和记忆纠错推到产品中心。

CaaS 崛起:为 Agent 构建可复用的上下文服务

来源:AI Engineer · BestBlogs 评分:88

CaaS 把重复知识工作需要的结构化 Web 上下文沉淀为可复用服务,适用于数据新鲜度和提取逻辑值得长期维护的场景,而非所有一次性检索都要另建平台。

Cursor 收购 Firetiger:构建可投入生产的 AI 智能体

来源:Cursor(@cursor_ai) · BestBlogs 评分:90

Cursor 宣布收购 Firetiger,继续建设能够处理生产工作流并自主解决问题的 Agent;真正的产品增量仍要看整合后的权限、可观察性和故障恢复能力。

LTX-2.5 开源:22B 音画生成模型,原生多镜头、自动时长与 4K HDR

来源:魔搭ModelScope社区 · BestBlogs 评分:87

Lightricks 开放 22B 参数 LTX-2.5 权重,新增原生多镜头、自动时长预测与 4K HDR,并同时提供适合微调的 Dev 和固定 8 步推理的 Distilled 版本。

计算机使用模型将让网页走向智能体化,而非等待 API 普及

来源:AI Engineer · BestBlogs 评分:90

Dhruv Batra 判断,长尾网站很难等到统一 API 覆盖,计算机使用模型会直接操作面向人的界面;这扩大了可达范围,也要求更严格的授权、验证和失败恢复。

延伸探索

今天的补充区可以按三条线继续读。模型与开源一侧包括 DeepSeek-V4-Pro、Gemini 3.7 Flash、Grok 4.6、模型路由和 Claude Code 成本;Agent 工程一侧集中在企业 Harness、DeepSeek Harness、多智能体交易研究、网页运行框架和安全电脑操作,能继续补足「循环如何获得上下文、工具与评测」的问题。

另一条线把视角拉到组织与产品:WorkBuddy 的 AI 原生资料库、游戏开发者对执行提速的反思、Google 开发者大会,以及实体产业的软件化,都在讨论同一个边界--执行更快之后,知识、判断、基础设施和业务闭环是否同步改变。可把这些材料作为三篇精讲的对照,而不必逐条追赶所有发布。

今日阅读路径

如果只有 15 分钟,先读「实用循环工程」,把 goal、loop、验证者和停止条件变成可立即使用的工作框架;再读 GLM-5.3 的网络安全部分,练习按审查、验证和利用链分层理解模型能力;最后读 AI Native 团队的知识底座章节,把个人工作流放回组织协同中检查。

读完可以追问两个问题:你正在委派的是任务,还是连价值判断也一起委派了?团队最依赖的业务规则,究竟锚定在代码、配置、数据,还是仍只存在于某个人的记忆里?欢迎打开原文继续阅读,也把你的实践和疑问留在评论区。

👉 近期早报

• BestBlogs 早报 · 2026-08-14

• BestBlogs 早报 · 2026-08-13

• BestBlogs 早报 · 2026-08-12

• BestBlogs.dev 第 108 期:智能的执行层

• BestBlogs.dev 第 107 期:个人 AGI

• BestBlogs.dev 第 106 期:1% 法则

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

来源:ginobefun· x.com