https://x.com/i/article/2090224725528363008
BestBlogs 早报|Addy 谈认知投降与验证环,Laycock 区分公民构建与专家治理,17 岁作者的 ICML 路径
在线阅读本期早报
BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。
导语
一个没有爆炸半径限制的 agent 循环,可以在没人核对时把错误放大。Addy Osmani 把「模型说什么,你就认什么」叫做认知投降。他在 Google 做了 14 年 Chrome 与 DevTools,现在问的不是写得有多快,而是验证环还在不在。
昨天的早报还在看 Claude 值班,以及上下文怎样给对。今天这三条并不合成一条行业主线:一条谈工程判断,一条谈组织治理,一条是 17 岁作者把 attention 改动投进 ICML 2026 的路径。
★ 精讲一:从 Chrome 调试工具到 AI 工程:与 Addy Osmani 对谈
来源:The Pragmatic Engineer · BestBlogs 评分:91
一个 agent 循环一旦自己能跑通,判断就可能从人身上滑走。Addy Osmani 把这种「模型说什么,你就认什么」叫做认知投降。它和认知负债不同:后者是记忆和理解被慢慢掏空,前者是你把答案的所有权交出去。
主持人介绍他在 Google 做了 14 年,多数时间在 Chrome,从工程师做到 director,带过 50 人以上的工程组织。这两个数字来自主持人开场,不是审计过的编制表。更早的时候,他在爱尔兰乡下自学,从零写过自己的浏览器。
他并不反对 harness、循环工程和软件工厂。相反,他觉得这是下一层抽象:软件工厂不再把力气花在单次提示上,而是做出能自己提示、测试和核验的系统。
可是软件不是下了产线就结束。发布之后才会在生产里崩、出 bug、碰到真实用户。若循环没有爆炸半径限制,也没有质量护栏,错误会在无人核对时放大。
他举过自己的应用:过去要手工翻 bug 报告,现在可以把分析、日志、错误和流量接进同一套循环,让系统按信号排优先级。Sentry 里新错误触发 agent 出一版修复,对他来说可以;自动合入生产,他觉得今天还不该做。
一年前他还会把 agent 的思考轨迹展开来读。现在一次任务可能拉起 20 到 30 个子 agent,他不会逐条点开。他改读结尾的决策摘要;若没有,就要求模型把决策过程写出来,并提防它事后编一套理由。
他称之为相互放大:让 agent 记下这次学到什么、卡在哪里、哪些决定以后还要用。人保留一点好奇心,才还能在出事时自己修,而不是指望模型再猜一轮。
谈到工程师还剩什么时,他用 Chrome 的 OWNERS 文件作比:Chromium 大到每一块都有少数人签字。agent 可以写很多代码,但谁决定能发、该拦、该推迟,仍然要有人在钩子上。
他区分「看起来符合规格」和「真的好」。模型能判断前者,后者还包含体验、是否让人愿意回来。他称为 alpha 的优势会随模型版本衰减,但可问责不会自动出现。
Chrome 官方已经在写面向 agent 的 DevTools,说明调试面正在从人用工具扩到可被调用的工作流。那只是产品方向。本期对谈真正多出来的,是怎么给验证留位置。
看一条 agent 工作流时,可以先问验证环在哪里、爆炸半径有多大,而不是先问它写得有多快。14 年和编制说明不了他永远正确,但能说明这是一位还在写代码的 director 给出的工作方法。
★ 精讲二:公民构建,智能体执行,专家治理
来源:Martin Fowler · BestBlogs 评分:91
这篇文章的作者是 Rachel Laycock,发表在 Martin Fowler 站点,不是 Fowler 本人的专栏。她从一个越来越常见的问题写起:周末做出聊天机器人或内部流程之后,为什么工程团队没有因此快十倍?
她承认自己的第一反应曾是「你不懂企业级软件」。随后她觉得,工程师自己把「写软件」和「软件工程」讲成了同一件事,才让这个问题显得刺耳。
她并不贬低这些公民应用。十二个月前,同样的人可能根本做不出来。可一旦业务开始依赖它,问题清单会换掉:客户数据有没有保护,依赖挂了怎么办,两年后谁还能读懂,能不能过审计,流量放大一千倍还撑不撑得住,出问题能不能比客户更早发现。
这些问题通常不会出现在演示里。她因此说,有经验的工程师变得更重要,不是因为只有他们会写代码,而是因为他们知道什么时候可以信任它。
几周前的 FOSE 上,她听到一个团队白天写规格,夜里让 agent 干活,早上再审查结果。会上很少谈写代码,更多谈设计、架构、治理和学习。agent 能很快生成大量代码时,好设计不是更不重要,而是更重要。
她在意的不是隔夜流水线本身,而是人在做什么:判断什么叫好、做什么取舍、交回来的是不是自己想要的。代码还是不是唯一的真相来源,也在那天被反复问到。
稀缺因此从「会写代码的人」转到工程判断。她写下那句后来被反复提起的话:公民构建,智能体执行,专家治理。她说组织不靠代码运转,靠的是信任。
这三句不是 Thoughtworks 已经落地的编制,而是她和信任的资深工程师反复碰撞后留下的组织假说。FOSE 例子也是转述。微软和 IBM 的治理文档只能说明企业在拆执行与治理,不能证明这套公式已经成立。
她还特意排除一种反模式:公民做出东西再扔给工程师去收拾。专家治理是先设计护栏、平台和反馈环,让更多人和 agent 能安全地构建,而不是事后擦地。
所以周末能跑起来的应用,和能进生产的软件,要用不同的问题清单。能演示,只说明它存在;能不能留下,取决于有没有人愿意为两年后的维护和一次审计负责。
★ 精讲三:151. 17 岁被 2026 年 ICML 收录论文的小少年:我 bet 开心!开心!开心!
来源:张小珺Jùn|商业访谈录 · BestBlogs 评分:91
嘉宾苏廷浩出生于 2009 年,现在 17 岁,在香港德瑞国际学校读高二。主持人张小珺说,这是节目第一次打开一个高中生的 AI 研究世界。完整转录里,出生年、学校、训练规模和支教安排都来自主持人与嘉宾口述。
他在上海读过幼儿园和一年小学,二三年级因父母工作迁到香港。他觉得上海打下的基础帮了普通话,国际学校则留出时间做竞赛、象棋和自学。他说 2025 年拿过 16 岁以下象棋第二,最长一盘下了两个半小时。
路径比结果更具体。他先看吴恩达的课入门,再跟着 Andrej Karpathy 从零写 GPT 和 Transformer 的视频。看不懂的时候,他给自己定了 30 天挑战:每天读一篇机器学习论文并做笔记。30 天结束后要考 IGCSE,阅读计划就停了。
他记得 Transformer 和 Lottery Ticket Hypothesis 读起来费力,但读懂后很清楚。有一篇象棋与机器学习的论文让他不满意,甚至想过以后自己写一篇更好的。兴趣对象是 AI 本身:他把它想成一种要改一改、看反应的生物,而不是只想发论文。
他一度想自己训练「很小但最好」的模型,去查 1B、0.5B、0.25B 需要多少 GPU 和天数后,发现就算很小,费用也可能到十几万甚至上百万。于是改成在自己的 Transformer 代码上实现 gated attention 等新论文,并说大约试了 200 次不同改动。
论文方向落在 attention。他的做法是把第一层 value 残差往后传,再在残差上用 RMS Norm;同时把第一层 attention projection 宽度乘 2,一半留给本层,一半留给后续残差。他和 Kimi 团队一位高中生交流后认为,两边都在做残差,但不是同一件事。
训练费用是自述账单,不能外推成通用成本。他说这篇论文大约花了 3 万,最大模型只到 0.5B;数据用的是免费的 FineWeb-Edu,最大大约 20B。有一次参数没调好、三个模型都没存 checkpoint,白白烧掉 1500。
他不推荐别人也去做预训练,因为烧钱需要家里撑着。若要把模型做大,他还估算过大约再花 6000。那天晚上他犹豫过,最后是哥哥和父母一起点头。
论文被 ICML 2026 接收。他准备去韩国参会,并说审稿人给了专业意见。外部检索没有坐实论文题目和审稿细节,因此这里只把它写成一条可核对的接收陈述,而不是给这篇论文排名。
接收之后他没有把故事停在会上。参加完会议,在城市停几天,就去农村支教。那是他连续多年支教里的一次:白天备课、抓昆虫、玩狼人杀,并提醒自己暂时离开 AI。
他也谈到同龄人觉得意义被抽空——不论做什么,AI 都可能做得更好。他难过过一段时间,后来选择先让自己和身边的人开心。这是一条带经费、学校和实验约束的年轻研究者路径,不是励志样板。
速览
无需 A/B 测试,如何把 AI 安全交付给百万患者|Jared Joselowitz 与 Ufonia
来源:AI Engineer · BestBlogs 评分:90
Ufonia 研究员 Jared Joselowitz 说,临床语音智能体 Dora 不能对患者做 A/B,也不能靠回滚撤销已经说完的医疗建议。Dora 负责术后随访和术前核对这类本由临床人员打的电话,因此被当作受监管的医疗器械。
团队用模拟框架 Matrix:PatBot 扮演患者,BevJudge 按临床定义的危险场景打分。讲者给出约 20 万次真实通话、20 家英国医院,以及后续两年覆盖百万患者的合同。美国已在两家诊所上线,另有 6 家签约。
提示词用安全加权指标优化,漏检红旗的代价远高于多问几句。白内障随访里,Dora 会问视物模糊是远是近、何时开始、能不能游泳。这是接触患者前的证据积累,不是百万合同已经交付完毕。
AI Coding 时代,研发项目管理新范式探索与实践
来源:腾讯云开发者 · BestBlogs 评分:90
腾讯健康发现个体 AI Coding 提效后,端到端交付体感没有同步变快。他们给出的结果是:中位交付周期从 19 天降到 9 天,P85 从 52 天降到 23 天,30 天以上长尾从 35% 收到 7%。数字按工作日计算,剔除法定假日和周末。
公式写成:组织效率 = 价值创造时间 /(价值创造时间 + 组织摩擦时间)。编码变短之后,等待排期、联调和跨团队协同占了大部分周期。治理路径是数据可见、数据可信、异常定位、瓶颈挖掘,状态改由 TAPD 事件推断,再用 PM-Skills 做态势感知。
这是一个团队复盘,不能外推到所有产品线。它说明模型加速写代码之后,卡点往往在协作和需求治理,而不是再换一个更快的补全工具。
The Pulse:Grok 的 CLI 被曝将所有本地文件上传到云端
来源:The Pragmatic Engineer · BestBlogs 评分:91
__XPOSTER_9wblr_IMAGE_6__
独立研究者 Cerblab 记录:xAI 的 Grok CLI 在普通登录下,会把读过的文件(包括 .env)原文传到 xAI,并在提示「回复 OK,不要读任何文件」时,仍把整个仓库打成 git bundle 上传。12 GB 的未读随机文件库里,存储通道仍走了 5.10 GiB。
The Pragmatic Engineer 转述:存储目标是 Google Cloud 的 grok-code-session-traces 桶;关闭「Improve the model」也不会关掉上传。SpaceX 随后用远程开关暂停默认上传,并称开启 ZDR 的企业客户未受影响。
仓促开源和「正在删除已留存编码数据」并不能写成风险已经清零。对比文中提到的 Cursor 本地索引,本地 agent 的默认同步策略会在用户不知情时变成数据出境。
实践者之声
来源:Martin Fowler · BestBlogs 评分:92
Jim Highsmith 写在 Martin Fowler 站点:思想领导力被做成内容品类,学术写作把判断藏进脚手架,LLM Voice 则让作者直接消失。作者是 Highsmith,不是 Fowler。Fowler 审他的书稿时只说了一句:把你自己放进去。
他主张实践者之声从经验里的结论起笔,把张力留给读者自己走。权威来自承担过结果的经验,而不是头衔或平台。学术脚手架、内容品类和无人称模型腔,在他看来都会把判断从文章里拿走。
AI 能模仿这种腔调,但不能替人承担后果。这是一篇观点文,不是已经普及的写作规范。接下来他准备补一版写作指南,目前还没有写完。
个人 AI 代理舰队的书面宪法:七个月零事故
来源:Hacker News - Newest: "AI Agent" · BestBlogs 评分:92
一名个人开发者先写书面宪法,再让代理舰队运行,自称连续七个月零事故。宪法规定能做什么、绝不能做什么、谁审计谁,以及代码违反条款时怎么办。舰队包括值班简报机器人、执行构建部署的 agent,以及一层策略规划。
方法是先观察失败形态,再立法,再让现实修订条款。四根承重墙是:未显式声明即非生产、不可逆操作必须由人扣动、每条执行路径同等强度校验、只追加不改写的账本。沉默降级必须响铃;下线要收缴密钥;上线前本地镜像哈希必须字节一致。
零事故是作者自述,未经第三方审计。价值在于把护栏从事后补丁改成事先架构,而不是证明「写一份宪法就安全」。
为前沿模型提供零数据保留服务
来源:OpenAI News · BestBlogs 评分:90
__XPOSTER_9wblr_IMAGE_7__
OpenAI 重申面向合格 API 客户的零数据保留:请求处理完后不保留提示词和回复,员工也看不到原文。企业数据默认不用于训练,除非客户明确选择加入。
现有 ZDR 安全系统按单次交互评估。Private Safety Processing 预览跨请求识别模式,且不让员工看到原文。内容可留在客户控制的基础设施,或用客户控制密钥加密后存在 OpenAI 侧。告警只回传活动类型,客户若要申诉,再自己决定是否交出原文。
这是政策与能力预览,计划 9 月开始推进并发布技术白皮书,不是已经全量上线的合规认证。企业要在保留安全监控和禁止留存原文之间找接口。
宇树上市,王兴兴开始回答下一个问题:机器人如何自主进化
来源:Founder Park · BestBlogs 评分:90
8 月 19 日,宇树科技在上交所挂牌。发行价 150.80 元,开盘 1100 元,从受理到敲钟用了 152 天。王兴兴当天只用很短篇幅回望,随即把话题转到机器人如何用模型和仿真自我进化。
他描述的循环是:大模型自动找论文和开源代码、生成训练代码,在仿真和真机上训练测试,再由 AI 和人共同评价,进入下一轮。他称之为物理 AI 机器人自进化 V1.0。过去十年他证明身体可以量产,现在想验证学习能不能同样工程化。
Founder Park 记录的是上市当天发言加创始人判断,不是已经验证的自主进化系统。硬件公司开始用智能体语言描述下一代能力,但工程化是否成立,还要用真机结果核对。
补充阅读
将对话转化为知识:Anthropic 的 Claude 如何构建人机协作团队
来源:Claude Blog · BestBlogs 评分:90
Slack CPO Jaime Delanghe 在 Claude 博客写人机团队:默认把对话放在公开频道,给 agent 明确角色,并把工作和决策的交接写清楚。衡量标准是结果,而不是活动量。她周一先看 agent 做好的简报、升级和会议准备,再由人决定下一步。
团队如何构建 – Linear
来源:Hacker News · BestBlogs 评分:90
Linear 统计约 12.7 万付费用户:2026 年 1 月到 6 月,各职能的 AI 采纳都翻了一倍,产品从 12% 升到 34%;AI 已撰写接近一半的 issue。产品经理挂上 pull request 的比例两年里从 3% 升到 10%。这是 Linear 自己的客户盘,不是全市场。
AI 理解、引擎驱动:零代码搭建实时数据链路
来源:大淘宝技术 · BestBlogs 评分:91
淘天直播把「维度 + 指标」做成自然语言到 Flink SQL 的指标驱动引擎,开发周期从天级收到分钟级。用户用约 200 字描述需求,系统识别维度并生成 DSL。架构把理解和正确性拆开,再用 Hook 做增量调整。
#680.OpenRouter CEO Alex Atallah:为什么中国开源模型正在碾压美国
来源:跨国串门儿计划 · BestBlogs 评分:88
OpenRouter CEO Alex Atallah 解释中国开源模型为何在路由市场上被重度使用:7 月他们上线约 70 个模型,大约每 10 小时一个。企业往往更担心前沿模型的数据去向,而不是开源权重本身。路由层会在质量、速度或降价出现时,把流量立刻切过去。
2 亿次患者互动之后:Vivek Muppalla 详解 Hippocratic AI 的临床语音智能体架构
来源:AI Engineer · BestBlogs 评分:89
Hippocratic 工程负责人 Vivek Muppalla 称 Polaris 语音栈已处理约 2 亿次患者互动,部署超过 60 个卫生系统。架构强调带上下文的临床语音识别、并行专家模型和低延迟校验。公司自称无重大安全事故,患者满意度 8.5 / 10,这是企业自述。
Qwen3.8-27B-DFlash2 开源:1.92B 草稿模型,SGLang 单并发吞吐达自回归 3.4 倍
来源:魔搭ModelScope社区 · BestBlogs 评分:88
Qwen3.8-27B-DFlash2 用 1.92B 草稿模型和路径选择器,在单卡 H200、SGLang、并发 1 时把吞吐做到自回归的约 2.7 到 3.4 倍,并称解码无损。五个基准上平均接受长度 4.80,高于文中对照的原生 MTP 和 DSpark。
医疗保险智能体的执行字节码:以 X12 约束 AI 智能体的工作流
来源:AI Engineer · BestBlogs 评分:87
有从业者主张把 X12 交易标准当作医疗保险智能体的执行字节码,用公开交易和控制点约束资格、索赔和支付,而不是让模型自由跑流程。目标仍是降低保险交互成本,并改善患者在理赔链路里的体验。
Claude 如何加速蛋白质设计与分析化学研究
来源:Anthropic Research · BestBlogs 评分:88
Anthropic 报告 Claude 在 15 个靶点中的 14 个设计出蛋白质结合剂,湿实验由 Adaptyv Bio 和 Twist Bioscience 完成。命中率高于文中所说常见的 10% 到 15% 基线;模型也能分析原始 NMR 和 LC-MS 数据,并与合同实验室结果对照。
Jason Wei 反驳小模型+工具路线:内化知识才是顶级智能的关键
来源:宝玉(@dotey) · BestBlogs 评分:88
宝玉转述 Jason Wei:小模型加工具补不齐内化知识。他曾以为 10 亿参数的认知核心加上搜索和代码执行就够,后来用羽毛球的肌肉记忆作反例。速度、综合判断,以及长任务里一次次查资料带来的错误累积,都会拉开和大模型的差距。
Ornith-1.5:从自我脚手架到自我改进
来源:Hacker News · BestBlogs 评分:90
Ornith-1.5 用自生成任务、任务脚手架和解答轨迹做自我改进,把课程从人工出题改成模型自己往前推。任务奖励看有效性、是否踩在能力边界,以及新不新。
延伸探索
医疗和企业生产这一簇,继续问仿真、护栏和领域专家怎么进闭环。Hinge Health 讲面向会员的 PHI 安全与升级规则;Maven Clinic 把全员采用和生成式可靠性一起做;Anterior 用逆向政策推理做临床可信的合成数据;Allos 把任务收窄、非公开数据和专家验证 ROI 写成垂直 AI 的共性。企业智能体那一组则强调审计、数据边界和人工升级必须在概念验证阶段就在,系统才进得了生产。
另一簇是推理加速和开源模型。DFlash 2、赤兔引擎、LFM2.5 的量化检查点、14MB 的 Needle,以及 GLM-5.3、Kimi K3 长上下文和 RAG 的对照,都在讨论更快、更便宜之后还能否核对。字节的 Agent Plan、采购里的协调缺口、15 个 API 的路由基准,加上前端十年规划和「软件到底在增加信息密度」的讨论,适合按自己的工作台去点,不必按同一条叙事读完。
今日阅读路径
时间有限,先读 Addy 的验证环,再读 Laycock 的生产问题清单。若你在做临床或高风险交付,第三条改读 Ufonia 的仿真门禁;若你想看一条可核对的年轻研究者路径,再打开苏廷浩这一期。
你可以按这个顺序读,并带着两个问题往下走:你现在的 agent 循环里,爆炸半径是写在架构里,还是只写在口头提醒里?周末能跑起来的东西,你准备拿哪几条问题去问它能不能进生产?读完欢迎留言评论,说说你更信任哪一种核对方式。
👉 近期早报
• BestBlogs 早报 · 2026-08-19
• BestBlogs 早报 · 2026-08-18
• BestBlogs 早报 · 2026-08-17
• BestBlogs.dev 第 108 期:智能的执行层
• BestBlogs.dev 第 107 期:个人 AGI
• BestBlogs.dev 第 106 期:1% 法则
BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。