# Jeff Dean 的1%法则与AI可靠系统构建

- 来源：ginobefun (@hongming731)
- 发布时间：2026-07-31 07:36
- AIHOT 分数：36
- AIHOT 链接：https://aihot.virxact.com/items/cms868lri00uurot0b4c3o43o
- 原文链接：https://x.com/hongming731/status/2082973550907142583

## AI 摘要

Jeff Dean在YC访谈中提出构建AI系统的“1%法则”：寻找通用模型成功率仅1%的专业问题，而非已能完成20%的任务。他将长时Agent拆解为检索、记忆、工具等部件，强调用可测量反馈闭环防止错误累积。TPU的起源同样遵循此方法——先量化语音识别的计算瓶颈，再围绕低精度线性代数重建设计。

## 正文

http://x.com/i/article/2082972545817677824

# BestBlogs 早报|Jeff Dean 的 1% 法则、马斯克 AI 富足叙事与 Gemini Robotics ER 2 的机器人编排闭环

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容，如果你希望它基于你的兴趣和阅读习惯整理，可以体验「我的早报」。

## 导语

一个 Agent 能连续工作几天，并不等于它已经成为可靠的工作系统；一台机器人能识别物体，也不等于它知道何时该停手、重试或把任务交给同伴；模型让供给变便宜，也不自动回答财富和权力如何分配。今天的三条精讲分别把这些容易被能力演示遮住的问题拉回工程与制度现场。

Jeff Dean 给出了一套从瓶颈出发的建造方法，也用「1% 法则」提醒创业者别把模型当前已经会做的事情误认成长期壁垒。

马斯克把数字智能、人形机器人和准无限供给连成一幅乐观图景，《经济学人》总编辑扎妮·明顿·贝多斯则追问风险、所有权与过渡成本。

Gemini Robotics ER 2 的更新更具体：它持续看视频判断任务进度，把高层推理交给模型、把动作执行交给 VLA 或机器人 API，并让多台异构机器人协作。

这也延续了近期早报对 Agent harness、上下文控制和推理效率的关注，但今天的重点从「怎样让模型做更多」转向「怎样知道它做对了，以及谁承担系统失灵的代价」。

## ★ 精讲一：Jeff Dean 谈构建 AI 的「1% 法则」：从模型能力到可靠系统

Jeff Dean 在 Y Combinator 的完整访谈里，从 TPU 的起点一路讲到能运行数天或数周的 Agent。两者看似相隔很远，方法却相通：先找到约束整个系统的瓶颈，再围绕可测量的反馈闭环重做设计。TPU 的缘起不是先有一块芯片再寻找用途，而是团队用餐巾纸估算语音识别服务所需的计算容量，发现通用硬件在延迟与能效上难以支撑规模，于是重新审视低精度线性代数这一核心负载。

这套思路放到长时 Agent 上，瓶颈就不再只是模型是否会写一段代码。Dean 把模型看作检索、记忆、工具、上下文、评测和编排系统中的一个部件。任务链越长，Agent 越容易进入训练数据没有充分覆盖的区域；一个小错误如果没有及时被测量和纠正，就会在后续步骤累积。清楚的规格、工具使用说明和验收条件因此不是附属文档，而是 Agent 能否持续工作的运行边界。

访谈里一个很有操作性的例子，是把性能工程师的工作方法封装成 Skill：先运行基准，定位热点，做一处修改，再测量差异；如果退化就回滚，如果改善就继续。关键不在于给模型塞入更多「优化知识」，而在于把人的测量-修改-比较-回滚流程变成可重复执行的程序。多个 Agent 还可以提出不同方案，再用同一组评测选择结果。这样，搜索空间变大了，但判断标准没有随生成数量一起漂移。

Dean 的「1% 法则」是给创业者的选题启发式：寻找通用模型今天几乎做不到、成功率可能只有 1% 的专业问题，而不是它已经能完成 20%、只待自然迭代填平差距的任务。这个数字不是创业成功率，也不是固定阈值；真正要问的是，团队拥有的领域知识、数据表面、产品交互或验证能力，能否把一个普遍失败的问题变成高质量服务，同时经得住基础模型能力快速推进。

这也解释了为什么他同时强调「品味」与反事实思考。品味不是模糊的审美，而是写下预测、事后复盘，并不断追问默认约束能否被改写。AlphaChip、AlphaEvolve 等自动实验案例进一步展示了同一方向：让系统提出多个候选、运行实验、读取结果并继续迭代。自动化能放大每单位算力的探索速度，但前提仍是可计算的目标、可靠的模拟或实验环境，以及不会自我确认的评测。

从近期关于 Skill Harness 与上下文工程的讨论回看，这场访谈补上了一个容易遗漏的次序：先量化问题，再封装方法，最后才扩张 Agent 数量和运行时长。否则，「工作了三天」可能只意味着偏航更久。完整访谈还涉及专业模型、持续学习、推理硬件和科研自动化，适合作为一份系统设计与创业选题的共同参考。详见

> 来源：Y Combinator · BestBlogs 评分：93

## ★ 精讲二：2 万字全文| 马斯克《经济学人》访谈：奇点临近 - AI"富足时代"与文明终局

马斯克在《经济学人》访谈中给出了一组非常激进、也需要严格归属给受访者本人的预测：他认为 AI 可能在大约五年内超过人类智能总和，到 2036 年，数字智能与人形机器人可能把商品和服务供给推向「准无限经济」，金钱和工作作为生存必需品的重要性随之下降。访谈整理将这一图景称作 AI 富足时代，但它不是已经被验证的经济路线图。

马斯克的推导分两步。第一步，软件模型把数字工作自动化；第二步，人形机器人作为「末端执行器」，把智能从比特世界带到原子世界。若机器能够持续生产住房、食物、交通和其他服务，供给不再受人类劳动时间约束，稀缺性就可能下降。他还把未来工作比作园艺：人们仍会工作，但更多出于兴趣、身份和创造欲，而非获取生存资料。

扎妮的追问让这段叙事不止于技术乐观主义。她直接问：机器人由谁拥有，企业在过渡期如何盈利，失去工作的人如何获得收入，是否需要更高的资本税、全民收入或股份分配？即使生产成本显著下降，所有权、住房土地、能源、分配渠道和政治权力也不会自动变得无限。供给能力与普遍可得性是两个不同命题，而访谈并没有给出从公司控制的机器人资产通往公共富足的完整制度桥梁。

风险部分同样存在明显张力。马斯克仍把 AI 和机器人导致人类毁灭的概率估计为 10%-20%，却又认为发展势头难以阻挡，因此倾向于以乐观态度参与其中。面对追问，他提出领先实验室之间建立早期访问和交叉测试机制，让竞争者在模型发布前寻找危险行为。这是一个可操作的行业互审思路，但仍需解决测试权限、利益冲突、披露责任和监管强制力；概率本身也是马斯克的主观判断，不应写成风险测量结论。

把这场访谈与近期 Sam Altman 关于算力丰裕和个人能动性的表达放在一起，能看出两种相似愿景背后的共同空白：技术供应曲线可以陡峭变化，制度调整却往往更慢。对读者更有用的不是接受或拒绝「富足」这个大词，而是把它拆成四组可验证问题：智能和机器人的实际生产率提升多少，关键资产归谁所有，安全外部性由谁承担，转型期的收入与权利如何安排。

访谈还延伸到中国的芯片与电力约束、Starlink 的地缘政治角色、欧洲政治和马斯克参与政府事务等争议话题。转载整理较长，阅读时应始终区分马斯克的预测、主持人的质询和可独立核验的事实。它的价值正来自这种并置：一个建造者描述自己希望抵达的世界，一位经济媒体编辑不断要求他说明中间道路与代价。详见

> 来源：Web3天空之城 · BestBlogs 评分：91

## ★ 精讲三：Gemini Robotics ER 2：视频理解、任务编排与多机器人协作

Gemini Robotics ER 2 的变化不只是机器人「看得更懂」，而是把视频理解变成一个持续运行的控制回路。Google DeepMind 将它定位为高层具身推理模型：模型接收连续的视频、音频或文本流，判断任务做到哪一步、下一步是什么，再把运动执行交给 VLA 模型、导航接口或其他机器人 API。开发者还可以把 Google Search 或自定义函数声明为工具。

这种分层很重要。高层模型负责语言、场景理解、计划和工具选择，低层控制器负责连续动作；两者通过明确接口连接。ER 2 可以一边执行当前动作，一边思考接下来要做什么，并通过 Gemini Live API 的双向流式端点减少「停下来想一遍」的顿挫。若倒水失败、物品滑落或环境变化，模型从新的视频状态重新判断，而不是机械执行预先写死的步骤。

Google 公布的自有评测中，ER 2 在任务进度分类上达到 57.4%，关键时刻识别达到 91.3%，平均时间误差为 0.96 秒；公司还称其以更少计算获得 4 倍执行速度。这组数字分别回答「现在处于哪一步」和「某个动作何时完成」，不能混为一个总能力分数。它们来自厂商测试，尚不能替代真实家庭、仓库或工厂里的长期独立验证，尤其是遮挡、网络波动、工具故障和陌生物体下的表现。

多机器人协作则把编排范围从一台机器扩展到异构设备。轮式机器人适合室内移动，人形机器人可能更能处理不平地面，机械臂擅长精确操作；共享的语义表示让它们可以交接任务。这里真正值得观察的不是演示中两台机器人能否完成一次协作，而是身份、状态、资源锁、失败恢复和安全权限如何跨设备传递。

安全也必须处于同一个闭环。Google 报告 ER 2 在安全指令遵循和人体接近评测上有所提升，并展示机器人检测到附近有人时停止、区域清空后再恢复。公司同时提出面向 VLA 编排器的安全基准，检查模型能否执行约束、监控环境、判断物理可行性并主动向人类澄清。仍需区分的是，基准改进说明特定测试上的进展，不等于部署环境已经安全。

与近期具身 AI 内容相比，本次新增的信息集中在时间判断、自纠错、低延迟与跨机器人交接，而不是重复介绍整个 Gemini Robotics 2 产品栈。评估物理 Agent 时，也应把感知、进度判断、动作接口、延迟、故障恢复和安全停机放在同一张清单上；单看空间推理或一段顺利演示，会漏掉真正决定可用性的系统条件。详见

> 来源：Google DeepMind News · BestBlogs 评分：92

## 速览

AI Coding 的下一站，不是更会写代码，而是更懂团队

QQ 浏览器团队发现，AI 在单次会话里被纠正，并不意味着下一位同事的 Agent 会记得同一陷阱。初版从对话自动抽取经验时，大约 90% 的候选内容无法改善后续行为，失败路径、调试噪声和模糊结论反而污染知识库。

团队随后用主题分组与 Review、Dedup、Merge 三层治理链路，把会话中的判断沉淀为可审查、可合并的组织知识。它与 Jeff Dean 的 Skill 方法形成一个组织层对应：关键不是保存更多对话，而是让规则有证据、适用范围和更新责任。详见

> 来源：腾讯技术工程 · BestBlogs 评分：91

LangSmith LLM Gateway：面向生产级智能体的运行时控制

LangSmith LLM Gateway 进入公开测试，把支出上限、速率限制、模型回退和 PII/Secret 脱敏放到 Agent 与模型提供商之间。策略可按组织、工作区、API Key、用户或客户执行，阻断事件则写入 LangSmith trace。

这让可靠性从「出事后观测」前移到「调用前执行策略」，也避免每个 Agent 重复实现供应商特定逻辑。代价是网关会成为新的延迟、耦合与故障域；采用前需要定义可用性目标、应急绕行和策略所有者。详见

> 来源：LangChain Blog · BestBlogs 评分：91

前端 Skill 驱动的团队 AI Coding 实践：从个人提效到整体赋能

阿里前端团队面对的是另一类团队一致性问题：后端、产品和设计都能让 AI 快速生成前端，但技术栈、组件、视觉和可维护性开始漂移。做课程或堆知识库都不足以在生成第一行代码前约束行为。

他们把工程规范组织成五维 Skill，让技术选型、组件复用、交互与检查项进入执行上下文。与 QQ 浏览器案例对照，知识沉淀回答「团队学到了什么」，Skill 更进一步回答「Agent 下一次应怎样做」；二者都需要版本维护，不能把历史规则永久固化。详见

> 来源：阿里技术 · BestBlogs 评分：91

AI 产业演化的时间尺度：所处阶段与未来节奏|基于两个经典框架的探索性分析

腾讯研究院借用 Utterback 和 Klepper 两个产业演化框架，判断 AI 正处在晚期流动期向早期过渡期移动的分化区域：模型、应用和基础设施的成熟速度并不同步，产品设计与行业结构仍在快速试错。

这套框架的用途是帮助定位不确定性，而不是把 2026-2035 年推演当作既定时间表。读者可以用它区分「技术性能继续跃迁」与「主导设计、供应链和商业格局开始稳定」这两类不同信号。详见

> 来源：腾讯研究院 · BestBlogs 评分：91

对话 Liblib 陈冕：关于活下来，以及所有接近死亡的时刻

Liblib 创始人陈冕复盘 AI 应用公司如何应对基础模型不断吞噬应用价值：更激进地竞争、更快迭代，并用多产品尝试寻找仍可掌握的用户场景。这是一篇带有强烈当事人视角的生存记录，而非可直接复制的经营公式。

它也为宏观富足叙事提供现实尺度的对照。能力快速扩张会创造新产品，同时压缩既有差异化窗口；应用公司仍要承担组织调整、现金流和产品迁移的成本。详见

> 来源：晚点LatePost · BestBlogs 评分：92

Nubank 如何在 AI 技能进入开发者前审查 2，000 个供应链依赖

Nubank 把 AI Skills 视作供应链依赖，而不只是提示词文件。Skill 可能带入硬编码 Token、数据外泄、Shell 操作、文件修改与过度权限，因此团队用本地检查、合并前 CI 和可信内部市场组成 Skill Vector 审查链路。

完整演讲称系统已扫描超过 2，000 个 Skills、识别超过 1，500 项风险，并将确定性规则与 LLM 上下文审查结合后以 SARIF 返回结果。数字来自团队实践报告；更普遍的启示是，Skill 一旦规模化，来源、权限、审计日志和准入策略必须进入软件供应链治理。详见

> 来源：AI Engineer · BestBlogs 评分：88

对话词元无限：字节系团队、数亿元天使轮，ToB Coding、靠 FDE 拿下数十家大客户

词元无限从 ToC 转向 B 端 AI Coding，以 FDE 进入客户现场，理解代码库、流程和交付约束，并称已落地数十家客户。通用模型越强，单纯包装模型的价值越容易被压缩，现场集成和工作流理解反而成为产品的一部分。

这与 Dean 建议小团队寻找专业领域、独特数据表面和高质量交互相呼应。需要看到的代价是，FDE 模式服务较重、复制速度受限；它能否沉淀为标准产品，才决定壁垒能否从项目交付扩展到规模化业务。详见

> 来源：Founder Park · BestBlogs 评分：89

## 补充阅读

脉搏：因可靠性问题放弃 Spotify 播客

Spotify 播客平台的反复发布故障让作者停止上传视频节目。这个个案不能代表所有大公司，却提醒团队：追逐 AI 新能力时，基础发布链路的可靠性仍直接决定用户是否留下。详见

> 来源：The Pragmatic Engineer · BestBlogs 评分：91

重构的经济效益

一项针对 Agent 生成代码的重构实验报告，改善结构后，后续 AI 辅助变更所需输入 Token 减少 83%。这不是所有项目都能复制的比例，但把可维护性转换成了可观测的推理成本。详见

> 来源：Martin Fowler · BestBlogs 评分：92

摆脱智能手机末日循环，重建健康数字关系

Larissa May 反对把手机禁令当作完整方案，主张结合情绪技能、青年共创、家庭示范与创造性技术使用。完整对话还给出每周一天不使用 AI、用线下活动替换被动刷屏等小尺度实践。详见

> 来源：TED · BestBlogs 评分：91

"接力跑"盘活全国算力，PD 分离终于破局：延迟砍半、成本直降近 40%！

无问芯穹的 PDD 架构以三级分离和 Token 重算隐藏跨集群 KV Cache 传输延迟，报告首 Token 延迟降低 51.5%、成本下降近 40%。这些是方案方数据，评估时还应核对网络拓扑、负载类型和重算代价。详见

> 来源：量子位 · BestBlogs 评分：88

AI 辅助软件开发：将研究转化为实践的团队画像与能力模型

DORA 2025 研究识别七种团队画像与七项关键能力，核心判断是 AI 会放大既有组织基础。工具普及不一定修复流程混乱，反馈速度、平台能力和团队协作仍决定收益落在哪里。详见

> 来源：InfoQ · BestBlogs 评分：89

腾讯混元开源 AngelSpec：支持投机解码训练及部署，推理加速最高 2.4 倍

腾讯混元开源 AngelSpec，以 DFly 与 MTP+TTT 两条路线覆盖投机解码的训练和部署，并报告最高 2.4 倍推理加速。数字应结合模型、硬件和接受率场景阅读，重点是训练端与服务端开始共享一套可落地工具链。详见

> 来源：腾讯混元 · BestBlogs 评分：89

下半年，垂直 Agent 先下牌桌？

文章讨论垂直 Agent 的 Token 与算力需求上升，提醒应用壁垒同时受到模型进步和基础设施成本挤压。判断一家公司能否留下，不能只看功能差异，还要看专有工作流、数据反馈和单位任务经济性。详见

> 来源：腾讯科技 · BestBlogs 评分：90

Deep Agents v0.7

Deep Agents v0.7 精简基础 harness，使基础输入 Token 减少 65%，同时增强中间件配置和文件系统性能。发布数据称性能相当，但生产迁移仍需用自身任务集检查旧提示被移除后是否出现行为退化。详见

> 来源：LangChain Blog · BestBlogs 评分：87

如何使用 Google 微基准测试评估 TPU 性能

Google 发布微基准套件，从网络、计算、内存和 I/O 实测 TPU，并以屋顶线模型判断工作负载受算力还是带宽约束。它把 Dean 所说的「先找瓶颈」落实成可重复测量流程。详见

> 来源：Google Developers Blog · BestBlogs 评分：88

GPU 管理：为何闲置 GPU 是新型的"停飞飞机"

文章把闲置 GPU 类比停飞飞机，强调基础设施回报取决于持续编排、负载匹配和专业化运维，而非采购数量。类比虽简化了差异，却能提醒团队用有效工作时间而不是卡数衡量产能。详见

> 来源：Hugging Face - Blog · BestBlogs 评分：88

## 今日阅读路径

如果只有十分钟，先读 Jeff Dean，拿走「量化瓶颈-封装 Skill-统一评测」这套可直接用于 Agent 项目的方法；再读马斯克访谈，把富足预测拆成供给、所有权、安全和分配四个问题；最后看 Gemini Robotics ER 2，理解物理 Agent 为什么必须同时处理视频反馈、动作接口、延迟与安全停机。

接着可以按自己的工作选择支线：带研发团队，读 QQ 浏览器的经验治理与 Nubank 的 Skill 供应链；负责生产系统，读 LangSmith Gateway 与重构经济性。做这组延伸阅读时，不妨记录一项今天就能采集的指标，以及一条需要写进运行策略的失败边界，并约定下一次复盘的时间与负责人；一周后再检查，团队的判断是否真的改变了系统行为。你会把 Agent 的哪一个瓶颈先变成可测量指标？面对「AI 富足」，你认为最容易被技术叙事跳过的是所有权、过渡期还是安全责任？欢迎读完原文后在评论区分享你的判断。

## 👉 近期早报

- BestBlogs 早报 · 2026-07-30

- BestBlogs 早报 · 2026-07-29

- BestBlogs 早报 · 2026-07-28

- BestBlogs.dev 第 105 期：明与暗

- BestBlogs.dev 第 104 期：判断力回归

- BestBlogs.dev 第 103 期：系统新信号

BestBlogs 是 AI 驱动的私人阅读助手，帮助你发现真正适合你的高质量内容，关注你感兴趣的来源和主题，每天生成一份更适合自己的「我的早报」，欢迎体验和关注我们。
