ginobefun@hongming731
44AI 编辑部评分,满分 100
2026-08-03 07:06· 1小时前
跳到正文
AI 摘要

BestBlogs 第106期推荐20篇AI文章,围绕Jeff Dean提出的「1%法则」展开:模型能力易接近可用,但规格、上下文、工具、记忆、评测与编排决定产品成败。本期亮点包括GPT-5.6 Sol推理优化使成本降20%、Kimi K3精确规模2.78万亿参数、Gemini Robotics 2全身控制,以及Claude Code、MCP、Skill等工程实践。

大家好!欢迎阅读 http://BestBlogs.dev 第 106 期 AI 精选文章推荐。

本周 Jeff Dean 提出一个很适合描述当下 AI 的「1% 法则」:模型能力可以很快接近可用,但最后决定产品能否成立的,往往是规格、上下文、工具、记忆、评测和编排。这个 1% 并不小,它包含了从一次漂亮演示走向可靠系统的全部困难。

本期 20 篇内容沿着这条线展开。GPT-5.6、Kimi K3 和 Gemini Robotics 继续推动能力与效率边界;Claude Code、MCP、Skill 与 WorkBuddy 则把注意力拉回 Harness、验证和组织知识;几场长访谈进一步追问,当智能变得充足,基础设施、产品和人的自主性将如何变化。

以下是本周最值得关注的 10 个精彩亮点:

🧩 Jeff Dean 在 YC 对谈中提醒,模型只是 AI 系统的一部分 。检索、记忆、工具、上下文、评测与编排,决定 Agent 能否完成真实任务。他用 TPU 的起源说明,简单的第一性原理估算常比排行榜更早暴露瓶颈。最后 1% 不是收尾,而是产品真正成立的地方。

⚡ OpenAI 官方披露,GPT-5.6 Sol 的推理内核优化让服务成本最高降低 20% ,改进的推测解码又把 Token 生成效率提升超过 15% 。ByteByteGo 进一步把 Agent 请求拆成编排、API 与推理三层。真正值得优化的指标,已经从每 Token 价格变成每个成功任务的成本 。

🧠 Kimi K3 的精确规模是 2.78 万亿参数 ,每个 Token 激活约 1042 亿参数。博阳从 LatentMoE、KDA 线性注意力和负载感知调度解释,它如何在通信与算力约束下继续扩展。这篇文章最可贵之处,是让 3T 级模型不再是魔法,而是一组可以理解、复用和质疑的工程选择。

🤖 Gemini Robotics 2 把视觉、语言与动作推进到全身控制、灵巧操作和多机器人协作。Anthropic 的 Drone-Bench 则给出必要边界:模型操控无人机的能力正在进步,但从二维画面重建可靠三维环境仍是主要瓶颈。能调用硬件不等于理解物理世界,演示走向可靠系统还差关键一步。

🔍 Karthika Raghavan 的 LLM-as-a-Judge 指南梳理了评估器的论文基础、生产用途、系统性偏见与对抗攻击。让另一个模型打分并不会自动得到可信评测,位置、长度、熟悉表达甚至提示注入都可能改变结果。验证闭环也需要被验证,这是所有 Agent 排行榜之前都应该补上的一课。

💻 Claude Code 创造者 Boris Cherny 分享,团队会随新模型发布重做提示词消融,只在真实任务反复失败时增加上下文、工具或指令。与之呼应,《Agent 开发指南》强调回答不等于负责 。而《编排器的税》进一步指出,子任务全文和重复定位一旦回流主上下文,就会持续损害编排器的工作记忆。

🛠️ FactSet 的 Yogendra Miraje 把 Skill 视为产品功能 :Prompt 决定 Agent 是谁,工具决定它能连接什么,Skill 决定任务如何完成。MCP 2026-07-28 则把连接层推进到无状态核心、版本化扩展与企业级授权。能力可以不断增加,但可靠 Harness、精准路由和权限治理必须先跟上。

📚 企业 Agent 的最后 1% 很多时候藏在组织知识里。阿里技术刊载的实践把知识拆成业务、架构、系统和基建四层;WorkBuddy 策略产品经理 Anne 用模型、上下文、Harness、Loop 四层解释产品化;另一篇文章则提醒,AI 编程会积累认知债与意图债 。代码交付更快,不代表团队仍然理解系统。

🌐 Sam Altman 把智能富足 描述为类似电力的基础设施,同时讨论芯片、能源、数据中心与人的自主性。马斯克在《经济学人》访谈中描绘物理 AI 与物质富足,也承认安全、权力集中和控制权的矛盾。李鸿胜则用产业演化框架提醒:模型、应用、组织和基础设施运行在不同时间尺度上,宏大叙事不能替代阶段判断。

🎯 Anthropic 产品负责人 Diane Penn 说,评测就是新的 PRD ,因为它能把模糊需求变成研究、工程与产品共同验证的信号。张小珺与 vLLM 核心维护者游凯超的长访谈,则把模型、推理引擎、Harness 和电力放进 Co-design。无论做产品还是做 Infra,最后的竞争都落在能否为长期结果负责。

希望本期的推荐能为您带来新的启发。保持好奇,我们下周见!

ginobefunhttp://x.com/i/article/2084050963296604160
ginobefun · @hongming731 · X·2026-08-03 07:06·1小时前
在 X 看原推· x.com
AI 摘要

BestBlogs 第106期推荐20篇AI文章,围绕Jeff Dean提出的「1%法则」展开:模型能力易接近可用,但规格、上下文、工具、记忆、评测与编排决定产品成败。本期亮点包括GPT-5.6 Sol推理优化使成本降20%、Kimi K3精确规模2.78万亿参数、Gemini Robotics 2全身控制,以及Claude Code、MCP、Skill等工程实践。

大家好!欢迎阅读 http://BestBlogs.dev 第 106 期 AI 精选文章推荐。

本周 Jeff Dean 提出一个很适合描述当下 AI 的「1% 法则」:模型能力可以很快接近可用,但最后决定产品能否成立的,往往是规格、上下文、工具、记忆、评测和编排。这个 1% 并不小,它包含了从一次漂亮演示走向可靠系统的全部困难。

本期 20 篇内容沿着这条线展开。GPT-5.6、Kimi K3 和 Gemini Robotics 继续推动能力与效率边界;Claude Code、MCP、Skill 与 WorkBuddy 则把注意力拉回 Harness、验证和组织知识;几场长访谈进一步追问,当智能变得充足,基础设施、产品和人的自主性将如何变化。

以下是本周最值得关注的 10 个精彩亮点:

🧩 Jeff Dean 在 YC 对谈中提醒,模型只是 AI 系统的一部分 。检索、记忆、工具、上下文、评测与编排,决定 Agent 能否完成真实任务。他用 TPU 的起源说明,简单的第一性原理估算常比排行榜更早暴露瓶颈。最后 1% 不是收尾,而是产品真正成立的地方。

⚡ OpenAI 官方披露,GPT-5.6 Sol 的推理内核优化让服务成本最高降低 20% ,改进的推测解码又把 Token 生成效率提升超过 15% 。ByteByteGo 进一步把 Agent 请求拆成编排、API 与推理三层。真正值得优化的指标,已经从每 Token 价格变成每个成功任务的成本 。

🧠 Kimi K3 的精确规模是 2.78 万亿参数 ,每个 Token 激活约 1042 亿参数。博阳从 LatentMoE、KDA 线性注意力和负载感知调度解释,它如何在通信与算力约束下继续扩展。这篇文章最可贵之处,是让 3T 级模型不再是魔法,而是一组可以理解、复用和质疑的工程选择。

🤖 Gemini Robotics 2 把视觉、语言与动作推进到全身控制、灵巧操作和多机器人协作。Anthropic 的 Drone-Bench 则给出必要边界:模型操控无人机的能力正在进步,但从二维画面重建可靠三维环境仍是主要瓶颈。能调用硬件不等于理解物理世界,演示走向可靠系统还差关键一步。

🔍 Karthika Raghavan 的 LLM-as-a-Judge 指南梳理了评估器的论文基础、生产用途、系统性偏见与对抗攻击。让另一个模型打分并不会自动得到可信评测,位置、长度、熟悉表达甚至提示注入都可能改变结果。验证闭环也需要被验证,这是所有 Agent 排行榜之前都应该补上的一课。

💻 Claude Code 创造者 Boris Cherny 分享,团队会随新模型发布重做提示词消融,只在真实任务反复失败时增加上下文、工具或指令。与之呼应,《Agent 开发指南》强调回答不等于负责 。而《编排器的税》进一步指出,子任务全文和重复定位一旦回流主上下文,就会持续损害编排器的工作记忆。

🛠️ FactSet 的 Yogendra Miraje 把 Skill 视为产品功能 :Prompt 决定 Agent 是谁,工具决定它能连接什么,Skill 决定任务如何完成。MCP 2026-07-28 则把连接层推进到无状态核心、版本化扩展与企业级授权。能力可以不断增加,但可靠 Harness、精准路由和权限治理必须先跟上。

📚 企业 Agent 的最后 1% 很多时候藏在组织知识里。阿里技术刊载的实践把知识拆成业务、架构、系统和基建四层;WorkBuddy 策略产品经理 Anne 用模型、上下文、Harness、Loop 四层解释产品化;另一篇文章则提醒,AI 编程会积累认知债与意图债 。代码交付更快,不代表团队仍然理解系统。

🌐 Sam Altman 把智能富足 描述为类似电力的基础设施,同时讨论芯片、能源、数据中心与人的自主性。马斯克在《经济学人》访谈中描绘物理 AI 与物质富足,也承认安全、权力集中和控制权的矛盾。李鸿胜则用产业演化框架提醒:模型、应用、组织和基础设施运行在不同时间尺度上,宏大叙事不能替代阶段判断。

🎯 Anthropic 产品负责人 Diane Penn 说,评测就是新的 PRD ,因为它能把模糊需求变成研究、工程与产品共同验证的信号。张小珺与 vLLM 核心维护者游凯超的长访谈,则把模型、推理引擎、Harness 和电力放进 Co-design。无论做产品还是做 Infra,最后的竞争都落在能否为长期结果负责。

希望本期的推荐能为您带来新的启发。保持好奇,我们下周见!

ginobefunhttp://x.com/i/article/2084050963296604160
在 X 查看原推x.com