https://x.com/i/article/2094577755082153984
BestBlogs 早报 · 09-01|OpenClaw 2.0协作,AI 应用护城河交付,ClickHouse控成本
在线阅读本期早报
BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。
导语
OpenClaw 2.0 由 933 位贡献者共同完成,其中 569 位是首次贡献者,合并了超过 16,000 个 PR。这组数字先把一个产品问题摆到眼前:智能体从个人工具长成多人平台时,怎样降低首次使用门槛,又怎样让任务和上下文无损交接?
产品走向协作只是第一层。基础模型不断吸收抠图、换背景和模板生成等单点功能,应用公司必须证明自己能组织完整结果,让用户反复使用并愿意付费。智能体真正进入生产后,数据库还要承接不可预测的并发查询,同时控制成本、身份与权限。
今天可以沿三层路径阅读:OpenClaw 展示产品如何从一个有用工作流长成团队空间;屠龙之术借 Canva、Figma 和美图重估应用护城河;ClickHouse CEO 则把商业化问题落到智能体基础设施。三层的共同检验都很朴素:一次能力展示,能否变成可持续运行的系统。
★ 精讲一:OpenClaw 2.0,意外之作
来源:OpenClaw Blog · BestBlogs 评分:91
OpenClaw 把 2.0 称作一次意外形成的大版本。团队最初只是想简化安装、重做浏览器应用,但清理工作一路延伸到消息、记忆、技能、模型、自动化、原生应用、插件与安全,最后变成项目历史上规模最大的更新。
发布规模解释了为什么团队需要近七周。此前 230 天里,OpenClaw 发布过 106 个版本,多数版本相隔一两天;这次约 16,000 个 PR,占项目历史合并 PR 的一半左右。团队认为原有基础和发布流程已经跟不上贡献速度,因此同时重做产品入口与工程底座。
933 位贡献者中有 569 位首次参与。数字来自 OpenClaw 官方说明,能证明本次发布的贡献规模,却不能直接推导活跃用户数或团队协作效率。现有站外材料只确认它进入中文技术聚合和 Hacker News 讨论视野,功能与协作能力仍应以官方文章和文档为准。
产品改造先解决首次上手。新安装会从用户电脑上已有的 ChatGPT 或 Claude 订阅、API 密钥和本地模型开始,减少必须在初始流程中完成的配置。用户先进入第一次对话,再通过对话补齐设置,浏览器应用则成为继续配置、返回任务和实时观察执行的主要入口。
这个设计把复杂系统拆成可生长的路径。一个最简单的 Claw 可以观察学校邮件,把作业截止或活动提醒发到 Telegram。之后,任务可以从即时消息跨到邮箱查找收据,再把答案发回给家人。用户不必先搭一套完整自动化平台,而是从一个输入、少量判断和一个输出开始。
共享云会话进一步改变了产品边界。团队成员可以加入正在进行的工作,也可以完整接手任务,同时保留智能体已经掌握的目标、历史消息和当前状态。多人协作的关键因此不只是共享一个机器人,而是让交接不再依赖复制提示词、重新讲背景和人工同步进度。
OpenClaw 团队称自己已用共享会话参与 2.0 的开发,这仍是官方自述,实际协作收益需要更多外部使用数据检验。但它给出了明确的产品检查表:首次上手成本是否足够低,上下文能否长期延续,任务能否跨系统成长,多人能否无损交接,用户是否保有模型和供应商选择权。
这套路径也解释了开源生态的作用。开放源代码不只提供可审查的实现,还让用户能够带入现有模型、账号和本地环境,再按自己的生活与工作塑造软件。OpenClaw 2.0 最有用的启发,是把智能体的成长单位从一次回答改成可延续、可拥有、可交接的工作流。
★ 精讲二:模型到底吃不吃应用?--从 Canva、Figma 到美图, 看 AI 应用公司的两种命运
来源:屠龙之术 · BestBlogs 评分:90
基础模型会不会吃掉应用,常被讨论成非此即彼的判断。屠龙之术把问题拆得更细:模型更容易吸收抠图、换背景、修图和模板化生成等单点功能;应用的机会则在复杂场景里,把模型、流程和付费组织成用户愿意反复购买的结果。
Canva 与 Figma 在材料中代表市场压力。即使业务仍在增长,投资者也可能因为模型替代风险下调估值预期。这个案例不宜直接外推到全部软件,却提醒应用团队,功能使用量和收入增长之外,还要解释自己的工作流为何难以被基础模型的一次升级取代。
播客给出一条四步链路。第一步是选择模型,应用根据任务在不同视觉模型和工具之间路由;第二步是拆解任务,把模糊需求变成脚本、画面、人物、尺寸和渠道规格;第三步是控制结果,让人物、品牌、模板与风格保持一致;第四步是交付可发布、可投放、可复用的成果。
这四步把技术复杂度留在产品内部。普通用户通常不想判断某个模型更擅长人像还是视频,也不想理解 Skill、MCP 或路由规则。用户关心的是最终结果是否符合场景、能否继续修改、多久可以完成,以及付出的费用是否值得。
美图提供了一个可观察样本。它既有美图秀秀等成熟产品积累的用户、品牌和分发,也在图像、视频、设计与专业工作流中建立新产品矩阵。面向电商的产品可以从一张商品图延伸到店铺装修、投放素材和视频,面向内容团队的产品则把脚本、人物、场景和成片串成流程。
播客还提到一个叫学他修图的功能。它没有把专业摄影师的修图方法包装成需要学习的新技术概念,而是直接告诉用户可以模仿某种风格。这个例子很小,却清楚说明应用层的价值:把模型能力翻译为目标明确、成本可理解、结果可预期的产品动作。
按照播客作者对美图财报和分析师会的转述,自研模型生成内容占最终交付的 96%,第三方 API 成本占收入为个位数百分比。以上数字没有在本期获得站外补证,应理解为作者分析案例的依据。它们指向的商业问题是,能力内化能否同时改善结果控制与调用成本。
有模型并不自动形成护城河。美图仍需证明生产力业务能否成为足够大的第二曲线,单位算力能带来多少收入,渠道分成后的毛利如何,以及海外用户能否持续续费。尝鲜、下载和一次爆款生成可能带来传播,却未必形成留存和稳定现金流。
对应用团队更实用的判断框架,是连续追问四件事:是否替用户隐藏模型复杂度,是否交付完整结果,用户是否会重复购买,收入增长能否伴随可持续毛利。模型会继续吸收功能,但应用仍可以通过场景理解、过程控制与结果交付建立价值。
★ 精讲三:ClickHouse CEO 谈 AI 利润、收入韧性与智能体基础设施
来源:20VC with Harry Stebbings · BestBlogs 评分:91
当应用开始交付跨系统结果,压力会继续传到数据基础设施。20VC 的访谈里,ClickHouse CEO 描述了一种不同于传统软件的负载:传统应用围绕固定用户角色、报表和流程设计,查询模式相对稳定;智能体却会穿过可观测性、数仓、CRM 等多个系统。
一次智能体任务可能并发发出数十条 SQL 查询,整条链路又受到最慢环节限制。数据库因此需要同时处理低延迟、高吞吐和不可预测的探索式查询。查询量越大,存储与计算效率越不只是后台指标,它会直接决定任务响应速度、产品定价和可持续使用范围。
智能体也不会天然为账单负责。它可能在尝试、回溯和重新规划中持续消费资源,因此基础设施厂商必须重新设计消费上限、访问方式和计价。ClickHouse 希望成为智能体构建应用时默认选择的数据库,这是一家供应商的产品目标,市场是否接受仍要看真实部署与长期扩张。
治理问题同样具体。受访者认为,未来每个智能体都需要独立身份、预算和授权。一个能够自动配置数据库、网络、计算与存储的智能体,必须清楚哪些企业数据可以访问、最多花多少钱、哪些动作需要人批准,以及越权后如何停止。
这使基础设施的控制面与性能同样重要。低延迟让任务跑得动,身份与权限让企业知道谁发起了操作,预算让成本能落到具体任务,审计则让失败可以追溯。随着部分治理自动化,企业还需要避免控制系统本身失去人类可见性。
访谈称 ClickHouse 的年度经常性收入已超过 3.5 亿美元,一组 AI 客户贡献不足总收入的 12%,公司净收入留存率超过 200%。这些经营数字都来自 CEO 访谈整理稿,本期没有站外补证,适合用来呈现 ClickHouse 的商业叙事,不应当作独立验证的行业基准。
这组叙事仍提出了有用的问题:基础设施增长来自少数热门客户,还是来自更多会持续扩张的生产使用?ClickHouse 的回答是,客户可以从数据仓库开始,再进入实时分析、应用开发和对外数据服务。高切换成本与客户扩张,才可能让收入越过短期 AI 热度。
开源和开发者自助分发帮助产品进入团队,规模化后还需要企业销售层。不同客户也需要云端、VPC 和本地部署选择,以满足监管、隐私与合规要求。这与前两篇形成递进:产品降低入口,应用组织结果,基础设施则承接规模、成本和信任。
基础设施团队可以用四项检查收尾:系统能否承受低延迟且不可预测的并发负载,单位查询成本能否压住,智能体能否获得受控的身份、预算与权限,收入是否来自长期扩张的使用。智能体基础设施的竞争,最终会同时发生在性能和治理上。
速览
下面七篇从生成媒体、编程语言、工程代理、编码评估、量化研究、算力供给和病理模型继续展开。
生成媒体的下一阶段:Google DeepMind 谈多模态世界模型、评估与真实工作流
来源:AI Engineer · BestBlogs 评分:90
Google DeepMind 的研究与产品负责人讨论 Gemini Omni、Veo、Nano Banana 等系统,观察生成媒体如何从专用图像与视频模型走向更统一的多模态世界模型。语言、图像、视频与音频之间的关系,正在从独立生成转向共同理解环境。
访谈把真实客户工作流和专业创作者经验放在重要位置。生成质量不能只由单一基准决定,审美默认值、音画一致性、用户修改路径和任务完成度,都需要进入评估。模型还要从真实失败中获得更有针对性的数据。
对产品团队来说,新的判断标准不是能否生成一段漂亮素材,而是能否进入现有创作流程,让专业判断继续发挥作用,并用接近真实工作的评估发现问题。世界模型的想象空间很大,可用性仍从具体工作流里产生。
Scala 创始人 Martin Odersky:语言比较与 AI 如何重塑编程
来源:Ryan Peterman · BestBlogs 评分:91
Scala 创始人在访谈中比较函数式编程、Scala、Rust、Go、Zig 和 Python 的取舍。他认为,随着 AI 生成更多代码,人类工程师的工作会更偏向表达规格、设置约束、验证结果和维护长期结构。
强类型、内存安全和显式能力系统为机器生成的代码提供可检查边界。函数式编程把状态变化推迟并隔离,也让行为更容易推理。语言的价值因此不只体现在写代码的速度,还体现在系统能否揭示错误和限制危险动作。
AI 编程没有让语言设计失去意义,反而提高了可验证结构的价值。团队选语言时,可以把模型生成效率与类型反馈、安全边界、维护成本放在一起,观察哪种组合最有利于人类长期掌控系统。
DoorDash 的 Flux 平台通过云端代理运行 130,000 项工程任务
来源:InfoQ · BestBlogs 评分:88
DoorDash 把工程代理从开发者笔记本迁移到 Flux 云平台。InfoQ 报道称,该平台在一个月内自动化 130,000 项工程任务,并支持每周超过 25,000 次自动代码审查,让任务能够脱离个人设备并行运行。
本地代理会受到 CPU、内存、在线时间和凭据暴露的限制,也很难统一追踪它代表谁访问了哪些系统。Flux 使用隔离沙盒、安全 MCP 网关和 300 多个可复用剧本,让任务从 Slack、GitHub 或定时流程触发,同时保留企业控制。
规模化工程代理的关键不只是增加模型调用,而是把执行环境、安全边界、身份和流程资产放进同一平台。对正在试点编码 Agent 的团队,这篇适合用来检查本地原型迁往生产时缺少哪些基础能力。
从排行榜到模型档案:对用于代理式编码的 LLM 进行深度评估
来源:The JetBrains Blog · BestBlogs 评分:90
JetBrains 提出一种编码代理评估管道,不只记录任务是否通过,还分析执行轨迹。两个模型可能解出同样数量的任务,却在步骤数、成本、工具使用、修改范围和失败方式上表现出完全不同的工程特征。
文章举例称,在一个私有基准上,两个模型解题数相同,其中一个平均使用 184 步、每次运行 2.79 美元,另一个平均 271 步、每次 1.24 美元。总通过率把这种行为差异隐藏了,轨迹分析则能形成更完整的模型档案。
团队选模型时,不必把答案压成单一排行榜。更有用的做法是按任务风险比较成功率、成本、步骤效率和失败模式,再决定哪个模型适合代码审查、修复或大型改动。行为档案比总分更接近真实部署决策。
AQuA:让量化研究 Agent 持续进化,也让回测结果经得起检验
来源:量子位 · BestBlogs 评分:89
AQuA 由普林斯顿、蚂蚁和斯坦福的研究团队开发,让 Agent 持续提出量化假设、运行实验并更新研究记忆。它最关注的并非一次漂亮回测,而是自我改进系统怎样避免把数据泄漏和过拟合保存成成功经验。
系统把数据路径和评价规则留在自主循环之外。Agent 可以改变研究方向、因子或模型配置,却不能随意改动判断成败的依据。每次实验还保存提出原因、证伪条件、市场状态和失败证据,让下一轮研究从可靠记录出发。
这种设计对量化之外同样有启发:长期记忆只有在证据可信时才会带来复利。任何递归改进系统都需要一个不由自身随意修改的验证边界,否则更长的记忆可能只是让错误传播得更远。
为什么 AI 需求将长期跑赢算力供给
来源:a16z · BestBlogs 评分:90
a16z 的讨论认为,推理需求、智能体应用和企业采用仍处较早阶段,算力、电力与数据中心供给可能在较长时间里追不上需求。即使市场担心基础设施泡沫,物理建设周期也不会因为软件进步立刻缩短。
访谈把训练、推理、数据中心回报、融资、开放模型和芯片生态放在一起。需求是否持续,要看 AI 能否进入企业流程并产生可计价结果;供给能否扩张,则受到电力、建设、融资和供应链共同约束。
这是一组投资判断,不是已被验证的供需定律。产品团队可以留下更直接的问题:推理成本下降后使用量会增加多少,资源紧张时哪些任务优先,以及多模型编排能否在质量与成本之间形成稳定控制。
实现病理基础模型的大规模实用化
来源:Microsoft Research Blog · BestBlogs 评分:85
微软研究院推出 GigaPath Flash 和 GigaTIME Flash,用蒸馏降低病理基础模型的计算与内存门槛。官方材料称,两种模型在保留大部分原始性能的同时,计算需求降低 50 倍,内存占用减少 8 倍。
更高效率意味着研究团队可以在更大患者队列上重复分析,研究疾病生物学、标志物和临床结果。模型面向研究用途,尚未被验证用于诊断、预后、治疗选择或其他患者护理决策,不同扫描设备、机构和人群上的表现也可能变化。
这项工作的价值在于把基础模型从单次高成本展示推进到可重复实验。医学 AI 的规模化不只需要更强性能,也需要让更多机构能够负担计算、运行对照并复核结果。
补充阅读
• AI 聊天机器人中,从按下回车到第一个单词之间发生了什么?(来源:ByteByteGo Newsletter)
用户按下回车后,系统要经历上下文准备、安全检查、分词、请求路由和并行处理,才开始生成第一个词。首词延迟因此是整条服务链路的结果,优化模型推理只是其中一环。
• AgentOps 不是 MLOps:当代理进入生产时,你的监控栈会出什么问题(来源:Towards Data Science)
传统 MLOps 更擅长观察单次预测,智能体却可能在多步轨迹中累积错误,并对相似输入给出不一致结果。文章提出围绕执行轨迹建立监控,让团队看到错误从哪一步开始放大。
• 引入自适应智能:破坏所有机器人攻击的经济基础(来源:The Cloudflare Blog)
Cloudflare 推出基于机器学习的自适应智能,持续分析流量模式,区分正常用户与恶意机器人。防御目标不仅是识别一次请求,也包括提高攻击者持续绕过规则的成本。
• 为什么 RAG 复杂度应该被证明是必要的(来源:Towards Data Science)
文章主张从词汇检索、混合搜索和简单流程开始,只有现有方案被证明不足时,再加入代理式检索等复杂结构。每增加一层组件,都应对应一个可测量的检索问题。
• 我用 Claude Cowork 搭建了一套让 PM 一天完成一周工作的系统(来源:How I AI)
一位产品经理把 Claude Cowork 用于计划工作、收集反馈和保存个人决策规则。案例的启发在于长期上下文怎样沉淀工作习惯,而非把一天完成一周简单理解为通用效率倍数。
• 把你关心的变成专栏:谈谈 BestBlogs 3.0 的一些思考(来源:Gino Notes)
BestBlogs 3.0 尝试让用户把电影、书籍、音乐等兴趣变成稳定专栏,由系统持续寻找、筛选和整理内容。它把个性化从一次推荐推进到可长期维护、能持续获得新内容的阅读主题。
• 在边缘运行 AI:直接在浏览器中运行实际工作负载(来源:InfoQ)
文章讨论在浏览器本地运行转录、实时视频处理和交互式数据分析。端侧推理可以改善隐私和响应速度,但模型大小、设备差异与更新成本仍需和云端方案一起权衡。
• Scott Jenson 谈桌面操作系统演进、本地优先与智能 UX(来源:InfoQ)
这篇访谈主张用本地优先架构和上下文感知界面重新思考桌面系统。AI 如果更了解用户正在处理的资料,就更需要清楚的权限、可见状态和不依赖网络的基本能力。
• Amazon Bedrock:用企业数据构建多租户智能体聊天应用(来源:AWS Artificial Intelligence)
AWS 给出多租户文档聊天参考架构,覆盖数据摄入、索引生命周期、用户级隔离与生产扩展。它提醒企业把租户边界贯穿存储、检索和生成全过程,而不只在界面层区分账号。
• FAQ as RAG: When You Get to Design the Corpus(来源:Towards Data Science)
当团队能够主动设计 FAQ 语料库时,RAG 的工作重点会变化:解析变得简单,检索更像缓存,少样本提示也可以转化为检索问题。高质量语料设计有时比增加检索组件更有效。
延伸探索
模型与平台更新集中在两个方向。一类扩展可用范围,如 Foundry Model Router 增加区域并更新模型池;另一类探索新交互与多模态形态,如 Runway 的界面世界模型、DeepSeek 的视觉模型,以及近期模型与芯片综述。阅读时可分别观察真实部署与厂商自测,避免把发布声量直接等同于产品成熟度。
Agent 工程内容更关注质量如何积累。GBrain 记忆评估、机器人数据管道、自动化测试、模块划分与工程熟练度,都在提醒团队:生成速度提高后,评测集、反馈记录、数据质量和可维护结构会变得更重要。AI 可以承担更多执行,人仍需定义基准并判断失败是否值得保留。
端侧与新入口提供了另一条线索。本地鸟类识别、浏览器推理、自动驾驶载客测试、界面世界模型和计算机使用智能体,把 AI 从聊天框带到设备、环境与操作系统。它们带来更直接的实时价值,也让隐私、传感器质量、物理安全和责任归属进入产品设计。
商业与职业变化则横跨算力合作、独立开发机会、常驻 AI 同事和 Agent 商业化讨论。模型与工具不会自动形成收入,团队仍需回答谁愿意持续付费、利益怎样分配、人在自动化流程里承担什么责任。对于个人,熟练度与判断力也需要通过实践继续积累。
今日小结
回顾今天的内容,OpenClaw 把智能体的成长落到低门槛上手、上下文延续和多人交接;应用公司要把模型、场景与流程组织成可复用结果;ClickHouse 则把并发、成本、身份与权限纳入基础设施。三层共同决定一次能力展示能否变成长期系统。
如果时间有限,产品团队可以先读 OpenClaw 与应用护城河两篇,基础设施团队重点看 ClickHouse,再用 DoorDash、AgentOps 和编码模型评估补齐运行条件。研究团队则可从 AQuA 与病理模型两篇观察验证边界和计算效率。
你更看好长期价值先在产品体验、结果交付还是基础设施治理上兑现?当智能体可以跨系统执行任务时,你所在的团队最缺的是上下文、评估、权限还是单位经济?欢迎分享实践、反例和仍未解决的问题。
👉 近期早报
• BestBlogs 早报 · 2026-08-31
• BestBlogs 早报 · 2026-08-30
• BestBlogs 早报 · 2026-08-29
• BestBlogs.dev 第 110 期:新的稀缺
• BestBlogs.dev 第 109 期:程序员的职业未来
• BestBlogs.dev 第 108 期:智能的执行层
BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。