早报:GEO仪表盘陷阱、阿里AI Agent发布实践、腾讯大仓AI工程化

ginobefun · @hongming731 · X·2026-07-08 07:24·54天前
AI 导读

本期早报聚焦三个议题:①GEO仪表盘在AI搜索时代高度随机(相同问题重复问结果一致率低于1%),采样常用API而非真实产品,建议团队优先修正源网页、确保Bing索引与搜索爬虫访问,而非购买昂贵仪表盘。②阿里技术分享AI Agent参与研发的CI/CD实践:数十万行Go代码、上百真实API冒烟用例、近三千行CI配置,30天内几乎每日发版;通过覆盖率门槛(>75%)、动态冒烟测试(AI生成测试SPEC+CI历史反馈+重试限制)、灰度与人工审核建立可信发布链路。③腾讯技术工程展示大仓(30+微服务、10+前端微应用)中AI从需求到交付的全链路:要求AI读取PRD、对齐方案、跑接口测试、补门禁脚本,将工程纪律而非模型能力作为核心。

ginobefun@hongming731
51AI 编辑部评分,满分 100

早报:GEO仪表盘陷阱、阿里AI Agent发布实践、腾讯大仓AI工程化

2026-07-08 07:24· 54天前
AI 导读

本期早报聚焦三个议题:①GEO仪表盘在AI搜索时代高度随机(相同问题重复问结果一致率低于1%),采样常用API而非真实产品,建议团队优先修正源网页、确保Bing索引与搜索爬虫访问,而非购买昂贵仪表盘。②阿里技术分享AI Agent参与研发的CI/CD实践:数十万行Go代码、上百真实API冒烟用例、近三千行CI配置,30天内几乎每日发版;通过覆盖率门槛(>75%)、动态冒烟测试(AI生成测试SPEC+CI历史反馈+重试限制)、灰度与人工审核建立可信发布链路。③腾讯技术工程展示大仓(30+微服务、10+前端微应用)中AI从需求到交付的全链路:要求AI读取PRD、对齐方案、跑接口测试、补门禁脚本,将工程纪律而非模型能力作为核心。

http://x.com/i/article/2074634521807601664

BestBlogs 早报 · 07-08|从 GEO 仪表盘的测量陷阱,到 AI Agent 发布信任,再到模型内部工作空间

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。

在线阅读:https://www.bestblogs.dev/explore/brief/2026-07-08

导语

今天的早报先从一个很现实的问题开始:AI 搜索时代,很多看起来精确的仪表盘其实未必能指导业务。接着看两篇来自阿里和腾讯的工程实践:当 AI Agent 参与真实研发,团队真正需要补上的不是更多提示词,而是门禁、验证、反馈和可审计的交付流程。

今天的 BestBlogs 早报,我们从三个问题展开。

第一个问题,是 AI 搜索时代的测量焦虑。很多团队开始购买 GEO 仪表盘,想知道自己的品牌有没有出现在 ChatGPT、Claude 或其他搜索 Agent 的答案里。但今天第一篇文章提醒我们,很多看起来很精确的数字,并不一定能回答真正的业务问题。

第二个问题,是 AI Agent 参与研发之后,代码到底敢不敢发。阿里技术和腾讯技术工程分别给出了一套真实生产环境里的做法。它们的共同点不是让模型更自由,而是把门禁、验证、反馈和人工卡点做成可审计流程。

第三个问题,是模型自身的行为。Anthropic 在 Claude 里观察到类似全局工作空间的内部模式,Liquid AI 则用一种更定向的训练方法处理推理模型里的重复循环。今天的主线其实很一致:AI 已经进入真实业务和真实工程,接下来要补的是可验证的机制。

★ 精讲 1|GEO 仪表盘的测量陷阱

称量烟雾:为什么GEO仪表盘基本无用 — Better Than Good. 来源:Hacker News 阅读全文

GEO 仪表盘正在成为 AI 搜索时代的新焦虑入口,但文章用多项研究和行业案例指出:品牌在 ChatGPT、Claude 等回答里的排名高度随机,很多指标既没有真实查询量,也缺少业务转化验证。它更适合作为今天的第一条,因为它提醒团队把注意力从昂贵仪表盘转回可验证的基础工作。

第一条精讲,是一篇名为称量烟雾的 GEO 仪表盘文章。

GEO,也就是面向生成式搜索的可见度优化,最近变成了一个很热的市场。很多工具会每天跑一批提示词,统计某个品牌在 AI 回答里出现的比例,再给出趋势线、排名、置信区间。听起来像是把搜索排名时代的那套仪表盘,平移到了 ChatGPT 和 Claude。

但文章的核心判断是,这类仪表盘常常是在称量烟雾。它们能给你一个数字,却未必能说明这个数字代表什么。

原因有几层。首先,搜索 Agent 的回答本来就高度随机。文中引用的研究里,六百名志愿者在 ChatGPT、Claude 和 Google 的 AI 系统里运行十二类品牌推荐提示,一共接近三千次。同一个问题重复问,得到完全相同列表的概率低于百分之一;连顺序都相同的概率接近千分之一。也就是说,所谓 AI 排名本身就不是一个固定位置,更像一个分布。

其次,很多工具采样的并不是用户真正使用的产品。它们为了便宜和可脚本化,常常去调模型 API。但 API 里的模型,不等于真实的 ChatGPT。真实产品有系统提示、记忆、账户上下文、模型路由、搜索 fan out,以及不同套餐的差异。你在一个没人真正逛的展厅里做了几百次神秘顾客调查,得到的置信区间再漂亮,也可能和真实顾客无关。

第三,所谓提示词搜索量也很难成立。传统 SEO 至少有关键词搜索量这个基础,因为大量用户真的会输入相似的词。但 Agent 时代的提示词更长、更碎、更会话化,而且主要平台并不公开完整查询日志。很多所谓 AI 提示词搜索量,本质上是用点击面板、Google 关键词反推,或者供应商自己定义的篮子去估算。

这篇文章没有说完全不能测。它提出了一个更窄的信号:不要测排名,先测 consideration set,也就是模型在回答某类问题时会不会把你放进候选集合。这个信号也需要六十到一百次运行才粗略稳定,但至少比单次排名更接近事实。

对实际团队来说,文章给出的建议很朴素。修正源网页上的错误信息,确保 Bing 索引和 IndexNow 做好,允许 OpenAI 的搜索爬虫访问,提供服务端渲染的静态 HTML,争取第三方引用,然后读自己的服务器日志。也就是说,与其买一个昂贵但未必有效的仪表盘,不如先把机器真正会读取的基础设施做好。

这条适合作为今天第一篇,是因为它提醒我们:AI 相关的焦虑很容易被包装成新工具,但工具能不能产生判断,还是要回到数据来源、采样对象和业务结果。

★ 精讲 2|AI Agent 代码发布信任

从「不敢发」到「天天发」:AI Agent 时代的 CI/CD 生存指南 来源:阿里技术 阅读全文

阿里技术这篇把 AI Agent 写代码后的发布信任问题讲得很具体:数十万行 Go 代码、数百个命令、上百个真实 API 冒烟用例和近三千行 CI 配置,如何支撑最近 30 天几乎每个工作日发版。它的价值不在理念,而在把分层门禁、动态冒烟、CI 历史反馈和灰度 telemetry 变成可审计流程。

第二条精讲,是阿里技术的 AI Agent 时代 CI/CD 生存指南。

文章一开始给了一组很具体的数据。a1 CLI 是一款统一研发命令行工具,有数十万行 Go 代码、数百个命令定义、上百个真实 API 冒烟用例,十余条 CI 流水线加起来近三千行 pipeline YAML。日均活跃用户数万,周调用量数亿次。最近三十天,它几乎每个工作日都发布一个版本。

这不是 Demo,也不是只给内部小团队试用的玩具。问题也因此变得更现实:当 AI Agent 深度参与代码生成、测试生成和工作项分析,每次 Agent 提交一个 MR,团队到底敢不敢直接发到生产环境。

文章的答案不是相信模型,而是建立多层防线。

第一层是代码准入。单元测试和 E2E 覆盖率是基础底线,覆盖率低于百分之七十五直接阻断。第二层是真实 API 的全量冒烟测试。这里很关键,它不是 mock 测试,而是并行调用真实平台 API,通过命名隔离保证资源互不冲突。接口契约、权限模型、真实环境里的副作用,很多只能在这里暴露。

第三层是文档同步和测试清单一致性。改了命令或 flag,就必须同步更新文档站。新增命令却没有登记到冒烟清单,也会被拦下。第四层是命令下线规范检查。下线比新增更容易破坏用户脚本,所以必须保留废弃入口、下线测试覆盖、文档移除和命令树引导。

真正有意思的是动态冒烟测试。AI Agent 改了一个命令,已有测试未必覆盖到这个未知区域。阿里的做法是让 AI 自己生成测试 SPEC 来验证 AI 的代码变更,但不是让它自由发挥。系统会基于 git diff 找到受影响命令,把 help 文本、surface diff 和上下文塞进 prompt,再要求模型输出符合 JSON schema 的测试用例。输出之后还有 stop hook 校验,最多重试三次,避免无限自愈循环。

它还设计了 CI 历史反馈。Agent 本身没有记忆,如果第一次动态冒烟失败,第二次很可能犯同样的错。于是流水线会抓取同一 commit 上一次失败的日志,把失败证据注入 prompt,让下一轮生成更有针对性。这里的关键是 soft skip:如果获取历史失败,不能阻塞发布,只写 unavailable 兜底。

后面的发布链路同样强调真实数据。通过 beta 灰度、人工审核、telemetry 分析、异常时二次人工卡点,再自动打 release tag。并且正式 tag 必须指向 beta 验证过的同一个 commit,避免中间有人推新代码,让验证对象和发布对象不一致。

这篇文章的价值在于,它把 AI 随机性当成工程输入,而不是当成信仰问题。AI 可以参与生产代码,但前提是每一步都有证据、门禁和逃生舱。

★ 精讲 3|大仓 Harness 工程化实践

从 Vibe Coding 到 Harness—— 一套大仓 AI 工程化实战 来源:腾讯技术工程 阅读全文

腾讯技术工程这篇从另一个角度补上 AI 工程化全链路:在 30 多个微服务、10 多个前端微应用的大仓里,AI 不能只会写代码,还要读 PRD、对齐方案、跑沙箱接口测试、补门禁脚本并交付 MR。它和阿里 CI/CD 一起构成今天更聚焦的主线:AI 研发不是模型能力秀,而是工程纪律。

第三条精讲,是腾讯技术工程的 Vibe Coding 到 Harness 实战。

这篇和上一条形成了很好的互补。阿里讲的是 CI/CD 里的发布信任,腾讯讲的是一个真实大仓里,AI 如何从需求一路走到交付。

文章的背景是 TAB 实验平台。它不是一个单仓库小项目,而是超过三十个微服务、十多个前端微应用,还有各平台 SDK 和少量 Python 工具链。一个看上去只有一行的需求,可能会牵动三个子仓库、五个协议字段、八个服务方法、十二个单测和两条接口测试。

团队真正遇到的痛点也不是模型不会写代码。文章说得很直接:PRD 不能被信任,方案对不上代码,改完没人验证,交付环节碎成一地。产品一句话说加个白名单删除,删除后会不会触发下游回收,接口是否幂等,灰度怎么处理,没人知道。AI 如果只负责把这句话变成代码,风险反而更大。

所以他们搭的 Harness,不是为了让 AI 看上去更聪明,而是为了让 AI 在这个工程里稳定、规范、可审计地把事情做对。

第一步是 SPEC First。先和团队磨出完整的全链路产研流程技术设计文档,把目标拆成 PRD 质量、需求分析、自动实现和集成验证,也把 AI 能做什么、必须人介入什么划清楚。没有这份 SPEC,后面的工具会搭歪。

第二步是把很多自然语言规则下沉成 Skill 和脚本。比如数据访问层必须用 GORM,错误必须用统一错误码,服务层和数据访问层覆盖率有明确底线,任何写操作必须走事务切面。能判定的规则,就不要只写在提示词里,而是变成 lint、门禁和覆盖率脚本。

第三步是缩减 Agent 角色。最终他们只保留需求 Agent、方案 Agent、开发 Agent 和代码审查 Agent,再加一个总控 Agent 调度流程。流程调度、跑门禁、跑测试、提 MR 这些确定性工作,不单独包装成角色,而是下沉到脚本。文章里有一句判断很实用:能写成 bash 的,就别让 Agent 跑。

第四步是十三个阶段的 workflow。从初始化、需求分析、需求确认、技术方案、方案评审、分支准备,到开发、集成测试、代码审查、验收和交付收尾。每一棒交什么、下一棒接什么、失败打回哪里,都写清楚。

这篇文章值得和阿里的 CI/CD 一起看。它们共同说明,AI 研发的核心不是纯 Vibe Coding,也不是把所有上下文都扔给模型。真正可靠的做法,是把需求、方案、代码、测试和交付变成一条有检查点的接力赛。

速览

接下来快速看今天另外七条。

第四条,Simon Willison 发布 sqlite-utils 4.0。这个版本加入数据库 schema migration、嵌套事务、复合外键等能力,也包含一些破坏性变更。值得注意的是,作者提到 AI 助手帮助他提升了版本质量。这条适合关注个人开发者工具和小型数据库工作流的同学。

第五条,Anthropic Research 发布语言模型中的全局工作空间。研究人员在 Claude 中观察到一小组内部神经模式,被称为 J space,行为上类似共享工作空间。它可以支持可报告、可控、灵活的内部推理。放在今天的脉络里,它回答的是模型内部可能如何组织思考。

第六条,阿里云开发者分享 Loop Engineering 实战。文章基于诊断系统的生产实践,讲从日志扫描到预发部署的全自主闭环。它不是只让模型给建议,而是把日志扫描、定位、修复、预发验证串成连续流程。原文给出的结果包括问题总量下降百分之九十六,同类问题修复时间从四十八分钟降到十五分钟,人工介入次数降为零。这条更偏生产运维和自动修复,也说明 AI 运维要靠闭环数据,而不是一次性脚本。

第七条,字节跳动 Seed 发布 EdgeBench。它是一个面向真实世界环境学习的超长程评测集,关注 Agent 在长周期任务里能不能真的从环境反馈中变好,而不只是完成单步推理。文章观察到 Agent 学习表现符合高精度 log sigmoid 曲线,并且学习速度约每三个月翻一倍。对关心 Agent 长程评测的人,这条值得跟。

第八条,Liquid AI 发布 Antidoom。它用 FTPO 处理推理模型里的重复循环。原文报告,在早期 LFM2.5 2.6B 检查点上,循环率从百分之十点二降到百分之一点四;在 Qwen3.5 4B 上,从百分之二十二点九降到百分之一。这和 Anthropic 那篇一起看,是今天的模型行为线索。

第九条,Sequoia Capital 访谈 Zipline。它不是简单讲无人机配送,而是拆开客户需求、安全工程、监管协作、垂直整合和硬件经济模型,解释为什么一套自动化物流基础设施能长期运转。

第十条,Schneider Electric 分享如何用 LangSmith 建 LLMOps 基础。重点在可观测性、评估和部署,以及一个大型企业在部署六十多个 AI 产品之后形成的经验。它提醒我们,企业级 AI 产品不是上线一个聊天框就结束,后面还有持续评估、问题追踪、版本演进和跨团队协作。这条和今天的 AI 工程化主题也有直接呼应。

sqlite-utils 4.0 发布,引入数据库模式迁移功能

Simon Willison 发布 sqlite-utils 4.0,引入数据库迁移、嵌套事务、复合外键等新特性及破坏性变更,并在 AI 的辅助下显著提升了版本质量。

来源:Simon Willison's Weblog 阅读全文

语言模型中的全局工作空间

Anthropic 研究人员提出证据表明,Claude 已经发展出一小套内部神经模式("J 空间"),其功能类似于全局工作空间,能够实现可报告、可控且灵活的内部推理,这与自动处理截然不同。

来源:Anthropic Research 阅读全文

Loop Engineering 实战:实现从日志扫描到预发部署的全自主闭环

本文基于阿里云诊断系统的生产实践,详细阐述了如何构建从日志扫描到预发部署的全自主 Loop 闭环,使 ERROR 总量下降 96%、同类问题修复时间从 48 分钟降至 15 分钟、人工介入次数降为零。

来源:阿里云开发者 阅读全文

EdgeBench:衡量真实世界环境学习,发现新 Scaling Law

字节跳动 Seed 发布超长程评测集 EdgeBench,发现 Agent 在真实环境中的学习表现遵循高精度 log-sigmoid 曲线,且学习速度每三个月翻一倍。

来源:字节跳动Seed 阅读全文

使用最终 Token 偏好优化减少灾难循环 — Blog

Liquid AI 推出 Antidoom,这是一种利用最终 Token 偏好优化(FTPO)的有针对性的方法,用于消除推理模型中的退化重复循环(灾难循环),在早期的 LFM2.5-2.6B 检查点上将循环率从 10.2% 降低到 1.4%,在 Qwen3.5-4B 上从 22.9% 降低到 1%,同时改进了评估分数。

来源:Hacker News 阅读全文

走进 Zipline 的自治系统:从无人机配送到自动化物流基础设施

这是一场深入拆解 Zipline 自动化物流基础设施的访谈,展示客户需求、安全工程、监管协作、垂直整合与硬件经济模型如何共同把无人机配送变成一套完整运营系统。

来源:Sequoia Capital 阅读全文

施耐德电气如何使用 LangSmith 构建 LLMOps 基础

本文详细介绍了施耐德电气如何使用 LangSmith 构建企业级 LLMOps 基础,涵盖可观测性、评估、部署以及从大规模部署 60 多个 AI 产品中得出的关键经验。

来源:LangChain Blog 阅读全文

补充阅读

补充阅读里,还有几条值得顺手看看。

第一条,AI 炼金术聊纯 Vibe Coding 做大项目为什么容易塌掉。它和腾讯那篇主题接近,所以今天放到补充阅读,更适合作为延伸材料。

第二条,一篇数据科学文章讲在国际空间站中识别微生物。文章用宏基因组学和 Kraken2 工具解释 k mer 和 minimizer 的底层思路,偏数据科学和生物信息学。

第三条,kapa.ai 分享如何用一个小模型丢掉百分之六十八的 RAG 上下文,同时保持百分之九十六召回率,并把查询成本减少三分之一。这条对做技术文档问答和客服知识库的人很实用。

第四条,有人把 Linux 移植到了 Atari Jaguar 游戏机。它更像一次硬核复古工程记录,涉及内存限制、工具链和 uClinux。

第五条,一个五十亿参数模型只用视频和手柄输入,完整跑完一场 Rocket League 二对二比赛,没有显式物理或渲染引擎。它展示的是端到端世界模型在游戏环境里的进展。

第六条,是关于 AI 进入中国工厂现场的观察。文章提出 FDE,也就是现场部署工程师,强调 AI 落地不是把模型交给客户,而是围绕业务结果做交付。

第七条,SWE Marathon 讨论项目级编码智能体评测。编码 Agent 已经能在真实工程任务里消耗数亿 token 持续工作,但在连贯 ownership 和可靠验证上仍然不足。

• 纯 Vibe Coding 做大项目,一定会塌掉:AI创业者徐文浩深度拆解其团队如何搭建一整套工程化「Harness」,让AI Agent在大型项目中高效协作而不失控,并指出纯Vibe Coding必然崩溃,关键在于用机制而非人力去治理复杂度。 阅读全文

• 在太空中鉴定微生物:本文展示了如何利用宏基因组学和 Kraken2 工具在国际空间站上鉴定微生物,揭示了泡菜发酵细菌令人惊讶的存在,并解释了其中涉及 k-mer 和最小化子的底层算法。 阅读全文

• 我们如何教一个小型 LLM 抛弃 68% 的 RAG 上下文 - kapa.ai - 即时 AI 回答技术问题:Kapa.ai 在检索器和生成器之间添加了一个小型 LLM 剪枝器,在保持 96% 回召率的同时抛弃了 68% 的检索块,使查询成本减少了三分之一,仅增加了不到一秒的延迟。 阅读全文

• Atari Jaguar 上的 Linux。没错,是真的。:本文记录了作者成功将 Linux 移植到 Atari Jaguar 游戏机的完整过程,详细介绍了内存限制、工具链问题和启动过程等技术挑战,使用了 uClinux 和 XIP 技术。 阅读全文

• 神经网络在没有传统引擎的情况下玩完完整的 Rocket League 比赛:50亿参数的模型仅凭视频和控制器输入即可运行完整的 2v2 Rocket League 比赛,且不使用显式的物理或渲染引擎。 阅读全文

• 一个哈佛硕士在货代公司“装龙虾”后的顿悟:AI 根本进不去真实的中国工厂:本文通过哈佛硕士Lawted的亲身经历,揭示了AI在真实中国工厂落地难的现实,并提出了FDE(现场部署工程师)作为一种以业务结果为导向的AI交付新模式,详细阐述了其商业模式、定价策略与人才培养路径。 阅读全文

• SWE-Marathon:用项目级评测检验编码智能体的真实工程能力:Rishi Desai 介绍了 SWE-Marathon 这一项目级基准:编码智能体已经能在真实工程任务中消耗数亿 token 持续工作,但在连贯 ownership 与可靠验证上仍明显不足。 阅读全文

今日阅读路径

如果你只有十分钟,建议先读三条精讲:GEO 仪表盘帮助你校准 AI 搜索测量,阿里 CI/CD 和腾讯 Harness 两篇帮助你理解 AI 工程化如何落到真实流程。随后再看 Anthropic 与 Liquid AI 两条模型行为内容,把外部工程和内部机制连起来。

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,欢迎体验和关注我们。