# 持久化AI同事崛起：Maersk纠错与模型主权

- 来源：ginobefun (@hongming731)
- 发布时间：2026-08-31 08:30
- AIHOT 分数：47
- AIHOT 链接：https://aihot.virxact.com/items/cmtgin56a01w2rokd067zvhs4
- 原文链接：https://x.com/hongming731/status/2094221309911937380

## AI 摘要

OpenAI产品负责人Tara Seshan提出AI产品演进三阶段，最终形态是持久化AI同事——系统拥有独立运行环境、上下文和工具，异步工作后交回可检查结果。Maersk通过重写SOP为流程记忆、受限运行时和纠错循环，在九个月记录超100,000次修正，系统运行超200个实例。Factory CTO建议企业以任务级选型评估模型，关注结果成本与工作流可迁移性，而非仅看Token单价。

## 正文

https://x.com/i/article/2094217470567686144

BestBlogs 早报 · 08-31｜持久化 AI 同事重分工，Maersk 靠纠错运行，Factory 守模型主权

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容，如果你希望它基于你的兴趣和阅读习惯整理，可以体验「我的早报」。

导语

当 AI 能够在独立环境中持续执行任务，第二天交回一份可以检查的结果，团队的稀缺能力会发生什么变化？今天的三篇精讲从个人工作、全球生产系统和企业模型战略三个层次回答这个问题。

OpenAI 产品负责人把人的角色概括为从划船转向掌舵：AI 承担更多执行，人负责问题、假设、品味和责任。Maersk 展示了另一面，执行进入生产之后，需要把 SOP 改造成流程记忆，用受限运行时、共享轨迹和回放形成纠错闭环。Factory CTO 则追问，这些结果数据、成功工作流和持续学习最终由谁掌握。

这三篇可以形成一套检查框架：个人是否会掌舵，系统是否能纠错，企业是否可迁移。若时间有限，先读 Maersk 的生产蓝图；若正在重新设计个人或产品团队的工作方式，从第一篇开始；若在做模型采购、平台架构或成本治理，第三篇提供了更直接的决策问题。

★ 精讲一：AI 的第三个时代：持久化 AI 同事崛起 | OpenAI 产品负责人 Tara Seshan

来源：Lenny's Podcast · BestBlogs 评分：92

这场访谈把 AI 产品的演进分成三个阶段。第一阶段是聊天界面，用户问、模型答；第二阶段是智能体，模型可以按指令完成一段任务；第三阶段是持久化 AI 同事，系统拥有自己的运行环境、上下文和工具，可以异步工作，再把产物交回给人。

这个变化的意义，不只是任务持续时间变长。一次对话要求人把问题压缩成即时请求，持久环境则允许任务保留状态，等待外部结果，并在多个步骤之间延续目标。衡量标准也随之改变：不再只看某次回答是否聪明，而要看系统能否交付可检查的完整结果。

访谈中最有记忆点的比喻，是从划船转向掌舵。划船者亲自完成每个动作，掌舵者要先识别决定成败的问题，形成足够尖锐的假设，再把假设变成可以测试的产物。产品经理的工作因此更接近持续实验，而非在变量快速变化的市场里追求一份看似完备的长期推演。

临时网站、交互原型和数据可视化是这种工作方式的具体载体。与其在演示稿中描述用户可能如何反应，不如让 AI 快速做出可触碰的工具，用真实反馈修正方向。这里的速度并非为了多产出页面，而是为了缩短假设与证据之间的距离。

访谈还解释了 Codex 与 Work 的产品关系：二者可以共享底层执行引擎，但 Work 去掉面向开发者的界面，把持久执行适配到知识工作。软件开发天然拥有测试、编译和运行结果等反馈信号，知识工作往往缺少同样明确的验证机制，因此更需要人在任务入口写清意图，在交付节点判断质量。

写作也被分成两类。汇报型写作是把已有信息整理给别人，适合让 AI 承担更多工作；思考型写作则通过组织语言发现矛盾、形成取舍，本身就是推理过程。若把后者完全外包，人可能得到一份流畅文档，却失去形成判断的过程。

这是一位产品负责人的实践观察，而非行业统一路线。它仍提供了可立即验证的分工方法：把整理、格式转换和原型执行交给 AI，同时由人写清假设、验收标准和最终取舍。关键发现是，效率提升并不意味着减少思考，而是让思考更快接触实验与反馈。当这种协作进入关键业务，下一步就要回答 Maersk 面对的问题：怎样让掌舵变成可观察、可回放、可纠错的生产系统。

★ 精讲二：Maersk 如何让 AI 智能体在全球航运中可靠运行

来源：AI Engineer · BestBlogs 评分：90

Maersk 的报告从航运异常开始。表面上，一次运输像一条线性流程；实际上，订舱、文件、港口、运输和多个遗留后台是并行运行的状态机。只要一处状态与其他系统不同步，常规路径就会中断，专家必须跨系统处理长尾异常。

这解释了为什么演示里的智能体循环不足以支撑生产。容易自动化的常规步骤通常已被传统软件覆盖，剩下的是规则不完整、系统速度不同、地区术语各异的复杂问题。智能体必须理解业务意图，还要在权限和工具边界内完成动作，并给出成功证据。

团队首先重写了 SOP。传统操作手册常由截图和点击说明组成，它告诉人界面上要做什么，却没有明确表达机器执行所需的前置条件、决策规则、业务标识符、后端调用、结果校验和恢复路径。把这些要素结构化之后，SOP 才从阅读材料变成可执行的流程记忆。

整个架构可以拆成三层：保存业务知识的流程记忆、约束工具和权限的运行时，以及捕获专家反馈的纠错循环。流程记忆持续吸收国家和业务线之间的差异；运行时限制智能体可以触达的系统；纠错循环则把一次失败变成下一版规则、工具或恢复路径。

报告提到系统运行超过 200 个实例。由于需要等待多个遗留系统，单次执行的延迟可能从数分钟延长到 10 分钟。这个数字提醒团队，智能体的端到端速度受最慢依赖约束，简单提高模型生成速度，并不能消除后台系统、权限审批和专家复核造成的等待。

团队在九个月里记录了超过 100,000 次修正。这里的数字指纠错记录，并非成功任务数或质量提升比例。共享轨迹让专家与工程师查看同一份执行证据，失败聚类把大量个案整理成可行动的类型，轨迹热力图则显示智能体在哪些步骤反复犹豫。

回放机制尤其值得借鉴。团队会在关闭写权限的真实案例上重放执行，比较修改前后的行为，而不让测试改变生产数据。专家的一句意见只有被转换成流程记忆、校验规则或工具变更，才算完成纠错；否则它仍是一条难以复用的个人经验。

Maersk 的蓝图可以浓缩成五个动作：让工作可表示，让执行有边界，让行为可观察，让纠错足够便宜，让改进能够复利。真正可持续的资产不是一次成功调用，而是失败留下的证据和可执行修正。它把第一篇的人类掌舵落实为组织系统，也把问题推向第三篇：这些轨迹、结果和学习由谁持有，供应商变化时能否继续使用。

★ 精讲三：美国企业该不该采用中国开源模型？Factory CTO 解析 AI 商业化与模型主权

来源：20VC with Harry Stebbings · BestBlogs 评分：90

这场访谈从美国企业是否应采用中国开放模型出发，但更有用的部分，是把产地争论还原成任务级选型。Factory CTO 建议企业对所有模型提出同样的问题：创作者的偏好和限制可能影响什么，这个模型是否适合眼前任务，如果它在六到十二个月后消失，系统能否切换。

这套方法避免用单一标签代替评估。模型来自哪里仍可能影响政策、安全和使用范围，涉及国家安全等敏感任务时，必须遵守适用政策并进行独立安全评估。对于一般企业任务，判断则应继续落实到数据如何处理、输出如何验证、任务能否完成，以及迁移成本由什么构成。

成本口径是第二个重点。Token 单价更低，不等于完成结果更便宜。访谈以代码审查为例：高单价模型若一次产出可接受结果，完整成本可能低于需要多轮提示、重试和人工修订的便宜模型。企业应合并计算模型费用、人工复核、失败重跑和等待时间。

这种结果成本也改变了资源分配方式。与其按个人分配 Token 配额，更合理的做法是围绕项目和结果估算投入，再检查花费是否换来了预期交付。它与 Robotaxi 的单位经济、Ironclad 的可信吞吐量形成呼应：输入成本只是局部变量，系统是否有效要看结果质量和全部配套开销。

更深一层是 harness，也就是包在模型外面的工作系统。它保存任务状态，负责模型路由、工具调用、验证和反馈，并把成功做法沉淀成可复用流程。模型更新很快，企业真正能够持续积累的是结果数据、评估标准、修正记录和工作流。

这也是模型主权的实际含义。接入多个模型只是起点；如果任务状态、工具接口和验收标准仍被某个供应商锁定，切换模型名称不会自动带来选择权。相反，企业若保存成功和失败的证据，并用同一套评估重新验证不同模型，就能在能力、价格或政策变化时保留议价空间。

访谈对开放模型未来占比、模型实验室竞争和中国模型风险的讨论包含个人判断，不宜写成 Factory 官方政策或美国企业共识。但它提出的四问框架足够实用：任务是否适配，完整结果成本是多少，创作者限制是否改变输出，半年或一年后能否连同工作流一起迁移。

把三篇合在一起，个人的目标与品味决定方向，组织的轨迹与修正积累可靠性，企业持有的数据与工作流保留选择权。持久 AI 的优势很少只来自某个模型名称，更可能来自团队能否持续设定方向、验证结果、编译经验，并在供应商变化时带着这些能力迁移。

速览

下面七篇把同一套判断扩展到安全、数据质量、产业经济、法律责任、代码边界、开发协作和游戏生产。每篇都先回答发生了什么，再提炼一个可以带回自己系统的问题。

为消费者金融数据打造隔离式 AI 堡垒：Rachna Srivastava 的可辩护架构

来源：AI Engineer · BestBlogs 评分：90

加州金融监管机构提出一套用于消费者金融欺诈调查的隔离式 AI 架构。系统把数据接入、处理和推理分开，目标不仅是阻止数据泄漏，还要让涉及消费者权益的判断可以复现，并能在法庭环境中说明依据。

设计使用硬件支持的加密、单向数据通道和不可篡改记录。数据能够沿批准方向进入分析环境，推理过程与每次决定则留下完整证据。安全由物理隔离、密码学和数据流共同保证，而不是依赖一项容易被后续配置改动削弱的软件开关。

它与 Maersk 的共享轨迹共同说明，高风险 AI 的可靠性首先是证据工程。团队可以用一个直接问题检查现有系统：能否重放某个结论从原始数据、模型处理到最终行动的全过程，并让独立审查者得到相同的事实链。

RAG 中的噪声文本：拼写错误、OCR 和经典拼写检查的局限

来源：Towards Data Science · BestBlogs 评分：91

RAG 系统面对的噪声并不只有用户拼错单词。快速输入和语音转写可能破坏词边界，OCR 会混淆形近字符，文档本身也可能带着历史错误。查询与资料任一侧出现偏差，都可能让字面检索错过正确内容。

经典拼写检查适合发现孤立错误，却难以处理词边界变化和依赖上下文才能判断的误拼。基于嵌入的方法能在语义空间里寻找相近表达，因此更适合承担后一道容错，但仍需要用真实噪声样本评估召回与误匹配。

检索质量应当按噪声来源分层治理，而不是只盯最终回答。这与流程记忆的要求一致：输入表示若不稳定，后面的模型再强也会建立在错误证据上。值得建立一套包含查询错字、转写错误和 OCR 错误的测试集，分别观察召回变化。

Robotaxi 经济学 2026：扩展至 40,000 辆车的数学逻辑

来源：DEV Community: machinelearning · BestBlogs 评分：85

文章根据二零二六年上半年公开数据判断，中国 Robotaxi 的瓶颈正在从算法能力转向车队单位经济。Pony.ai 与 WeRide 已经产生显著收入，但车辆折旧、远程安全支持和利用率，让一次乘车可运行与整家公司可盈利之间仍有距离。

文章列出的数据包括 Pony.ai Robotaxi 服务收入增长 534%，达到 2,064 万美元，但六个月仍亏损 9,886 万美元；WeRide 收入增长 73.3%，亏损约 1.16 亿美元。这些数字来自文章汇总，价值在于呈现收入增长与公司盈利之间的结构性缺口。

这与模型选型里的完整结果成本是同一类提醒：局部能力成立，不代表系统经济成立。下一阶段应把每车利用率、远程支持负担和资产折旧放在同一张表中，观察规模扩大究竟摊薄成本，还是同步放大运营复杂度。

ALDI 前员工将 AI 用作「准法律顾问」的行为遭到谴责

来源：Hacker News · BestBlogs 评分：85

澳大利亚公平工作委员会报告称，案件近期增加 40%，部分增长与自辩诉讼人使用生成式 AI 有关。一名前 ALDI 员工依据错误的 AI 建议推进解雇争议，委员会认定案件缺乏实质成功可能，并判其承担 1,230 澳元法律费用。

委员会计划从十月二十日起要求申请人披露 AI 使用情况，并已提供面向依赖 AI 的诉讼人的模板。该案例也显示，多问两三个智能体并不会自动形成专业复核；同源模型可能重复相似错误，程序规则和证据要求仍需由当事人承担。

AI 降低了采取法律行动的门槛，却没有转移最终责任。它把第一篇的人机分工落到高后果场景：越容易生成一份看似完整的材料，越要明确谁核验法律依据、谁判断胜算，以及谁为提交行为负责。

Flowise 漏洞揭示 JavaScript 展开运算符的批量赋值风险

来源：HackerNoon · BestBlogs 评分：89

__XPOSTER_98g8c_IMAGE_7__

Flowise 的 CVE-2026-69258 展示了一个普通 JavaScript 写法如何突破 AI 工作流边界。未受保护的对象展开把攻击者控制的字段写进执行上下文，使聊天 ID、会话历史等本应由服务端管理的属性可能被覆写，而且入口无需认证。

问题的危险之处在于，整体展开会自动接纳未来新增字段。修复不应只屏蔽当前已知属性，而要显式列出允许进入系统的字段，并沿参数从请求、控制器到执行层的全部传播路径保持一致校验。

智能体权限最终会落到这些看似普通的数据结构操作上。它与金融隔离架构形成尺度对照：无论系统多大，可信边界都要能回答哪些数据由用户控制、哪些字段影响权限。一次全库搜索对象展开与合并位置，可能比再加一层提示词约束更有价值。

AWS 开源 Kiro Crew，用于异步编码代理

来源：InfoQ · BestBlogs 评分：85

AWS 开源 Kiro Crew，让多个编码代理跨会话、工具和任务异步运行。开发者可以委派事件调查、工单分类、迁移和拉取请求监控，然后离开当前会话；代理继续工作，之后交回结果供人审查。

系统组合了共享记忆、可复用技能、定时任务、并发代理以及外部工具集成。它原先在 Amazon 内部以 MeshClaw 名称开发，报道引述的内部采用规模超过 39,000 名开发者；这一数字来自项目方陈述，更适合作为使用背景，而非独立效果证明。

Kiro Crew 把持久化 AI 同事落到了开发工作台，但决定价值的不是同时运行多少代理。更好的验收问题是：人回来时能否看到可审查结果、清楚轨迹和继续推进所需的上下文。这与 Maersk 的生产闭环相连，也为多代理系统划出了先做单体可靠性的顺序。

AI 在游戏产业落地到什么程度了？

来源：晓辉博士 · BestBlogs 评分：87

这期视频以科隆游戏展开发者大会为线索，观察游戏 AI 从单点生成工具进入生产管线和交互玩法。行业评价标准正在从演示是否惊艳，转向内容能否编辑、能否接入主流引擎，以及综合成本与稳定性是否满足生产要求。

视频以腾讯 Motus AI 的 3D 角色动画生成实践说明，静态角色还要经过骨骼、蒙皮、行为与多角色交互等环节，真正难点是让生成结果可预测、可修改并进入现有流程。游戏还提供高反馈、可控制的环境，用于训练智能体的规划、行动和因果推理。

它与 Maersk 的航运现场形成一虚一实的对照：智能体进步既需要真实流程，也需要能够反复试验和读取结果的环境。对游戏团队而言，值得优先观察的不是又生成了多少资产，而是生成内容进入引擎后的可编辑性、稳定性和反馈闭环。

补充阅读

• Box CTO Ben Kus：智能体基础设施的半衰期正在缩短（来源：AI Engineer）

智能体基础设施的半衰期已从数年缩短到数月。更持久的优势来自让团队、架构、评估和供应商选择都能根据证据常态化替换。

• Navan：智能体正处在微服务的 2015 年（来源：AI Engineer）

可靠的智能体系统应按分层生产平台建设：先打磨单智能体闭环，再按实际边界加入记忆、轨迹可观测性、策略控制和多智能体协作契约。

• 从刷 Token 到可信吞吐量：Ironclad 的 AI 工程治理方法（来源：AI Engineer）

AI 工程团队需要把 Token 成本与交付价值、治理护栏放在一起观察，并解决代码生成之后出现的评审和 CI 瓶颈，以提高可信吞吐量。

• 智能体网站：为每位访客实时生成个性化体验｜Carlos Sanchez，Adobe（来源：AI Engineer）

Adobe 正在构建根据访客意图、站内检索和低延迟模型动态调整的智能体网站。系统组合经批准的页面区块，而不是无约束地重新生成整站。

• Cloudflare 扩展 AI 搜索，让代理和开发者更易搜索自定义数据（来源：InfoQ）

Cloudflare AI 搜索把自定义数据的搜索与检索做成托管服务，支持代理集成和多模态搜索，并与其现有开发工具衔接。

• Gemini 3.5 Transcribe 发布：更精准的实时语音转写模型 · AIHOT（来源：AIHOT — 精选）

Google 推出面向实时语音转写的 Gemini 3.5 Transcribe，强调更低词错误率和延迟，并支持智能转录、函数调用与多语言处理。

• ScholarAgent：不仅仅是阅读研究，更是重现研究（来源：DEV Community: machinelearning）

ScholarAgent 从论文中提取实验方法、生成实现代码、在沙箱执行，再与原始数据比较，并允许人在关键步骤监督和批准，把论文阅读推进到可检查的重现实验。

• 在本地运行 Qwen3.8 27B：来自我的 Mac Studio 的实际数据 · AIHOT（来源：AIHOT — 精选）

作者在 Mac Studio M3 Ultra 上以 Q4KM 量化运行 Qwen3.8 27B，报告生成速度为每秒 14 tokens；虽然慢于前代，但 Token 消耗下降，使实际回答时间接近。

• OpenClaw：红过，爱过，散了（来源：量子位）

文章回顾 OpenClaw 从快速走红到热度下降的过程，并把变化归因于原厂编码代理增强，以及用户对安全、成本和维护负担的重新评估。

• 开源视频编辑工具 Diffusion Studio Editor，代码即文档的双向同步剪辑（来源：meng shao(@shao__meng)）

Diffusion Studio Editor 将可视化剪辑操作与代码文件双向同步，并提供波形分析、语音识别、帧捕获等命令行工具，让 AI Agent 能检查素材并修改可追踪的编辑状态。

延伸探索

智能体安全与自我改进是一组值得继续追踪的内容。相关材料覆盖智能体协同攻击复盘、Warp 用双 Skill 吸收人工审查反馈、Context Engineering 的模块化组织，以及 AI 时代如何用测试、规则文档和流程卡点保持代码可维护。共同问题是，反馈怎样进入下一次执行，而不是停在一次对话里。

模型与算力基础设施形成第二组路径，包括开放权重模型在本地 GPU 上的任务适配、近内存计算 CXL 设备、受限硬件上的推理与离线搜索工具，以及近期模型发布的部署取舍。阅读时可以把参数和排行榜放到一旁，优先比较内存需求、吞吐、任务质量和迁移成本。

开发工具与开源工程覆盖自然语言视频生产、自托管网站聊天、Shell 性能、Zig 编译器进展和实验性 Linux 驱动。它们看似分散，却都强调同一项工程价值：让系统的中间状态可见、可修改、可复现，方便人和 Agent 在同一份事实基础上协作。

商业与人物内容则从 AI 创业、投资经验、人机接口和传统行业变化提供另一种观察角度。它们适合用来思考成功后的组织能力、信任如何建立，以及技术变化如何进入真实市场。标题级材料里包含预测和行业传闻，阅读时应回到原始来源再形成判断。

今日小结

回顾今天的内容，Tara Seshan 把人机分工推进到持久化协作，Maersk 用流程记忆、受限运行时和纠错闭环回答生产可靠性，Factory CTO 则把模型选型落到结果成本、工作流归属和迁移权。三者共同组成会掌舵、能纠错、可迁移的判断框架。

如果只读一篇，生产与平台团队优先看 Maersk；产品经理和知识工作者先看第一篇的实验与写作分工；采购、架构和治理负责人可从第三篇的四问框架开始，再用 Robotaxi、Flowise 与 Ironclad 的材料补充成本和边界视角。

欢迎在评论区分享你的实践与问题：哪些任务已经可以交给持久智能体，哪些判断仍必须由人完成？当团队更换模型时，轨迹、评估和成功工作流能否一起迁移？这些具体答案，比选定某个永远不变的工具更值得讨论。

👉 近期早报

• BestBlogs 早报 · 2026-08-30

• BestBlogs 早报 · 2026-08-29

• BestBlogs 早报 · 2026-08-28

• BestBlogs.dev 第 110 期：新的稀缺

• BestBlogs.dev 第 109 期：程序员的职业未来

• BestBlogs.dev 第 108 期：智能的执行层

BestBlogs 是 AI 驱动的私人阅读助手，帮助你发现真正适合你的高质量内容，关注你感兴趣的来源和主题，每天生成一份更适合自己的「我的早报」，欢迎体验和关注我们。
