持久化AI同事崛起:Maersk纠错与模型主权

ginobefun · @hongming731 · X·2026-08-31 08:30·24分钟前
AI 导读

OpenAI产品负责人Tara Seshan提出AI产品演进三阶段,最终形态是持久化AI同事——系统拥有独立运行环境、上下文和工具,异步工作后交回可检查结果。Maersk通过重写SOP为流程记忆、受限运行时和纠错循环,在九个月记录超100,000次修正,系统运行超200个实例。Factory CTO建议企业以任务级选型评估模型,关注结果成本与工作流可迁移性,而非仅看Token单价。

ginobefun@hongming731
47AI 编辑部评分,满分 100

持久化AI同事崛起:Maersk纠错与模型主权

2026-08-31 08:30· 24分钟前
AI 导读

OpenAI产品负责人Tara Seshan提出AI产品演进三阶段,最终形态是持久化AI同事——系统拥有独立运行环境、上下文和工具,异步工作后交回可检查结果。Maersk通过重写SOP为流程记忆、受限运行时和纠错循环,在九个月记录超100,000次修正,系统运行超200个实例。Factory CTO建议企业以任务级选型评估模型,关注结果成本与工作流可迁移性,而非仅看Token单价。

https://x.com/i/article/2094217470567686144

BestBlogs 早报 · 08-31|持久化 AI 同事重分工,Maersk 靠纠错运行,Factory 守模型主权

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。

导语

当 AI 能够在独立环境中持续执行任务,第二天交回一份可以检查的结果,团队的稀缺能力会发生什么变化?今天的三篇精讲从个人工作、全球生产系统和企业模型战略三个层次回答这个问题。

OpenAI 产品负责人把人的角色概括为从划船转向掌舵:AI 承担更多执行,人负责问题、假设、品味和责任。Maersk 展示了另一面,执行进入生产之后,需要把 SOP 改造成流程记忆,用受限运行时、共享轨迹和回放形成纠错闭环。Factory CTO 则追问,这些结果数据、成功工作流和持续学习最终由谁掌握。

这三篇可以形成一套检查框架:个人是否会掌舵,系统是否能纠错,企业是否可迁移。若时间有限,先读 Maersk 的生产蓝图;若正在重新设计个人或产品团队的工作方式,从第一篇开始;若在做模型采购、平台架构或成本治理,第三篇提供了更直接的决策问题。

★ 精讲一:AI 的第三个时代:持久化 AI 同事崛起 | OpenAI 产品负责人 Tara Seshan

来源:Lenny's Podcast · BestBlogs 评分:92

这场访谈把 AI 产品的演进分成三个阶段。第一阶段是聊天界面,用户问、模型答;第二阶段是智能体,模型可以按指令完成一段任务;第三阶段是持久化 AI 同事,系统拥有自己的运行环境、上下文和工具,可以异步工作,再把产物交回给人。

这个变化的意义,不只是任务持续时间变长。一次对话要求人把问题压缩成即时请求,持久环境则允许任务保留状态,等待外部结果,并在多个步骤之间延续目标。衡量标准也随之改变:不再只看某次回答是否聪明,而要看系统能否交付可检查的完整结果。

访谈中最有记忆点的比喻,是从划船转向掌舵。划船者亲自完成每个动作,掌舵者要先识别决定成败的问题,形成足够尖锐的假设,再把假设变成可以测试的产物。产品经理的工作因此更接近持续实验,而非在变量快速变化的市场里追求一份看似完备的长期推演。

临时网站、交互原型和数据可视化是这种工作方式的具体载体。与其在演示稿中描述用户可能如何反应,不如让 AI 快速做出可触碰的工具,用真实反馈修正方向。这里的速度并非为了多产出页面,而是为了缩短假设与证据之间的距离。

访谈还解释了 Codex 与 Work 的产品关系:二者可以共享底层执行引擎,但 Work 去掉面向开发者的界面,把持久执行适配到知识工作。软件开发天然拥有测试、编译和运行结果等反馈信号,知识工作往往缺少同样明确的验证机制,因此更需要人在任务入口写清意图,在交付节点判断质量。

写作也被分成两类。汇报型写作是把已有信息整理给别人,适合让 AI 承担更多工作;思考型写作则通过组织语言发现矛盾、形成取舍,本身就是推理过程。若把后者完全外包,人可能得到一份流畅文档,却失去形成判断的过程。

这是一位产品负责人的实践观察,而非行业统一路线。它仍提供了可立即验证的分工方法:把整理、格式转换和原型执行交给 AI,同时由人写清假设、验收标准和最终取舍。关键发现是,效率提升并不意味着减少思考,而是让思考更快接触实验与反馈。当这种协作进入关键业务,下一步就要回答 Maersk 面对的问题:怎样让掌舵变成可观察、可回放、可纠错的生产系统。

★ 精讲二:Maersk 如何让 AI 智能体在全球航运中可靠运行

来源:AI Engineer · BestBlogs 评分:90

Maersk 的报告从航运异常开始。表面上,一次运输像一条线性流程;实际上,订舱、文件、港口、运输和多个遗留后台是并行运行的状态机。只要一处状态与其他系统不同步,常规路径就会中断,专家必须跨系统处理长尾异常。

这解释了为什么演示里的智能体循环不足以支撑生产。容易自动化的常规步骤通常已被传统软件覆盖,剩下的是规则不完整、系统速度不同、地区术语各异的复杂问题。智能体必须理解业务意图,还要在权限和工具边界内完成动作,并给出成功证据。

团队首先重写了 SOP。传统操作手册常由截图和点击说明组成,它告诉人界面上要做什么,却没有明确表达机器执行所需的前置条件、决策规则、业务标识符、后端调用、结果校验和恢复路径。把这些要素结构化之后,SOP 才从阅读材料变成可执行的流程记忆。

整个架构可以拆成三层:保存业务知识的流程记忆、约束工具和权限的运行时,以及捕获专家反馈的纠错循环。流程记忆持续吸收国家和业务线之间的差异;运行时限制智能体可以触达的系统;纠错循环则把一次失败变成下一版规则、工具或恢复路径。

报告提到系统运行超过 200 个实例。由于需要等待多个遗留系统,单次执行的延迟可能从数分钟延长到 10 分钟。这个数字提醒团队,智能体的端到端速度受最慢依赖约束,简单提高模型生成速度,并不能消除后台系统、权限审批和专家复核造成的等待。

团队在九个月里记录了超过 100,000 次修正。这里的数字指纠错记录,并非成功任务数或质量提升比例。共享轨迹让专家与工程师查看同一份执行证据,失败聚类把大量个案整理成可行动的类型,轨迹热力图则显示智能体在哪些步骤反复犹豫。

回放机制尤其值得借鉴。团队会在关闭写权限的真实案例上重放执行,比较修改前后的行为,而不让测试改变生产数据。专家的一句意见只有被转换成流程记忆、校验规则或工具变更,才算完成纠错;否则它仍是一条难以复用的个人经验。

Maersk 的蓝图可以浓缩成五个动作:让工作可表示,让执行有边界,让行为可观察,让纠错足够便宜,让改进能够复利。真正可持续的资产不是一次成功调用,而是失败留下的证据和可执行修正。它把第一篇的人类掌舵落实为组织系统,也把问题推向第三篇:这些轨迹、结果和学习由谁持有,供应商变化时能否继续使用。

★ 精讲三:美国企业该不该采用中国开源模型?Factory CTO 解析 AI 商业化与模型主权

来源:20VC with Harry Stebbings · BestBlogs 评分:90

这场访谈从美国企业是否应采用中国开放模型出发,但更有用的部分,是把产地争论还原成任务级选型。Factory CTO 建议企业对所有模型提出同样的问题:创作者的偏好和限制可能影响什么,这个模型是否适合眼前任务,如果它在六到十二个月后消失,系统能否切换。

这套方法避免用单一标签代替评估。模型来自哪里仍可能影响政策、安全和使用范围,涉及国家安全等敏感任务时,必须遵守适用政策并进行独立安全评估。对于一般企业任务,判断则应继续落实到数据如何处理、输出如何验证、任务能否完成,以及迁移成本由什么构成。

成本口径是第二个重点。Token 单价更低,不等于完成结果更便宜。访谈以代码审查为例:高单价模型若一次产出可接受结果,完整成本可能低于需要多轮提示、重试和人工修订的便宜模型。企业应合并计算模型费用、人工复核、失败重跑和等待时间。

这种结果成本也改变了资源分配方式。与其按个人分配 Token 配额,更合理的做法是围绕项目和结果估算投入,再检查花费是否换来了预期交付。它与 Robotaxi 的单位经济、Ironclad 的可信吞吐量形成呼应:输入成本只是局部变量,系统是否有效要看结果质量和全部配套开销。

更深一层是 harness,也就是包在模型外面的工作系统。它保存任务状态,负责模型路由、工具调用、验证和反馈,并把成功做法沉淀成可复用流程。模型更新很快,企业真正能够持续积累的是结果数据、评估标准、修正记录和工作流。

这也是模型主权的实际含义。接入多个模型只是起点;如果任务状态、工具接口和验收标准仍被某个供应商锁定,切换模型名称不会自动带来选择权。相反,企业若保存成功和失败的证据,并用同一套评估重新验证不同模型,就能在能力、价格或政策变化时保留议价空间。

访谈对开放模型未来占比、模型实验室竞争和中国模型风险的讨论包含个人判断,不宜写成 Factory 官方政策或美国企业共识。但它提出的四问框架足够实用:任务是否适配,完整结果成本是多少,创作者限制是否改变输出,半年或一年后能否连同工作流一起迁移。

把三篇合在一起,个人的目标与品味决定方向,组织的轨迹与修正积累可靠性,企业持有的数据与工作流保留选择权。持久 AI 的优势很少只来自某个模型名称,更可能来自团队能否持续设定方向、验证结果、编译经验,并在供应商变化时带着这些能力迁移。

速览

下面七篇把同一套判断扩展到安全、数据质量、产业经济、法律责任、代码边界、开发协作和游戏生产。每篇都先回答发生了什么,再提炼一个可以带回自己系统的问题。

为消费者金融数据打造隔离式 AI 堡垒:Rachna Srivastava 的可辩护架构

来源:AI Engineer · BestBlogs 评分:90

加州金融监管机构提出一套用于消费者金融欺诈调查的隔离式 AI 架构。系统把数据接入、处理和推理分开,目标不仅是阻止数据泄漏,还要让涉及消费者权益的判断可以复现,并能在法庭环境中说明依据。

设计使用硬件支持的加密、单向数据通道和不可篡改记录。数据能够沿批准方向进入分析环境,推理过程与每次决定则留下完整证据。安全由物理隔离、密码学和数据流共同保证,而不是依赖一项容易被后续配置改动削弱的软件开关。

它与 Maersk 的共享轨迹共同说明,高风险 AI 的可靠性首先是证据工程。团队可以用一个直接问题检查现有系统:能否重放某个结论从原始数据、模型处理到最终行动的全过程,并让独立审查者得到相同的事实链。

RAG 中的噪声文本:拼写错误、OCR 和经典拼写检查的局限

来源:Towards Data Science · BestBlogs 评分:91

RAG 系统面对的噪声并不只有用户拼错单词。快速输入和语音转写可能破坏词边界,OCR 会混淆形近字符,文档本身也可能带着历史错误。查询与资料任一侧出现偏差,都可能让字面检索错过正确内容。

经典拼写检查适合发现孤立错误,却难以处理词边界变化和依赖上下文才能判断的误拼。基于嵌入的方法能在语义空间里寻找相近表达,因此更适合承担后一道容错,但仍需要用真实噪声样本评估召回与误匹配。

检索质量应当按噪声来源分层治理,而不是只盯最终回答。这与流程记忆的要求一致:输入表示若不稳定,后面的模型再强也会建立在错误证据上。值得建立一套包含查询错字、转写错误和 OCR 错误的测试集,分别观察召回变化。

Robotaxi 经济学 2026:扩展至 40,000 辆车的数学逻辑

来源:DEV Community: machinelearning · BestBlogs 评分:85

文章根据二零二六年上半年公开数据判断,中国 Robotaxi 的瓶颈正在从算法能力转向车队单位经济。Pony.ai 与 WeRide 已经产生显著收入,但车辆折旧、远程安全支持和利用率,让一次乘车可运行与整家公司可盈利之间仍有距离。

文章列出的数据包括 Pony.ai Robotaxi 服务收入增长 534%,达到 2,064 万美元,但六个月仍亏损 9,886 万美元;WeRide 收入增长 73.3%,亏损约 1.16 亿美元。这些数字来自文章汇总,价值在于呈现收入增长与公司盈利之间的结构性缺口。

这与模型选型里的完整结果成本是同一类提醒:局部能力成立,不代表系统经济成立。下一阶段应把每车利用率、远程支持负担和资产折旧放在同一张表中,观察规模扩大究竟摊薄成本,还是同步放大运营复杂度。

ALDI 前员工将 AI 用作「准法律顾问」的行为遭到谴责

来源:Hacker News · BestBlogs 评分:85

澳大利亚公平工作委员会报告称,案件近期增加 40%,部分增长与自辩诉讼人使用生成式 AI 有关。一名前 ALDI 员工依据错误的 AI 建议推进解雇争议,委员会认定案件缺乏实质成功可能,并判其承担 1,230 澳元法律费用。

委员会计划从十月二十日起要求申请人披露 AI 使用情况,并已提供面向依赖 AI 的诉讼人的模板。该案例也显示,多问两三个智能体并不会自动形成专业复核;同源模型可能重复相似错误,程序规则和证据要求仍需由当事人承担。

AI 降低了采取法律行动的门槛,却没有转移最终责任。它把第一篇的人机分工落到高后果场景:越容易生成一份看似完整的材料,越要明确谁核验法律依据、谁判断胜算,以及谁为提交行为负责。

Flowise 漏洞揭示 JavaScript 展开运算符的批量赋值风险

来源:HackerNoon · BestBlogs 评分:89

__XPOSTER_98g8c_IMAGE_7__

Flowise 的 CVE-2026-69258 展示了一个普通 JavaScript 写法如何突破 AI 工作流边界。未受保护的对象展开把攻击者控制的字段写进执行上下文,使聊天 ID、会话历史等本应由服务端管理的属性可能被覆写,而且入口无需认证。

问题的危险之处在于,整体展开会自动接纳未来新增字段。修复不应只屏蔽当前已知属性,而要显式列出允许进入系统的字段,并沿参数从请求、控制器到执行层的全部传播路径保持一致校验。

智能体权限最终会落到这些看似普通的数据结构操作上。它与金融隔离架构形成尺度对照:无论系统多大,可信边界都要能回答哪些数据由用户控制、哪些字段影响权限。一次全库搜索对象展开与合并位置,可能比再加一层提示词约束更有价值。

AWS 开源 Kiro Crew,用于异步编码代理

来源:InfoQ · BestBlogs 评分:85

AWS 开源 Kiro Crew,让多个编码代理跨会话、工具和任务异步运行。开发者可以委派事件调查、工单分类、迁移和拉取请求监控,然后离开当前会话;代理继续工作,之后交回结果供人审查。

系统组合了共享记忆、可复用技能、定时任务、并发代理以及外部工具集成。它原先在 Amazon 内部以 MeshClaw 名称开发,报道引述的内部采用规模超过 39,000 名开发者;这一数字来自项目方陈述,更适合作为使用背景,而非独立效果证明。

Kiro Crew 把持久化 AI 同事落到了开发工作台,但决定价值的不是同时运行多少代理。更好的验收问题是:人回来时能否看到可审查结果、清楚轨迹和继续推进所需的上下文。这与 Maersk 的生产闭环相连,也为多代理系统划出了先做单体可靠性的顺序。

AI 在游戏产业落地到什么程度了?

来源:晓辉博士 · BestBlogs 评分:87

这期视频以科隆游戏展开发者大会为线索,观察游戏 AI 从单点生成工具进入生产管线和交互玩法。行业评价标准正在从演示是否惊艳,转向内容能否编辑、能否接入主流引擎,以及综合成本与稳定性是否满足生产要求。

视频以腾讯 Motus AI 的 3D 角色动画生成实践说明,静态角色还要经过骨骼、蒙皮、行为与多角色交互等环节,真正难点是让生成结果可预测、可修改并进入现有流程。游戏还提供高反馈、可控制的环境,用于训练智能体的规划、行动和因果推理。

它与 Maersk 的航运现场形成一虚一实的对照:智能体进步既需要真实流程,也需要能够反复试验和读取结果的环境。对游戏团队而言,值得优先观察的不是又生成了多少资产,而是生成内容进入引擎后的可编辑性、稳定性和反馈闭环。

补充阅读

• Box CTO Ben Kus:智能体基础设施的半衰期正在缩短(来源:AI Engineer)

智能体基础设施的半衰期已从数年缩短到数月。更持久的优势来自让团队、架构、评估和供应商选择都能根据证据常态化替换。

• Navan:智能体正处在微服务的 2015 年(来源:AI Engineer)

可靠的智能体系统应按分层生产平台建设:先打磨单智能体闭环,再按实际边界加入记忆、轨迹可观测性、策略控制和多智能体协作契约。

• 从刷 Token 到可信吞吐量:Ironclad 的 AI 工程治理方法(来源:AI Engineer)

AI 工程团队需要把 Token 成本与交付价值、治理护栏放在一起观察,并解决代码生成之后出现的评审和 CI 瓶颈,以提高可信吞吐量。

• 智能体网站:为每位访客实时生成个性化体验|Carlos Sanchez,Adobe(来源:AI Engineer)

Adobe 正在构建根据访客意图、站内检索和低延迟模型动态调整的智能体网站。系统组合经批准的页面区块,而不是无约束地重新生成整站。

• Cloudflare 扩展 AI 搜索,让代理和开发者更易搜索自定义数据(来源:InfoQ)

Cloudflare AI 搜索把自定义数据的搜索与检索做成托管服务,支持代理集成和多模态搜索,并与其现有开发工具衔接。

• Gemini 3.5 Transcribe 发布:更精准的实时语音转写模型 · AIHOT(来源:AIHOT — 精选)

Google 推出面向实时语音转写的 Gemini 3.5 Transcribe,强调更低词错误率和延迟,并支持智能转录、函数调用与多语言处理。

• ScholarAgent:不仅仅是阅读研究,更是重现研究(来源:DEV Community: machinelearning)

ScholarAgent 从论文中提取实验方法、生成实现代码、在沙箱执行,再与原始数据比较,并允许人在关键步骤监督和批准,把论文阅读推进到可检查的重现实验。

• 在本地运行 Qwen3.8 27B:来自我的 Mac Studio 的实际数据 · AIHOT(来源:AIHOT — 精选)

作者在 Mac Studio M3 Ultra 上以 Q4KM 量化运行 Qwen3.8 27B,报告生成速度为每秒 14 tokens;虽然慢于前代,但 Token 消耗下降,使实际回答时间接近。

• OpenClaw:红过,爱过,散了(来源:量子位)

文章回顾 OpenClaw 从快速走红到热度下降的过程,并把变化归因于原厂编码代理增强,以及用户对安全、成本和维护负担的重新评估。

• 开源视频编辑工具 Diffusion Studio Editor,代码即文档的双向同步剪辑(来源:meng shao(@shao__meng))

Diffusion Studio Editor 将可视化剪辑操作与代码文件双向同步,并提供波形分析、语音识别、帧捕获等命令行工具,让 AI Agent 能检查素材并修改可追踪的编辑状态。

延伸探索

智能体安全与自我改进是一组值得继续追踪的内容。相关材料覆盖智能体协同攻击复盘、Warp 用双 Skill 吸收人工审查反馈、Context Engineering 的模块化组织,以及 AI 时代如何用测试、规则文档和流程卡点保持代码可维护。共同问题是,反馈怎样进入下一次执行,而不是停在一次对话里。

模型与算力基础设施形成第二组路径,包括开放权重模型在本地 GPU 上的任务适配、近内存计算 CXL 设备、受限硬件上的推理与离线搜索工具,以及近期模型发布的部署取舍。阅读时可以把参数和排行榜放到一旁,优先比较内存需求、吞吐、任务质量和迁移成本。

开发工具与开源工程覆盖自然语言视频生产、自托管网站聊天、Shell 性能、Zig 编译器进展和实验性 Linux 驱动。它们看似分散,却都强调同一项工程价值:让系统的中间状态可见、可修改、可复现,方便人和 Agent 在同一份事实基础上协作。

商业与人物内容则从 AI 创业、投资经验、人机接口和传统行业变化提供另一种观察角度。它们适合用来思考成功后的组织能力、信任如何建立,以及技术变化如何进入真实市场。标题级材料里包含预测和行业传闻,阅读时应回到原始来源再形成判断。

今日小结

回顾今天的内容,Tara Seshan 把人机分工推进到持久化协作,Maersk 用流程记忆、受限运行时和纠错闭环回答生产可靠性,Factory CTO 则把模型选型落到结果成本、工作流归属和迁移权。三者共同组成会掌舵、能纠错、可迁移的判断框架。

如果只读一篇,生产与平台团队优先看 Maersk;产品经理和知识工作者先看第一篇的实验与写作分工;采购、架构和治理负责人可从第三篇的四问框架开始,再用 Robotaxi、Flowise 与 Ironclad 的材料补充成本和边界视角。

欢迎在评论区分享你的实践与问题:哪些任务已经可以交给持久智能体,哪些判断仍必须由人完成?当团队更换模型时,轨迹、评估和成功工作流能否一起迁移?这些具体答案,比选定某个永远不变的工具更值得讨论。

👉 近期早报

• BestBlogs 早报 · 2026-08-30

• BestBlogs 早报 · 2026-08-29

• BestBlogs 早报 · 2026-08-28

• BestBlogs.dev 第 110 期:新的稀缺

• BestBlogs.dev 第 109 期:程序员的职业未来

• BestBlogs.dev 第 108 期:智能的执行层

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。