# AI预检检查：智能体工作记忆架构

- 来源：Tomer Tunguz 博客（VC 分析）
- 作者：Tomasz Tunguz
- 发布时间：2026-07-08 08:00
- AIHOT 分数：57
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmrcpxyar03a0ihx5hcxdrz78
- 原文链接：https://www.tomtunguz.com/the-ai-preflight-check

## 精选理由

Tunguz 把代理的记忆问题拆成预检+看门狗，不是大模型调参，而是软件架构层的优化，做 agent 的开发者可以直接偷师。

## AI 摘要

一种为AI智能体设计的预检工作记忆架构：查询到来时，系统从磁盘上约90个索引化的技能库中检索最相关技能，仅加载到上下文窗口。本地开源模型Ornith 35B（350亿参数，通过Ollama在Apple Silicon上运行）执行任务，约80%常规任务由本地模型完成，困难任务路由至前沿模型。看门狗记录每次预检决策和技能调用，夜间通过异步推理处理全天轨迹，自动决定哪些技能需新增或固化（如日历排期转为确定性Rust代码），实现自我改进循环。昨天，看门狗首次未提出任何改进建议，系统或接近性能平台期。

## 正文

简而言之：一种面向 AI 智能体的工作记忆架构——预检环节从长期技能库中检索出正确技能，本地模型执行任务，看门狗则彻夜追踪执行轨迹并更新技能库。

我至今还记得，我的智能体曾在我说话说到一半时就把内容忘得一干二净。

上下文窗口大小并非瓶颈所在。记忆架构才是。

我一直在尝试一种运行预检指令的记忆架构。飞行员在起飞前会规划航线，我的智能体也是如此。

一条查询请求落地：“总结第三季度董事会演示文稿。”这句话背后是 20 万原始 token 的邮件、PDF 和聊天记录。

预检即检索。智能体会检查其技能库，挑选出与当前任务相关的技能，并仅将这些技能加载到上下文窗口中。技能是经过整合的记忆；预检步骤就是智能体挑选正确技能的方式。

随后，本地的 Ornith 35B 模型会基于已加载的上下文执行任务。困难任务会被路由至前沿模型处理；常规任务则留在本地模型上完成，这种情况约占 80% 的时间。

看门狗会监控哪些技能被加载、做出了哪些决策以及成功率。每一次预检决策都会被记录。每一次技能调用都是一个带有名称和版本号的工件。

夜间，异步推理会处理当天的执行轨迹。它会判断应该开发哪些新技能，以及现有技能的哪些部分应转化为确定性代码。日历排程就是一个很好的例子：大语言模型不应去比较空闲时段和忙碌时段；Rust 在这方面要擅长得多。系统会重写其技能库并重新启动，形成一个自我改进的循环。

昨天是看门狗首次未提出任何改进建议。我怀疑这种情况不会持续下去。但这暗示了一点：当改进达到一定水平后，系统会进入一个平台期。只有真正全新的异常情况才需要人工介入。

技能库是一组工作流文件（目前约 90 个），按磁盘索引存储，并通过意图匹配进行检索。技能是编写一次、进行版本控制、并以工具模式形式提供给模型的工作流。关于技能库的构建方式，请参阅《技能蒸馏》一文。↩︎

Ornith 35B 是一款本地部署的开源权重模型，属于 350 亿参数级别，通过 Ollama 在 Apple Silicon 上运行。它能处理常规智能体工作——分类、草拟、工具选择、结构化提取——并将困难部分路由至前沿模型。 ↩︎

请参阅《异步推理全速推进》一文，了解使过夜、长达数小时的智能体运行变得可行的队列架构。 ↩︎
