发现好多人盯着 Apodex 1.1 的 35B 开源权重流口水, 我反而觉得这次最值钱的是跟着一起开源的 FrontierAgent。
模型决定想法,harness 才决定它能不能把活干完, 先给大家一个判断标准,手头的活满足任意三条,就别在聊天窗口硬扛了:
要查多个来源、要读一堆本地文件、能拆成多个独立分支、跑一半可能改需求、要跑 shell 改文件、最后要交付报告 / CSV / 代码这类真实文件。
就问个问题、润色一段话、总结一篇文章这种小活,普通聊天工具更省事。
有 5 类烂活,扔给它特别合适:
1️⃣多源调研、竞品分析、尽调 以前查个选型要开几十个网页,来源互相矛盾,查完还要自己整理对比。开 Agent Team 拆给子 agent 分头查市场、价格、案例、风险,最后给你带来源的报告、对比 CSV、风险反例,不是简单拼摘要。
2️⃣一文件夹资料变成可交付物 PDF、CSV、代码、图片散在各处,聊天窗口传到后面就丢上下文,最后只给你一段文字。它把文件分成只读输入区、工作区、输出区,原始文件不会动,最后给你清洗好的表、核查报告、来源索引,都是能直接用的文件。 跑一半经常改需求的长任务 最烦调研到一半加新文件、改预算,以前全得重跑。它跑的时候你直接输新要求,会在安全节点注入,已经跑完的有效结果全保留,只重算受影响的部分,还能断点续跑。我之前跑 AI 副业调研,8 个 agent 跑一半砍预算加约束,就是这么处理的。
3️⃣代码仓库调查和受控修复 让 AI 改代码最怕它乱改无关文件、留脏状态、改了什么说不清。所有修改先给你看 diff,审批了才生效,有 checkpoint 能回滚,改完给你测试结果和变更说明,不会把你仓库搞炸。
4️⃣批量评测模型和工作流 跑 benchmark 最烦搭环境、跑一半断了、失败样本不好重跑。它内置评测套件,并发执行、失败项单独重跑、产物自动收集,BrowseComp、HLE 这些主流 benchmark 都现成支持。
5️⃣别什么任务都开 Agent Team,这是很多人容易踩的坑。 单条主线、文件分析、代码调查这种聚焦的活,用 ReAct 模式就行,省 token 效率高;范围宽、能拆成多个独立分支、需要交叉验证证据的,再开 Agent Team。并行是有成本的,小任务没必要。
这次开源是挺实在的,Apache 2.0 协议,不绑定 Apodex 自家模型,任何 OpenAI 兼容的 endpoint 都能接。Agent runtime、终端 TUI、任务看板、文件沙箱、修改审批、回滚、评测套件全给你了,不是只放个权重就完事。
也说清楚边界:框架是跑在本地的,但 35B 模型要本地离线跑还是得有合适的 NVIDIA GPU,普通笔记本别想;连云端 API 的时候数据该走还是走,不是用了本地框架就 100% 离线。
天天被查资料、整文件、改代码这些破活耗时间的,真可以去试试,比在聊天窗口里反复传文件效率高不少。