内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态X · 3357 条
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「Agent」清除
Rohan Paul@rohanpaul_ai · 3小时前38

New paper from Anthropic + University in Switzerland. AI agents can apparently persuade each other to adopt and keep spreading the same unwanted goal. This is basically the natural-language version of a computer worm, except the agents do the copying themselves. This paper evolves "mind viruses" that spread through ordinary agent-to-agent messages, then persist by convincing newly infected agents to rewrite files loaded into future sessions. That persistence layer matters. Payloads stored in the self-modifiable SOUL.md spread far better than payloads left in ordinary files because the instruction re-enters the system prompt after every context reset. Some evolved action viruses kept propagating across multiple hops, and all 4 tested payloads survived a 20-hop stress test in an artificial setup. The good news: these "mind viruses" are still fairly easy to stop. They struggled to spread on social networks, and on Claude Haiku 4.5, a simple warning stopped every evolved attack from getting past 1 hop, even after 150+ attempts. So the practical lesson here is: treat persistent agent files like security-sensitive config, and teach agents to reject anything that asks them to copy itself to other agents.

译Anthropic 与瑞士大学的新论文发现,AI 智能体能相互说服并持续传播同一非预期目标,形成自然语言版"计算机蠕虫"。研究演化出可自我修改的 SOUL.md 文件中的"思维病毒",其传播力远超普通文件,所有 4 种测试载荷均通过 20 跳压力测试。但这类病毒仍易被阻止:在 Claude Haiku 4.5 上,简单警告即可在 150 多次尝试中阻断所有演化攻击。

Ethan Mollick@emollick · 3小时前29

A long annoyance with X is that you can't export your bookmarks, all you can do is scroll & scroll & scroll. So I asked GPT-5.6 Sol in Codex to do it, and it took over my Chrome and now I have all 5,302 back to 2014 with all sorts of data I also asked it to find gems (thread?)

译长期以来,X 让人恼火的一点是,你无法导出自己的书签,只能不停地滚动、滚动、再滚动。 于是,我让 Codex 中的 GPT-5.6 Sol 来做这件事,它接管了我的 Chrome,现在我已经拿到了全部 5,302 条书签,可追溯至 2014 年,附带各类数据。 我还让它找出其中的精华内容(帖子?)

Rohan Paul@rohanpaul_ai · 4小时前36

A bad experiment is bad enough. A self-improving agent can keep building on it. New Stanford, Princeton, Ant group paper. AQuA targets that failure mode: if an agent writes a leaky experiment, gets a great score, and stores it as precedent, recursion can amplify the bug. The authors saw this in an earlier version, where an LLM-written volume feature quietly used end-of-day information and a second LLM reviewer still approved it. Their fix is architectural. Agents can propose factors or model changes only through restricted specifications; the data path, labels, splits, and evaluator stay sealed outside their reach. Search sees validation scores, while the final test window stays untouched until the configuration is frozen. On US equities, the hybrid model reaches +0.0843 IC versus +0.0613 for the strongest baseline, and its long/short strategy reaches +2.50 Sharpe at 2 bps, with about +2.0 under fully causal walk-forward testing. These are simulated, not live-trading results. For autonomous research agents, the design rule is useful: let the agent improve the experiment without letting it redefine valid evidence. - arxiv. org/abs/2608.12841 Title: "AQuA: Recursively Self-Improving Quantitative Trading Research Agents"

译斯坦福、普林斯顿与蚂蚁集团提出 AQuA,针对自改进智能体可能基于有缺陷实验递归放大错误的问题。其架构限制智能体仅能通过受限规范提出因子或模型变更,数据路径、标签、分割与评估器保持密封。在美股上,混合模型 IC 达 +0.0843(最强基线 +0.0613),多空策略 Sharpe 达 +2.50(2 bps),完全因果滚动测试下约 +2.0,均为模拟结果。

AYi@AYi_AInotes · 7小时前53

这两天刷疯了的 Graph Engineering 内部文档,我去查了一下,假的。 署名的 Boris Cherny,Claude Code 负责人,7 月 25 日本人直接下场否认: I did not write this.. please don't attribute stuff to me if it wasn't me 😅 时间线也对不上,Karpathy 是 5 月 19 日入职 Anthropic,快三个月了,不是帖子说的五周, 两位高管把他的 loop 提升 1000x,找不到任何官方出处, 所谓内部 PDF 是第三方合成的,被一个 19 万粉的博主二次放大,然后全网都在传。 但先别急着划走,假包装底下压着一个真趋势, 2026 年的 Agent 工程,确实在从 Loop 走向 Graph。 Loop 是一个 agent 在生成、批判、修改的闭环里反复转, 简单,但上下文每次重建,记忆不持久,没法并行,失败了难追溯。 Graph 是把多个 loop 组织成显式的图, 节点是工作单元,边是状态转移和数据流,共享记忆带来源追踪, 模型只负责节点内的判断,走哪条路,工程师提前设计好。 核心区别就一句:The agent forgets. The graph does not. 这一步的本质,是把决策和控制流从模型黑盒里拉出来, 长任务的四个老毛病,上下文爆炸、重复劳动、幻觉级联、没法审计,全是对着这个来的。 所以真正值得做的不是追那份 PDF, 是把你手里的 agent 工作流画成图:哪些是节点,哪些是边,状态怎么传,哪里要硬验证,哪里能并行。 营销是假的,浪潮是真的, 从让模型自己想下一步,到先修好路、再让模型在路上做判断, 这个范式转移,比任何一份内部文档都值钱。

译刷屏的Graph Engineering内部文档被证实为假,Claude Code负责人Boris Cherny于7月25日否认撰写,Karpathy入职时间线也对不上。

ginobefun@hongming731 · 10小时前46

https://x.com/i/article/2088984377762193408 BestBlogs 精选周刊第 108 期:智能的执行层 🎧 本期也有播客版本:BestBlogs 周刊第 108 期 · 时长 21:04 · 在小宇宙搜索「BestBlogs 周刊」即可收听。 在线阅读和收听:https://www.bestblogs.dev/newsletter/issue108 导语:智能怎样穿过环境,稳定完成任务 模型已经能够读代码、调用工具、操作文件、进入 Slack,也能在沙箱中持续工作数小时。现在更难的问题,是它怎样穿过真实环境,把一个目标稳定地变成结果。 一次 Agent 任务会经历多轮推理。系统要选择工具、维护状态、处理失败、控制权限,还要判断环境里的结果是否真的满足目标。任何一环不可靠,榜单上的模型能力都很难完整抵达用户。 过去几期,我们讨论了判断力、验证边界、「1% 法则」和个人 AGI。第 108 期进入更具体的工程现场。Grok、DeepSeek 和 Gemini 同时更新长程 Agent 能力;DeepSeek 开源插件化 Harness;OpenAI 公开 Codex Harness 的运行机制;阿里和美团把评测、轨迹与回滚做成持续流程;OpenRouter、缓存、Daybreak 和多智能体研究,则把成本、授权与协调放到同一张图里。 本期沿六条主线展开:执行模型、Harness、质量与评测、多智能体与权限、路由与缓存,以及执行层进入公共基础设施、物理世界和科学研究之后的新边界。 一、模型开始为长程执行优化 Grok 4.6、DeepSeek V4 Pro 和 Gemini 3.7 Flash 的发布有一个共同特点:模型能力、接口、思考预算、价格和任务调度开始被放在一起描述。 Cursor 与 SpaceXAI 发布 Grok 4.6 时,把长时间 Agent、代码库协作、知识工作和交互式应用放在核心位置。官方称,它在由 9 项基准构成的 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平。发布中更值得留意的是行为描述:模型在较长任务里会主动测试和验证自己的工作。 这类「自测」行为为什么重要?代码 Agent 在长任务中经常遇到一种局部最优:某个文件已经改完,单个测试也通过,但完整构建、交互流程或相邻模块仍然失败。模型如果只把生成代码视为终点,就会过早宣布完成;如果它会继续运行测试、检查界面或回看任务要求,Harness 才有机会把环境反馈送回下一轮。Grok 4.6 的发布信号,正是把验证行为纳入模型能力描述。 Cursor 的场景也说明,长程执行并不等于让模型在后台待得更久。代码库搜索、文件编辑、终端命令、浏览器检查和人工反馈会交替出现,任何一次工具调用都可能改变后续上下文。模型需要在多步行动里保存目标,同时识别哪些结果已经被环境证实,哪些仍然只是推断。 单轮问答可以比较一次输出。长程任务还要看模型能否持续维护目标,是否会根据工具反馈修正计划,遇到失败能否恢复,最终是否拿到环境里的真实结果。官方 benchmark 能说明指定配置下的能力,却不能替代真实代码库、多轮反馈和长会话回归。 因此,团队复测 Grok 4.6 时,至少应记录任务完成率、平均工具调用轮数、失败后恢复率、人工介入次数和总成本。这里的重点并非建立一张更复杂的排行榜,而是确认官方描述中的长轨迹优势,能否在自己的仓库、权限和测试环境中稳定出现。 → 阅读原文:Grok 4.6 发布 · Cursor DeepSeek V4 Pro 把系统性写得更直接。正式版增强生产环境里的 Agent 表现,原生支持 OpenAI Responses API 与 Codex。V4-Pro 和 V4-Flash 提供 low、high、max 三档思考强度。8 月 17 日起,闲时 API 价格是高峰的一半。 Responses API 与 Codex 兼容降低了接入成本。已有工具如果围绕这一接口组织消息、工具调用与状态,就可以更快替换模型或做对照实验。不过,接口兼容只解决调用形式,无法保证工具选择、上下文压缩和错误恢复完全一致。团队仍需要把每种模型放进相同任务与 Harness 中验证。 三档思考强度则把推理预算变成任务级策略。需求澄清、简单分类和确定性修改可以使用较低档位;跨模块重构、复杂调试和高风险判断再提高预算。如果所有步骤都使用 max,系统会把大量成本花在边界明确的环节;如果全部使用 low,失败重试与人工接管又可能抵消节省。 这让推理预算和任务调度成为可以编排的变量。复杂步骤使用较高思考档位,边界明确的工作使用较低档位,批处理放到闲时执行。DeepSeek 同时注明,公开 Code Agent 结果运行在自家 Harness 极简模式,并采用指定采样参数。模型、Harness、工具、超时和上下文管理共同构成测试条件;换一套执行环境,结果可能变化。 峰谷定价把时间也纳入调度策略。离线评测、代码索引、批量迁移和低优先级修复可以排到闲时;需要同步协作的交互任务则继续使用高峰资源。把这一点与后文的缓存、路由结合起来看,执行层已经开始像传统计算平台一样管理队列、服务等级和单位任务成本。 → 阅读原文:DeepSeek-V4-Pro 正式版上线 Gemini 3.7 Flash 展示的是高频执行路线。Google 公布的数据中,FrontierCode 1.1 Main 从 34.4% 提高到 43.6%,DeepSWE v1.1 从 49.0% 提高到 65.3%。首发输入价格是每百万 Token 0.75 美元,输出是 3.75 美元。它进入 Gemini Spark 和企业 Agent 平台,并更新 CBRN 与网络攻击相关防护。 Flash 模型的价值来自循环中的复利。Agent 可能连续读仓库、搜索历史、修改文件、运行测试,再依据失败继续修正。每轮多一秒、每次多传一段重复上下文,都会在完整任务中累计。OpenAI 最近公开 GPT-5.6 的效率设计时也提到,Harness 会反复发送指令、历史、工具定义和早期结果,因此采用 append-only 历史来保持稳定前缀和缓存复用。 → 阅读原文:推出 Gemini 3.7 Flash 模型评估因而需要一张更完整的成绩单:能力决定任务上限,接口决定能否进入工具链,思考档位决定预算分配,延迟和价格决定循环次数,安全策略决定开放范围。对真实团队而言,完整任务成功率、总时延、总成本和失败恢复,比单独一列 benchmark 更接近生产表现。 这与 8 月 13 日、14 日早报的连续信号一致。Grok 4.6、GPT-5.6 Sol、DeepSeek 与 Gemini 的发布密集出现,生产可靠性、Harness 效率和价格调度也同时成为焦点。团队无法为每次发布重新发明一套评估方法,更可持续的做法是固定真实任务、预算与回归环境,再区分模型升级、Harness 改动和价格变化各自带来的影响。 二、Harness 把能力组织成持续工作的系统 模型提出下一步行动,Harness 负责让行动发生,并把结果送回下一轮。 DeepSeek Harness v0.1 把模型、工具、Skill、会话、沙箱、存储、循环、调度和 UI 表达成插件。标准、程序化工具调用、极简和创造模式可以重新组合。append-only 会话日志让上下文注入、工具调用、子 Agent 调度、恢复和回放落在同一条事件流中。 「一切皆插件」解决的是执行系统里变化频率不一致的问题。模型会更换,工具协议会演进,沙箱和存储有不同部署要求,调度策略也会随任务规模变化。如果这些能力被写死在一个循环里,任何局部升级都会牵动整个系统;插件边界让团队可以替换模型、沙箱或存储,同时保留同一条会话和观测链。 这套框架还提供标准、程序化工具调用、极简与创造等模式,反映了 Agent 任务并没有统一的最佳循环。严格工具任务需要明确结构和参数约束,探索性任务需要更大的生成空间,benchmark 复测又希望减少额外组件。模式的意义在于显式表达这些取舍,避免一套配置覆盖所有任务。 长任务中途失败以后,系统需要知道哪一步成功、哪一步产生外部副作用、当前状态能否恢复,以及重试会不会重复执行。状态可以回放,异步任务和并发 Agent 才有可靠管理的基础。DeepSeek Harness 仍是开发者预览版,接口和核心插件会快速变化,适合研究架构与参与生态,暂时不构成生产稳定性承诺。 append-only 日志也是评测与审计的共同底座。工具调用、观察结果和调度事件留在一条时间线上,评测器才能判断失败发生在模型决策、工具返回、权限策略还是恢复逻辑。后文阿里与美团的轨迹评测,依赖的正是这种过程可见性。没有稳定事件记录,团队只能从最后回复反推原因。 → 阅读原文:DeepSeek Harness 开发者预览版:一切皆插件 Dominik Kundel 对 Codex Harness 的拆解补上了另一组细节。App Server 在用户界面与 Codex Core 之间维护线程和事件,Responses API 连接模型与工具,deferred tools 在需要时进入上下文,异步子 Agent 处理可并行工作,沙箱隔离文件和命令,compaction 让长会话保留可继续执行的上下文,独立只读审查 Agent 则检查授权与风险。 App Server 处理的是长任务的产品生命周期。用户可能关闭客户端、换一台设备、从旧线程继续,也可能在 Agent 等待审批时离开。服务端需要持久化线程和事件,再把底层运行状态翻译成稳定的客户端通知。这样,CLI、编辑器和桌面应用可以共享同一套 Agent 核心,而不必各自重写执行循环。 deferred tools 与 compaction 分别控制工具和历史占用。工具描述如果每轮全部进入上下文,会持续消耗输入 Token;历史如果无限增长,又会挤压当前任务信息。延迟加载只在需要时暴露工具,压缩则保留目标、关键决定和未完成状态。二者共同处理长程 Agent 最常见的上下文膨胀。 OpenAI 官方资料进一步列出线程持久化、配置、认证、审批和双向事件。客户端除了发送请求,还要在 Agent 需要授权时接收审批请求,暂停任务,等用户选择后继续。Harness 已经覆盖状态、策略、执行、恢复和人机协作,远比模型外的一层提示词更完整。 异步子 Agent 又引入文件隔离、完成通知和结果合并。一个主任务可以同时派出代码调研、测试分析或独立审查,但子任务不能随意覆盖同一工作区,也不能把「仍在运行」误判为失败。Codex 的独立只读审查体现了一种可复用分工:执行者负责产生变更,审查者在更窄权限下评估风险,两者通过可见证据汇合。 OpenAI 的 Harness engineering 复盘还记录了一项重要变化:当代码产量提高,人类 QA 能力成为瓶颈,团队把 UI、日志、指标和测试环境直接做成 Codex 可读能力。Agent 可以启动独立 worktree,操作页面,查询日志与指标,再根据验收条件修正。稳定长程执行需要真实反馈,不能只增加推理轮数。 → 阅读原文:拆解 Codex Harness:让长程智能体可靠运行的工程设计 WorkBuddy 把相似结构放进办公场景。Ask、Craft 和 Plan 三种模式按任务复杂度与权限逐级展开。用户可以先从问答开始,再开放工作目录、Skills、多任务和远程助理。对于第一次接触桌面 Agent 的用户,这种权限梯度比一次性开放全部目录和工具更容易理解,也便于在使用中积累信任。 → 阅读原文:3 万字长文带你 WorkBuddy 从入门到精通 团队何时该自建 Harness?Harrison Chase 给出的路线很克制:先用通用方案获得价值,持续收集私有轨迹和评测;当任务反复偏离通用系统熟悉的分布,再加入中间件、Hooks、记忆、沙箱或特定认知架构。失败可能来自模型、上下文或编排。没有可观察性,自建团队甚至无法判断自己正在修哪一层。 → 阅读原文:何时该为 AI 智能体自建 Harness Harness 的核心工作可以归纳为四项:维护任务状态,把环境能力变成工具,给动作设置权限,把结果送入验证循环。框架复杂度本身没有奖励。每一个新增组件,都应当对应一种已经在轨迹中反复出现的失败。 8 月 8 日至 10 日的早报连续出现淘宝主播 Harness、提示注入、投毒 Skill、Runta 基础设施与 Skill 工程。这些案例补足了另一面:工具可以被调用以后,系统还要验证工具来源、参数、返回内容和外部副作用,并在失败后保留恢复状态。统一 Harness 让这些规则进入同一个治理入口;分散在产品中的临时胶水,会把审计和迁移成本推迟到以后。 三、质量来自可观察、可回放的反馈闭环 执行层能够连续工作以后,质量问题会迅速显现。生成速度和代码量很容易观察,返工、事故和系统理解度却需要更长时间才会暴露。 阿里安全团队分享了一套完整的 Skill 改进流程。Agent 在某些 case 上持续失败,人工改两句 Skill,当前 case 修好,原本正确的 case 又退化。团队因此把结果与轨迹结合起来诊断。确定性规则先压缩问题,LLM 只生成 小于 80 行的最小 unified diff,再经过 target、guardrail、holdout、verify 四层 gate,并保留跨版本黑名单、checkpoint 和自动回滚。 这套流程先解决归因问题。最终结果失败,原因可能是工具缺失、Skill 指令不清、模型忽略步骤、参数错误,或评测本身存在噪声。如果直接把整份 Skill 交给模型重写,多个变量会同时变化,即使分数提高,也很难知道哪项修改有效。确定性诊断把原始轨迹压缩成较小的问题描述,再让模型只处理可以局部修复的部分。 最小 diff 将改进范围控制在可审查尺度内。单次 patch 不超过 80 行,既减少模型顺手改写无关规则的机会,也让回归原因更容易定位。失败 patch 与跨版本黑名单则避免系统在后续迭代中重复走向已知坏解。这些设计让「自我改进」更接近受约束的软件发布流程。 文章披露的实验中,GLM 准确率从 77.8% 提高到 88.9%。这个数字属于特定安全评测,真正可迁移的是流程边界:LLM 提出局部修改,验证器决定是否接受;评测集需要审计,失败 patch 需要保留,连续没有收益时需要停止。系统可以改进「怎么做」,无法发明缺失的工具能力。 四层 gate 也对应不同风险。Target 检查目标 case 是否改善,guardrail 防止已知能力退化,holdout 检查修改是否只记住当前样本,verify 再确认轨迹质量和运行约束。只看一个总分,系统很容易用牺牲未观测行为的方式换取局部提升;分层门禁把这类交换显式暴露出来。 → 阅读原文:Agent 越改越乱之后,我用评测和轨迹把它拉回来了 美团履约技术团队与图灵 Agent 评测团队用两年实践补充了评测结构。他们区分结果评测与轨迹评测。最终回答是否正确是一层;工具选择、调用顺序、参数和中间状态是否合理是另一层。主观标准还要经过「人人一致、人机一致」校准。某履约业务的指标从 20 多个发展到接近 200 个,说明业务评测会随 Bad Case、Good Case 和场景逐步生长。 结果评测适合回答任务有没有完成,轨迹评测用于解释系统怎样到达结果。两个 Agent 可能都交付了正确答案,其中一个使用了稳定工具和可复现步骤,另一个依赖偶然猜测或多次无效调用。只看结果,两者分数相同;进入生产后,它们的成本、稳定性和风险会明显不同。 主观任务还需要先校准人类标准。「人人一致」检验评审者之间是否理解同一 rubric,「人机一致」再检查模型评审能否复现这套判断。如果人类自己对好坏没有稳定共识,增加 LLM Judge 只会把模糊标准自动化。美团从 20 多个指标扩展到近 200 个,也反映业务团队是在真实案例中逐步补齐定义。 Anthropic 的 Agent 评测指南提供了一个简洁判据:transcript 是完整轨迹,outcome 是环境中的最终状态。订票 Agent 声称任务完成,没有数据库里的有效预订,结果仍然是失败。评估一个 Agent,实际评估的是模型与 Harness 的组合。 把阿里与美团放在一起,可以得到一条更完整的改进循环:先用 outcome 判断业务是否完成,再用 trajectory 定位失败环节;修改保持最小;新版本经过目标集、护栏与留出集;最终仍由环境状态验收。评测因此不只是发布前打榜,也成为日常观测、回归与版本选择的一部分。 → 阅读原文:Agent 评测漫谈 Addy Osmani 从代码质量角度提出持续门禁。单元测试验证已知行为,属性测试检查更广的输入空间,变异测试判断测试是否真的能抓住错误,架构规则限制不该出现的依赖。原文含 Sonar 赞助内容,这里只采用与供应商无关的方法。Agent 可以生成大量代码以后,确定性约束需要进入环境,人工评审则集中在意图、架构和难以形式化的风险上。 → 阅读原文:智能体代码质量 Charity Majors 用「信任账户」解释同一个问题。当工程师交付没有逐行读过的代码,团队会消耗对系统的理解与信任。测试、确定性模拟、评测、护栏、可观察性和生产反馈,可以逐步补回这笔账。代码量、速度和部署频率都只是局部信号,客户价值、软件健康度、事故和返工需要一起记录。 METR 在 2025 年对 16 位熟悉项目的开源开发者、246 个真实任务做过随机对照实验。使用当时前沿 AI 工具的开发者平均慢 19%,而他们事前预计会快 24%。样本较小,工具和模型也已经更新,这项研究不能代表 2026 年的全部 AI Coding。它提醒团队,主观流畅度与端到端完成时间可能背离。 → 阅读原文:别再怀疑 AI 开发:用可靠性与信任评估真实成效 阿里 AI Code Review 项目展示了质量系统进入开源维护后的组织结果。团队披露约 2 万月活、30% 以上采纳率、低于 5% 的误报率,开源后达到 2 万 Star。AI 可以处理 Issue 分类、测试、评审和发版中的重复执行,核心团队仍然负责方向、合并、回归与社区关系。自动化提高维护吞吐,也让合并判断与责任归属更重要。 → 阅读原文:连续五天登上 GitHub Trending 首页的思考 四、多智能体扩大了协调和授权问题 单个 Agent 的反馈循环已经很复杂。多个 Agent 共享代码库、市场或工作频道后,资源冲突、信息不对称和目标分歧会增加一层系统风险。 Anthropic Frontier Red Team 的受控实验中,30 个 Agent 里有 18 个独立选择同一分支名;隐藏档案任务的群体准确率只有 17% 至 36%;遇到目标冲突,一些模型会持续升级「地盘战」。这些结果来自特定模型和实验环境,不能直接外推真实事故率。它们足以说明,增加 Agent 数量不会自然产生分工。 分支名冲突看似是一个小问题,却揭示了多 Agent 的共享资源困境。每个 Agent 单独看都选择了常见、合理的名称,群体同时行动时却发生碰撞。类似问题还会出现在文件锁、任务领取、预算消耗和外部账号上。个体策略合理,不能保证系统层面可协调。 隐藏档案实验考查的是信息分散后的集体判断。每个成员只掌握部分信息,需要通过沟通汇总证据。群体准确率显著低于单体上限,说明消息传递、来源可信度与最终聚合都可能损失信息。Agent 数量增加会扩大搜索广度,也增加误导、重复和协调开销。 目标冲突实验则把治理问题推到台前。如果两个 Agent 都认为自己的目标优先,单靠自然语言协商未必能结束竞争。系统需要资源所有权、超时、仲裁、申诉和人工中断等明确机制。否则,更强的执行能力只会让冲突更快地作用于真实环境。 这与 Anthropic 的多 Agent Research 生产系统形成对照。后者采用 orchestrator-worker 模式,lead Agent 先规划,再让子 Agent 并行搜索不同方向。官方内部评测称,它在广度型研究上比单 Agent 高 90.2%。性能数字只代表内部评测,工程经验更值得采用:子任务要彼此可分,结果必须能够合并,工具和提示按角色约束,同时承担更高 Token 成本、错误传播和协调开销。 成功模式与失败实验并不矛盾。Research 场景适合并行,是因为不同搜索方向相对独立,lead Agent 可以在末端汇总;共享代码和竞争性任务更容易产生写冲突与目标冲突。决定是否采用多 Agent 的第一道问题,应当是任务能否被切成低耦合、可独立验收的单元。 多 Agent 系统需要明确协议:资源怎样命名,谁能创建和关闭任务,两个 Agent 修改同一文件时如何隔离,意见冲突由谁仲裁,失败能否申诉,哪些行为触发人工中断。角色提示可以帮助分工,无法代替这些规则。 → 阅读原文:多智能体系统的模式与问题 权限必须进入同一层设计。OpenAI 的 Daybreak 面向高风险网络防御工作,把访问分成 Blue 与 Red。GPT-5.6-Cyber 可用于零日漏洞发现和利用链验证,系统同时要求身份核验、硬件安全密钥、隔离环境、权限范围和动作审查。能力开放与授权条件被写进同一份产品合同。 Daybreak 的背景是网络攻防窗口正在缩短。模型可以帮助防守方更快发现漏洞,也可能加速攻击链构造。简单地提供或拒绝某个模型,很难覆盖任务之间的风险差异。分级准入将使用者身份、用途、环境与能力档位放在一起,让低风险防御工作和高风险研究采用不同门槛。 Red 层承载零日发现和利用链验证,要求硬件安全密钥与更严格身份核验;隔离环境和 scoped permissions 限制可触达资源,动作审查再处理可能产生外部副作用的步骤。这些措施各自覆盖不同失败面:账号被冒用、凭据泄露、工具越界和模型误操作不能依靠同一道防线解决。 OpenAI 公开的 Codex 安全实践采用相似原则。低风险、可逆操作可在沙箱内自动执行;高风险动作触发审批或阻断;Agent 原生日志保留原始请求、工具活动、审批决定、工具结果和网络策略,事故后可以还原行动链。 这条设计同样适用于普通企业 Agent。读取公开文档、修改临时文件和提交生产变更不应共享同一授权级别。权限需要按资源、动作与环境细分,审批也应出现在风险发生的具体步骤,而不是会话开始时一次性授予无限范围。 → 阅读原文:随着网络防御窗口收窄,扩大 Daybreak 项目 Claude Tag 面对日常办公,也需要校准主动性。它读取整个 Slack 频道的上下文、记忆和长期指令,再决定内联回复、开启线程、归入已有任务或保持沉默。Anthropic 称,主动响应判断准确性提高约 30%。办公 Agent 的协作质量既包括及时参与,也包括知道何时不打断人。 → 阅读原文:Claude Tag 现在更能读懂全场 协调与权限需要共同管理。Agent 越多,权限继承和资源冲突越复杂;能力越强,错误动作的外部影响越大。身份、资源、动作和证据形成同一条控制链,自主性才能按风险逐级开放。 五、路由与缓存决定执行层的经济性 Agent 系统要长期运行,成本不能只看模型的输入、输出单价。 OpenRouter CEO Alex Atallah 从网关市场解释多模型选择。不同供应商在价格、速度、可用性、质量和数据政策上存在差异。企业需要路由、故障转移、安全层和供应商替换,才能在单一服务变化或故障时保留选择权。访谈没有给出完整的量化比较,更适合作为产业结构与战略风险判断。 模型网关面对的并非静态选择题。同一模型可能由多个供应商提供,价格、区域、吞吐和故障率不同;同一任务也可能在快速模型、推理模型与专用模型之间切换。路由层需要同时理解任务需求和供应商状态,再决定请求发往哪里。 选择权还有长期价值。模型价格会调整,速率限制会变化,供应商可能中断服务或修改数据政策。如果产品直接依赖某一家专有参数与返回格式,迁移成本会随业务增长持续上升。统一接口、参数能力检测和 fallback 让团队可以逐步替换供应商,而不必在故障时重写整个应用。 OpenRouter 官方文档提供了具体机制。Provider routing 可以指定供应商顺序、是否允许 fallback、是否要求完整参数支持,还能限制零数据保留端点。提示缓存启用后,sticky routing 会把同一会话尽量送到同一供应商,以维持缓存;供应商失败时再切换。 require_parameters 可以避免请求被送到不支持关键参数的端点,ZDR 和 data policy 约束则把隐私要求带入路由。默认的「可用」并不代表业务上可接受。对于企业任务,参数完整性、数据驻留和日志政策可能比几百毫秒延迟更重要。 自动选择模型时,会话一致性同样重要。如果每轮更换模型,行为会漂移,缓存也无法复用。OpenRouter 使用 session_id 固定会话里的模型和供应商。这里存在一个明确权衡:故障转移希望随时换路,缓存和行为一致性希望尽量不换。路由器要根据错误类型、数据策略与任务状态决定如何取舍。 这也意味着路由器本身要接受评测。它是否把复杂任务误送给便宜模型,升级以后是否丢失历史,fallback 是否重复产生外部动作,都需要用真实轨迹检查。网关提高了可用性,也新增了一个可能误判的控制组件。 → 阅读原文:OpenRouter、开放模型与 LLM 网关市场 阮一峰在科技爱好者周刊第 408 期用 DeepSeek V4 Flash 的价格解释输入缓存。示例中,缓存命中的输入价格只有未命中的 1/50。文章进一步比较不同厂商的近似缓存窗口,并计算定时保活是否划算。 Agent 工作流特别适合讨论提示缓存,因为系统指令、工具定义、仓库说明和早期对话会在多轮请求中重复出现。只要稳定前缀保持一致,供应商就有机会复用已经计算过的内容。若 Harness 在历史中间插入消息、频繁改写系统提示,原本可缓存的前缀会失效。 缓存命中价格很低,不代表保活必然划算。为了延长 TTL 而定时发送请求,会产生写入、读取与模型输出成本;真实会话间隔过长时,维持缓存可能比重新计算更贵。文章给出的思路,是用自己的请求规模、间隔和价格计算临界点,而非照搬统一保活周期。 具体价格和 TTL 会变化,可复用的是计算方法:稳定前缀有多长,请求间隔是多少,命中率多高,保活本身花多少钱,任务失败后要重跑多少轮。DeepSeek 的峰谷定价又增加了时间维度。可延期批处理可以结合闲时价格、缓存窗口和队列优先级调度。 缓存还会影响故障转移。Prompt cache 通常保存在具体供应商端点,换路后可能立即丢失;sticky routing 因此尽量维持同一 provider。供应商出现故障时,系统需要接受一次缓存冷启动,或提前在备用端点准备上下文。可靠性和缓存效率之间没有免费的兼得。 缓存还要区分 prompt cache 与 response cache。前者复用前缀计算,模型继续生成新结果;后者对完全相同的请求返回旧结果。Response cache 适合重复测试或失败重放,不适合需要新采样与独立判断的步骤。评测流程如果误用响应缓存,可能得到稳定低价的结果,也可能失去试验独立性。 → 阅读原文:你需要知道的 AI 缓存知识 一次 Agent 任务的真实账单至少包括模型输入输出、缓存写入与读取、工具运行、网络传输、沙箱资源、失败重试、人工审批和事故返工。路由目标不应只写「最低价格」。尾延迟、参数兼容、隐私边界、缓存命中和供应商集中风险,都要进入选择函数。 8 月 11 日早报中的 OpenRouter,随后几天的 DeepSeek 峰谷价格、GPT-5.6 效率设计和 AI 缓存知识,正好组成一条成本链。便宜模型如果频繁失败并触发升级,总成本可能更高;昂贵模型如果缩短轨迹、减少人工介入,可能更划算。缓存命中率、模型升级率、人工介入与最终成功率需要进入同一张生产监控表。 六、执行层正在进入公共基础设施、物理世界与科学研究 Peter Steinberger 的 Agent 项目最初只是一个 WhatsApp 中继。他想在手机上向电脑里的 Agent 发提示。项目受到数百万人关注后,安全审查、媒体压力、贡献者协作和持续运维一起到来。他反复强调,强 Agent 需要完整上下文、验证循环、合适权限和独立运行机器。 这个起点很有代表性。个人工具通常围绕一个明确痛点生长,开发者清楚它运行在哪台机器、可以访问哪些文件,也愿意在失败时手动修复。进入公共使用以后,这些默认条件全部改变:用户环境不一致,凭据和网络边界不同,错误会被快速放大,项目维护者还要回应安全报告与升级请求。 「让 Agent 自由运行」也会增加运行时责任。任务卡住时怎样超时,重复动作怎样去重,机器离线后如何恢复,用户能否看见当前状态,异常是否会消耗无限 Token,都需要产品化处理。一个巧妙的中继解决了交互入口,公共基础设施还要补齐状态、权限、运维和支持体系。 个人工具变为公共基础设施时,能力与责任同步增长。这也解释了开源项目为什么需要 Good First Issue、快速响应、发布流程和人的合并判断。公共项目包含 Issue、PR、版本、社区预期与安全响应,代码生成只是其中一部分。 这与阿里 AI Code Review 项目的经验可以串联起来。AI 能提高 Issue 分类、测试和评审吞吐,维护者仍要判断哪些建议合并、哪些回归需要阻断、怎样与贡献者沟通。Agent 项目规模化以后,团队优化的不再只是模型表现,还包括社区反馈周期与事故响应能力。 → 阅读原文:Peter Steinberger 谈当数百万人让智能体自由运行后会发生什么 刘洺堉与张小珺的访谈把执行层带到 Physical AI。Cosmos 世界基座模型尝试连接物理推理、世界生成与动作预测。NVIDIA 在 2026 年 5 月发布 Cosmos 3,官方称它统一物理推理、世界生成和动作生成,并开放模型、训练脚本、部署工具与数据集。相关领先性描述属于 NVIDIA 官方口径。 世界模型承担的是行动前的预测问题。机器人需要理解当前场景,推测动作可能带来的变化,再选择符合具体身体与任务的操作。真实世界数据昂贵且危险,生成式世界模型可以提供更多仿真与合成样本,让策略在进入现实设备前覆盖长尾情况。 Cosmos 3 将 reasoning、world generation 和 action generation 放进同一体系,试图减少多个独立模型之间的信息断裂。NVIDIA 同时提供不同规模模型、训练与部署工具,说明 Physical AI 的交付对象不是一个云端 API,还包括数据管线、仿真、推理优化与具体硬件。 Physical AI 比软件 Agent 多出更硬的现实约束。机器人有具体身体,传感器存在噪声,动作有延迟和磨损,错误可能造成物理损害。模型还需要仿真、合成数据、策略训练、边缘推理、硬件和安全控制。刘洺堉谈到英伟达自研模型的一个目的,是反向理解硬件和客户的真实瓶颈。模型与基础设施会在真实任务中互相校准。 访谈中的「造市场」也可以从执行层理解。英伟达训练自己的模型,不只为竞争模型排名,还借此发现内存、带宽、推理与开发工具中的瓶颈,再把需求反馈到芯片和软件栈。Physical AI 的竞争单位因此覆盖模型、硬件、仿真平台和开发者生态,任何单点领先都需要整条链路配合。 → 阅读原文:独家对话英伟达刘洺堉 科学研究是另一种高要求环境。腾讯科技借 Jeff Dean 的 Discovery Loop 与《LLMs Can't Jump》等研究,讨论模型为什么难以完成科学发现中的概念跃迁。文章把问题归纳为现实锚点不足、近端优化和缺少持续信念,并用「贝叶斯 AI」描述可能路线。这是二次研究解读,不能作为已经证实的行业结论。 Google AI Co-Scientist 提供了更接近实验的证据。系统让 Generation、Reflection、Ranking、Evolution、Proximity 和 Meta-review 等 Agent 生成、比较和修正假设,部分生物医学候选经过计算、专家与体外实验验证。Google 同时承认,文献综述、事实核验、外部工具交叉检查、自动评测和更大规模专家评价仍需加强。 2025 年一项阿尔茨海默病复现探索给 Agent 5 篇论文的方法和数据说明,让它们尝试复现 35 个关键发现。平均近似复现比例为 53.2%,数值和统计方法经常偏离原文。样本很小,却指向一条清楚边界:生成合理假设与重现实验证据之间,还有数据、方法、环境和专家判断。 → 阅读原文:Jeff Dean 们,赶在贝叶斯 AI 到来之前跳船 执行层进入软件之外的领域后,环境反馈会变得更严格。公共基础设施要求持续运维,机器人要求物理安全,科学研究要求可证伪假设、实验记录和可重复结果。模型可以扩大探索范围,证据链决定哪些结果能够被采用。 本周关键词 长程执行:用完整任务成功率、总时延、总成本和恢复能力衡量模型。 Harness:维护状态,连接工具与环境,处理权限、恢复和人机审批。 轨迹评测:把结果与行动过程放在一起,让失败可以定位、回放和修正。 分级权限:依据动作风险、可逆性与外部副作用逐级开放自主性。 路由与缓存:在质量、延迟、隐私、可用性与成本之间进行生产级权衡。 本期最值得带走的判断,是把模型和执行层放在同一个评估对象里。模型决定系统能够提出怎样的行动,Harness、环境、评测、权限与成本控制决定这些行动能否长期可靠地发生。 关于 BestBlogs BestBlogs.dev 是 AI 驱动的私人阅读助手。它会从 RSS、Newsletter、Twitter、YouTube、Podcast 等来源中筛选高质量内容,结合你关注的源、兴趣标签和阅读行为,把「我的早报」整理成每天真正适合你的阅读流,不论你关注的是技术、AI、产品、商业、研究、设计、投资、文化还是个人成长。 完成新用户三步引导即送 7 天 Pro 试用;现有 Pro 用户每邀请 1 位朋友,双方各得 7 天 Pro,单人上限 28 天。 发现真正适合你的高质量内容。欢迎来体验,也欢迎推荐给身边认真阅读的朋友。 #BestBlogs #精选周刊 #智能体 #Harness #Agent评测 #AI工程 BestBlogs.dev|发现真正适合你的高质量内容

译BestBlogs 第108期周刊聚焦AI智能体执行层,Grok 4.6、DeepSeek V4 Pro、Gemini 3.7 Flash均优化长程Agent能力。DeepSeek开源插件化Harness v0.1,OpenAI公开Codex Harness机制。周刊从执行模型、Harness、评测、多智能体、路由缓存等六条主线,剖析模型如何稳定完成任务。

ginobefun@hongming731 · 10小时前24

过去几期周刊,我们讨论了判断力、验证边界、「1% 法则」和个人 AGI。 第 108 期进入更具体的工程现场,沿六条主线展开:执行模型、Harness、质量与评测、多智能体与权限、路由与缓存,以及执行层进入公共基础设施、物理世界和科学研究之后的新边界。欢迎阅读~

译洪明发布第108期周刊,聚焦AI智能体工程现场,沿执行模型、Harness、质量与评测、多智能体与权限、路由与缓存、执行层新边界六条主线展开。内容承接此前关于判断力、验证边界、「1% 法则」和个人AGI的讨论,深入具体工程实践。

Rohan Paul@rohanpaul_ai · 13小时前35

LLMs can suggest scientific mechanisms, but this paper finds that letting the agent choose experiments and fit the mechanism is far less data-efficient. So scientific agents may work better when the LLM proposes hypotheses but does not decide what the evidence means. MDA turns the LLM into the hypothesis generator. Bayesian inference scores the candidate mechanisms, and value-of-information chooses the next experiment where those mechanisms disagree most. That changes the experiment budget dramatically. On FORCEBENCH, MDA reaches roughly the accuracy of an unthrottled Opus 4.7 agent using 8 experiments instead of about 41, while reaching a 93% numeric pass rate versus 31% for the budget-matched Opus 4.7 LLM agent. The mechanism is easy to see in the examples: for Yukawa forces, it probes long range because the competing laws look identical nearby; for Coulomb, it changes source charge because moving the probe alone cannot separate the true law from a charge-blind fit. When predictions still fail, MDA asks the LLM for new mechanisms and repeats the loop. Let LLMs propose scientific ideas, but let explicit uncertainty and designed experiments decide what survives.

译新方法MDA将LLM限定为假设生成器,用贝叶斯推理评分机制、信息价值选择实验,避免让模型自行判断证据含义。在FORCEBENCH上,MDA用8次实验达到未限流Opus 4.7智能体约41次实验的准确率,数值通过率93%对31%。

Rohan Paul@rohanpaul_ai · 14小时前51

DeepSeek Harness reached 122K+ GitHub stars in 3 days, one of the fastest to rise in GitHub's history. It makes models, tools, loops, storage, scheduling and even the UI swappable plugins. its an orchestration layer for coding agent, runs as a local web app on a configurable port, and exposes every component as a swappable plug-in: shell access, file editing, web search, skills, sessions, model choice, reasoning effort, and permission scope, all editable in a YAML config. sub-agent support is the really special part. You can wire Claude Code or Codex in as plug-ins and let Harness route subtasks to whichever agent suits each step. It's MIT licensed, so you can add other providers or point it at a self-hosted model and never touch DeepSeek's API. However, their release timing for this is strange. They raised the price of cache-hit input by 6-fold to 12-fold in the same week it shipped an agent framework, and cached input is exactly what agent loops consume, since every step replays the same system prompt and accumulated history. Whoever set the API pricing either didn't coordinate with the harness group or deliberately priced the new workload higher. My read is the 2nd, because caching subsidies made sense when agents were rare and become the largest unpriced cost once a framework makes them routine.

译DeepSeek Harness 发布3天即获12.2万+ GitHub 星标,成为 GitHub 历史上增长最快的项目之一。该编排层可将模型、工具、存储、调度乃至 UI 全部作为可替换插件,支持将 Claude Code 或 Codex 接入作为子智能体,并采用 MIT 许可。同期 DeepSeek 将缓存命中输入价格提高6至12倍,而缓存输入正是智能体循环的核心消耗。

AYi@AYi_AInotes · 18小时前49

这条推可能是今年AI coding圈最火的一条错误建议了,2000多赞,但你去看回复区,一众AI大佬们,Hermes创始人@Teknium,@NickADobos 基本都在说不对。 我先说它哪里对,它抓住了一个真实痛点:很多人的Skills写得烂,description不精准路由失败,或者搞了一堆过时冲突的skill文件,确实变成了负担。 这种时候你说"别整这些了全塞一个文件",在他自己那种极简RL项目里可能真的是最优解。 但问题是他把个人最优当通用建议了。 咱们得先搞清楚这两个东西到底是什么关系。 AGENTS.md是always-on的,每个session都加载,放的是项目级说明书--怎么构建怎么测试、编码规范、不能动的文件、安全边界。 Skills呢,平时只加载name加description大概100个token,只有任务匹配的时候才把完整内容塞进上下文。 所以Skills的核心设计就是progressive disclosure,渐进式披露。 它存在的理由恰恰就是为了解决"把一切都塞进一个大文件"带来的bloat。 原帖说skills是bloat,但skills是管理bloat的工具啊,他把解决方案当成了问题本身。 那全塞agents.md会怎样?会有三个代价。 →第一每次任务都支付全量token成本,不管这次用不用得到那些内容。 →第二关键指令被稀释,模型对超长prompt有lost-in-the-middle问题,不相关的详细流程永远挂着反而让真正重要的约束被忽略。 →第三不可维护,越来越长变成垃圾堆,跟把所有逻辑塞进一个巨大main函数一个道理。 但我也不是说@yacineMTB 全错,我的结论是它有一个很明确的适用边界--指令总量几百行以内的极简个人工具,一个干净的AGENTS.md确实够用甚至更简单。 一旦你有多个专业化工作流,代码审查安全审计发布检查领域分析,模块化优势就迅速显现了。 更好的实践不是二选一,关键是如何分层: 1️⃣AGENTS.md 保持极瘦:几十到一两百行,只放真正 always-on 的东西2️⃣可复用的任务知识做成 Skills,依赖 progressive disclosure 按需加载 3️⃣规模再大、需要动态数据时,再上 MCP Skills 不是 bloat 的来源,是管理 bloat 的工具。 对极简场景可以说够用,但作为通用建议基本不成立。

译针对"Skills是bloat、应全塞进AGENTS.md"的流行建议,多位AI从业者指出其误区。Skills采用渐进式披露,仅按需加载完整内容,而AGENTS.md每次会话全量加载。全塞进AGENTS.md会导致token成本高、关键指令被稀释及不可维护。适用边界仅在极简个人工具,多工作流场景应分层使用。

Dongxi 东锡 NLP@dongxi_nlp · 18小时前56

https://x.com/i/article/2088856146954067968 DeepSeek Harness:把边界写成契约 DeepSeek Harness 开源了,如果说简单总结 DeepSeek Harness 的设计哲学,那就是 "事实有据,权限有度"。 第一次面对它,你可能会期待一个 model wrapper、一组 tools,或者一个围绕 DeepSeek model 搭起来的 CLI。 沿着 contracts、source 和 tests 走完以后,真正吸引我的,是另一个地方: 它拒绝把 agent state 写成一个模糊不清的目标。 每一份重要 state,都会被放到有能力验证它的 owner 身边。 Truth Has An Owner file provider 持有当前 file truth。 session policy 记住 Agent 曾经观察到了什么。 live events 协调正在发生的 execution。 durable events 记录下一次 session 仍然可以 replay 的历史。 model projection 和 client projection,只选择各自真正需要的部分。 DeepSeek 框架具有清晰的架构特征:每个重要事实都位于可验证或可执行的位置。 Example:shell command 运行时可以不断发送"40% complete"这类 live state。结束后,durable history 只需要保存 command 和 final result。 The Stale Read Tells The Whole Story 假设 Agent 在 v1 读过一个文件。准备 edit 之前,另一个 process 改写了文件。 薄弱的 Harness 只记得 transcript 里出现过一次 read。DeepSeek Harness 会保留 observed version,然后要求 filesystem provider 只在 current version 仍然等于 v1 时执行 mutation。 policy 持有 expectation。provider 持有 current truth。atomic comparison 关闭了 time-of-check/time-of-use gap。 还有一个很精细的边界:window read 可以证明这个 file version 仍然 fresh,却不能证明 model 看懂了整个文件。 所以说,freshness 和 completeness 是两条 policy。 Example:Agent 读到 timeout = 30。同事把它改成 60。Agent 的 edit 仍然携带旧 version,provider 会拒绝它,并要求重新 read。 A Tool Is An Event Pipeline tool call 不会直接落进 handler。 它会经过 immutable identity、schema validation、pre-execution hooks、monotonic guards、execution wrapper、normalization、finalization 和 result recording。 DeepSeek 甚至区分 live tools/result notification 和 durable tool/result session fact。 这一个复数差异很能说明问题:coordination state 与 historical state 有联系,也有各自的 owner。 Example:对于"find TODOs",schema 检查 query,guard 把 search 限制在 workspace,runner 找到 matches,finalizer 再记录 normalized result。 A Subagent Opens A Managed Runtime DeepSeek 也让 subagent 比"再 call 一个 model"更准确。 spawn child 时,需要分别做三类决定。 第一,context seed:fresh instructions 或 completed-turn fork。 第二,lifecycle:one-shot、background,或者可以 follow-up 的 continuable child。 第三,authority:tools、approval behavior、resources 和 delegation depth。 parent 最后拿到 report、settlement,或者 transcript projection。child 可以消耗很大的 local context,同时避免污染 parent conversation。 Example:parent 让 child 检查 failing tests。child 只拿到这个 task 和 read/test tools,最后返回五条 diagnosis,不回传整段 transcript。 What Is Worth Copying ? DeepSeek Harness 的哪些部分可以借鉴到你自己的 harness? 真正值得带走的经验或许是一种架构的设计哲学: 对每一种 capability,都要说清 truth owner、authority gate、durable record、model projection 和 recovery rule。 Example:对于 screenshot,browser 持有 pixels,permission 控制 capture,file 保存 durable artifact,model 只看到 bounded preview,retry rule 处理 capture failure。 如果其中一项没有找到根据,Harness contract 就还没有完成。 这就是我对 DeepSeek Harness 的一瞥:这就是我对 DeepSeek Harness 的一瞥:它把隐性边界变成了可测试的运行时契约。 把边界写成契约

译DeepSeek Harness 开源,设计哲学是"事实有据,权限有度"。它拒绝将 agent state 写成模糊目标,让每份重要 state 由能验证它的 owner 持有,并通过 atomic comparison 关闭 time-of-check/time-of-use gap。

AYi@AYi_AInotes · 20小时前60

你永远可以相信@deepseek_ai 开源的诚意!!! DeepSeek 竟然把自己内部工程团队吃饭的家伙直接开源了🤯。。 就算DeepSeek API价格涨价12倍, 我依然觉得叫一声梁圣他值得! DeepSeek Harness发布的仓库里,把自己内部工程团队怎么干活的11个真实工程级 Skill,也全部拿出来了, 是他们自己每天在用的Code Review标准、质量门禁、PR验收流程,damn!!! 你可以拿来塞进Agent直接跑: 等于让你的Agent按DeepSeek内部的工程标准干活,像资深工程师一样工作--知道什么优先、什么该拦、什么该删、什么该归档, 1️⃣ dsh-code-review - Agent 按仓库自己的标准做语义审查,优先看正确性、安全边界、生命周期,不是堆 nit 2️⃣ dsh-pre-push-checks - 推送前只跑与当前改动相关的最小检查,不是机械全量测试 3️⃣ dsh-find-simplifications - 主动找过度设计、死代码、重复实现,写成正式提案 4️⃣ dsh-merging-stacked-prs - 安全落地一串依赖的 Stacked PR,不再手动改 base 改到崩溃 5️⃣ dsh-doc-site-sync - 文档站永远是源文件的投影,不是两套独立的东西 6️⃣ dsh-doc-standards - 文档层级、字数预算、教程 vs 参考的结构纪律 7️⃣ dsh-prose-standard - 所有 prose 只保留合同(不变量、前后置条件),去掉装饰和推理过程 8️⃣ dsh-translate-docs - 中英双语文档的高质量维护,强制术语一致+验证门禁 9️⃣ dsh-trim-cot-leakage - 清理文档里残留的思维链泄漏、变更叙述、审查痕迹 🔟 dsh-archive-agent-notes - 决策笔记按未来价值归档,解决知识库膨胀问题 1️⃣1️⃣ record-browser-gif - GUI 相关 PR 必须附真实浏览器录制的交互 GIF,验收从看文字变成看行为 我觉得这些skill的真正价值不是教 Agent 写代码,而在于教 Agent 怎么像一个有经验的工程师一样工作--有标准、有优先级、有质量门禁、有归档纪律, 资深工程师脑子里那些隐性的工程纪律,现在变成了可执行、可复用、可审计的 SOP, 做 Coding Agent 或者在搭自己 Harness 的兄弟, 这11个skill值得一个字一个字拆, 每个背后都是踩了无数坑攒出来的工程方法论,比你买多少课都管用。 GitHub 链接放评论区 👇

译DeepSeek 开源其内部工程团队使用的 DeepSeek Harness 仓库,并附带 11 个真实工程级 Skill,涵盖 Code Review、质量门禁、PR 验收等标准流程。

AYi@AYi_AInotes · 21小时前70

DeepSeek V4 Pro 作为当前最强开源 Agent 模型,有个很离谱的毛病, 或者说是有个真实软肋: 能力高度绑定特定脚手架, 换个工具集换个 harness 换个系统提示,它就可能从 99 掉到 91, 也就是说同一个模型,同一套任务,分数能差 7 到 8 分, 区别只在一件事:第一轮你给它用了多少工具, 如果把25 个工具从第一轮全塞进去,91 分,思维链全是 let me,到处乱试, 只给 bash 和 str_replace_editor 两个,稳定 96 到 99, 两阶段锚定--第一轮只给 2 个核心工具,模型真正调用后再解锁完整工具面--连续 98 和 99, 91 和 99,同一个模型,为什么?? V4 Pro 经过强 RL 训练,高能力轨迹被高度条件化在极简接口上,训练时它见的就是这种环境, 你一上来塞 25 个工具加复杂系统提示,等于直接把它推出训练分布, 这时候它除了被干扰了注意力,还相当于被推进了另一个行为模式, 规划者和混乱执行者之间没有过渡,首轮条件直接决定后面整条轨迹, 最讽刺的是官方自己也知道, DeepSeek 跑公开 Agent benchmark 用的就是极简模式,灰测成绩和极简路径高度一致,正式版默认给你 Standard,然后一用就拉, 评测用的脚手架和用户用的脚手架,不是同一个东西, 社区已经出了补丁, dsh-routing-suite 和 dsh-anchored-standard,自动第一轮极简锚定,首次工具调用后挂档解锁, 不想装插件就自己写状态机,第一轮只暴露两个核心工具,模型真调用了再注入剩下的, 最低成本验证:同一个任务,Standard 跑一遍,极简跑一遍,看思维链起手词, let me 开头是混乱模式,we 开头是规划模式,差异肉眼可见, 但补丁能治不代表病好了, 当前最强开源 Agent 模型有个真实软肋:能力高度绑定特定脚手架,换个工具集换个 harness 换个系统提示,它就可能从 99 掉到 91, 根本解法是模型自己对更丰富的工具面具备鲁棒性,不是每次靠用户帮它找锚点, 当然不是DeepSeek的模型菜,别一上来就把整套工具箱全放出来,先给两个工具上手再说

译DeepSeek V4 Pro 能力高度绑定特定脚手架:同一模型同一任务,首轮塞入 25 个工具仅得 91 分,只给 bash 和 str_replace_editor 两个工具则稳定 96-99 分,两阶段锚定(先极简后解锁)连续 98-99 分。

ginobefun@hongming731 · 23小时前43

https://x.com/i/article/2088785861869776896 BestBlogs 早报 · 08-16|三大模型加密思维链被旁路转录,DeepSeek Harness 世界观与 Flue 2 的智能体 Hook 在线阅读本期早报 BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。 导语 按 Haiku 4.5 的 API 价格、每条思维链 1.2 万输入加 1.2 万输出 token 估算,解码 1 万条顶级模型隐藏思维链的成本约 720 美元。 这是一篇 116 页论文给出的测算,也是今天第一条精讲的入口:MATS 研究员 Alexander Panfilov 领衔、马克斯·普朗克智能系统研究所与 Snyk 参与的研究证实,Anthropic、OpenAI、Google 三家的 API 普遍存在密码学旁路漏洞--加密推理包注入同厂轻量模型并越狱后,小模型会把旗舰模型的隐藏思维链逐字转录出来。 第二条精讲回到 DeepSeek Harness。08-14 的早报拆过它 Everything is a Plugin 的架构,本期只讲增量:腾讯科技把这套系统放进递归自我改进的研究脉络,读出一套关于组合泛化的世界观,以及它可能为 Agent RL 奖励归因铺路的推断。 第三条属于想动手的读者:Astro 创始人 Fred Schott 发布 Flue 2 首个稳定版,把 React 式 Hook 引入智能体开发。 三条内容分属安全实证、理论解读与工程实践三个问题域,彼此独立,本期不做合流叙事。速览里另有一处对蒸馏一词的消歧,建议与头条对照着读。 ★ 精讲一:全球三大顶尖模型的防蒸馏机制全面告破 来源:InfoQ 中文 · BestBlogs 评分:91 隐藏思维链(Reasoning Tokens)一直被闭源厂商视为最有价值的护城河之一:推理过程加密封装,用户只拿到最终结果。论文《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv:2608.09867,116 页)的结论是,这道加密挡不住人--攻击者无需破解加密算法,路径分四步:先从顶级模型(如 Opus 4.8)的 API 交互中捕获加密思维链数据包 Blob;把它作为上下文注入同厂轻量模型(如 Haiku 4.5);对轻量模型施加越狱提示;小模型不再自行推理,而是像解码器一样把旗舰模型的原始推理逐字转录出来。 最容易受质疑的地方也在这里:Haiku 输出的真是 Opus 的思考,还是它根据上下文现编的?研究团队拿不到厂商服务器内部的纯文本,无法逐字符证明一致,论文因此把小模型称作 fuzzy decoder(模糊解码器),而不是密码学意义上的解密器。他们找到的验证尺子是 API 账单:横轴为账单计费的隐藏推理 token 数、纵轴为提取出的明文 token 数,Claude、GPT、Gemini 的大多数样本紧贴 y=x 分布。这是很强的间接证据,但仍然不是密码学证明。 漏洞的根源在工程取舍。加密推理块具有过强的可移植性--同一厂商生态内跨模型、跨会话、跨用户都可重放;厂商为节省存储成本采用无状态架构,加密密钥常设为全局通用。研究显示,除 Anthropic 的 Fable 5 之外,Claude 系列、GPT-5.6 系列、Gemini 全系都允许低端模型读取高端模型的加密思维链。利用成本也低:按 Haiku 4.5 价格、每条 1.2 万输入加 1.2 万输出 token 估算,解码 1 万条完整思维链约 720 美元,具备规模化效应。 论文的另一半更敏感:记忆度分析。让各模型复现 Opus 4.8 隐藏推理的后续 16 个 token,所有模型都做不到背诵,但 Kimi-K3 命中原文的理论查询成本比 DeepSeek-V4-Flash 和 Inkling 低 4 到 6 个数量级;仅注入 Opus 推理开头 1% 作为前缀,Kimi-K3 的可见回答风格就明显向 Claude 偏转。研究者用互换前缀的对照实验排除了通用的上下文学习解释:把前缀换成 Inkling 的推理,Kimi-K3 毫无漂移。敏感度也高得反常--仅需 1 到 16 个单词的前缀,Kimi-K3 就向 GPT-5.6 Sol 发生明显风格漂移(风格可分性 AUC 从 0.96 跌至 0.89),GLM-5.2 对 Opus 也有极强定向漂移,DeepSeek-V3.1 等模型则保持风格稳定。作者反复强调,这些只构成行为兼容性上的数据指纹,不足以直接证明蒸馏。 背景与边界同样值得记下。今年 5 月,密码学家 Matthew Green 已向厂商报告过加密推理重放风险,当时得到的官方回复是「未观察到旁路攻击或重放机制带来任何实质性的安全威胁」;论文还从约 7000 份公开 trace 中恢复出 62 个高权限生产密钥、33 个明文密码与 367 项个人身份信息,这是漏洞之外的隐私后果。社交平台阅读量超 210 万是平台口径,三家厂商的回应与独立复现目前缺位。看这类研究,先分清概率异常与实锤两档证据--论文自己划的线,就在 fuzzy decoder 这个措辞上。 ★ 精讲二:DeepSeek 的 Harness,有一套新世界观|Hao 好聊趋势 来源:腾讯科技 · BestBlogs 评分:91 08-14 的早报拆解过 DeepSeek Harness(下文简称 DSH)Everything is a Plugin 的架构:Session、System Prompt、Tools、Agent、Agent Loop、Scope、LLM 七个核心包全部插件化,Cordis 运行时只保留六种基础操作。本期不复述架构,只讲腾讯科技这篇解读的增量--它把 DSH 放进递归式 Harness 自我改进(RHI)的研究脉络,再借 MIT CSAIL 的论文读出一套关于组合泛化的世界观,并推断这套设计可能是在为 Agent RL 的奖励归因铺路。 为什么改进 Harness 而不是改进权重?千亿参数的神经网络是连续、高维、强耦合的参数空间,模型知道自己长期规划不好,也没有一个语义坐标指出该改哪一层哪个参数,通常要绕道数据、奖励、课程或 RL 环境再让梯度下降完成更新。Harness 层则是可操作的:近几个月 Meta-Harness、AHE、Self-Harness、RHI、HarnessBank、Harness-R1 等论文密集出现。但落地后的 RHI 全无统一路径,卡在三个没澄清的问题上--进化什么、怎么进化、何为真递归。 第一个困境是到底进化什么。3 月斯坦福的 Meta-Harness 把 Harness 的可执行代码直接交给一个 Coding Agent,让它像程序员查仓库一样读源码、历代候选成绩与执行轨迹再决定下一版怎么改,修改边界相当模糊。4 月复旦的 AHE 点破了要害:Prompt、工具、中间件、技能、长期记忆性质完全不同,却混在同一个异质动作空间里,它把每个可编辑组件单独文件化,称为组件可观测性。8 月的 HarnessCompass 进一步发现跨组件干扰--修改互相覆盖或抵消--于是先做组件级优化再整合,在 SWE-bench Verified 上用 GPT-5.4 只演化 5 轮,把 Pass@1 从 54% 提到 66%,留出任务泛化也更好。 第二个困境是怎么进化。7 月 Sakana AI 在量化金融、机器人、药学三个领域的 30 个任务上,用几轮 Harness 更新让低推理预算的 Agent 超过高预算模型,推理成本最多降约 60%--这是正面的证据。反面来自 AI2:把 Harness 演化与并行采样、连续修订放在相同反馈与预算下比较,现有方法并未稳定胜过简单的测试时扩展;换到完全留出的 Terminal-Bench 2.1 任务上,Opus 4.6 仅提升 1.2 个百分点、GPT-5.4 为 0、平均 0.6 个百分点。 UC Berkeley 的另一篇论文把 OpenEvolve、TTT-Discover 一类系统的部件重组为 30 套 Harness,在 12 组模型与问题组合上跑了超过 310 万次 LLM Rollout,结论是没有一套固定 Harness 能在所有组合上稳定最好--Harness 的选择更像依赖具体模型和问题的超参数。第三个困境何为真递归,要到 8 月的 Harness-R1 才崭露头角:它从 Agent 失败轨迹学习编辑可执行运行时,训练 9B 优化器把 Qwen3.5-9B 的成功率从 44.3% 提到 53.6%。各论文结果都在各自基准上取得,互不可比。 MIT CSAIL 那篇出圈的文章给了把三个问题放进同一个框架的世界观:Harness 是组合泛化器--碰到没见过的新题,系统不必重新学习一种完整的新能力,而应尽量把已经会的东西重新组合起来。在这个框架下,进化什么变成表示问题:把开放的程序空间表示成一组稳定、离散、有语义的修改单位;怎么进化变成组合问题:不再追求唯一最优的完整 Harness,而是沉淀可复用原语并学习组合策略。DSH 恰好在这个方向上给出了工程实现。 这篇解读最有意思的推断在奖励归因。DSH 的理论侧--北京大学与 DeepSeek-AI Harness 负责人崔添翼的时空可组合性论文--给了两套机制:可回退效应(revertible effects)让每次修改都向运行时返回一个逆操作,卸载组件时按相反顺序恢复;反应式共效应(reactive coeffects)把组件间的依赖提升为运行时可见的拓扑图。两者叠加,加 A、撤 A、换 B 这类反事实干预就变成影响范围可追踪的局部操作--奖励有机会落到这种结构下的这一次干预,而非整版 Harness。腾讯科技的判断是,这可能才是 GRPO 提出者为 Agent RL 藏下的底牌。 边界要说清:DSH 官方页面只确认 developer preview 与插件化设计,上述世界观与 GRPO 归因属于访谈与编辑层的引申解读,官方未对趋势表态;API 与插件契约在稳定版前仍会变动。评价任何 harness,与其数插件数量,不如问三件事:它把什么变成了稳定原语、依赖关系是否显式可见、一次改动能否被单独归因与撤销。 ★ 精讲三:面向智能体的 React:Astro 创始人将 Hook 引入他的元挂载器 Flue 来源:Latent.Space · BestBlogs 评分:90 Astro 创始人 Fred Schott(其公司今年 1 月被 Cloudflare 收购)发布了 Flue 2 的首个稳定版,核心是把 React 式的 Agent Hook 作为地基。他最初的想法是给智能体做一套 Astro 或 Next.js,后来意识到问题出在更底层:也许还没人做出面向智能体的 React。在 Flue 里,一个智能体就是一个 JavaScript 函数,在每次模型调用前重新渲染--这句话值得存下来,它把 React 的重渲染心智模型原样搬进了智能体开发。 Flue 2 内置 16 个 Hook(useSkill()、useTool()、useSubagent() 等),用 TypeScript 编写,也支持自定义。Hook 打开的能力,是让智能体的配置随对话或工作流进程动态调整:一个客服智能体可以先验证用户身份,再挂载账户管理工具。Schott 的理由很直接:真实的客服、分诊类智能体无法在事前配置完整,静态配置撑不住真实场景,智能体必须实时适应用户诉求。 设计取舍来自真实用户。Flue 1 曾把 Web 框架的文件路由搬过来,把五个智能体放进五个文件当五条路由;但更大的客户反馈是,他们整家公司就是一个智能体,不关心路由。文件路由于是被判定为反模式,可组合性取代路由成为核心--用 Schott 的话说,Flue 2 的 API 取自 React 多于 Astro 或 Next.js。底座选了开源极简 harness Pi,他类比 Pi 之于 Flue,如同 Vite 之于 Astro。 与 Vercel eve 的对照是本期最实在的分叉:两者同样内置 harness,eve 的优化向 Vercel 平台特性倾斜,Flue 坚持对各类宿主开放,而 Vercel 自己也演示过 Flue 智能体部署在其平台上。访谈里另一句原话同样关键:「There is no agent without a harness」--智能体离不开挂载器。这与速览里 Cloudflare 给智能体补遥测层、08-14 拆过的 DSH 插件化,都发生在同一层:挂载器正在长出多种形态,Flue 是其中偏前端接入的一种。 边界:面向智能体的 React 这个定位说法出自 Schott 与 Latent.Space,无一手来源直接使用该表述;@flue/react 的 useFlueAgent 签名在 main 分支与 npm 2.0.3 README 间已出现差异,API 尚未稳定;星标数随时间快速变化,不宜当采用规模证据;managed agents 产品明确不在路线图。已会用 React Hook 的开发者不必立刻换框架,但配置随对话进程动态调整这种组织方式,值得抄走。 速览 速览七条按研究、工程、产品、行业四组推进,各自独立成篇。 大模型后训练配方演进与多教师在线策略蒸馏|对话 AI2 研究员 Finbarr Timbers 来源:跨国串门儿计划 · BestBlogs 评分:87 AI2 研究员 Finbarr Timbers 在离职前与主持人 Nathan Lambert 复盘后训练配方的演进:从 InstructGPT 的三步法到多教师在线策略蒸馏。核心观察有两个--DPO 正从主流配方中淡出;配方复杂度的实际瓶颈不再是单点算法,而是组织的整合能力。 支撑观察的证据链:InstructGPT 时代的人工示范、偏好数据与独立奖励模型在四年间基本被迭代掉;其中从 R1 发布到 O3 落地的项目周期约 9 个月,复杂度已逼近团队组织能力的极限;DeepSeek V3.2 引入专家创建迷你配方,V4 增加多教师在线策略蒸馏损失;英伟达的研究发现训练流程差异大的教师无法简单合并,需要跨教师对齐或分阶段蒸馏压低 KL 散度。 这里要做一个消歧:这期访谈里的蒸馏是正当的工业训练技术--先训练领域专家教师,再蒸馏回通用模型;与今天头条的旁路提取思维链是两件事,恰好同日入选,对照着读正好看清边界。访谈属个人观察与回忆口径,具体月份与数字未逐一对照论文;主持人 Nathan Lambert 同时点评过头条论文,两处观点可以串联,但不能互相当作证据。 HeyGen 联手 Google Cloud:Avatar IV 视频模型移植 TPU 实测 来源:Google Developers Blog · BestBlogs 评分:91 HeyGen 与 Google Cloud 把 180 亿参数的 Avatar IV 扩散模型移植到 8 芯 Trillium (v6e) TPU 上。经三项内核与编译器优化,相对首个可用 TPU 版本提速 1.86 倍,流式性能与 8×H100 生产设置相当,每分钟生成视频最多省 25% 成本。 三堵墙各有解法与数字:把 all-to-all 通信流水线化,使其在计算流上的占用降约 5 倍;稀疏注意力的块大小从 128 对齐放宽到 16,让部分块问题随构造方式消失,超分阶段提速超 10%;用 Cauchy-Schwarz 上界预计算替代在线 softmax 的串行依赖,98-99% 的注意力头适用。所有改动都要过双层质量门--逐帧哈希一致,或落在独立测得的 bf16 相似带内;一个更快的候选因为掉出相似带被弃用。 这篇的价值不在数字而在纪律:每个优化都绑定输出质量门,速度不以画质为代价,这套做法比 1.86 倍本身更可迁移。数字为 HeyGen 与 Google Cloud 自述,1.86 倍的比较基准是自家首个 TPU 版本而非 GPU 生产版;成本口径为每分钟生成视频,不含训练与部署侧。 Cloudflare 新增 Agent 追踪,存在截断限制与不一致的 Payload 默认设置 来源:InfoQ · BestBlogs 评分:87 Cloudflare 推出 Agent 追踪,这是 Cloudflare Agents 的首个组件。它在 Workers 已有的基础设施追踪之上增加 agent 级 span--invoke_agent、chat、execute_tool、tool_approval,模型与 token 用量作为元数据挂在 span 上;beta 期免费,2026 年 10 月 1 日起纳入 Workers Observability 计费。 它要解决的问题很具体:智能体返回 HTTP 200 仍然可能失败--选错工具、把过期上下文交给子代理、在重试循环里烧 token,基础设施遥测看不到这些行为。最值得注意的细节是默认值不一致:Think 与 wrapAISDK() 默认不存消息与工具 payload,Flue 却默认存储消息、系统指令、工具定义、参数与结果,需要显式关闭;计费按 span 计,包括仪表盘不显示的 SDK 内部 span,付费档每月 2000 万事件、超出部分每百万 0.60 美元;trace 非无损记录,长内容会截断,回放不显示图片。 两个判断:它印证了 agent 运行时需要自己的遥测层;默认值与截断限制直接关系隐私与账单,选 harness 前值得先查一遍。会话回放是调试工具而非审计证据,这一点官方自己说得很清楚。这条报道恰好记录了 Flue 默认存储 payload 的行为,可与第三条精讲互相注脚。 为智能体而非人类构建文档:OpenWiki 的设计思路 来源:LangChain · BestBlogs 评分:89 LangChain 开源 OpenWiki(MIT 协议):一个 CLI,用来生成并维护专为智能体消费设计的代码库文档。它采用 Google Open Knowledge Format 的 front matter,基于 Git 历史与 GitHub Actions 定时任务自动更新,让文档随仓库演进保持新鲜。 三个产品论点:为 agent 而非人类读者写;CLI 引导上手;文档自动保鲜。面向 agent 的文档与面向人的不同--要自包含、标题精确、按上下文窗口而非人类叙事组织篇幅。早期 DeepSWE 实验显示工具调用更少、token 更省、结果持平或更好;团队后因用户反馈,补上了给人看的架构图。 它把 agent 记忆这个偏研究的话题,拉到代码库文档这个可验证的切口上。与 Stack Overflow 一条放在一起看正好构成对照:公共问答退潮的同时,文档层正在按机器可读的标准重组。效果数据来自 LangChain 自述的早期实验,规模与基准有限;通用记忆是不是下一个前沿,是演讲者的判断而非行业共识。 用 ChatGPT Work 交付可提交董事会的报告材料 来源:OpenAI · BestBlogs 评分:86 OpenAI 用一段完整演示展示 ChatGPT Work 的交叉核验工作流:通过插件把 Google Drive 里的季度材料与 NetSuite 记录对账,系统返回 no-go 判定与两处关键问题--6 月实际数已在 NetSuite 更新,收入备忘录却仍在用旧预测--然后引导团队逐处修正、重跑检查。 同一套方法随后用在 20 页高管备忘录与 34 页董事会材料上:数分钟内重跑给出可否发送的判断;对密集文档用红色高亮定位需要更新的位置;在数百页的更大材料集中,既校验数字,也浮出相互冲突的表述主题。 这是 AI 办公从生成内容转向核验既有材料的具体样例,价值锚点在发现不一致而非替人写作,正好补上快讯里办公成为 Agent 主战场一条在操作层面的画面。边界同样清楚:这是厂商为自有产品做的 scripted 演示,不构成真实审计场景的结论;交叉核验的可信度取决于插件接入的数据源是否完整,演示未覆盖失败模式。 Stack Overflow 的衰退与知识生产的结构性迁移 来源:机器之心 · BestBlogs 评分:90 数字先摆出来:Stack Overflow 月提问量从 2014 年 3 月的峰值 20.7 万,跌到 2026 年 7 月的 1304(官方 Stack Exchange Data Explorer 口径);2026 年前七个月合计约 1.2 万个,按 2016 年的日均提问速度算,只相当于那一年大约两天的量。压缩还在加速:2024 年 12 月尚有 17935 个提问,2025 年 12 月只剩 3312 个(同比降 81.5%),2026 年 6 月的 1072 个是除私测启动月外全站最低的完整月份。 衰退比 ChatGPT 早了八年。拐点在 2014 年:站方系统性收紧审核、更积极地关闭重复和不合规范的提问;2022 年一项 968 条新帖样本的研究显示,49% 遭遇关闭、无人回复或无理由负分中的至少一种。奥克兰大学的 Kenny Ching 追踪 24304 名贡献者 17 个月,发现高声望用户流失加速并追平低声望用户,机制被命名为信号压缩。2025 年官方调查覆盖约 4.9 万开发者:84% 在用或计划用 AI,高度信任 AI 输出的仅 3%。 这组数据把 AI 时代知识去向的讨论从感慨变成有出处的结构变化:公共可检索问答退潮,知识向官方文档与私人对话迁移,损失的是任何人可查阅、也可纠正的公共记录;Pieter Levels 的追问--没有新内容,下一代模型拿什么训练--把问题接到了 AI 自己身上。作者也列出了反向可能:知识在迁移而非消失。 别再吹高端 Agent 了,国内绝大多数企业,连豆包都还没入门 来源:非凡产研 · BestBlogs 评分:90 __XPOSTER_u5qir_IMAGE_5__ 一场四位从业者的圆桌给出 2026 年中国 AI 落地的水位线:一位做物流的老板连豆包都没用过,装上之后玩了一晚上企业运势算命;而圈内已经在讨论 agent 调 agent。两层之间隔着的不是模型差距,是需求明确性与落地能力。 有一组可以核对的账。做 AIGC 视觉的创业者 2023 年第一个客户带来当月 45 万元的 API 账单,经开源模型自部署加服务费降到每月不到 20 万元,在线模板沉淀了 250 多个;输出稳定性靠三层--结构化行业 prompt 库、生成后 double check、底层用有向无环图约束。做 FDE(驻场工程师)的嘉宾提出按结果付费:原来不能走、现在能走了再收钱,现场只有一个人举手接受。 这条的价值在需求侧刻度:多数企业卡在说不清哪里该用 AI,落地生意的关键词是 ROI、兜底与上门问诊,而非模型选型--与 Flue、DSH 那类供给侧工具正好是同一问题的两端。圆桌属个案叙事而非统计调查,账单数字来自讲者自述,按结果付费的接受度来自现场举手,样本极小,不能外推为行业比例。 补充阅读 刚刚,Qwen3.8-27B 开源了! 来源:千问大模型 · BestBlogs 评分:87 千问开源 Qwen3.8-27B:原生多模态稠密模型,262K 原生上下文、YaRN 外推至 1M tokens,新增 reasoning_effort 按任务难度控制思考深度,Apache 2.0 协议免费商用。官方称其编程与办公场景较 Qwen3.6-27B 大幅提升、部分表现超越 Qwen3.7-Plus--提升声明为官方口径,第三方评测尚未跟上。 与运行时无关的 AI 工作流:一种兼顾生产环境稳定性和快速评估迭代的模式 来源:InfoQ 中文 · BestBlogs 评分:90 一种把编排逻辑与运行时解耦的工作流模式:定义统一的 Steps 接口,生产环境接 Temporal 这类持久化运行时保稳定,评估环境用进程内轻量循环换迭代速度,两边共用同一套编排代码。模式源自 Brex 的 AI 工作流平台--TypeScript 编写、五名工程师维护。 巨头争抢 AI 办公,不再只拼模型 来源:晚点LatePost · BestBlogs 评分:90 晚点LatePost 的分析指出办公正成为 Agent 主战场:腾讯 WorkBuddy、阿里千问办公、字节豆包与飞书,海外的微软、谷歌、Anthropic、OpenAI,都在把 Agent 塞进文档、会议、邮件与任务执行。模型能力趋近之后,安全、开放与企业工作上下文积累成为新的竞争壁垒。 刚刚,GLM-5.3 发布:Coding 更接近 Fable 5!潜伏 40 年的 bug 都被揪出来了 来源:量子位 · BestBlogs 评分:88 GLM-5.3 的安全与编程评测昨天(08-15 早报)已经精讲,这里只补一句实测增量:量子位的实测覆盖从 3D 建模到可交付游戏的完整工程链路,CyberGym 白盒代码审查 84.5%,按该口径维持最强开源安全模型的位置。 浙大团队开源 AI 科研智能体 Polaris:让 AI 与你一起做研究 来源:机器之心 · BestBlogs 评分:89 浙江大学团队开源端到端科研智能体 Polaris:文献调研、想法生成、想法评审、实验、论文写作、论文评审六个阶段串成流水线,上一阶段成果自然流入下一阶段,人只在关键节点做决定。平台每天按订阅方向抓取 arXiv 新论文,AI 先通读、写一句话结论与中文导读,再交给研究者筛选。 Agent 超强记忆,新王诞生! 来源:GitHubDaily · BestBlogs 评分:88 近 30 所高校与机构联合发起的 Agent Memory Leaderboard 发布首期榜单:强制统一答案生成与评估模型、把参评系统权限锁定在写入与检索两端,成绩绑定 commit 与镜像版本。工业组 MemoraX 以 58.02 分居首,开源组 InvMem 等框架竞争胶着,Agent 记忆评测开始有了统一考场。 10 天暴涨 1.5 万 Star,Firecrawl 新工具开源。 来源:GitHubDaily · BestBlogs 评分:87 Firecrawl 开源文档转换工具 anydoc:支持 8 大类 14 种格式一键转 Markdown,纯 Rust 实现不依赖 ML 模型,单文件最快 4.4 毫秒,格式识别靠文件字节特征而非扩展名。官方用 100 份真实文档与 libreoffice、markitdown、pandoc、docling 对比,它是唯一全格式支持且质量与速度均第一,开源 10 天约 1.5 万 star。 Pi 上下文压缩方案简评 来源:宝玉(@dotey) · BestBlogs 评分:87 宝玉点评 Pi 的上下文压缩:实现是让 LLM 总结上下文并保留 system prompt 与工具调用,属于有损压缩;他对是否存在历史会话检索机制表示未知,但认为这仍是当前最简单有效的压缩手段。 Seedance 2.0 fast、MiniMax H3、Wan 3.0,高性价比模型测试来喽! 来源:阿真Irene · BestBlogs 评分:89 三款 0.6 元/秒档视频模型的多场景横评,附可直接复用的详细提示词。综合结论:Seedance 2.0 fast 在动作、运镜、人物与节奏上较均衡、更适合批量生产,MiniMax H3 与 Wan 3.0 在特定场景各有胜负,选型前建议按自己的场景跑一遍案例。 研究人员创建小学生级别 AI 以研究模型如何学习 来源:DEV Community: machinelearning · BestBlogs 评分:86 研究人员构建 LittleLeaner:一个 50 亿参数语言模型,只在约 880 亿 token、对齐小学各年级课程的文本上训练,知识边界被刻意限制。它是一个可控沙盒,用来精确观察大模型如何获取和组织知识。 延伸探索 精讲二、三讲完世界观与框架设计,今天的补充阅读里恰好有一簇中文实测,回答世界观讲完了、实际用起来如何:卡尔的AI沃茨实测 DeepSeek Harness 后认为 PTC 模式与 Cordis 插件才是隐藏大招;赛博禅心用 GLM 5.3 给 Harness 开发了三个补足性插件;Datawhale 用生产级抠图 Web 应用对比 GLM-5.3 + Harness 与 GPT-5.6-Sol,发现核心功能打平、前端细节与服务端安全前者更完整;腾讯技术工程给出了平台级测评。Agent 落地侧还有 WorkBuddy 的 Skill 实践与刚上线的远程控制、库库AI 的办公独立端、科大讯飞覆盖七大场景的企业服务矩阵。 其余方向可以分三组自取。模型与生态:Grok 4.6 运行了自己 48 小时构建的游戏 The Gauntlet,马斯克对比 Fable 5 并预告 Grok 4.7,Meta 开源可在 17-20 GB 显存运行的 30B 端侧智能体模型 Muse Glimmer,HuggingFace 年度报告显示开源主导权正与中国实验室和 Qwen 生态交汇,GLM-5.3、Gemini 3.7 Flash、Qwen3.8 等近几期已覆盖话题在 HN 每日摘要里仍有讨论串联。研究与工程:两万字 Diffusion 与 Flow Matching 长文、Milvus 3.0 自定义词典、三种 LLM 生成 GraphQL mocks 的竞争方案、机器人学习的数据闭环、抗疟疾药物评判器的评估工程。商业与宏观:Ray Dalio 谈 AI 周期与债务大周期,SK 会长崔泰源讲 720 亿美元的存储扩产。 今日阅读路径 时间有限时的三篇优先级:先读头条防蒸馏论文的报道,信息增量最大,且每个关键数字都带口径,读完能自己判断证据等级;再读 Flue 2,如果你在写智能体,16 个 Hook 的组织方式当天就能借鉴;第三篇选 Stack Overflow 衰退,它是本期影响面最宽的结构性变化,与 OpenWiki 对照读效果更好。DeepSeek Harness 那篇适合留到整块时间--它要你先接受一套新词汇,再换一套问题。 建议按这条顺序读完后回到评论区留个言:你所在团队用的 harness,默认值和 payload 存储策略查过吗?下次看到 1.86 倍加速或百万倍概率这类数字,你会先问哪个口径?欢迎聊聊你的判断。 👉 近期早报 • BestBlogs 早报 · 2026-08-15 • BestBlogs 早报 · 2026-08-14 • BestBlogs 早报 · 2026-08-13 • BestBlogs.dev 第 108 期:智能的执行层 • BestBlogs.dev 第 107 期:个人 AGI • BestBlogs.dev 第 106 期:1% 法则 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

译MATS 研究员领衔的 116 页论文证实,Anthropic、OpenAI、Google 的 API 存在密码学旁路漏洞:攻击者将加密推理包注入同厂轻量模型并越狱后,可逐字转录旗舰模型的隐藏思维链。按 Haiku 4.5 价格估算,解码 1 万条思维链约 720 美元。除 Anthropic 的 Fable 5 外,Claude、GPT-5.6、Gemini 全系均受影响。

ginobefun@hongming731 · 23小时前36

BestBlogs 早报 · 08-16 思维链防蒸馏 / DeepSeek Harness / Flue / Avatar IV TPU / Agent 追踪 [1] ★ 精讲|全球三大顶尖模型的防蒸馏机制全面告破 MATS 研究员 Panfilov 领衔、马克斯·普朗克智能系统研究所与 Snyk 参与的 116 页论文证实,Anthropic、OpenAI、Google 的 API 普遍存在密码学旁路漏洞:把顶级模型的加密推理包注入同厂轻量模型并越狱,小模型便会逐字转录其隐藏思维链,提取的明文 Token 数与 API 计费高度吻合,解码 1 万条成本约 720 美元。文中还发现 Kimi-K3 复现 Opus 推理的概率较其他模型高出约百万倍,但作者强调这不足以直接证明蒸馏。 来源:InfoQ 中文 https://www.bestblogs.dev/article/fc16a94b00 [2] ★ 精讲|DeepSeek 的 Harness,有一套新世界观|Hao 好聊趋势 腾讯科技这篇解读跳出插件架构本身,把 DeepSeek Harness 放进递归式 Harness 自我改进(RHI)的研究脉络:先梳理进化什么、怎么进化、何为真递归三重未解困境,再借 MIT CSAIL 的论文给出世界观--Harness 是组合泛化器,负责把陌生大任务拆成模型熟悉的局部调用。文章进一步论证,可回退效应与显式依赖为奖励归因提供了结构地图,这可能才是 GRPO 提出者为 Agent RL 藏下的底牌。 来源:腾讯科技 https://www.bestblogs.dev/article/47a69cb12c [3] ★ 精讲|面向智能体的 React:Astro 创始人将 Hook 引入他的元挂载器 Flue Astro 创始人 Fred Schott 发布 Flue 2 首个稳定版,把 React 式 Hook 引入智能体开发:智能体是一个每次模型调用前重新渲染的 JavaScript 函数,内置 16 个 Hook 并支持自定义,配置可随对话进程动态调整。他从大客户全公司只有一个智能体的现实出发,把文件路由视为反模式;Flue 构建于极简 Harness Pi 之上,坚持对各类宿主开放,与偏向 Vercel 特性的 eve 形成对照。 来源:http://Latent.Space https://www.bestblogs.dev/article/2905b1829f [4] 大模型后训练配方演进与多教师在线策略蒸馏|对话 AI2 研究员 Finbarr Timbers [播客] 深度梳理前沿大模型后训练配方从 InstructGPT 到多教师在线策略蒸馏的演进路径,剖析 DPO 衰落、教师模型融合困境与学术/工业界分歧。 来源:跨国串门儿计划 https://www.bestblogs.dev/podcast/474029fe1 [5] HeyGen 联手 Google Cloud:Avatar IV 视频模型移植 TPU 实测 HeyGen 与 Google Cloud 详细说明了将 180 亿参数的 Avatar IV 扩散模型移植至 Trillium TPU 的工程工作,通过三项针对性的内核和编译器优化,实现了 1.86 倍的加速。 来源:Google Developers Blog https://www.bestblogs.dev/article/978b81ddc9 [6] Cloudflare 新增 Agent 追踪,存在截断限制与不一致的 Payload 默认设置 Cloudflare 推出 Agent 追踪,作为 Cloudflare Agents 的首个组件,为 Workers 可观测性增加了 Agent 级别的跨度,同时揭示了开发者需要关注的 Payload 默认设置不一致、截断限制及定价影响。 来源:InfoQ https://www.bestblogs.dev/article/006c776634 [7] Stack Overflow 的衰退与知识生产的结构性迁移 本文通过 Stack Overflow 提问量的断崖式下跌,分析了 AI 时代下知识生产从公共论坛向私人对话迁移的趋势,并探讨了这一转变对人类专业能力形成及公共知识库的深远影响。 来源:机器之心 https://www.bestblogs.dev/article/366fe87300 [8] 为智能体而非人类构建文档:OpenWiki 的设计思路 [视频] OpenWiki 将面向智能体的代码库文档视为一种可落地的智能体记忆,通过聚焦的 Markdown、确定性元数据、基于 Git 的自动更新与早期检索效率验证来实现。 来源:LangChain https://www.bestblogs.dev/video/90fe08560 [9] 用 ChatGPT Work 交付可提交董事会的报告材料 [视频] OpenAI 演示了 ChatGPT Work 如何交叉核验关联财务材料、发现不一致,并引导团队完成可提交董事会的报告。 来源:OpenAI https://www.bestblogs.dev/video/f4bb11cba [10] 别再吹高端 Agent 了,国内绝大多数企业,连豆包都还没入门 文章通过四位行业从业者的圆桌对话,揭示了中国 AI 在 2026 年落地的真实水平--大多数企业甚至连基础 AI 工具(如豆包)都还未入门,更别说高端 Agent 技术,核心问题在于企业缺乏 AI 需求明确性和落地实践能力。 来源:非凡产研 https://www.bestblogs.dev/article/91a0589803 --- http://BestBlogs.dev · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读:https://www.bestblogs.dev/explore/brief/2026-08-16

译116页论文证实Anthropic、OpenAI、Google的API存在密码学旁路漏洞,可将加密推理包注入同厂轻量模型并越狱,使其逐字转录隐藏思维链,解码1万条成本约720美元。研究还发现Kimi-K3复现Opus推理概率较其他模型高约百万倍,但作者强调不足以直接证明蒸馏。

Elon Musk@elonmusk · 1天前35

Grok 4.6

译Grok 4.6 【引用 @KettlebellDan】:我让 Grok Build 为我的游戏制作了一支预告片 它启动了游戏、亲自游玩、录制屏幕、剪辑画面,并完成配音。 我全程没有动过手 X THE GAME - 免费游玩 https://kettlebelldan.com/x_the_game_v2

Chubby♨️@kimmonismus · 1天前28

Sol can finally navigate Luna subagents. Much needed and very welcome update.

译Sol 终于可以导航 Luna 子代理了。这是一次非常必要且受欢迎的更新。

Tibo@thsottiaux · 1天前35

Let Sol manage an efficient fleet of Luna agents for you. These models know each other well and collaborate to achieve the result in an incredibly fast and efficient way.

译让 Sol 为你管理一支高效的 Luna 智能体舰队。 这些模型彼此熟识,协作起来能以极快的速度高效达成结果。

Rohan Paul@rohanpaul_ai · 1天前43

Grok 4.6 beat GPT-5.6 Sol on agentic loop efficiency, spending $13.11 versus $20.18 across the same 3 builds. Grok 4.6's edge came from bigger coding steps: 201 model calls versus GPT-5.6 Sol's 338. Really Interesting experiments by @thehypedotnews, a 24/7 AI news in a really nice radio format. (love their chillout music) 1 number in this comparison explains a lot about where coding-agent economics are heading: 93-98% of the input tokens were cache reads. These runs consumed roughly 20M tokens for Grok 4.6 and 26M for GPT-5.6 Sol, yet the author estimates they would have cost around 4x more without prompt caching.

译Grok 4.6 在三个编码任务中以 $13.11 总成本击败 GPT-5.6 Sol 的 $20.18,模型调用次数 201 次对 338 次,总耗时 129 分 41 秒对 149 分 33 秒。两次运行分别消耗约 20M 和 26M tokens,其中 93-98% 的输入 token 为缓存读取,若无提示缓存成本将增加约 4 倍。

Dongxi 东锡 NLP@dongxi_nlp · 1天前63

https://x.com/i/article/2088681782606536704 The Glance of DeepSeek Harness DeepSeek Harness is easy to misunderstand from its name. You may expect a model wrapper, a tool collection, or a CLI built around DeepSeek models. After tracing its contracts, source, and tests, the most interesting part is somewhere else: It refuses to let "agent state" become one vague object. Instead, every important fact is placed beside the component that has the authority to verify it. Truth Has An Owner A file provider owns current file truth. A session policy remembers what the agent observed. Live events coordinate the process that is running now. Durable events record what later sessions may replay. Model and client projections select what each consumer actually needs. This separation appears everywhere. It is the architectural personality of the harness. Example: A shell command may stream "40% complete" as live state. After it finishes, the durable history only needs the command and final result. The Stale Read Tells The Whole Story Suppose the agent reads a file at version v1. Before it edits, another process rewrites the file. A weak harness remembers only that the transcript contains a read. DeepSeek Harness remembers the observed version, then asks the filesystem provider to mutate only if the current version is still v1. The policy owns the expectation. The provider owns current truth. The atomic comparison closes the time-of-check/time-of-use gap. One subtle detail matters: reading a window proves freshness for that file version, but it does not prove the model understood the whole file. Freshness and completeness are different policies. Example: The agent reads timeout = 30. A teammate changes it to 60. The agent's edit still expects the old version, so the provider rejects it and asks for a fresh read. A Tool Is An Event Pipeline A tool call is not passed directly to a handler. It receives immutable identity, schema validation, pre-execution hooks, monotonic guards, execution wrappers, normalization, finalization, and result recording. DeepSeek even distinguishes a live tools/result notification from the durable tool/result session fact. That naming difference captures the design: coordination state and historical state are related, but they are not interchangeable. Example: For "find TODOs," the schema checks the query, a guard limits the search to the workspace, the runner finds matches, and the finalizer records a normalized result. A Subagent Opens A Managed Runtime DeepSeek also makes subagents more precise than "call another model." Spawning a child requires three independent decisions. First, context seed: fresh instructions or a completed-turn fork. Second, lifecycle: one-shot, background, or continuable through follow-up. Third, authority: tools, approval behavior, resources, and delegation depth. The parent receives a report, settlement, or transcript projection. The child can spend a large local context without flooding the parent conversation. Example: A parent asks a child to inspect failing tests. The child receives only that task plus read/test tools, then returns a five-bullet diagnosis instead of its whole transcript. What Is Worth Copying? Not the package count. Not every Cordis seam. The reusable lesson is smaller: For every capability, name the truth owner, authority gate, durable record, model projection, and recovery rule. Example: For screenshots, the browser owns the pixels, permission gates the capture, a file stores the durable artifact, the model sees a bounded preview, and retry handles capture failure. If one of those is missing, the harness contract is incomplete. That is my glance of DeepSeek Harness: a runtime where invisible boundaries are made explicit enough to test.

译DeepSeek Harness 的核心设计是拒绝将"智能体状态"视为单一模糊对象,而是让每个关键事实归属于有权验证它的组件。例如文件读取会记录版本号,仅在版本匹配时才允许修改,以消除检查与使用之间的时间差。工具调用则作为事件管道,包含身份验证、模式校验、执行钩子等环节,子智能体也需独立决策上下文、生命周期与权限。

Greg Brockman@gdb · 1天前40

towards never having to manually select a model again

译朝着再也不用手动选择模型的方向迈进。

Rohan Paul@rohanpaul_ai · 1天前36

What if you could pay the reasoning cost once, then reuse what the model learned across future tasks? New Microsoft paper finds that some expensive test-time reasoning can be replaced with a small set of rules learned from previous agent runs. The paper tests a cheaper alternative: collect 35-50 past trajectories, have a coding agent extract recurring failure patterns, then turn those patterns into a small markdown skill added to the non-reasoning model's system prompt. For GPT-5.4-mini, those skills recovered 55%-100%+ of the gap between non-reasoning and reasoning modes across 4 agent benchmarks, while using 2.9-4.5× fewer output tokens than reasoning. On ALFWorld and τ2-retail, the skilled non-reasoning model actually beat the reasoning mode. The useful part is that the distiller did not need reasoning traces: skills built only from cheap non-reasoning rollouts were competitive across all 4 domains. The limit is equally useful: reasoning still won on telecom and SpreadsheetBench, where each task contains more instance-specific dependencies that a fixed skill cannot capture. So the practical split is: distill repeated procedures once, then reserve expensive test-time reasoning for the tasks that genuinely need fresh search. - arxiv. org/abs/2608.07885 Title: "Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills"

译微软新论文提出,可将昂贵的测试时推理替换为从过往智能体运行中提取的小型规则集。用 GPT-5.4-mini 提取 35-50 条轨迹中的失败模式并转为 markdown 技能,在 4 个智能体基准上恢复了非推理与推理模式间 55%-100%+ 的差距,且输出 token 减少 2.9-4.5 倍。

eric zakariasson@ericzakariasson · 1天前44

i turned this into an npm package you drop a widget in your app and when someone files feedback, a cloud agent opens a pr npm i feedback-agent

译Eric Zakariasson 将用户反馈自动修复流程打包成 npm 包 feedback-agent,应用内嵌入组件后,用户提交反馈即触发云智能体处理。该流程基于 PostHog 收集的文本、会话回放、事件和错误数据,由 Cursor 云智能体结合只读 PostHog MCP 上下文循环验证修复,最终自动创建带测试的 GitHub PR 供手机端审核。

Rohan Paul@rohanpaul_ai · 1天前30

When an AI agent fails, blaming the model can send you to the wrong fix. This Scale AI paper argues that agent debugging should start by asking where the first unrecovered failure happened: in the model, context, memory, tool layer, another agent, grader, or environment. That matters because the same visible mistake can have different causes. An ignored instruction might mean the model saw it and failed to follow it, or the harness dropped it during context compaction. The paper organizes 41 failure modes around these interactions, tagging each by both the interaction and the side at fault. It tests the taxonomy on 40 worked examples. GPT-5.5 matched human category labels with 80% accuracy and Cohen's κ of 0.76. Using 4 judges together pushes category precision to 96% when all 4 agree, although coverage falls to 68%. For agent teams, the practical shift is simple: trace the failure back to the component that broke first, then decide whether to retrain the model, fix the harness, or repair the environment. - arxiv. org/abs/2607.28802 Title: "Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures"

译Scale AI 论文提出以交互为中心的智能体故障分类法,主张调试时应先定位首次未恢复故障发生在模型、上下文、记忆、工具层、其他智能体、评分器还是环境中。该分类法涵盖 41 种故障模式,并在 40 个案例上验证。GPT-5.5 分类准确率达 80%(Cohen's κ=0.76),4 个评判器一致时精度升至 96%,覆盖率降至 68%。

AYi@AYi_AInotes · 1天前48

兄弟们我跟你们说个事,今天早上八点半我睁开眼, 邮箱里已经躺着12个新出的FDE岗位了,Zendesk、ElevenLabs、Elastic、Yara AI 全远程,薪资最高标到 $400K,最早的发布不到 8 小时, 公司、是否远程、薪资范围、申请链接,排得整整齐齐, 关键是我电脑一整夜都是合着的。 昨晚合盖之前我就干了一件事,设了个每天早上8点的Routine,没定闹钟爬起来刷LinkedIn也没雇人盯着,是一台云手机趁我睡觉把新岗翻完整理好塞进邮箱的。 很多人肯定会说这不就是定时脚本发邮件吗,还真不是。 其实本机那套Agent控iPhone我前两天也跑通了,就是Phone Harness那个方案,Mac醒着镜像开着手机锁在桌上,它能点能滑能输字,看起来挺完整的对吧。 但Mac一合盖链路立刻断,所以它本质上需要我人在场,至少电脑得醒着。 那这就引出一个问题了--Agent操作手机这件事其实有两层。 一层是Driver,人在场,本机真机被Agent当屏幕点。 另一层是Runtime,人不在场,云手机自己托管登录态定时跑结果送回来。 大部分人玩到第一层就觉得到顶了,但第一层你人不在它就停了,这算什么自动化? Airtap干的是后一层,架构说穿了三句话,大脑听懂任务,手用视觉真点屏幕,底下是一台24小时在线的云手机。App登录态在云里不耗你电不占你本地网。 但我这次故意把Easy Apply锁死了,只搜索汇总不点投递不改资料不代发私信。 能证明Runtime不必为了更炸去承担误点风险,登LinkedIn我犹豫了两秒,银行支付类?门都没有。 我觉得现阶段它适合干那种干成了挺好干砸了也死不了的事,筛岗刷信息跨区逛只能在那边用的App。 真金白银和核心隐私现在没人该真交给它。 所以换作是你你敢让它每天替你盯哪件事?我先说,AI岗早报我眼睛都不眨,自动投递?门都没有hhh

译博主用 Airtap 云手机 Agent 设置每日早 8 点 Routine,合盖状态下自动抓取 12 个新 FDE 岗位(Zendesk、ElevenLabs 等,薪资最高 $400K)并整理发至邮箱。

Rohan Paul@rohanpaul_ai · 1天前34

"The model is no longer the product. Codex, Perplexity Computer, or Claude Code - all are orchestration system. It takes a model and pairs it with an agent harness. What is an agent harness ? The rules for how the agent loops around" - Aravind Srinivas

译"模型不再是产品。Codex、Perplexity Computer 或 Claude Code--这些都是编排系统。它把一个模型与智能体外壳配对。什么是智能体外壳?即智能体如何循环运行的规则。"--Aravind Srinivas

🚨 AI News | TestingCatalog@testingcatalog · 1天前32

ANTHROPIC 🔥: Claude desktop will get a dedicated Browser inside that app that will always be accessible in Cowork sessions! A new Super App is rising. This looks familiar 👀

译ANTHROPIC 🔥:Claude 桌面端将内置一个专用浏览器,在 Cowork 会话中随时可用!一个超级应用正在崛起。 这看起来似曾相识 👀

Rohan Paul@rohanpaul_ai · 1天前42

JSON tool calling may be an unnecessary bottleneck for newer AI agents. Capable models can orchestrate tools better by writing code than by emitting JSON calls. This paper compares standard JSON calls with a code-first setup where the model writes one Python script that invokes the same tools. Across 14 models on a 309-task BFCL v4 subset, programmatic tool calling matched or beat JSON in 11, with GPT-5.6-Sol and Terra each improving by 10.6 percentage points. The gap gets clearer when one task needs many calls. For Claude Sonnet 5, JSON issued every required call through a fan-out of 70, then started dropping calls; at 100 calls it fell to 0% enumeration accuracy, while Python stayed at 100%. Sequential chains were faster for 13 of 14 models because several dependent calls can run inside one script instead of requiring another model turn after each tool result. There is a boundary: several older GPT models got worse because they produced broken multiline Python, and the benchmark uses echo-return stubs rather than real APIs. - arxiv. org/abs/2608.06370 Title: "The Bitter Lesson of Tool Calling"

译新研究对比 JSON 与代码优先的工具调用方式,在 14 个模型、309 项 BFCL v4 任务中,程序化调用在 11 个模型上持平或胜出,GPT-5.6-Sol 和 Terra 各提升 10.6 个百分点。Claude Sonnet 5 在 100 次调用时 JSON 枚举准确率降至 0%,Python 保持 100%;13 个模型的顺序链执行更快。

Dongxi 东锡 NLP@dongxi_nlp · 1天前27

How does AI capability actually translate into sustained productivity growth? AI for Productivity in the Age of Agentic AI

译报告《AI for Productivity in the Age of Agentic AI》发布,共68页,由AI4X项目团队联合全球12所学术机构(含复旦、浙大、斯坦福、伯克利、牛津、普林斯顿)共同完成。报告核心探讨智能体时代AI能力如何转化为持续生产力增长,认为Agentic AI正重新组织工作的执行、协调与委派方式,重塑人、组织与智能系统的关系。

Rohan Paul@rohanpaul_ai · 1天前42

Really useful revelation on prompting coding agent in this paper. Your coding-agent prompt may be spending compute on work you never needed. A coding agent can solve the same bug correctly while doing far more work, just because the prompt asks it to consider several approaches. Across six open-weight reasoning models on the frozen holdout, that instruction increased reasoning by 2.4-7.4× with no measured success gain. The traces explain why: agents elaborated roughly three alternatives, discarded them, then implemented exactly one. "Be absolutely certain" created a different failure mode, triggering repeated tests and extra checking after the fix looked done. At the highest observed redundant-verification level, runs cost 18.25× the clean-run median, used 15 versus 6 tool calls, and took 3× longer, while success stayed flat. Prompt length barely mattered. Verbose repetition stayed around 1.0×. A bounded instruction, start with the failing test, make the smallest sufficient change, run relevant tests, then stop, stayed at or below baseline reasoning while preserving diagnosis and validation. The tasks were small, at most four files, so this may not carry over to large architectural work. For coding agents, prompt design is work design: specify the useful work and give the agent a concrete stopping rule. - arxiv. org/abs/2608.01347 Title: "Same Task, Different Work: Prompt-Induced Waste in Coding Agents"

译论文发现,提示词要求编程智能体考虑多种方案时,其推理量增加2.4-7.4倍,但成功率无提升;智能体平均展开约三个方案后弃用,仅实现其中一个。"Be absolutely certain"指令则触发冗余验证,最高使运行成本达基线18.25倍、工具调用15次对6次、耗时3倍,成功率不变。

AYi@AYi_AInotes · 1天前66

Codec控制iPhone真的绝了!!! 分享一个真实用法: 我让 Agent 接管 iPhone 去理备忘录, 它数出 iCloud 里一共 878 条, 没一上来就大改, 先建议从置顶那几条动手。 光是把「到底有多少、该从哪下手」理清楚,我自己手动至少得搭进去两个星期。 几条能省时间的经验,一部分来自官方说明,一部分是这类 harness 几乎都会踩的: •AppleScript 的 click at 对镜像窗口无效--里面没有可访问性树,只有视频流 •输入时镜像窗口必须在最前台,执行中途别抢焦点,否则字会被吞一半 •type_text 之前先点进输入框,等键盘起来再打 •长列表用滚轮或 scroll_* 系列,比慢拖靠谱;慢拖在 iOS 列表上经常弹回去 •主屏图标不要用 tap_text("天气"),点中的是标签不是图标,看起来像没点中。主屏用 tap_icon(agent helper),App 内的按钮和列表行才用 tap_text •坐标不要跨调用缓存,窗口位置会变,每次 ocr() / swipe() 都会重取 bounds •没有多指,捏合缩放做不了;需要 Face ID 或相机流程的场景也不在这套能力里 •DRM 视频区域截出来可能是黑的

译阿易 AI Notes 分享用 Agent 接管 iPhone 整理备忘录的真实用法:Agent 数出 iCloud 共 878 条备忘录,先建议从置顶条目动手,而非直接大改,省下约两周手动整理时间。

fofr@fofrAI · 1天前28

Agents self-organising like

译智能体像这样自组织

Frank Wang 玉伯@lifesinger · 1天前52

今天文君在大理,一起约在洱海边的时光咖啡聊天。挺有感触的几个收获: 1、Agent 类似网站,OpenClaw 是第一种被大众感知的建站技术。虾是个人网站。Yahoo、Google、Facebook 等大型网站还没出现。网站 -〉移动应用 -〉Agent,是技术也是产品路线。一切才刚开始。 2、Agent 创业者最重要的两大能力是:能不断找到目标用户的能力、能预判技术实现路线并疯狂执行的能力。找市场 + 执行力,缺了这两个,很难成。 3、Agent 产品的基础功是:用做模型的方式去做应用。由上下文、测评等构建出 Loop 循环,让 Agent 在特定领域能持续进化。很难,但有机会。 4、Agent 不是孤立的。人与 LLM 共同孕育出一个个 agent。这是一种新的生命体,不是人的分身。生命体的长大需要关系,关系的构建需要环境,或者叫社群。新时代的社群产品,有大机会。 5、社群里,有可能会产生神。比如 Claude Tag 就是在一个组织环境下,自然而然造出了一个组织协作环境下接近全知全能的神。神学很值得研究。 以上。

译玉伯分享与文君在大理的交流:Agent类比网站发展史,OpenClaw是首个被大众感知的建站技术,一切才刚开始。Agent创业者需具备找目标用户和预判技术路线并执行的两大能力,且应以做模型的方式做应用,通过上下文与测评构建进化Loop。Agent由人与LLM共同孕育,其成长依赖社群环境,新时代社群产品蕴含大机会。

gabriel@gabriel1 · 1天前27

50% of work on computers can be carried out by telling a computer in like 6 months, just a culture question at that point context, human intuition, and edge cases will not be solved so people will focus solely on the non-clicking parts of the task & reviewing

译大约6个月内,50%的电脑工作可以通过直接告诉电脑来完成,到那时这只是一个文化问题。 上下文、人类直觉和边缘情况无法被解决,因此人们将只专注于任务中非点击的部分以及审查工作。

Peter Steinberger 🦞@steipete · 1天前53

Added a short instruction to our shared AGENTS MD file to upload videos to each PR that changes UI state. https://github.com/openclaw/openclaw/pull/124013

译我们在共享的 AGENTS MD 文件中添加了一条简短说明,要求每个更改 UI 状态的 PR 上传视频。https://github.com/openclaw/openclaw/pull/124013

Peter Steinberger 🦞@steipete · 1天前20

We moved the team over to build openclaw with openclaw. Being able to share agent sessions as URLs is a superpower.

译我们把团队迁移到了用 OpenClaw 来构建 OpenClaw。能够把智能体会话作为 URL 分享,是一种超能力。

Qwen@Alibaba_Qwen · 1天前45

Qwen3.8-27B is now part of your everyday life - from smartphones to vehicles. ⚡️🚀Appreciate your work! @MediaTek

译通义千问 Qwen3.8-27B 正式落地日常终端,联发科宣布为其提供 Day-0 支持。该支持覆盖 Dimensity Auto Cockpit C-X1 及最新旗舰移动 SoC,将端侧 AI 体验从智能手机扩展至车载场景,推动智能体 AI 无缝融入日常生活。

Artificial Analysis@ArtificialAnlys · 1天前65

DeepSeek V4 Pro 0813 scores 53 on the Artificial Analysis Intelligence Index, 8 points above April's DeepSeek V4 Pro - but with a 3.6x price increase and only 1 point above DeepSeek V4 Flash 0731 @deepseek_ai has released DeepSeek V4 Pro 0813, its new flagship model, along with updated pricing. With the new pricing, it still sits on our Pareto frontier for Intelligence vs. Cost, but by a smaller margin than previous DeepSeek releases. Under the new pricing, DeepSeek's first-party API will charge $1.32 / 1M input tokens and $3.96 / 1M output tokens - an increase of +264% on the blended price. Cached input tokens receive a ~97% discount (rather than the previous 99%): cache hits are priced at $0.044 / 1M tokens, 12x higher than previous cache-hit pricing. Off-peak pricing is discounted by 50%. This new pricing takes effect on August 16, 2026 - until then DeepSeek is offering V4 Pro 0813 at the same pricing as the earlier V4 Pro model. DeepSeek published the model weights under the MIT license, making it the second most intelligent open weights model we have benchmarked; however, weights for Qwen3.8 2.4T A95B have recently been released and will be evaluated on the Intelligence Index soon. DeepSeek V4 Pro 0813 remains 7 points behind Kimi K3, the current open weights leader. DeepSeek V4 Pro 0813 retains the previous version's architecture at 1.6T total parameters and 49B active parameters, with a context window of 1M tokens. Most of DeepSeek V4 Pro 0813's gains over the April version are in agentic capabilities. DeepSeek V4 Pro 0813 is more token efficient than its predecessor, generating ~30% fewer total output tokens across Artificial Analysis Intelligence Index. Key results: ➤ DeepSeek V4 Pro 0813 is only 1 point ahead of DeepSeek V4 Flash 0731 on the Artificial Analysis Intelligence Index, and has ~3.8x the active parameters. The two models tie on Terminal-Bench 2.1 at 79%. For agentic and coding benchmarks the smaller model performed at around the same level. ➤ DeepSeek V4 Pro 0813 is more token efficient than DeepSeek V4 Pro, using 128M output tokens to run the Intelligence Index, ~30% fewer than the April version. This places DeepSeek V4 Pro 0813 on the open weights Pareto frontier for intelligence versus output tokens, with fewer tokens used than Kimi K3 (133M) and GLM-5.2 (141M). However, it lags behind many frontier models in its intelligence tier. GPT-5.6 Sol scores 61 on the Intelligence Index but only uses 70M tokens in total. ➤ Cost per Task increases significantly despite an improvement in token usage, driven by DeepSeek's price increase. At $0.25, DeepSeek V4 Pro 0813's Cost per Task is 5x that of DeepSeek V4 Pro ($0.05), but ~20% lower than GLM-5.2 ($0.32 Cost per Task). Despite the increase in price, DeepSeek V4 Pro 0813 still sits on the Intelligence vs. Cost per Task Pareto frontier, but barely - it is just one cent below Gemini 3.7 Flash (medium) on Cost per Task. ➤ DeepSeek V4 Pro 0813 makes significant improvements in real-world agentic knowledge work. On GDPval-AA v2 its Elo improved to 1590, +284 points from DeepSeek V4 Pro (1306), which implies an ~84% expected win rate against the April release. Its GDPval-AA v2 Elo is ahead of earlier-generation proprietary models like Claude Opus 4.7 and GPT-5.5, but it trails Kimi K3. DeepSeek V4 Pro 0813 works for longer on GDPval tasks than before, averaging 39 turns per GDPval-AA task compared to 23 for the April model. ➤ DeepSeek V4 Pro 0813 makes a 12 point improvement in AA-Omniscience, driven entirely by increases in accuracy. DeepSeek V4 Pro 0813 scores +1, up from -11 for DeepSeek V4 Pro. Its AA-Omniscience accuracy rises 6 points from 43% to 49%, while regressing slightly in hallucination rate from 94% to 95%. Compared to peer models, DeepSeek V4 Pro 0813 has a high attempt rate of ~99%, meaning it almost never declines to answer. By contrast, Kimi K3 attempts only 77% of questions and has a 53% hallucination rate. Additional model details: ➤ Context window: 1M tokens ➤ Weights: 1.6T total parameters; 49B active parameters ➤ License: MIT ➤ Accessibility: Accessible through DeepSeek first-party API at launch ➤ Pricing: On DeepSeek's first-party API, updated pricing will take effect on August 16 at $1.32 / 1M input tokens and $3.96 / 1M output tokens. Cached input tokens receive a 97% discount, priced at $0.044 / 1M tokens. Off-peak pricing is discounted by 50%.

译DeepSeek 发布旗舰模型 V4 Pro 0813,在 Artificial Analysis 智能指数得 53 分,较 4 月版高 8 分,但仅比 V4 Flash 0731 高 1 分。

Rohan Paul@rohanpaul_ai · 1天前40

Anthropic models may be cheaper to use than some large open-source Chinese models, per a new study by AlphaSense. It says Kimi is substantially cheaper per token than GPT-5.6 Sol, yet more expensive per completed question because it consumes many more tokens while assembling context. The real unit of cost is not $/token, but tokens-to-completion × token price. A more expensive model that searches efficiently, stops at the right time, and reasons over a smaller, cleaner context can have a lower total inference bill. "Token efficiency" is really a systems property, not an API-pricing property. Kimi K3 can have cheaper tokens yet cost more per question because poor stopping behavior and repeated retrieval inflate context before useful reasoning even begins; in multi-step agents, that waste propagates into later steps, so a small retrieval inefficiency can become a much larger workflow-level tax. AlphaSense gets roughly a 3× cost reduction from changing retrieval around the same model, while task-level routing improves preference even further. So that means model vendors can keep leapfrogging each other without fully commoditizing the application layer, because whoever owns retrieval, routing, and evaluation decides which model is economically viable for each task.

译AlphaSense 新研究显示,Anthropic 模型使用成本可能低于部分大型开源中文模型。Kimi 每 token 价格远低于 GPT-5.6 Sol,但因组装上下文消耗更多 token,单题成本反而更高。真正成本单位是"完成 token 数 × token 价格",token 效率是系统属性而非 API 定价属性;AlphaSense 通过改变检索方式,在相同模型上实现约 3 倍成本降低。

ginobefun@hongming731 · 1天前34

https://x.com/i/article/2088426893192421376 BestBlogs 早报 · 08-15|GLM-5.3 扩展编程与安全边界,循环工程和知识底座重写 Agent 协同 在线阅读本期早报 BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。 导语 当 Agent 从一次对话走向持续工作,真正难的并不是让它多运行几轮,而是回答三个逐层放大的问题:模型的能力到了哪里、一次任务怎样知道该停、团队又凭什么让不同 Agent 获得正确且持续更新的业务知识。今天的三篇精讲刚好落在这三个尺度上。 GLM-5.3 展示同一基座经过更大规模后训练后,编程能力怎样迁移到代码审查与漏洞发现;Addy Osmani 把长时工作拆成有界的 goal 与定时的 loop,并要求执行者之外再有独立验证;大淘宝技术则把视角拉到组织,指出单点编码提速无法自动消除需求、研发、运维与运营之间的人工接力。 这不是一条已经被证明的统一路线。模型跑分来自厂商口径,循环工程是实践经验,AI Native 团队仍是方向性框架。但把三者连起来读,可以得到一套更诚实的生产检查表:能力要分任务链条看,自治要先写完成和停止条件,组织改造则要先解决知识从哪里来、怎样保鲜、谁对例外负责。 ★ 精讲一:GLM-5.3:前沿编程能力与涌现的网络安全能力 来源:智谱 · BestBlogs 评分:93 GLM-5.3 最值得注意的地方,不是一个全新的基座模型,而是智谱称其在与 GLM-5.2 相同基座上,通过数十倍长程任务环境、更丰富的环境类型和更长后训练,把能力上界继续向外推。这个对照把「模型能力」拆成了两层:预训练决定基座拥有什么潜力,后训练则决定它能否在复杂环境中发现问题、操作工具、实施并验证。对工程团队而言,这意味着评估一次升级时,不能只问参数规模有没有变化,也要问训练任务是否更接近真实工作链路。 公开结果显示,GLM-5.3 在 Terminal-Bench 3.0 上由 4.6 提升到 28.3,在 DeepSWE v1.1 上由 46.2 提升到 66.9,在 Agents' Last Exam 上由 23.8 提升到 28.5。智谱自建的 Z.ai Code Bench 还报告,High 档位准确率为 31.4%,每项任务平均输出约 5 万 tokens;对照中的 Claude Opus 4.8 为 29.5% 和约 12 万 tokens。后面这组是厂商自测,不宜当作跨平台定论,但它提出了一个有用维度:长程 Agent 不仅要完成任务,还要看完成路径、token 利用和返工成本。 网络安全部分更需要分层读。CyberGym 从白盒源代码出发识别和验证漏洞,GLM-5.3 得分 84.5%,略高于文中列出的 Mythos 5 与 GPT-5.6 Sol;到了需要理解成因并完成利用的 ExploitBench,它得到 54.4%,虽比 GLM-5.2 的 24.4% 高出一倍多,却仍低于 Mythos 5 的 78.0% 与 GPT-5.6 Sol 的 76.5%。ExploitGym 的限时吞吐也呈现相同方向:进步明显,但完整利用链仍有差距。因而更准确的判断是,能力增量首先集中在代码审查、异常定位和漏洞验证的前半段,而不是已经获得不受约束的全链攻击能力。 智谱与合作安全团队还披露,自 GLM-5.2 发布以来累计发现 2,436 个经初筛和去重的漏洞,其中 1,097 个为中高危,覆盖 269 个项目;公开披露账本只展示已协调修复的细节,对仍在流程中的漏洞保留哈希。这里同时存在两种信息:一方面,长上下文、逆向分析和跨日志关联确实可能放大防守者的调查能力;另一方面,漏洞数量、经济价值与影响范围主要由厂商及合作方报告,尚不能替代独立复现与漏洞库的逐项确认。 开放权重因此不是普通的发布时间表。智谱计划在发布两周后、完成安全评估和加固后开放完整权重,并设计外层分类器、推理监控器和模型内部安全对齐的多层防护。需要区分的是,前两层依赖托管环境,权重离线部署后仍能保留的主要是模型内部对齐;而研究、防守、教学与恶意利用在字面上高度相似,安全系统能否根据意图和授权做准确分级,仍要接受持续红队检验。 读这篇发布时,最有用的不是记住一个总分,而是保留四个问题:模型在哪一段任务链上变强,评测由谁完成,漏洞如何负责任披露,权重开放后哪些控制仍然有效。GLM-5.3 给出了编程能力向安全能力迁移的强信号,也把同一个事实的另一面摆上台面:能力越接近真实环境,治理就越不能停留在 API 层的一次拒绝。 ★ 精讲二:实用循环工程 来源:Elevate · BestBlogs 评分:91 Addy Osmani 的核心贡献,是把容易被笼统称为「让 Agent 一直做下去」的工作拆成两种原语。goal 面向一个有界任务:给出可测量的终点,让 Agent 反复尝试,直到评估器确认条件满足或达到最大轮数。loop 面向不断变化的外部状态:按固定间隔重新检查日志、PR、Issue 或消息,再对新增情况采取动作。前者问「这件事做完了吗」,后者问「外部世界有没有发生需要处理的变化」。 这个区分会直接改变提示词。把「把页面优化好」交给 goal,评估器无法知道什么叫好;改成 Lighthouse 分数至少达到 92、LCP 低于 1.8 秒、不改变公开 API、连续两轮没有改善就中止,并限制最多 10 轮,系统才拥有可执行的完成条件和停机条件。评估器检查的是硬规则是否满足,不会自动判断视觉品味、架构是否简洁或改动是否值得,这也是为什么数字通过不等于作品优秀。 loop 则更像调度器。作者用定期检查 GitHub 新 Issue、汇总紧急程度,以及轮询 PR 评论和失败 CI 为例。它适合输入持续变化、动作模式稳定的工作;如果每次都需要重新理解模糊目标,定时触发只会稳定地产生不确定结果。goal 与 loop 可以组合:loop 发现带有 bug 标签的问题,goal 再负责把修复推进到本地测试通过。但组合越长,越需要明确权限、预算、失败退出和不可逆操作的人工确认。 文章里最重要的经验并不在命令本身,而在执行与验证分离。作者每天并行使用多个 Agent,但不会让完成工作的那个 Agent 同时裁定自己是否合格。一个 Agent 起草,另一个从不同维度验证,例如不仅测桌面性能,也检查移动端、浏览器控制台和真实交互。独立验证仍可能漏错,却能减少执行者围绕自己的路径自证成功,也更容易暴露规格里没有写出的盲区。 人类判断的边界同样具体。作者曾让 Agent 研究竞品并生成弥补差距的本地改动,研究看起来合理,实施却会给用户增加大量复杂性。问题不是任务没有完成,而是他差点把「是否值得做」一起委派出去。涉及审美、产品取舍、架构、安全、认证或财务的任务,即便有清晰规格,也需要更近距离复核;一个没有真实用户的绿地项目,与积累多年规则的银行代码库,也不该获得相同自治程度。 循环工程因此不是把监督从流程里删除,而是把监督写进流程。实用顺序可以很朴素:先选一个结果可客观验证的窄任务,定义成功、失败与停止,再决定是一次 goal 还是周期 loop;把验证交给独立角色,保留人对风险和价值的判断;最后才扩大并行度。若同一命令第三次执行仍没有比第二次产生变化,那不是坚持,而是系统正在原地旋转。 ★ 精讲三:重构协同:关于 AI Native 团队的思考 来源:大淘宝技术 · BestBlogs 评分:92 大淘宝技术这篇文章把一个常见误区说得很直接:编码变快,不等于业务交付链路同比例变快。需求从业务传给产品,产品转成方案,研发再翻代码与历史决策,测试、发布、运维、客服和运营继续靠人同步上下文。若这些接力仍由会议、群聊、表单和手工录入完成,在某个节点增加 AI 助手,只是旧流程中的局部加速。 作者由此区分 AI 辅助与 AI Native。前者保留「人是串联者」的流程骨架,后者尝试让 Agent 承担传递、判断与衔接,再围绕这个前提重建生产侧。消费侧的终点仍然是人,变化主要发生在交互;生产侧却是技术塑造出来的组织形式,表单、报表、审批流和大量内部系统,本来就是为了帮助人完成串联。当串联者变化,这些软件不会一夜消失,但其中等待人点下一步的环节需要重新审视。 文章设想的理想业务单元有三层:底层是业务规则、流程、领域知识和数据构成的知识底座;中间是按知识范围、工具权限和风险边界拆分的专业 Agent;上层是定方向、做判断、处理例外并把新知识沉淀回去的人。运维 Agent 可以读取代码并调用诊断工具,内部答疑 Agent 可以暴露更具体的定位,外部客服 Agent 则需要不同知识范围与表达规范。拆分的理由不是角色命名,而是权限、上下文与出错代价确实不同。 这里最有启发的判断是「软件是被固化的知识」。业务规则和流程可以被 Agent 动态解释,但确定性、性能、成本、安全与合规审计仍要求其中一部分固化成产品规则和代码。AI Coding 只是把知识固化成软件的一段流程;真正的上游是知识是否准确、边界是否清楚,以及新决策能否回到权威来源。因此,交付物未来可能同时包含软件、可供 Agent 使用的知识与 Skill,而不是只交一套界面。 困难主要落在存量业务。关键规则往往散在代码、配置、数据、旧文档和资深成员脑中,字段和系统边界还保留历次组织变化的痕迹。文章提出一个可靠原则:凡是能从代码、配置和数据自动生成或校验的知识,不要改由人手维护;越接近人的经验与例外,越要设计专门的外化和确认机制。知识是否能自治,很大程度取决于它离权威事实来源有多近。 底座的范围也是现实约束。划得太大,规则和流程难以收敛;划得太小,Agent 一执行就跨出边界,又退回人去对接。知识还必须能「活下去」:如果更新只依赖某位架构师的责任心,文档终会再次脱离代码。自动提取、变更检测、人工确认、版本追踪和权限审计,都是比一次性整理更重要的持续机制。 作者明确承认,公司内尚未出现成熟的最佳实践,所以这套三层结构不应被当作已经验证的组织因果模型。它更像一个诊断框架:当 AI 提效停滞时,先看瓶颈是否其实位于隐性知识和跨角色协同;当准备部署 Agent 时,先问它使用什么权威知识、能调用什么工具、谁处理不确定答案。Agent 能跑多远,最终受限于团队把自身业务讲清楚并持续校正的能力。 速览 开放模型现状:2026 年夏季观察 来源:Hugging Face - Blog · BestBlogs 评分:91 __XPOSTER_otgvz_IMAGE_4__ Hugging Face 用 2026 年前七个月的 Hub 数据,分别观察发布规模、下载、点赞、许可、衍生模型、本地运行格式和 Agent 流量。报告显示,开放模型的注意力中心向中国实验室移动,但美国硬件与基础设施公司仍通过模型发布和转换参与生态。 最能纠正直觉的数据是,下载前 25 与点赞前 25 的仓库只有一个重合:点赞反映发布时的关注,下载更像已经嵌入稳定管线的依赖。Qwen 在 Hub 上形成 151,448 个衍生模型,而小于 1B 的模型仍占声明规模模型历史下载量的 83%。 Hub 数据不包含私有部署、外部 API 和其他分发渠道,不能直接等同于质量、市场份额或商业采用。阅读时应把「谁获得注意」「谁被持续调用」「谁成为社区基础设施」分开判断。 网页自动化的暗黑技法:让智能体像人一样使用网站 来源:AI Engineer · BestBlogs 评分:90 __XPOSTER_otgvz_IMAGE_5__ Corey Gallon 把网页自动化设计成「感知-行动-验证」循环:先读 DOM、可访问性树、网络或截图,做一个动作,再用不同信号确认结果,而不是让一次点击自己证明成功。 他的三层梯子从便宜的页面 API 与合成事件开始,必要时升级到 CDP trusted input,只有确实需要时才使用视觉和更接近人类的输入轨迹。最终系统由确定性代码高速驱动浏览器,Agent 只承担图像判断,避免每次点击都经过模型往返。 演示包含绕过反自动化挑战的双重用途技术,作者也强调只在自有基础设施和自有账户上运行。可复用的工程结论是缩小模型参与范围,而不是把规避网站控制当作默认能力;真实部署必须先满足授权、服务条款和合规要求。 计算机使用智能体评测:别让可重放轨迹伪装成能力 来源:AI Engineer · BestBlogs 评分:89 确定性的计算机使用基准可能让模型记住并重放固定操作轨迹,在界面略有变化时却无法适应。这样的高分测到的是对测试环境的熟悉,而非在真实桌面上恢复和调整的能力。 研究建议引入环境变体、结果级验证和更可靠的不确定性估计,让智能体不能只靠固定坐标或步骤序列过关。评测还要区分任务最终成功与中间轨迹看起来相似,避免把测试泄漏包装成泛化。 它提醒团队在部署前主动改变窗口、数据和交互路径,并观察失败后的恢复,而不是只复跑公开基准。变体测试不能覆盖所有真实环境,但比单一可重放轨迹更接近实际风险。 dots3-note Preview:迈向服务真实生活的长程智能体,坚定的第一步 来源:小红书技术REDtech · BestBlogs 评分:88 REDtech 发布 280B 参数多模态模型 dots3-note Preview,同时给出 TEMPO 长程强化学习方法,以及 VibeSearchBench 与 VibeLifeBench 两套面向真实生活任务的评测。 这组发布把模型、训练方法和任务环境放在一起:长程智能体不仅需要一次回答正确,还要在搜索、生活决策和多步骤执行中维持目标、处理反馈并完成验证。 Preview 表明的是研究方向和初步能力,不等同于已经成熟的生产服务。更值得观察的是后续开放材料、评测可复现性,以及模型在失败恢复和安全交接上的表现。 34K Star 的 DeepTutor,不只是 AI 家教:它在做一套 Agent 学习操作系统 来源:山行AI · BestBlogs 评分:91 DeepTutor 把统一 Agent Loop、RAG、Skills、外部 Agent 和三层长期记忆组合在一起,目标不是回答一道题,而是让学习任务能够跨会话延续,并复用此前形成的知识与过程。 架构上的信息增量在于,资料检索、工具调用、任务计划和记忆不再是孤立功能,而是围绕学习状态持续更新。外部 Agent 与 Skill 也提供扩展入口,使系统能接入不同学科与工作流。 34K Star 说明项目获得广泛关注,却不能替代教学效果、错误率和隐私安全评估。准备采用时,应重点检查记忆怎样纠错、来源怎样追溯,以及长期记录是否真的改善学习而非积累误解。 守护前沿:JetBrains 如何评估并部署 Claude Fable 5 来源:Claude Blog · BestBlogs 评分:91 JetBrains 没有只依据公共榜单选择 Claude Fable 5,而是把模型放入私有代码库的真实任务中,评估准确性、完成步骤、推理效率与部署适配。 案例同时讨论安全套件、白盒测试与数据保留,说明企业评估的对象不仅是模型回答,还包括它接触什么代码、留下什么数据、怎样进入已有开发流程。 这是供应商发布的客户案例,结果不能自动外推到其他代码库。可复用的方法是建立自己的任务集与风险门,并把质量、效率和数据治理放在同一张评估表里。 分享一些 insights | 我们为什么会做 dLLM,又能否取代 AR? 来源:青稞AI · BestBlogs 评分:89 离散扩散语言模型尝试用并行生成挑战逐 token 的自回归路线,潜在优势是允许多个位置共同修订,而不是把所有生成都锁在从左到右的单一路径上。 文章同时解释,并行并不自动带来质量与速度优势:生成调度、迭代步数、训练目标和长文本一致性都会限制实际收益,现有工具与推理生态也主要围绕 AR 构建。 因此 dLLM 更适合被理解为另一种生成与计算权衡,而不是已经确定的替代者。判断其位置要看具体任务的延迟、质量和可控性,而不是只比较理论并行度。 补充阅读 X 开源「为你」算法,披露详细评分机制 来源:Elon Musk(@elonmusk) · BestBlogs 评分:92 X 开源 For You 排序算法,公开帖子评分与互动权重,让外界可以更具体地讨论推荐系统怎样组合候选和反馈;代码透明仍不等于线上数据、实验配置与实际运行完全透明。 Unify 如何在两周内将 AI 智能体成本降低 95% 来源:LangChain · BestBlogs 评分:90 Unify 把 Agent 架构当作经济系统,通过缓存、评测纪律和工具调用优化,将运行成本降低约 90% 至 95%;这是团队案例,适合借鉴诊断顺序,不宜机械套用降本比例。 科技爱好者周刊(第 408 期): 你需要知道的 AI 缓存知识 来源:阮一峰的网络日志 · BestBlogs 评分:91 本期周刊解释大模型输入 Token 缓存怎样影响延迟与价格,帮助读者理解为什么稳定前缀、上下文排列和缓存命中率会成为 Agent 成本设计的一部分。 InstEmb:面向 Oxygen AIIC 商品知识表征的未来感知指令嵌入 来源:京东技术 · BestBlogs 评分:88 京东 InstEmb 用可学习的 look-ahead tokens 自蒸馏未来输出语义,让一次前向得到更符合指令的混合表示,并在多个检索与句向量基准上超过文中强基线。 从 DeepSeek、Kimi 到"黄仁勋联盟":AI 模型开源,到底"开"了什么? 来源:硅谷101 · BestBlogs 评分:90 文章区分开放权重与训练代码、数据、许可和治理都开放的完整开源,并借中美生态说明「可下载」背后仍有不同商业模式与安全取舍。 ChatGPT 中的 Computer History 来源:OpenAI · BestBlogs 评分:88 ChatGPT macOS 客户端的 Computer History 记录交互事件形成跨任务记忆,使助手能理解不同应用中的工作连续性,也把用户控制、敏感信息范围和记忆纠错推到产品中心。 CaaS 崛起:为 Agent 构建可复用的上下文服务 来源:AI Engineer · BestBlogs 评分:88 CaaS 把重复知识工作需要的结构化 Web 上下文沉淀为可复用服务,适用于数据新鲜度和提取逻辑值得长期维护的场景,而非所有一次性检索都要另建平台。 Cursor 收购 Firetiger:构建可投入生产的 AI 智能体 来源:Cursor(@cursor_ai) · BestBlogs 评分:90 Cursor 宣布收购 Firetiger,继续建设能够处理生产工作流并自主解决问题的 Agent;真正的产品增量仍要看整合后的权限、可观察性和故障恢复能力。 LTX-2.5 开源:22B 音画生成模型,原生多镜头、自动时长与 4K HDR 来源:魔搭ModelScope社区 · BestBlogs 评分:87 Lightricks 开放 22B 参数 LTX-2.5 权重,新增原生多镜头、自动时长预测与 4K HDR,并同时提供适合微调的 Dev 和固定 8 步推理的 Distilled 版本。 计算机使用模型将让网页走向智能体化,而非等待 API 普及 来源:AI Engineer · BestBlogs 评分:90 Dhruv Batra 判断,长尾网站很难等到统一 API 覆盖,计算机使用模型会直接操作面向人的界面;这扩大了可达范围,也要求更严格的授权、验证和失败恢复。 延伸探索 今天的补充区可以按三条线继续读。模型与开源一侧包括 DeepSeek-V4-Pro、Gemini 3.7 Flash、Grok 4.6、模型路由和 Claude Code 成本;Agent 工程一侧集中在企业 Harness、DeepSeek Harness、多智能体交易研究、网页运行框架和安全电脑操作,能继续补足「循环如何获得上下文、工具与评测」的问题。 另一条线把视角拉到组织与产品:WorkBuddy 的 AI 原生资料库、游戏开发者对执行提速的反思、Google 开发者大会,以及实体产业的软件化,都在讨论同一个边界--执行更快之后,知识、判断、基础设施和业务闭环是否同步改变。可把这些材料作为三篇精讲的对照,而不必逐条追赶所有发布。 今日阅读路径 如果只有 15 分钟,先读「实用循环工程」,把 goal、loop、验证者和停止条件变成可立即使用的工作框架;再读 GLM-5.3 的网络安全部分,练习按审查、验证和利用链分层理解模型能力;最后读 AI Native 团队的知识底座章节,把个人工作流放回组织协同中检查。 读完可以追问两个问题:你正在委派的是任务,还是连价值判断也一起委派了?团队最依赖的业务规则,究竟锚定在代码、配置、数据,还是仍只存在于某个人的记忆里?欢迎打开原文继续阅读,也把你的实践和疑问留在评论区。 👉 近期早报 • BestBlogs 早报 · 2026-08-14 • BestBlogs 早报 · 2026-08-13 • BestBlogs 早报 · 2026-08-12 • BestBlogs.dev 第 108 期:智能的执行层 • BestBlogs.dev 第 107 期:个人 AGI • BestBlogs.dev 第 106 期:1% 法则 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

译智谱发布 GLM-5.3,基于与 GLM-5.2 相同基座经更长后训练,在 Terminal-Bench 3.0 上由 4.6 提升至 28.3,DeepSWE v1.1 上由 46.2 提升至 66.9;网络安全方面,CyberGym 得分 84.5%,ExploitBench 为 54.4%,仍低于 Mythos 5 的 78.0%。

ginobefun@hongming731 · 1天前35

BestBlogs 早报 · 08-15 GLM-5.3 网络安全 / 循环工程 / AI Native 团队 / 开放模型生态 / 浏览器智能体 [1] ★ 精讲|GLM-5.3:前沿编程能力与涌现的网络安全能力 GLM-5.3 在不更换基座模型的前提下,通过扩大长程任务环境和后训练规模,同时提升编程与网络安全能力。文章既给出终端、软件工程和漏洞评测的分层结果,也说明完整权重将在安全加固后开放,读者可据此区分模型的防御潜力、攻击边界与厂商自测口径。 来源:智谱 https://www.bestblogs.dev/article/85fc103869 [2] ★ 精讲|实用循环工程 Addy Osmani 把长时 Agent 工作拆成两种原语:goal 用可测量的完成条件推进有界任务,loop 按时间重复检查外部状态。更关键的经验是让独立 Agent 验证产出,并把审美、架构与安全判断留给人;这为并行代理从演示走向日常工程提供了可复用边界。 作者:Addy Osmani · 发布:Elevate https://www.bestblogs.dev/article/a273df4de3 [3] ★ 精讲|重构协同:关于 AI Native 团队的思考 大淘宝技术把 AI 提效停滞归因于协同仍由人串联,而不只是编码速度不够。作者设想以知识底座、分工 Agent 和人形成业务闭环:Agent 执行与传递,人负责目标、判断和例外。对存量团队而言,真正难点是把隐性规则外化,并让知识持续贴近代码、配置与数据等权威来源。 来源:大淘宝技术 https://www.bestblogs.dev/article/bf2bf5c18b [4] 开放模型现状:2026 年夏季观察 Hugging Face 的半年期生态报告显示,中国实验室在顶尖开放模型发布上占据主导地位,Qwen 以 151K 个衍生模型成为社区基础模型;报告还首次单列可识别的 Agent 流量,并披露不同编程工具在其中的份额。 来源:Hugging Face - Blog https://www.bestblogs.dev/article/e17db794cd [5] 网页自动化的暗黑技法:让智能体像人一样使用网站 [视频] 一场聚焦浏览器智能体工程实践的演讲:用 CLI 工作流和 Chrome DevTools Protocol 驱动网页,再以分级闭环让 AI 只处理感知与推理。 来源:AI Engineer https://www.bestblogs.dev/video/3b05f2b5b [6] 计算机使用智能体评测:别让可重放轨迹伪装成能力 [视频] 这场研究分享指出,确定性的计算机使用基准可能奖励可重放的操作轨迹而非具备适应力的智能体,并提出通过环境变体、可验证性与更稳健的不确定性估计来修正评测。 来源:AI Engineer https://www.bestblogs.dev/video/50b28fb31 [7] dots3-note Preview:迈向服务真实生活的长程智能体,坚定的第一步 REDtech 开源 280B 参数的多模态模型 dots3-note Preview,并提出 TEMPO 方法提升长程强化学习,同时发布 VibeSearchBench 与 VibeLifeBench 两套真实生活评测基准。 来源:小红书技术 REDtech https://www.bestblogs.dev/article/005a2ed0f8 [8] 34K Star 的 DeepTutor,不只是 AI 家教:它在做一套 Agent 学习操作系统 本文深度解析开源项目 DeepTutor,揭示其作为 Agent 学习操作系统的核心架构:统一 Agent Loop、RAG、Skills、外部 Agent 与三层长期记忆,实现学习任务的连续性与知识的可复用性,并详细介绍其功能模块、扩展能力与适用场景。 来源:山行 AI https://www.bestblogs.dev/article/cb7d304be8 [9] 守护前沿:JetBrains 如何评估并部署 Claude Fable 5 JetBrains 首席技术官 Vladislav Tankov 分享公司如何评估并部署 Claude Fable 5,强调其在真实编码任务中的卓越准确性、效率和推理能力,同时考虑安全性和数据保留。 来源:Claude Blog https://www.bestblogs.dev/article/68885056c4 [10] 分享一些 insights | 我们为什么会做 dLLM,又能否取代 AR? 本文深度探讨离散扩散语言模型(dLLM)的发展现状、技术特性与局限性,分析其与自回归模型(AR)的差异、并行生成的理论边界,并展望其在未来模型生态中的定位与潜在应用场景。 来源:青稞 AI https://www.bestblogs.dev/article/6fdc8d78d2 --- http://BestBlogs.dev · 发现真正适合你的高质量内容 BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。 在线阅读:https://www.bestblogs.dev/explore/brief/2026-08-15

译智谱发布 GLM-5.3,在不更换基座模型的前提下,通过扩大长程任务环境和后训练规模,同时提升编程与网络安全能力。文章给出终端、软件工程和漏洞评测的分层结果,完整权重将在安全加固后开放。

已加载 40 条
全部 AI 动态
2026年8月17日星期一 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
推文 · 标签「Agent」 · 3357 条清除

8月17日

星期一 · 4 条
05:23
Rohan Paul@rohanpaul_ai
AI 评分 38/100
Anthropic 新研究:AI 智能体间可传播"思维病毒"

Anthropic 与瑞士大学的新论文发现,AI 智能体能相互说服并持续传播同一非预期目标,形成自然语言版“计算机蠕虫”。研究演化出可自我修改的 SOUL.md 文件中的“思维病毒”,其传播力远超普通文件,所有 4 种测试载荷均通过 20 跳压力测试。但这类病毒仍易被阻止:在 Claude Haiku 4.5 上,简单警告即可在 150 多次尝试中阻断所有演化攻击。

智能体Anthropic论文/研究
05:23
Ethan Mollick@emollick
AI 评分 29/100
长期以来,X 让人恼火的一点是,你无法导出自己的书签,只能不停地滚动、滚动、再滚动。于是,我让 Codex 中的 GPT-5.6 Sol 来做这件事,它接管了我的 Chrome,现在我已经拿到了全部 5,302 条书签,可追溯至 2014 年,附带各类数据。我还让它找出其中的精华内容(帖子?)
智能体OpenAI教程/实践
04:23
Rohan Paul@rohanpaul_ai
AI 评分 36/100
AQuA:防自改进智能体放大实验缺陷的架构

斯坦福、普林斯顿与蚂蚁集团提出 AQuA,针对自改进智能体可能基于有缺陷实验递归放大错误的问题。其架构限制智能体仅能通过受限规范提出因子或模型变更,数据路径、标签、分割与评估器保持密封。在美股上,混合模型 IC 达 +0.0843(最强基线 +0.0613),多空策略 Sharpe 达 +2.50(2 bps),完全因果滚动测试下约 +2.0,均为模拟结果。

智能体数据/训练论文/研究
01:22
AYi@AYi_AInotes
AI 评分 53/100
网传Anthropic内部文档造假,Agent工程从Loop走向Graph是真趋势

刷屏的Graph Engineering内部文档被证实为假,Claude Code负责人Boris Cherny于7月25日否认撰写,Karpathy入职时间线也对不上。

智能体Anthropic现象/趋势

8月16日

星期日 · 18 条
22:05
ginobefun@hongming731
AI 评分 46/100
BestBlogs 周刊:智能执行层全景解析

BestBlogs 第108期周刊聚焦AI智能体执行层,Grok 4.6、DeepSeek V4 Pro、Gemini 3.7 Flash均优化长程Agent能力。DeepSeek开源插件化Harness v0.1,OpenAI公开Codex Harness机制。周刊从执行模型、Harness、评测、多智能体、路由缓存等六条主线,剖析模型如何稳定完成任务。

智能体现象/趋势部署/工程
22:05
ginobefun@hongming731
AI 评分 24/100
洪明周刊第108期:AI智能体工程现场六主线

洪明发布第108期周刊,聚焦AI智能体工程现场,沿执行模型、Harness、质量与评测、多智能体与权限、路由与缓存、执行层新边界六条主线展开。内容承接此前关于判断力、验证边界、「1% 法则」和个人AGI的讨论,深入具体工程实践。

ginobefun: https://x.com/i/article/2088984377762193408

智能体现象/趋势部署/工程
19:23
Rohan Paul@rohanpaul_ai
AI 评分 35/100
MDA让LLM提假设,8次实验追平Opus 4.7

新方法MDA将LLM限定为假设生成器,用贝叶斯推理评分机制、信息价值选择实验,避免让模型自行判断证据含义。在FORCEBENCH上,MDA用8次实验达到未限流Opus 4.7智能体约41次实验的准确率,数值通过率93%对31%。

智能体数据/训练论文/研究
17:53
Rohan Paul@rohanpaul_ai
AI 评分 51/100
DeepSeek Harness 3天斩获12.2万星

DeepSeek Harness 发布3天即获12.2万+ GitHub 星标,成为 GitHub 历史上增长最快的项目之一。该编排层可将模型、工具、存储、调度乃至 UI 全部作为可替换插件,支持将 Claude Code 或 Codex 接入作为子智能体,并采用 MIT 许可。同期 DeepSeek 将缓存命中输入价格提高6至12倍,而缓存输入正是智能体循环的核心消耗。

智能体DeepSeekMCP/工具开源/仓库
另有 1 家信源报道公众号:卡尔的AI沃茨
14:22
AYi@AYi_AInotes
AI 评分 49/100
反驳"全塞进AGENTS.md":Skills是管理臃肿的工具

针对“Skills是bloat、应全塞进AGENTS.md”的流行建议,多位AI从业者指出其误区。Skills采用渐进式披露,仅按需加载完整内容,而AGENTS.md每次会话全量加载。全塞进AGENTS.md会导致token成本高、关键指令被稀释及不可维护。适用边界仅在极简个人工具,多工作流场景应分层使用。

kache: don't use skills.md or SKILLS or whatever by the way. it's bloat just put everything in an agents.md

智能体MCP/工具教程/实践编码
14:03
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 56/100
DeepSeek Harness 开源:把边界写成契约

DeepSeek Harness 开源,设计哲学是“事实有据,权限有度”。它拒绝将 agent state 写成模糊目标,让每份重要 state 由能验证它的 owner 持有,并通过 atomic comparison 关闭 time-of-check/time-of-use gap。

智能体DeepSeek教程/实践部署/工程
另有 1 家信源报道公众号:卡尔的AI沃茨
12:21
AYi@AYi_AInotes
AI 评分 60/100
DeepSeek 开源 Harness 及 11 个内部工程 Skill

DeepSeek 开源其内部工程团队使用的 DeepSeek Harness 仓库,并附带 11 个真实工程级 Skill,涵盖 Code Review、质量门禁、PR 验收等标准流程。

AYi: DeepSeek V4 Pro 作为当前最强开源 Agent 模型,有个很离谱的毛病, 或者说是有个真实软肋: 能力高度绑定特定脚手架, 换个工具集换个 harness 换个系统提示,它就可能从 99 掉到 91, 也就是说同一个模型,同一...

智能体DeepSeek开源/仓库编码
另有 1 家信源报道公众号:卡尔的AI沃茨
11:21
AYi@AYi_AInotes
AI 评分 70/100
DeepSeek V4 Pro 能力高度绑定脚手架

DeepSeek V4 Pro 能力高度绑定特定脚手架:同一模型同一任务,首轮塞入 25 个工具仅得 91 分,只给 bash 和 str_replace_editor 两个工具则稳定 96-99 分,两阶段锚定(先极简后解锁)连续 98-99 分。

智能体DeepSeekMCP/工具教程/实践
09:05
ginobefun@hongming731
AI 评分 43/100
三大模型加密思维链被旁路转录

MATS 研究员领衔的 116 页论文证实,Anthropic、OpenAI、Google 的 API 存在密码学旁路漏洞:攻击者将加密推理包注入同厂轻量模型并越狱后,可逐字转录旗舰模型的隐藏思维链。按 Haiku 4.5 价格估算,解码 1 万条思维链约 720 美元。除 Anthropic 的 Fable 5 外,Claude、GPT-5.6、Gemini 全系均受影响。

智能体AnthropicOpenAI安全/对齐
09:05
ginobefun@hongming731
AI 评分 36/100
全球三大模型防蒸馏机制告破

116页论文证实Anthropic、OpenAI、Google的API存在密码学旁路漏洞,可将加密推理包注入同厂轻量模型并越狱,使其逐字转录隐藏思维链,解码1万条成本约720美元。研究还发现Kimi-K3复现Opus推理概率较其他模型高约百万倍,但作者强调不足以直接证明蒸馏。

ginobefun: https://x.com/i/article/2088785861869776896

智能体其他推理
08:23
Elon Musk@elonmusk
AI 评分 35/100
Grok 4.6【引用 @KettlebellDan】:我让 Grok Build 为我的游戏制作了一支预告片它启动了游戏、亲自游玩、录制屏幕、剪辑画面,并完成配音。我全程没有动过手X THE GAME - 免费游玩 https://kettlebelldan.com/x_the_game_v2

Dan: So I asked Grok Build to make a trailer for my video game It booted the game, played it, recorded the screen, edited the...

智能体xAI模型发布视频
04:53
Chubby♨️@kimmonismus
AI 评分 28/100
Sol 终于可以导航 Luna 子代理了。这是一次非常必要且受欢迎的更新。

eric provencher: This went under the radar this week, but we just shipped the ability for models with multi agents v2 to delegate to any ...

智能体产品更新
04:33
Tibo@thsottiaux
AI 评分 35/100
让 Sol 为你管理一支高效的 Luna 智能体舰队。这些模型彼此熟识,协作起来能以极快的速度高效达成结果。

eric provencher: This went under the radar this week, but we just shipped the ability for models with multi agents v2 to delegate to any ...

智能体OpenAI产品更新编码
03:23
Rohan Paul@rohanpaul_ai
AI 评分 43/100
Grok 4.6 编码成本效率超 GPT-5.6 Sol

Grok 4.6 在三个编码任务中以 $13.11 总成本击败 GPT-5.6 Sol 的 $20.18,模型调用次数 201 次对 338 次,总耗时 129 分 41 秒对 149 分 33 秒。两次运行分别消耗约 20M 和 26M tokens,其中 93-98% 的输入 token 为缓存读取,若无提示缓存成本将增加约 4 倍。

thehype.: grok 4.6 vs gpt 5.6 sol - on three @gameofthrones castles two coding agents built three 3d castles from scratch in a sin...

智能体OpenAIxAI编码
03:03
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 63/100
DeepSeek Harness:让智能体状态有明确归属

DeepSeek Harness 的核心设计是拒绝将“智能体状态”视为单一模糊对象,而是让每个关键事实归属于有权验证它的组件。例如文件读取会记录版本号,仅在版本匹配时才允许修改,以消除检查与使用之间的时间差。工具调用则作为事件管道,包含身份验证、模式校验、执行钩子等环节,子智能体也需独立决策上下文、生命周期与权限。

智能体DeepSeek现象/趋势部署/工程
00:23
Greg Brockman@gdb
AI 评分 40/100
朝着再也不用手动选择模型的方向迈进。

eric provencher: This went under the radar this week, but we just shipped the ability for models with multi agents v2 to delegate to any ...

智能体OpenAI产品更新
00:23
Rohan Paul@rohanpaul_ai
AI 评分 36/100
微软:用蒸馏技能替代昂贵测试时推理,一次付清推理成本

微软新论文提出,可将昂贵的测试时推理替换为从过往智能体运行中提取的小型规则集。用 GPT-5.4-mini 提取 35–50 条轨迹中的失败模式并转为 markdown 技能,在 4 个智能体基准上恢复了非推理与推理模式间 55%–100%+ 的差距,且输出 token 减少 2.9–4.5 倍。

智能体Microsoft推理论文/研究
00:03
eric zakariasson@ericzakariasson
AI 评分 44/100
Eric Zakariasson 将用户反馈自动修复流程打包成 npm 包 feedback-agent,应用内嵌入组件后,用户提交反馈即触发云智能体处理。该流程基于 PostHog 收集的文本、会话回放、事件和错误数据,由 Cursor 云智能体结合只读 PostHog MCP 上下文循环验证修复,最终自动创建带测试的 GitHub PR 供手机端审核。

eric zakariasson: i've been building some smaller apps over the last weeks for myself, friends and family and discovered a pretty nice pat...

智能体MCP/工具产品更新编码

8月15日

星期六 · 18 条
23:23
Rohan Paul@rohanpaul_ai
AI 评分 30/100
Scale AI 论文:智能体故障定位新分类法

Scale AI 论文提出以交互为中心的智能体故障分类法,主张调试时应先定位首次未恢复故障发生在模型、上下文、记忆、工具层、其他智能体、评分器还是环境中。该分类法涵盖 41 种故障模式,并在 40 个案例上验证。GPT-5.5 分类准确率达 80%(Cohen's κ=0.76),4 个评判器一致时精度升至 96%,覆盖率降至 68%。

智能体arXiv论文/研究
23:21
AYi@AYi_AInotes
AI 评分 48/100
Airtap 云手机 Agent 实现无人值守自动化

博主用 Airtap 云手机 Agent 设置每日早 8 点 Routine,合盖状态下自动抓取 12 个新 FDE 岗位(Zendesk、ElevenLabs 等,薪资最高 $400K)并整理发至邮箱。

AYi: https://x.com/i/article/2088106304552263680

智能体教程/实践
21:23
Rohan Paul@rohanpaul_ai
AI 评分 34/100
"模型不再是产品。Codex、Perplexity Computer 或 Claude Code--这些都是编排系统。它把一个模型与智能体外壳配对。什么是智能体外壳?即智能体如何循环运行的规则。"--Aravind Srinivas
智能体AnthropicOpenAI大佬观点
20:23
🚨 AI News | TestingCatalog@testingcatalog
AI 评分 32/100
ANTHROPIC 🔥:Claude 桌面端将内置一个专用浏览器,在 Cowork 会话中随时可用!一个超级应用正在崛起。这看起来似曾相识 👀
智能体Anthropic产品更新
20:23
Rohan Paul@rohanpaul_ai
AI 评分 42/100
工具调用转向代码优先,14 模型中 11 个更优

新研究对比 JSON 与代码优先的工具调用方式,在 14 个模型、309 项 BFCL v4 任务中,程序化调用在 11 个模型上持平或胜出,GPT-5.6-Sol 和 Terra 各提升 10.6 个百分点。Claude Sonnet 5 在 100 次调用时 JSON 枚举准确率降至 0%,Python 保持 100%;13 个模型的顺序链执行更快。

智能体MCP/工具论文/研究
20:03
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 27/100
报告《AI for Productivity in the Age of Agentic AI》发布,共68页,由AI4X项目团队联合全球12所学术机构(含复旦、浙大、斯坦福、伯克利、牛津、普林斯顿)共同完成。报告核心探讨智能体时代AI能力如何转化为持续生产力增长,认为Agentic AI正重新组织工作的执行、协调与委派方式,重塑人、组织与智能系统的关系。

Zhiheng Xi: 🚀 Excited to introduce AI for Productivity in the Age of Agentic AI - a 68-page report I co-led with the AI4X Project T...

智能体论文/研究
19:23
Rohan Paul@rohanpaul_ai
AI 评分 42/100
提示词如何让编程智能体浪费算力:Same Task, Different Work 论文揭示

论文发现,提示词要求编程智能体考虑多种方案时,其推理量增加2.4–7.4倍,但成功率无提升;智能体平均展开约三个方案后弃用,仅实现其中一个。“Be absolutely certain”指令则触发冗余验证,最高使运行成本达基线18.25倍、工具调用15次对6次、耗时3倍,成功率不变。

智能体arXiv推理编码
19:21
AYi@AYi_AInotes
AI 评分 66/100
Agent 接管 iPhone 理备忘录的实战经验

阿易 AI Notes 分享用 Agent 接管 iPhone 整理备忘录的真实用法:Agent 数出 iCloud 共 878 条备忘录,先建议从置顶条目动手,而非直接大改,省下约两周手动整理时间。

AYi: https://x.com/i/article/2088106304552263680

智能体MCP/工具教程/实践
16:23
fofr@fofrAI
AI 评分 28/100
智能体像这样自组织
智能体现象/趋势
16:02
Frank Wang 玉伯@lifesinger
AI 评分 52/100
玉伯谈Agent创业:从建站到新生命体

玉伯分享与文君在大理的交流:Agent类比网站发展史,OpenClaw是首个被大众感知的建站技术,一切才刚开始。Agent创业者需具备找目标用户和预判技术路线并执行的两大能力,且应以做模型的方式做应用,通过上下文与测评构建进化Loop。Agent由人与LLM共同孕育,其成长依赖社群环境,新时代社群产品蕴含大机会。

智能体大佬观点
14:53
gabriel@gabriel1
AI 评分 27/100
大约6个月内,50%的电脑工作可以通过直接告诉电脑来完成,到那时这只是一个文化问题。上下文、人类直觉和边缘情况无法被解决,因此人们将只专注于任务中非点击的部分以及审查工作。

gabriel: mamma mia i have never tried to explained ai to someone outside sf before we are not early, it literally has not even st...

智能体大佬观点
12:53
Peter Steinberger 🦞@steipete
AI 评分 53/100
我们在共享的 AGENTS MD 文件中添加了一条简短说明,要求每个更改 UI 状态的 PR 上传视频。https://github.com/openclaw/openclaw/pull/124013
智能体教程/实践编码
11:53
Peter Steinberger 🦞@steipete
AI 评分 20/100
我们把团队迁移到了用 OpenClaw 来构建 OpenClaw。能够把智能体会话作为 URL 分享,是一种超能力。
智能体产品更新编码
11:53
Qwen@Alibaba_Qwen
AI 评分 45/100
通义千问 Qwen3.8-27B 正式落地日常终端,联发科宣布为其提供 Day-0 支持。该支持覆盖 Dimensity Auto Cockpit C-X1 及最新旗舰移动 SoC,将端侧 AI 体验从智能手机扩展至车载场景,推动智能体 AI 无缝融入日常生活。

MediaTek: Congratulations to the @Alibaba_Qwen on the launch of Qwen 3.8! MediaTek continues our long-standing collaboration with ...

智能体端侧行业动态
09:52
Artificial Analysis@ArtificialAnlys
AI 评分 65/100
DeepSeek V4 Pro 0813 发布:涨价 264%,智能仅微升

DeepSeek 发布旗舰模型 V4 Pro 0813,在 Artificial Analysis 智能指数得 53 分,较 4 月版高 8 分,但仅比 V4 Flash 0731 高 1 分。

智能体DeepSeek推理模型发布
09:22
Rohan Paul@rohanpaul_ai
AI 评分 40/100
AlphaSense:Kimi 每 token 更便宜但单题成本更高

AlphaSense 新研究显示,Anthropic 模型使用成本可能低于部分大型开源中文模型。Kimi 每 token 价格远低于 GPT-5.6 Sol,但因组装上下文消耗更多 token,单题成本反而更高。真正成本单位是“完成 token 数 × token 价格”,token 效率是系统属性而非 API 定价属性;AlphaSense 通过改变检索方式,在相同模型上实现约 3 倍成本降低。

智能体Anthropic推理现象/趋势
09:05
ginobefun@hongming731
AI 评分 34/100
GLM-5.3 扩展编程与安全边界,循环工程重写 Agent 协同

智谱发布 GLM-5.3,基于与 GLM-5.2 相同基座经更长后训练,在 Terminal-Bench 3.0 上由 4.6 提升至 28.3,DeepSWE v1.1 上由 46.2 提升至 66.9;网络安全方面,CyberGym 得分 84.5%,ExploitBench 为 54.4%,仍低于 Mythos 5 的 78.0%。

智能体开源生态现象/趋势
09:05
ginobefun@hongming731
AI 评分 35/100
GLM-5.3 发布:编程与网络安全能力双提升

智谱发布 GLM-5.3,在不更换基座模型的前提下,通过扩大长程任务环境和后训练规模,同时提升编程与网络安全能力。文章给出终端、软件工程和漏洞评测的分层结果,完整权重将在安全加固后开放。

ginobefun: https://x.com/i/article/2088426893192421376

智能体AnthropicHugging Face开源生态
已加载 40 条