两个 AI Agent 事故暴露同一根因:把模型输出当成了系统状态。X 抓取 25/25 全失败,日报却写「新增 0 条」;待办「今天」未转标准日期,提醒直接消失。LLM 负责判断,确定性代码负责日期、状态、重试和告警——「没有结果」不等于「没有发生」。
两个 AI Agent 事故暴露同一根因:把模型输出当成了系统状态。X 抓取 25/25 全失败,日报却写「新增 0 条」;待办「今天」未转标准日期,提醒直接消失。LLM 负责判断,确定性代码负责日期、状态、重试和告警——「没有结果」不等于「没有发生」。
Matt Webb 在发布 Galactic Compass 2 后,借助 ChatGPT 作为耐心的互动导师,学会了使用四元数来完成应用开发。他认为,即使将大量思考外包给 AI,学习并不会停止,反而会推动他学习更多。这一体验凸显了生成式 AI 在教育场景中的潜力。
Slack 首席产品官 Jaime DeLanghe 分享了将对话转化为机构知识、构建人机智能体团队的最佳实践。她主张默认使用公开频道,让智能体从可见对话中学习,并建议将会议、邮件、日历等上下文连接起来以减少重复劳动。在 Slack 中由 Claude 驱动的智能体负责起草、总结、监控等生产工作,人类负责审查、决策与交接,形成循环协作。
全球设计公司 Populous 高级建筑师 Georgina Myers 介绍团队用 Runway 辅助体育场馆概念设计:过去完整视频需外部渲染团队至少三周,且提交前两周须冻结设计模型;如今 Runway 能生成传达尺度感的完整渲染和航拍图,将视觉制作时间缩短,让设计师把时间还给设计本身。该工具已用于利雅得 MBS 体育场等中东项目,支持 9 种不同活动模式的场景迭代。
Hugging Face 构建了一个约束感知的 GPU 分配器,并在七个基准场景中与 FIFO 调度器对比。在相同硬件和负载下,GPU 利用率最高提升 33 个百分点,优先级加权输出在全部场景中均上升,最高达 105%。分配器将实时推理需求按曲线而非峰值处理,批量任务按优先级跨整个调度周期排序,从而回收了预留闲置容量。
Cursor 已基本完成从 Solid 到 React 的迁移,新 agents 窗口 99% 为 React,并将 scss 和 Tailwind 全部转为 @stylexjs。迁移主要出于性能和可维护性考量,团队认为信号式响应在大规模应用中易引发意外扇出,而 React 的问题解决更直接。引用推文显示该迁移由智能体完成,共 +266K/−193K 次编辑。
The most famous AI tool migrated Solid to React with an agent: +266K/−193K edits. That direction is easy. React's model ...
针对“Skills是bloat、应全塞进AGENTS.md”的流行建议,多位AI从业者指出其误区。Skills采用渐进式披露,仅按需加载完整内容,而AGENTS.md每次会话全量加载。全塞进AGENTS.md会导致token成本高、关键指令被稀释及不可维护。适用边界仅在极简个人工具,多工作流场景应分层使用。
don't use skills.md or SKILLS or whatever by the way. it's bloat just put everything in an agents.md
DeepSeek Harness 开源,设计哲学是“事实有据,权限有度”。它拒绝将 agent state 写成模糊目标,让每份重要 state 由能验证它的 owner 持有,并通过 atomic comparison 关闭 time-of-check/time-of-use gap。
另有 3 家信源报道X:阿易 AI Notes (@AYi_AInotes)公众号:卡尔的AI沃茨X:Rohan Paul (@rohanpaul_ai)作者主张博客应围绕自己尚未完全理解但想弄清的议题展开,并坚持每篇都提出至少略有争议的观点,以此倒逼研究和思考。写作过程常会改变作者原有看法,如发现新版 OpenAI 模型已失去 o3 的地理定位能力。作者认为新手解释陌生领域反而有优势,且公开个人履历可避免误导读者。
GitHub Secure Open Source Fund 第四期 50 个开源项目结合 AI 辅助工作流、维护者经验、GitHub 安全工具、专家指导与资金支持,系统性提升项目安全性。该计划展示了开源生态在 AI 时代应对安全挑战的实践路径,为维护者提供了可复用的安全加固模式。
Linear Agent 的价值在于完成未预设的工作,因此团队未为其编写固定路径,而是通过系统提示词、工具设计、产品模型、运行范围及底层自定义 harness 划定边界。系统提示词聚焦沟通风格、硬性边界与产品概念解释;工具设计将约束编码进参数,使无效操作难以执行。团队还引入系统技能作为组合单元,按需渐进加载,避免一次性暴露过多上下文。
Raft 逆向自动化产品演示视频制作:不先让多模态模型看素材,而是把视频压平为智能体易处理的工件。每个智能体各司其职、交接具体工件并进入同一评审循环,导演-制作-QA 流程一键复制。视频由产品状态而非记忆生成,可复现状态消除连续性错误,让修改局部化。
http://x.com/i/article/2084443952405762048
LangChain 梳理了 Lyft、Vodafone 和 LATAM Airlines 将客户体验(CX)智能体投入生产的实践。三家企业的共同经验是:先用小范围场景验证价值,再逐步扩展;同时需重视智能体与现有客服系统的集成、人工接管机制以及持续评估。文章还总结了避免过度承诺、明确智能体能力边界等关键教训。
与普遍认知相反,使用 LLM 的核心技能并非提示词技巧,而是对目标领域的专业知识。以陶哲轩与 ChatGPT 讨论雅可比猜想反例为例,其简短、精准的提问和纠错能力源于深厚的数学理解,而非通用提示策略。具备领域知识的人能更有效地引导模型,从同一模型中获取远超新手的价值。
If you send me an email that seems like it was written by AI, that will make me curious whether I'm right, and instead o...
Thoughtworks CTO Giles Edwards-Alexander通过实验证明,对AI智能体编写的代码库进行重构可显著降低后续修改的token消耗。一个由Claude Code和Cursor生成的约15万行Rust应用中,单个数据访问层文件从17,155行重构至3,695行,输入token消耗从159,564降至27,360。
NorthStar Anesthesia 基于 Databricks 平台,在数周内为 3,000 名临床医生构建了一款排班应用。该应用整合了实时数据与 AI 调度逻辑,将排班效率提升至分钟级,并支持跨 25 个以上美国医疗点的动态人员调配。项目通过 Databricks 的 Lakehouse 架构和低代码工具实现快速开发,无需额外采购专用排班软件。
一家PE支持的医疗账单平台用4个月建成7个生产级AI智能体,处理真实医保理赔,零患者数据暴露。团队在构建数据富化管道(每笔理赔预计算34个动态变量)和评估框架上投入的工程时间远超模型集成。系统跨两个模型提供商路由调用,切换模型不影响输出结果。
A PE-backed healthcare billing platform had two people hand-writing every rule in their claims system. 300+ denial codes...
Databricks 现场工程团队构建了一套自助式基础设施供应系统,旨在让客户更高效地部署和管理 AI 智能体。该系统通过自动化资源调配,将基础设施交付时间从数周缩短至分钟级,支持 GPU、存储和网络等资源的按需分配。目前该平台已在内部使用,并计划逐步向外部客户开放。
Anthropic 用 Claude Code 实现百万行级代码迁移,Bun 创始人两周内将项目从 Zig 迁到 Rust,成本约 16.5 万美元。核心在于前置约束:先建立强 judge 改写测试为双端断言,再用对抗 agent 验证规则不被稀释。人类时间几乎全花在 Rulebook 上,大模型只用于写规则和高风险审查。
http://x.com/i/article/2077886850262503424
另有 1 家信源报道X:Claude Devs (@ClaudeDevs)小红书以 3 人 3 天推出内测版本,约一个月实现全员覆盖,核心是 AI Native 项目运作机制。技术选型基于 OpenClaw 二次开发,通过 Seal AI Zone 隔离集群与 NEX 沙箱解决安全,Self-GC 使输入 Token 下降 10%~15%、Auto 模式路由使成本降低 69%,并自研 LLM Wiki 三层记忆架构与 Skill Hub 生态。
一支团队为4-9岁儿童构建了实时AI数学与阅读辅导老师。儿童无法忍受2-3秒的回复延迟,标准Agent工具循环导致每轮3-4秒空闲,孩子会问“为什么它不动了?好无聊”。团队放弃了标准工具循环,构建自定义框架让模型在单次响应中流式输出多个动作,解释器边生成边解析执行,孩子只需等待约30个token的首个动作。同时引入异步规划器,在孩子思考或说话的间隙运行,基于不可变事件日志协调两个Agent的共享状态。该架构在指令遵循、延迟与灵活动作空间之间取得平衡。
Bun 于 2025 年 12 月被 Anthropic 收购,作者使用预发布版 Claude Fable 5 进行了大量 Rust 重写。Bun 最初用 Zig 在一年内构建,如今 CLI 月下载超 2200 万,被 Claude Code 等采用。广泛功能带来稳定性挑战,v1.3.14 修复了多项 use-after-free、内存泄漏等 bug。团队通过 ASAN、Fuzzilli 模糊测试等系统性预防,并借助 Rust 的内存安全特性减少此类缺陷。
另有 1 家信源报道IT之家(RSS)Sierra 的 AI 加速团队为全公司各部门员工开发了 AI 智能体。团队分享了构建过程中的具体成果与经验教训。
LangChain 通过挖掘智能体运行轨迹(traces)来定位失败模式,并利用这些数据微调评估模型(judge models),其成本低于前沿大语言模型。该方法结合评估(evals)进行性能爬山(hill-climb),以系统化方式提升智能体表现。
文章总结9组39条AI设计原则,核心是让用户信任程度匹配AI真实可靠性。关键点:AI应发挥模糊意图、内容生成等优势,而非替代传统界面;接受输出多样性,提供多版本和局部修改;输出附证据便于一键验证;用户保留编辑、拒绝、撤销等控制权;AI诚实说明角色和限制;重视失败路径,支持撤销、日志、转人工。
Karpathy LLM-WIKI反转逻辑:人只筛选高质量资料并做最终判断,AI负责整理、链接、更新等脏活。三层架构(原始层、知识层、规则层)将资料编译成有机知识网络,让存量内容生长复利。核心是升级人与AI的分工。
http://x.com/i/article/2069352641423896576
作者将社交平台流行的“长寿五要素”(平静、睡眠、肌肉量、代谢、现金流)及抗衰补剂交给AI文献核查工具Apodex,后者跑了41分钟、翻了24篇覆盖千万人的队列研究。结论:核心方向没错但有三个漏洞——睡眠规律比时长更重要,肌肉力量比质量更保命,现金流需通过看病、饮食等中介起作用。被冤枉的体力活动(三千多万人Meta分析显示运动达标死亡风险降至0.69)和社会关系同样关键。补剂如白藜芦醇、维生素D等均缺乏人类硬证据。
一本名为《XQuant:人人都是量化交易员》的开源量化书采用“问题驱动”设计:先写Spec让AI生成代码跑通策略,再补理论。全书用9个问题串联量化pipeline:量化怎么赚钱、买什么(3只ETF)、买多少(3种仓位分法)、何时买卖、如何回测、过拟合检测(第6章极早讲述)、实盘、改进、因子研究。正文与练习代码分开维护,每章提供现成Spec给Claude/Cursor生成代码,训练将模糊想法转为清晰任务描述的能力。
http://x.com/i/article/2069024565901119488
Meta 在 Privacy-Aware Infrastructure (PAI) 的资产分类中采用混合模式:先构建含代码、血缘、语义标注的上下文证据,再调用 LLM 处理歧义、冷启动和新颖资产;人工审核标签与模型推荐严格隔离。LLM 不直接做生产决策,其稳定行为被蒸馏为版本化确定性规则用于生产执行,LLM 角色随规则积累逐步缩小。核心原则:上下文比提示词更重要、解耦评估与优化、将稳定行为规则化。
阿易 AI Notes 用自我验证型 AI 工具 Apodex,拆解“白毛股神”关于 $SIVE 和 CPO 的投资叙事。核查发现五条核心声称中四条站不住:GB200 大量采用 CPO 为假(实际用铜缆);800V 转型与 GB200 同步不成立(GB200 用 54V);$SIVE 被夸大为“最纯受益标的”(近 70% 营收来自无线业务);技术壁垒最高查无实据。英伟达更倾向投资中游厂商。核查报告附 23 条一手来源。
买MacStudio运行大模型性价比不高。以M3 Ultra 96G(32999元)为例,运行Qwen3.6-27B 4bit量化版并开投机解码,速度约65 token/s。设备成本换算成API调用(GLM-5.2,每百万token 28元)可买约1178M token,需连续运行209天才能回本。512G版(108749元)运行量化GLM-5.2速度仅17 token/s,回本约7年。模型每1.5个月更新,建议普通用户买coding plan或租卡。已有Mac或显卡者,闲置时跑模型才划算。