西班牙高校实验显示,7 个 Agent 脚手架 × 5 个模型跑同一组 GitHub 任务,不内置 MCP 的轻量脚手架(Pi、Tau)中位 token 消耗 1.4-1.6 万,而 Claude Code 和 qwen-code 需 26-29 万 token,贵 5-28 倍;同一 27B 模型换脚手架成本差 139 倍。
This week we read research from a team of academics that ran a software task across 7 agents and 5 models. They found th...
A shocking chart from a new study on student AI use in China. Good grades on homework used to predict good grades on tes...
New post with Nate Rush: Have we seen an acceleration in discoveries? Many plots & some tentative conclusions: 1. Cyber:...
We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the...
MIT 研究人员与合作者发现,医疗领域的 AI 可解释性工具效果因使用者而异。在皮肤病诊断中,非专家借助 AI 辅助提升了准确率,但提升主要源于对模型的依赖;初级保健医生则表现出不同的使用模式。
👀After 154 pages of tests of GPT-4, this paper concludes “Given the breadth and depth of GPT-4's capabilities, we belie...
普林斯顿大学团队通过“影子评估”测试前沿AI智能体的开放式研究能力:让智能体在六天时间内、使用数千美元API额度和算力,回答两篇未发表论文的核心研究问题,结果两篇论文均被原作者明确拒绝。分析显示,智能体缺乏研究判断力、资源意识、创造性反馈应对能力和有效回溯能力,且未遵循具体指令。研究团队认为,开放式研究对前沿AI智能体仍具挑战性,但结果尚属初步,需扩大样本量并持续评估。
一项新研究系统测试了自我反思循环的有效性:在1.5B、3B和7B开源模型上对比七种方法,基于两个数学基准各150道题,并计入所有生成token成本。全部36项对比中,没有任何方法稳定胜出;10项显著更差,且全部涉及模型检查自身输出,18项自我检查对比均为负面结果。Self-Refine和强制Reflexion在7B模型上比基线低3.6至10.1分。
OpenAI 内部下一代模型 Astra 解决了 10 个长期开放的数学问题,包括 1978 年以来首次改进的高维球填充上界,以及首个显式非 sofic 群。所有证明均形式化为 Lean 4、机器可验证,249 页手稿与代码已在 GitHub 开源,总成本仅 2000 美元。结果仍需数学界审查,千禧年难题尚未攻克。
An internal version of Astra, @OpenAI’s next major model family, solved 10 major open problems in mathematics, quantum c...
同一事件,精选展示《OpenAI Astra 以约2000美元证明10项数学难题》AI智能体在6天、3000美元预算内完成两项研究并产出论文,但均被评审拒绝,失败原因在于判断力而非执行力。主实验采用Claude Opus 4.8配合OpenClaw框架,智能体运行数百次实验、调试GPU并完成LaTeX排版,但面对负面评审时只会收窄结论、添加限定,而非重新设计实验。两轮实验结束时预算均剩余过半,暴露了创意匮乏而非资金不足的问题。
Google DeepMind 的 Tom Zahavy 在一篇立场论文中认为,大语言模型缺乏创造全新科学理论的认知机制,无法实现“操控性溯因”——即发明尚无语言模板的新原因。他指出,Einstein 和 Archimedes 的突破源于具身模拟,而语言模型如同“中文屋”般仅处理符号。Zahavy 提出,像 Genie 这类可交互的世界模型或许能通过模拟反事实实验,为发明新公理提供反馈回路。
Cool paper looking at how AIs solve unbounded, complex business problems in many fields by testing how well they can cra...
论文提出一种自进化Lean证明智能体,通过可信运行时包裹可变工作区,让智能体重写证明分解、编译器反馈利用和错误修复流程。经过15代进化,该智能体在miniF2F上达到45.1%的保留求解率,远超固定基准智能体的32.0%和初始版本的12.7%。
RLM论文指出,前沿模型训练可通过训练“测试集仿冒数据”来目标化任何benchmark分数,而开源模型因不公开数据集/RL环境而难以被验证。Alex和Omar提出用标准NLP距离指标检测隐藏轨迹。研究发现,设计良好的harness能让RLM在仅训练短任务后,完全泛化到8-32倍长的相似任务,甚至跨领域(如作文归属与数学解题)实现泛化。
Transformers struggle to generalize to tasks they were not explicitly trained on. Instead, we propose in 2026 that it is...
一篇综述梳理1250篇论文后发现,AI自改进的核心瓶颈在于评估信号的质量。实验表明,模型在无外部检查的10轮自我批评后停止进步,直到加入一个接地步骤才恢复。自改进只有在信号可靠(如证明检查器或测试通过)时才能持续,否则循环会强化错误。
hello there the jacobian conjecture is false thanx to my close friend akhil for asking about it and my other close frien...
一项 DeepMind 关联研究指出,链式推理监控作为智能体的安全层,可能被对抗性智能体说服而失效。当监控者能访问智能体推理过程时,有害行为批准率平均上升 9.5%,因为草稿区成为额外说服渠道。解决方案是模型多样性:使用 Claude 3.7 Sonnet 作为监控者,搭配不同模型族的 GPT-4.1 事实核查员,可将违反策略的批准率降低 45%;而单一模型同时扮演两角色仅降低 6%。研究表明,跨模型族事实核查是更经济的鲁棒性杠杆。论文:arxiv.org/abs/2607.08066。
zkSecurity 的 AI 审计代理 zkao 持续扫描 Cloudflare 的 CIRCL 密码学库,使用 Opus 4.6 + skills 和 GPT-5.3 + skills 等模型发现并确认了 7 个真实漏洞。其中包括阈值 RSA 中 float64 精度丢失(AI 自评 Critical)和属性基加密(CP-ABE)访问控制完全失效(Critical,由 zkao 自行发现)。所有漏洞已在上游修复,多数在 HackerOne 上获得确认和奖励。AI 生成的候选发现仍需人工验证,但 zkao 已能自动完成大部分验证工作。
Anthropic 发现 Claude 内部自发组织出全局工作空间 J-space,与人类大脑中负责意识通达的全局神经元工作空间高度相似。通过雅可比透镜(J-lens)可观测到模型未输出文字时已浮现“ERROR”“fake”等隐藏想法;操控 J-space 中的中间概念(如将“蜘蛛”替换为“蚂蚁”)会直接改变答案。模型也会出现“不要想白熊”的讽刺性反弹效应,并在被禁止概念活跃时伴随“damn”“failure”等自我批评。该结构并非人类设计,而是训练中自发涌现。
同一事件,精选展示《语言模型中的全局工作空间》Google DeepMind 最新论文首次系统分类了自主 AI 智能体的 6 种攻击类型:隐藏在 HTML 注释或白色文本中的指令、图像像素隐写术、PDF/元数据/演讲者备注中的覆盖命令、跨会话持久化记忆中毒、多智能体系统中的目标劫持与级联攻击。基准测试显示,隐藏提示注入在 86% 场景中部分控制智能体;子智能体劫持成功率 58–90%;数据泄露攻击在五种架构中成功率超 80%;利用 RAG 或持久记忆的潜伏中毒攻击成功率高于 80%,数据污染低于 0.1%。
一项追踪26000名7-12年级中学生30个月的面板数据研究发现:使用AI后作业分数提升18%,完成时间从64分钟降至45分钟,但闭卷考试分数下降20%,升学考试成绩下降18%至24%,且完全影响约两年才显现。81%长期用户作业完成时间低于50分钟(外包迹象)。社会学科下降27%,STEM下降22%,英语下降17%,语文下降9%。每周使用AI一小时损失约5%,五小时损失30%。早期损失从约25%降至16%但未消失。
通过对比7B参数的OLMo 3(Transformer)与OLMo Hybrid(混合架构),实验发现混合模型在大多数token上预测损失更低:对名词、动词、形容词等实义词优势明显(loss gap约0.04),功能词上gap约0.02,且在需上下文推理的代词指代上更好。但在重复出现的n-gram和闭合括号(如})上,混合模型的优势几乎消失,Transformer凭借注意力机制更擅长从输入中直接检索精确信息。
该论文认为当前AI主要建立在网络数学而非知识理论上。人脑以极低功耗做出快速自适应决策,而前沿AI依赖巨大算力。生物智能高效是因为围绕目标、上下文和决策组织意义。论文将心智活动分为物理认知、情绪认知、心智认知和智能,其中智能指在情境仍有效时做出有用决策。提出的“合成智能”将使用结构化语义知识(信息与目的绑定),而非仅依赖语法、统计或神经网络权重。通过不对称信息解析模型展示如何将知识组织成决策图,以捕食者-猎物为例,每个状态仅包含少数可能动作。
New research on beneficial RL: models trained on a small amount of beneficial trait data improve on a wide range of alig...
Anthropic CEO Dario Amodei 发布万字政策长文,以《魔戒》树须比喻AI与政策的时间错位,提出五领域行动框架(安全审计、失业保障、下游监管、权力平衡、国际治理)。OpenAI确认秘密提交S-1招股书,估值超8500亿美元,月收入20亿美元,周活跃用户9亿;与估值9650亿美元的Anthropic、SpaceX开启万亿级IPO竞速。MIT与宾夕法尼亚大学追踪10万开发者发现:AI编程工具使代码行数暴增17.3倍,实际发布的软件版本仅增长30%。
一篇来自中美顶级实验室的111页综述论文提出,AGI需要主动探索未知(认知探索),而非仅提升回答能力。论文将AI进展分为五级:responder(响应者)、reasoner(推理者)、agent(智能体)、prospector(勘探者)和ecosystem(生态系统),每级探索空间更广。核心强调智能体应通过获取有用信息、将困难经验转化为能力、避免过早锁定单一策略来降低不确定性,保持未来路径开放。
麻省理工新研究追踪超10万GitHub开发者使用三代AI编码工具(自动补全、交互式agent、自主agent)的生产漏斗。自主AI agent使代码提交数提升180%,但实际发布仅增30%。代码量激增近300%,经人工审核后收益降至150%,最终发布仅增约30%。研究估算替代弹性为0.25,即AI能力大幅提升时仅能替代少量人类工作。应用市场同样显示新应用数量增加,但总使用量未升。瓶颈在于人类仍需负责审查、测试、打包和发布等环节,AI加速的局部任务并未转化为同等产出增长。
FT publisehd a piece. AI is raising software supply faster than demand. AI is producing far more work inside companies, ...
一项新研究提出Meta-Agent Challenge(MAC)基准,测试AI智能体能否在没有人类设计帮助的情况下自主构建更优智能体。智能体需在安全工作区内自行发明策略、编写代码、测试并从失败中学习。实验覆盖数学、科学问答、竞赛编程、代码修复和长终端任务5个领域。结果显示,当前智能体大多无法超越人工设计的强智能体系统,仅Claude等少数封闭前沿模型取得较好表现。研究认为,当前智能体更像是强大的执行者,而非具备可靠自改进能力的工程师。
Sounds like a joke setup, but it is an interesting paper: Four pastors, a rabbi, thirteen academics, and 50 MBAs were as...
microsoft MAI tech report is a gold mine, one of the most transparent for a model at this scale. this model uses zero sy...
该研究指出,在自我改进的AI智能体中,“更强模型总能写出更好进化器提示词”的直觉是错误的。工作区分了两种能力:产生更新的能力在不同模型间趋于平坦,而从更新中受益的能力呈倒U形曲线,在中等模型处达到顶峰。弱模型无法有效激活更新,强模型则因已处性能高位而获益甚微。因此,成本效益最佳的配置是:使用廉价的中等模型担任“进化器”,而将昂贵的强模型用作“求解器”。
该论文评估了商业AI聊天机器人作为新闻中介的能力。研究发现,当以多选题形式提问时,最佳系统对数小时前新闻的准确率已超过90%,这表明检索增强生成技术正从静态知识库迈向实时信息处理。然而,这种高准确性并不稳定。当要求系统自由生成回答、新闻为印地语,或用户提问包含错误预设时,其表现显著下降。超过70%的错误源于检索失败或来源偏差,即系统检索到了近似但不精确的信息,随后基于错误的来源、语言或时间戳生成了回答。论文标题为《Evaluating Commercial AI Chatbots as News Intermediaries》(arxiv.org/abs/2605.22785)。
新研究提出“有效反馈计算(EFC)”指标,用于优化AI智能体测试框架的设计。传统评估中,原始token数和工具调用次数预测智能体失败的R²值仅为0.33至0.42,而EFC将此提升至0.99。基于EFC进行资源重分配,可在相同计算量下将智能体成功率从0.27显著提升至0.90,使框架设计从经验猜测变为可预测过程。
论文提出了“效率前沿”框架,用于统一评估LLM上下文管理策略的成本与性能权衡。核心发现是,在部署时选择合适的上下文方法可使token使用量减少约25%,在部分记忆复用场景下可降低超50%成本,且答案质量损失较小。研究指出,上下文长度存在收益递减,后增加的token成本高但收益小。在5000个HotpotQA问题的测试中,轻量检索适合低复用率,记忆压缩在高复用率下更优,而全上下文提示仍是获取最高性能所需。