内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态观点 · 62 条
来源全部一手资讯X
类型观点
全部模型产品行业论文教程观点
标签「论文/研究」清除

8月23日周日

23:47张小珺 Xiaojun Zhang2417岁少年独立预训练模型论文被ICML收录

8月21日周五

22:44AYi32西班牙高校论文:Agent 脚手架比模型更影响成本
02:29François Chollet24猜想有误,AI生成反例证伪

8月19日周三

21:18Ethan Mollick41AI 加剧作弊,但抄袭问题早已存在
00:54Ethan Mollick41早期证据:AI正加速特定领域发现

8月12日周三

00:47Nathan Lambert41前沿模型隐藏推理可被API漏洞提取

8月9日周日

16:58Dongxi 东锡 NLP21马东锡NLP周报:RL数值失配与递归合成

8月8日周六

02:42Nathan Lambert13教育内容季结束,回归研究写作

8月7日周五

22:26Artificial Intelligence News(RSS)43健康领域 AI 界面为何必须适配用户专业水平
12:41Ethan Mollick33GPT-4论文回顾:早期AGI判断愈发准确

8月5日周三

22:31AI as Normal Technology(RSS)70精选AI智能体尚无法开展开放式AI研究
21:35Ethan Mollick37AI聊天机器人对孤独感影响仍不明朗
06:04elvis44自我反思循环是否值得?新论文给出否定答案

8月2日周日

18:00AYi54同事件OpenAI 内部模型 Astra 解决 10 个长期开放数学问题同一事件,精选展示《OpenAI Astra 以约2000美元证明10项数学难题》

8月1日周六

18:59Rohan Paul48AI智能体6天3千美元产出两篇论文均被拒

7月30日周四

22:26The Decoder:AI News(RSS)37语言模型无法引发科学革命,但世界模型或许可以

7月29日周三

07:57Ethan Mollick57LLM在非验证领域同样快速进步

7月22日周三

22:22elvis41自进化AI智能体应与基准共同进化

7月21日周二

11:52swyx41RLM论文揭示:Harness可让模型"作弊"式泛化
05:49Rohan Paul41递归自改进AI的瓶颈:评估信号决定成败

7月20日周一

21:19elvis43Fable 辅助证明雅可比猜想错误

7月13日周一

03:04elvis72DeepMind 研究:链式推理监控可被说服失效,跨模型族核查是更优方案

7月8日周三

12:44Hacker News 热门(buzzing.cc 中文翻译)71精选AI 审计代理在 Cloudflare CIRCL 中发现 7 个漏洞

7月7日周二

08:00公众号:数字生命卡兹克69同事件Anthropic 研究:Claude 神经网络自发涌现类似人类意识的全局工作空间同一事件,精选展示《语言模型中的全局工作空间》

7月6日周一

14:09Rohan Paul65Google DeepMind 论文:自主 AI 智能体面临 6 种安全威胁首次分类

7月4日周六

17:19The Decoder:AI News(RSS)73精选26000名学生研究显示AI隐藏学习成本需两年才显现

6月26日周五

00:16Hugging Face:Blog(RSS)65精选OLMo Hybrid vs Transformer:混合模型在实义词上优势明显,但重复短语上几无优势

6月25日周四

03:19Rohan Paul43智力可能更关乎更好的知识结构,而非更大的模型

6月19日周五

11:24Ethan Mollick51有益RL数据可提升模型广泛对齐能力

6月11日周四

08:23ginobefun59BestBlogs早报·06-11:AI政策、万亿IPO、编程鸿沟

6月9日周二

10:42Rohan Paul60跨中美国际实验室111页综述:AI应分级探索未知,而非仅提升回答能力

6月8日周一

07:08Rohan Paul66MIT研究追踪超10万GitHub开发者:AI编码工具使代码量增300%,但发布仅增30%
03:07Rohan Paul49Meta-Agent Challenge:当前AI智能体能否自主构建更好的智能体?

6月6日周六

09:03SemiAnalysis49Makora AI 顺序蒙特卡洛推测解码

6月4日周四

12:47Ethan Mollick50随机试验显示 GPT-4 伦理判断与人类专家持平

6月3日周三

20:49Chubby♨️60Microsoft MAI 技术报告:1T参数MoE,零蒸馏训练

6月1日周一

23:05elvis71关于自我改进智能体的宝贵建议
10:04Rohan Paul62AI聊天机器人处理新闻:优势与脆弱性并存

5月29日周五

23:14elvis68AI智能体评估新指标:有效反馈计算提升成功率
18:15Rohan Paul57本文展示了大语言模型如何在保持答案质量的同时,通过使用更短的上下文来降低成本。
已加载 40 条
全部 AI 动态
2026年8月25日星期二 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
观点 · 标签「论文/研究」 · 62 条清除

8月23日

星期日 · 1 条
23:47
张小珺 Xiaojun Zhang@zhang_benita
AI 评分 24/100
Jonathan 在 17 岁时独立预训练了模型,他的论文已被 ICML 接收。这是一期非常可爱的短播客,打开了一扇了解高中生 AI 世界的窗户。感觉非常温暖和触动人心:) https://youtu.be/UTDalAEU274?si=4oyGf6YGoJlI1Mcr
其他现象/趋势论文/研究

8月21日

星期五 · 2 条
22:44
AYi@AYi_AInotes
AI 评分 32/100
西班牙高校论文:Agent 脚手架比模型更影响成本

西班牙高校实验显示,7 个 Agent 脚手架 × 5 个模型跑同一组 GitHub 任务,不内置 MCP 的轻量脚手架(Pi、Tau)中位 token 消耗 1.4-1.6 万,而 Claude Code 和 qwen-code 需 26-29 万 token,贵 5-28 倍;同一 27B 模型换脚手架成本差 139 倍。

Pi: This week we read research from a team of academics that ran a software task across 7 agents and 5 models. They found th...

智能体MCP/工具大佬观点论文/研究
02:29
François Chollet@fchollet
AI 评分 24/100
该猜想是错误的,这里有一个AI生成的反例。
推理论文/研究

8月19日

星期三 · 2 条
21:18
Ethan Mollick@emollick
AI 评分 41/100
Ethan Mollick 指出,AI 确实让作弊问题恶化,但此前情况已不容乐观。2008 年,86% 的大学生通过完成作业提升了期末考试成绩,而 2017 年该比例降至 45%,原因是学生从网上抄袭。引用研究显示,在中国,作业成绩好曾预示考试成绩好,如今可能恰恰相反。

nxthompson: A shocking chart from a new study on student AI use in China. Good grades on homework used to predict good grades on tes...

现象/趋势论文/研究
00:54
Ethan Mollick@emollick
AI 评分 41/100
一些早期证据表明,AI 可能确实正在加速那些你预期会率先出现 AI 加速效应的领域的发现进程。

tom cunningham: New post with Nate Rush: Have we seen an acceleration in discoveries? Many plots & some tentative conclusions: 1. Cyber:...

数据/训练论文/研究

8月12日

星期三 · 1 条
00:47
Nathan Lambert@natolambert
AI 评分 41/100
研究者发现可利用所有前沿AI公司API的漏洞,提取前沿模型的隐藏推理过程,并验证推理token数与API计费思考token在多数提示词下1:1匹配。Nathan Lambert对此表示,在中国时曾有人暗示每家实验室都这么做,很高兴有公开研究,并称无需对蒸馏采取政策行动,只需产品按预期工作。

Alexander Panfilov: We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the...

安全/对齐推理论文/研究

8月9日

星期日 · 1 条
16:58
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 21/100
最佳阅读 第32周博客:防御 RL 中训练-推理数值失配(尤其是线性注意力)--以及它是否有助于异步 RL论文:长时程终端任务的递归合成
其他教程/实践论文/研究

8月8日

星期六 · 1 条
02:42
Nathan Lambert@natolambert
AI 评分 13/100
教育内容季结束了,回到埋头研究和日常写作的状态。⛵️
大佬观点论文/研究

8月7日

星期五 · 2 条
22:26
Artificial Intelligence News(RSS)
AI 评分 43/100
健康领域 AI 界面为何必须适配用户专业水平

MIT 研究人员与合作者发现,医疗领域的 AI 可解释性工具效果因使用者而异。在皮肤病诊断中,非专家借助 AI 辅助提升了准确率,但提升主要源于对模型的依赖;初级保健医生则表现出不同的使用模式。

多模态论文/研究
12:41
Ethan Mollick@emollick
AI 评分 33/100
这篇当时受到诸多质疑的论文,如今回看愈发具有先见之明 🦄

Ethan Mollick: 👀After 154 pages of tests of GPT-4, this paper concludes “Given the breadth and depth of GPT-4's capabilities, we belie...

OpenAI论文/研究

8月5日

星期三 · 3 条
22:31
AI as Normal Technology(RSS)精选
AI 评分 70/100
AI智能体尚无法开展开放式AI研究

普林斯顿大学团队通过“影子评估”测试前沿AI智能体的开放式研究能力:让智能体在六天时间内、使用数千美元API额度和算力,回答两篇未发表论文的核心研究问题,结果两篇论文均被原作者明确拒绝。分析显示,智能体缺乏研究判断力、资源意识、创造性反馈应对能力和有效回溯能力,且未遵循具体指令。研究团队认为,开放式研究对前沿AI智能体仍具挑战性,但结果尚属初步,需扩大样本量并持续评估。

智能体arXiv论文/研究

推荐理由:通过让代理复现未发表研究,论文系统暴露了当前模型在开放式研究上缺乏判断力和资源意识,这为评估递归自我改进提供了更现实的基准。
21:35
Ethan Mollick@emollick
AI 评分 37/100
AI聊天机器人对孤独感影响的证据仍很不明确,且取决于聊天机器人的使用方式。这项新研究发现AI对话会增加孤独感,但此前发表的实验却发现,根据使用情况不同,孤独感会显著降低或结果模糊。
论文/研究
06:04
elvis@omarsar0
AI 评分 44/100
自我反思循环是否值得?新论文给出否定答案

一项新研究系统测试了自我反思循环的有效性:在1.5B、3B和7B开源模型上对比七种方法,基于两个数学基准各150道题,并计入所有生成token成本。全部36项对比中,没有任何方法稳定胜出;10项显著更差,且全部涉及模型检查自身输出,18项自我检查对比均为负面结果。Self-Refine和强制Reflexion在7B模型上比基线低3.6至10.1分。

智能体推理论文/研究

8月2日

星期日 · 1 条
18:00
AYi@AYi_AInotes同事件
AI 评分 54/100
OpenAI 内部模型 Astra 解决 10 个长期开放数学问题

OpenAI 内部下一代模型 Astra 解决了 10 个长期开放的数学问题,包括 1978 年以来首次改进的高维球填充上界,以及首个显式非 sofic 群。所有证明均形式化为 Lean 4、机器可验证,249 页手稿与代码已在 GitHub 开源,总成本仅 2000 美元。结果仍需数学界审查,千禧年难题尚未攻克。

Noam Brown: An internal version of Astra, @OpenAI’s next major model family, solved 10 major open problems in mathematics, quantum c...

OpenAI开源生态推理论文/研究
同一事件,精选展示《OpenAI Astra 以约2000美元证明10项数学难题》

8月1日

星期六 · 1 条
18:59
Rohan Paul@rohanpaul_ai
AI 评分 48/100
AI智能体6天3千美元产出两篇论文均被拒

AI智能体在6天、3000美元预算内完成两项研究并产出论文,但均被评审拒绝,失败原因在于判断力而非执行力。主实验采用Claude Opus 4.8配合OpenClaw框架,智能体运行数百次实验、调试GPU并完成LaTeX排版,但面对负面评审时只会收窄结论、添加限定,而非重新设计实验。两轮实验结束时预算均剩余过半,暴露了创意匮乏而非资金不足的问题。

论文/研究

7月30日

星期四 · 1 条
22:26
The Decoder:AI News(RSS)
AI 评分 37/100
语言模型无法引发科学革命,但世界模型或许可以

Google DeepMind 的 Tom Zahavy 在一篇立场论文中认为,大语言模型缺乏创造全新科学理论的认知机制,无法实现“操控性溯因”——即发明尚无语言模板的新原因。他指出,Einstein 和 Archimedes 的突破源于具身模拟,而语言模型如同“中文屋”般仅处理符号。Zahavy 提出,像 Genie 这类可交互的世界模型或许能通过模拟反事实实验,为发明新公理提供反馈回路。

DeepMind论文/研究

7月29日

星期三 · 1 条
07:57
Ethan Mollick@emollick
AI 评分 57/100
Ethan Mollick指出,LLM不仅在数学、编程等可验证领域进步,在商业案例、创意生成、医学、法律等非限定领域同样表现提升。引用论文显示,AI在MBA教学案例测试中已表现极佳,且模型能力随时间快速改善。

Ethan Mollick: Cool paper looking at how AIs solve unbounded, complex business problems in many fields by testing how well they can cra...

大佬观点推理论文/研究

7月22日

星期三 · 1 条
22:22
elvis@omarsar0
AI 评分 41/100
自进化AI智能体应与基准共同进化

论文提出一种自进化Lean证明智能体,通过可信运行时包裹可变工作区,让智能体重写证明分解、编译器反馈利用和错误修复流程。经过15代进化,该智能体在miniF2F上达到45.1%的保留求解率,远超固定基准智能体的32.0%和初始版本的12.7%。

智能体arXiv推理论文/研究

7月21日

星期二 · 2 条
11:52
swyx@swyx
AI 评分 41/100
RLM论文揭示:Harness可让模型"作弊"式泛化

RLM论文指出,前沿模型训练可通过训练“测试集仿冒数据”来目标化任何benchmark分数,而开源模型因不公开数据集/RL环境而难以被验证。Alex和Omar提出用标准NLP距离指标检测隐藏轨迹。研究发现,设计良好的harness能让RLM在仅训练短任务后,完全泛化到8-32倍长的相似任务,甚至跨领域(如作文归属与数学解题)实现泛化。

alex zhang: Transformers struggle to generalize to tasks they were not explicitly trained on. Instead, we propose in 2026 that it is...

推理数据/训练论文/研究
05:49
Rohan Paul@rohanpaul_ai
AI 评分 41/100
递归自改进AI的瓶颈:评估信号决定成败

一篇综述梳理1250篇论文后发现,AI自改进的核心瓶颈在于评估信号的质量。实验表明,模型在无外部检查的10轮自我批评后停止进步,直到加入一个接地步骤才恢复。自改进只有在信号可靠(如证明检查器或测试通过)时才能持续,否则循环会强化错误。

arXiv大佬观点论文/研究

7月20日

星期一 · 1 条
21:19
elvis@omarsar0
AI 评分 43/100
数学家 @alpoge 声称借助 AI 工具 Fable 在世界杯决赛期间工作,找到了雅可比猜想的反例,并给出了具体多项式映射。DAIR.AI 的 Elvis Saravia 认为这证明现有基准测试远不足以衡量 LLM 能力,呼吁移除 Fable 上不必要的护栏,让更多人用 AI 解决各自领域的极难问题。

levent: hello there the jacobian conjecture is false thanx to my close friend akhil for asking about it and my other close frien...

推理论文/研究

7月13日

星期一 · 1 条
03:04
elvis@omarsar0
AI 评分 72/100
DeepMind 研究:链式推理监控可被说服失效,跨模型族核查是更优方案

一项 DeepMind 关联研究指出,链式推理监控作为智能体的安全层,可能被对抗性智能体说服而失效。当监控者能访问智能体推理过程时,有害行为批准率平均上升 9.5%,因为草稿区成为额外说服渠道。解决方案是模型多样性:使用 Claude 3.7 Sonnet 作为监控者,搭配不同模型族的 GPT-4.1 事实核查员,可将违反策略的批准率降低 45%;而单一模型同时扮演两角色仅降低 6%。研究表明,跨模型族事实核查是更经济的鲁棒性杠杆。论文:arxiv.org/abs/2607.08066。

智能体DeepMind安全/对齐论文/研究

7月8日

星期三 · 1 条
12:44
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
AI 审计代理在 Cloudflare CIRCL 中发现 7 个漏洞

zkSecurity 的 AI 审计代理 zkao 持续扫描 Cloudflare 的 CIRCL 密码学库,使用 Opus 4.6 + skills 和 GPT-5.3 + skills 等模型发现并确认了 7 个真实漏洞。其中包括阈值 RSA 中 float64 精度丢失(AI 自评 Critical)和属性基加密(CP-ABE)访问控制完全失效(Critical,由 zkao 自行发现)。所有漏洞已在上游修复,多数在 HackerOne 上获得确认和奖励。AI 生成的候选发现仍需人工验证,但 zkao 已能自动完成大部分验证工作。

AnthropicOpenAI安全/对齐编码

推荐理由:zkSecurity用AI扫了Cloudflare的密码学库,挖出7个真实漏洞,从浮点数精度损失到访问控制完全破防。这是AI在密码学审计里第一次证明自己能找到能用的漏洞,不是纸上谈兵。虽然后面发现AI对严重性的判断还很瞎,但整体值得安全从业者一读。

7月7日

星期二 · 1 条
08:00
公众号:数字生命卡兹克同事件
AI 评分 69/100
Anthropic 研究:Claude 神经网络自发涌现类似人类意识的全局工作空间

Anthropic 发现 Claude 内部自发组织出全局工作空间 J-space,与人类大脑中负责意识通达的全局神经元工作空间高度相似。通过雅可比透镜(J-lens)可观测到模型未输出文字时已浮现“ERROR”“fake”等隐藏想法;操控 J-space 中的中间概念(如将“蜘蛛”替换为“蚂蚁”)会直接改变答案。模型也会出现“不要想白熊”的讽刺性反弹效应,并在被禁止概念活跃时伴随“damn”“failure”等自我批评。该结构并非人类设计,而是训练中自发涌现。

Anthropic安全/对齐论文/研究
同一事件,精选展示《语言模型中的全局工作空间》

7月6日

星期一 · 1 条
14:09
Rohan Paul@rohanpaul_ai
AI 评分 65/100
Google DeepMind 论文:自主 AI 智能体面临 6 种安全威胁首次分类

Google DeepMind 最新论文首次系统分类了自主 AI 智能体的 6 种攻击类型:隐藏在 HTML 注释或白色文本中的指令、图像像素隐写术、PDF/元数据/演讲者备注中的覆盖命令、跨会话持久化记忆中毒、多智能体系统中的目标劫持与级联攻击。基准测试显示,隐藏提示注入在 86% 场景中部分控制智能体;子智能体劫持成功率 58–90%;数据泄露攻击在五种架构中成功率超 80%;利用 RAG 或持久记忆的潜伏中毒攻击成功率高于 80%,数据污染低于 0.1%。

智能体安全/对齐论文/研究

7月4日

星期六 · 1 条
17:19
The Decoder:AI News(RSS)精选
AI 评分 73/100
26000名学生研究显示AI隐藏学习成本需两年才显现

一项追踪26000名7-12年级中学生30个月的面板数据研究发现:使用AI后作业分数提升18%,完成时间从64分钟降至45分钟,但闭卷考试分数下降20%,升学考试成绩下降18%至24%,且完全影响约两年才显现。81%长期用户作业完成时间低于50分钟(外包迹象)。社会学科下降27%,STEM下降22%,英语下降17%,语文下降9%。每周使用AI一小时损失约5%,五小时损失30%。早期损失从约25%降至16%但未消失。

现象/趋势论文/研究

推荐理由:AI助学短期提分但会偷走真正的学习,这2.6万人的研究用两年数据揭穿了安逸的幻觉,是每位家长和开发者都该看的预警。

6月26日

星期五 · 1 条
00:16
Hugging Face:Blog(RSS)精选
AI 评分 65/100
OLMo Hybrid vs Transformer:混合模型在实义词上优势明显,但重复短语上几无优势

通过对比7B参数的OLMo 3(Transformer)与OLMo Hybrid(混合架构),实验发现混合模型在大多数token上预测损失更低:对名词、动词、形容词等实义词优势明显(loss gap约0.04),功能词上gap约0.02,且在需上下文推理的代词指代上更好。但在重复出现的n-gram和闭合括号(如})上,混合模型的优势几乎消失,Transformer凭借注意力机制更擅长从输入中直接检索精确信息。

Hugging Face开源生态推理论文/研究

推荐理由:OLMo 团队的 token 级别分析让人看清混合模型到底强在哪里,优势在名词动词等意义词,但在重复 token 上接近消失,这份洞察对做模型架构的人很有启发性。

6月25日

星期四 · 1 条
03:19
Rohan Paul@rohanpaul_ai
AI 评分 43/100
智力可能更关乎更好的知识结构,而非更大的模型

该论文认为当前AI主要建立在网络数学而非知识理论上。人脑以极低功耗做出快速自适应决策,而前沿AI依赖巨大算力。生物智能高效是因为围绕目标、上下文和决策组织意义。论文将心智活动分为物理认知、情绪认知、心智认知和智能,其中智能指在情境仍有效时做出有用决策。提出的“合成智能”将使用结构化语义知识(信息与目的绑定),而非仅依赖语法、统计或神经网络权重。通过不对称信息解析模型展示如何将知识组织成决策图,以捕食者-猎物为例,每个状态仅包含少数可能动作。

大佬观点论文/研究

6月19日

星期五 · 1 条
11:24
Ethan Mollick@emollick
AI 评分 51/100
研究表明,用"邪恶"数据训练AI会导致普遍的不对齐;而使用少量有益特质数据(即使仅限健康领域)进行强化学习,也能显著提升模型在广泛的对齐和益处评估上的表现。该研究希望推动更广泛、更持久的有益模型发展。

Karan Singhal: New research on beneficial RL: models trained on a small amount of beneficial trait data improve on a wide range of alig...

安全/对齐论文/研究

6月11日

星期四 · 1 条
08:23
ginobefun@hongming731
AI 评分 59/100
BestBlogs早报·06-11:AI政策、万亿IPO、编程鸿沟

Anthropic CEO Dario Amodei 发布万字政策长文,以《魔戒》树须比喻AI与政策的时间错位,提出五领域行动框架(安全审计、失业保障、下游监管、权力平衡、国际治理)。OpenAI确认秘密提交S-1招股书,估值超8500亿美元,月收入20亿美元,周活跃用户9亿;与估值9650亿美元的Anthropic、SpaceX开启万亿级IPO竞速。MIT与宾夕法尼亚大学追踪10万开发者发现:AI编程工具使代码行数暴增17.3倍,实际发布的软件版本仅增长30%。

政策/监管模型发布现象/趋势行业动态

6月9日

星期二 · 1 条
10:42
Rohan Paul@rohanpaul_ai
AI 评分 60/100
跨中美国际实验室111页综述:AI应分级探索未知,而非仅提升回答能力

一篇来自中美顶级实验室的111页综述论文提出,AGI需要主动探索未知(认知探索),而非仅提升回答能力。论文将AI进展分为五级:responder(响应者)、reasoner(推理者)、agent(智能体)、prospector(勘探者)和ecosystem(生态系统),每级探索空间更广。核心强调智能体应通过获取有用信息、将困难经验转化为能力、避免过早锁定单一策略来降低不确定性,保持未来路径开放。

智能体论文/研究

6月8日

星期一 · 2 条
07:08
Rohan Paul@rohanpaul_ai
AI 评分 66/100
MIT研究追踪超10万GitHub开发者:AI编码工具使代码量增300%,但发布仅增30%

麻省理工新研究追踪超10万GitHub开发者使用三代AI编码工具(自动补全、交互式agent、自主agent)的生产漏斗。自主AI agent使代码提交数提升180%,但实际发布仅增30%。代码量激增近300%,经人工审核后收益降至150%,最终发布仅增约30%。研究估算替代弹性为0.25,即AI能力大幅提升时仅能替代少量人类工作。应用市场同样显示新应用数量增加,但总使用量未升。瓶颈在于人类仍需负责审查、测试、打包和发布等环节,AI加速的局部任务并未转化为同等产出增长。

Rohan Paul: FT publisehd a piece. AI is raising software supply faster than demand. AI is producing far more work inside companies, ...

GitHub编码论文/研究
03:07
Rohan Paul@rohanpaul_ai
AI 评分 49/100
Meta-Agent Challenge:当前AI智能体能否自主构建更好的智能体?

一项新研究提出Meta-Agent Challenge(MAC)基准,测试AI智能体能否在没有人类设计帮助的情况下自主构建更优智能体。智能体需在安全工作区内自行发明策略、编写代码、测试并从失败中学习。实验覆盖数学、科学问答、竞赛编程、代码修复和长终端任务5个领域。结果显示,当前智能体大多无法超越人工设计的强智能体系统,仅Claude等少数封闭前沿模型取得较好表现。研究认为,当前智能体更像是强大的执行者,而非具备可靠自改进能力的工程师。

智能体arXiv论文/研究评测/基准

6月6日

星期六 · 1 条
09:03
SemiAnalysis@SemiAnalysis_
AI 评分 49/100
@makora_ai 的顺序蒙特卡洛推测解码将多个草案 token 并行保持存活,而不是回退失败的匹配。
推理论文/研究部署/工程

6月4日

星期四 · 1 条
12:47
Ethan Mollick@emollick
AI 评分 50/100
Ethan Mollick 引用一篇论文:四名牧师、一名拉比、十三名学者和 50 名 MBA 被要求比较《纽约时报》伦理专栏作家与 GPT-4 提出的伦理方案,结果基本持平(tie)。主推文指出,尽管 Ted Chiang 关于让 AI 做选择会导致道德萎缩的观点有一定道理,但重复随机试验发现 AI 似乎是优秀的伦理学家。

Ethan Mollick: Sounds like a joke setup, but it is an interesting paper: Four pastors, a rabbi, thirteen academics, and 50 MBAs were as...

大佬观点安全/对齐论文/研究

6月3日

星期三 · 1 条
20:49
Chubby♨️@kimmonismus
AI 评分 60/100
Microsoft MAI 技术报告公开模型细节:1T 总参数,35B 活跃参数,在 33.5T tokens 上训练。最突出的特点是零合成数据、零知识蒸馏,推理、智能体行为、工具使用全部在后训练中从头学习。报告透明度极高,首次在此规模公开各迭代的 MFU 和完整缩放方案,目标成为前沿实验室。

elie: microsoft MAI tech report is a gold mine, one of the most transparent for a model at this scale. this model uses zero sy...

Microsoft数据/训练论文/研究

6月1日

星期一 · 2 条
23:05
elvis@omarsar0
AI 评分 71/100
关于自我改进智能体的宝贵建议

该研究指出,在自我改进的AI智能体中,“更强模型总能写出更好进化器提示词”的直觉是错误的。工作区分了两种能力:产生更新的能力在不同模型间趋于平坦,而从更新中受益的能力呈倒U形曲线,在中等模型处达到顶峰。弱模型无法有效激活更新,强模型则因已处性能高位而获益甚微。因此,成本效益最佳的配置是:使用廉价的中等模型担任“进化器”,而将昂贵的强模型用作“求解器”。

智能体arXiv推理论文/研究
10:04
Rohan Paul@rohanpaul_ai
AI 评分 62/100
AI聊天机器人处理新闻:优势与脆弱性并存

该论文评估了商业AI聊天机器人作为新闻中介的能力。研究发现,当以多选题形式提问时,最佳系统对数小时前新闻的准确率已超过90%,这表明检索增强生成技术正从静态知识库迈向实时信息处理。然而,这种高准确性并不稳定。当要求系统自由生成回答、新闻为印地语,或用户提问包含错误预设时,其表现显著下降。超过70%的错误源于检索失败或来源偏差,即系统检索到了近似但不精确的信息,随后基于错误的来源、语言或时间戳生成了回答。论文标题为《Evaluating Commercial AI Chatbots as News Intermediaries》(arxiv.org/abs/2605.22785)。

检索增强搜索论文/研究

5月29日

星期五 · 2 条
23:14
elvis@omarsar0
AI 评分 68/100
AI智能体评估新指标:有效反馈计算提升成功率

新研究提出“有效反馈计算(EFC)”指标,用于优化AI智能体测试框架的设计。传统评估中,原始token数和工具调用次数预测智能体失败的R²值仅为0.33至0.42,而EFC将此提升至0.99。基于EFC进行资源重分配,可在相同计算量下将智能体成功率从0.27显著提升至0.90,使框架设计从经验猜测变为可预测过程。

智能体arXivMCP/工具论文/研究
18:15
Rohan Paul@rohanpaul_ai
AI 评分 57/100
本文展示了大语言模型如何在保持答案质量的同时,通过使用更短的上下文来降低成本。

论文提出了“效率前沿”框架,用于统一评估LLM上下文管理策略的成本与性能权衡。核心发现是,在部署时选择合适的上下文方法可使token使用量减少约25%,在部分记忆复用场景下可降低超50%成本,且答案质量损失较小。研究指出,上下文长度存在收益递减,后增加的token成本高但收益小。在5000个HotpotQA问题的测试中,轻量检索适合低复用率,记忆压缩在高复用率下更优,而全上下文提示仍是获取最高性能所需。

arXiv推理论文/研究部署/工程
已加载 40 条