内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态观点 · 19 条
来源全部一手资讯X
类型观点
全部模型产品行业论文教程观点
标签「arXiv」清除

8月7日周五

22:31a16z:News(RSS)35AI 书籍泛滥正稀释图书市场:含 AI 文本书籍已占约 40% 销售额

8月5日周三

22:31AI as Normal Technology(RSS)70精选AI智能体尚无法开展开放式AI研究

7月26日周日

21:54Rohan Paul41AI让自由职业市场更看重价格而非资历

7月22日周三

22:22elvis41自进化AI智能体应与基准共同进化

7月21日周二

05:49Rohan Paul41递归自改进AI的瓶颈:评估信号决定成败

6月19日周五

21:22Rohan Paul56新研究:最强LLM也无法完全免疫越狱--Fable 5与Opus 4.8自动化红队攻击分析

6月8日周一

03:07Rohan Paul49Meta-Agent Challenge:当前AI智能体能否自主构建更好的智能体?
01:07elvis59论文提出用代码压缩率衡量AI智能体是否真正发现新知识

6月3日周三

10:16Rohan Paul60FluxMem:将AI智能体记忆视为持续演化的动态连接网络

6月1日周一

23:05elvis71关于自我改进智能体的宝贵建议

5月29日周五

23:14elvis68AI智能体评估新指标:有效反馈计算提升成功率
18:15Rohan Paul57本文展示了大语言模型如何在保持答案质量的同时,通过使用更短的上下文来降低成本。
06:14Rohan Paul60学术论文现14.7万次虚假引用,AI生成问题激增

5月28日周四

02:02elvis57AI智能体老化基准AgingBench发布

5月23日周六

00:16Hugging Face:Blog(RSS)50专业化胜过规模:Dharma 发布 DharmaOCR,3B 专用模型在 OCR 基准上超越商业前沿 API

5月17日周日

21:10Rohan Paul63智能体设计中,精确搜索(grep)是否优于向量检索?

5月11日周一

00:58elvis57智能体AI工作流的可扩展模式

5月1日周五

17:40Rohan Paul51经济论文揭示AI行业的结构性杰文斯悖论与垄断趋势

4月8日周三

00:00Berkeley RDI:Blog(AI 安全与评测)87精选我们如何攻破顶级AI Agent基准测试及未来展望
共 19 条,没有更多了
全部 AI 动态
2026年8月25日星期二 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
观点 · 标签「arXiv」 · 19 条清除

8月7日

星期五 · 1 条
22:31
a16z:News(RSS)
AI 评分 35/100
AI 书籍泛滥正稀释图书市场:含 AI 文本书籍已占约 40% 销售额

一项由 Stony Brook、Columbia、Michigan 及 MIT 数字经济倡议研究人员发布的论文显示,AI 生成书籍在自助出版类别中激增,含可检测 AI 文本的书籍已占据约 40% 的观测销售额。

arXiv现象/趋势

8月5日

星期三 · 1 条
22:31
AI as Normal Technology(RSS)精选
AI 评分 70/100
AI智能体尚无法开展开放式AI研究

普林斯顿大学团队通过“影子评估”测试前沿AI智能体的开放式研究能力:让智能体在六天时间内、使用数千美元API额度和算力,回答两篇未发表论文的核心研究问题,结果两篇论文均被原作者明确拒绝。分析显示,智能体缺乏研究判断力、资源意识、创造性反馈应对能力和有效回溯能力,且未遵循具体指令。研究团队认为,开放式研究对前沿AI智能体仍具挑战性,但结果尚属初步,需扩大样本量并持续评估。

智能体arXiv论文/研究

推荐理由:通过让代理复现未发表研究,论文系统暴露了当前模型在开放式研究上缺乏判断力和资源意识,这为评估递归自我改进提供了更现实的基准。

7月26日

星期日 · 1 条
21:54
Rohan Paul@rohanpaul_ai
AI 评分 41/100
AI让自由职业市场更看重价格而非资历

一项新研究显示,ChatGPT出现后,AI影响较大的自由职业岗位中,资历信号的重要性下降约7.8%,而价格的重要性上升约1.1%。高资历工作者失去部分需求优势,需求转向更廉价的劳动力,表明AI使这些岗位的从业者变得更可互换。

arXiv现象/趋势

7月22日

星期三 · 1 条
22:22
elvis@omarsar0
AI 评分 41/100
自进化AI智能体应与基准共同进化

论文提出一种自进化Lean证明智能体,通过可信运行时包裹可变工作区,让智能体重写证明分解、编译器反馈利用和错误修复流程。经过15代进化,该智能体在miniF2F上达到45.1%的保留求解率,远超固定基准智能体的32.0%和初始版本的12.7%。

智能体arXiv推理论文/研究

7月21日

星期二 · 1 条
05:49
Rohan Paul@rohanpaul_ai
AI 评分 41/100
递归自改进AI的瓶颈:评估信号决定成败

一篇综述梳理1250篇论文后发现,AI自改进的核心瓶颈在于评估信号的质量。实验表明,模型在无外部检查的10轮自我批评后停止进步,直到加入一个接地步骤才恢复。自改进只有在信号可靠(如证明检查器或测试通过)时才能持续,否则循环会强化错误。

arXiv大佬观点论文/研究

6月19日

星期五 · 1 条
21:22
Rohan Paul@rohanpaul_ai
AI 评分 56/100
新研究:最强LLM也无法完全免疫越狱--Fable 5与Opus 4.8自动化红队攻击分析

新研究对Anthropic Fable 5和Opus 4.8进行自动化红队攻击,持续改写有害提示词直至模型拒绝或生成坏答案。Fable 5最差攻击成功率6.1%,Opus 4.8为11.5%,证明最强LLM也无法完全免疫越狱——即便微小失败率,规模化自动化攻击仍可产生大量有害内容。旧式编码/角色扮演型越狱已非主要威胁,新弱点在于上下文:自适应攻击者在被拒后不断改写请求,寻找模型视为合法而非危险的框架。白宫与Anthropic正转向基于基准的测试框架,通过评分绕过程度、暴露能力、攻击可重复性及实际后果来量化越狱风险,而非追求不现实的完美免疫。

Rohan Paul: The White House and Anthropic may have found the first serious path to restore Mythos and Fable access without pretendin...

AnthropicarXiv安全/对齐

6月8日

星期一 · 2 条
03:07
Rohan Paul@rohanpaul_ai
AI 评分 49/100
Meta-Agent Challenge:当前AI智能体能否自主构建更好的智能体?

一项新研究提出Meta-Agent Challenge(MAC)基准,测试AI智能体能否在没有人类设计帮助的情况下自主构建更优智能体。智能体需在安全工作区内自行发明策略、编写代码、测试并从失败中学习。实验覆盖数学、科学问答、竞赛编程、代码修复和长终端任务5个领域。结果显示,当前智能体大多无法超越人工设计的强智能体系统,仅Claude等少数封闭前沿模型取得较好表现。研究认为,当前智能体更像是强大的执行者,而非具备可靠自改进能力的工程师。

智能体arXiv论文/研究评测/基准
01:07
elvis@omarsar0
AI 评分 59/100
论文提出用代码压缩率衡量AI智能体是否真正发现新知识

本周一篇AI论文探讨自我改进智能体是否真正发现新知识,还是仅重新组合已知信息。作者将行为分为三类:检索(查询已有笔记本)、搜索(组合现有工具)和发现(发明新概念),并用范畴论和左Kan扩展定义——若旧版本能产生相同结果则非发现。他们构建Builder/Breaker agent研究蛋白质力学,四轮中R²从0.48升至0.68再降至0.54和0.41,看似变差实则不断挑战更难蛋白质并重写理论:数据增长近10倍,模型代码仅增长1.3倍。论文提出用代码压缩率作为真实发现信号。链接:arxiv.org/abs/2606.01444。

智能体arXiv大佬观点推理

6月3日

星期三 · 1 条
10:16
Rohan Paul@rohanpaul_ai
AI 评分 60/100
FluxMem:将AI智能体记忆视为持续演化的动态连接网络

FluxMem是一种新型AI智能体记忆系统,其核心思想是将记忆视为一个动态连接的网络,而非静态存储。它将事实、过往任务经历与可复用技能作为图中的节点进行存储。执行任务时,FluxMem先收集可能有用的记忆,再根据任务反馈动态修正记忆间的连接关系。此外,系统能将反复成功的任务路径转化为可复用技能。测试显示,该系统在LoCoMo基准上平均准确率达95.06,并在GAIA基准上结合Kimi K2取得了12.73分的性能提升,优于现有记忆系统。

智能体arXiv大佬观点

6月1日

星期一 · 1 条
23:05
elvis@omarsar0
AI 评分 71/100
关于自我改进智能体的宝贵建议

该研究指出,在自我改进的AI智能体中,“更强模型总能写出更好进化器提示词”的直觉是错误的。工作区分了两种能力:产生更新的能力在不同模型间趋于平坦,而从更新中受益的能力呈倒U形曲线,在中等模型处达到顶峰。弱模型无法有效激活更新,强模型则因已处性能高位而获益甚微。因此,成本效益最佳的配置是:使用廉价的中等模型担任“进化器”,而将昂贵的强模型用作“求解器”。

智能体arXiv推理论文/研究

5月29日

星期五 · 3 条
23:14
elvis@omarsar0
AI 评分 68/100
AI智能体评估新指标:有效反馈计算提升成功率

新研究提出“有效反馈计算(EFC)”指标,用于优化AI智能体测试框架的设计。传统评估中,原始token数和工具调用次数预测智能体失败的R²值仅为0.33至0.42,而EFC将此提升至0.99。基于EFC进行资源重分配,可在相同计算量下将智能体成功率从0.27显著提升至0.90,使框架设计从经验猜测变为可预测过程。

智能体arXivMCP/工具论文/研究
18:15
Rohan Paul@rohanpaul_ai
AI 评分 57/100
本文展示了大语言模型如何在保持答案质量的同时,通过使用更短的上下文来降低成本。

论文提出了“效率前沿”框架,用于统一评估LLM上下文管理策略的成本与性能权衡。核心发现是,在部署时选择合适的上下文方法可使token使用量减少约25%,在部分记忆复用场景下可降低超50%成本,且答案质量损失较小。研究指出,上下文长度存在收益递减,后增加的token成本高但收益小。在5000个HotpotQA问题的测试中,轻量检索适合低复用率,记忆压缩在高复用率下更优,而全上下文提示仍是获取最高性能所需。

arXiv推理论文/研究部署/工程
06:14
Rohan Paul@rohanpaul_ai
AI 评分 60/100
学术论文现14.7万次虚假引用,AI生成问题激增

研究人员审查250万篇论文发现,2025年同行评议期刊中出现了14.7万次指向不存在研究的引用,这些虚假的研究、作者和期刊由AI生成,且未被察觉,已永久留在科学记录中。问题增长迅速:2023年每2828篇论文中约1篇含此类引用,到2026年初已升至每277篇约1篇。完整研究见arxiv论文2605.07723。

arXiv数据/训练现象/趋势

5月28日

星期四 · 1 条
02:02
elvis@omarsar0
AI 评分 57/100
AI智能体老化基准AgingBench发布

这项研究提出了AgingBench,一个用于纵向评估AI智能体可靠性的基准。它将智能体老化归纳为四种机制,包括压缩老化和干扰老化,旨在衡量部署后的智能体是退化以及退化形式。研究指出,即使冻结模型权重,智能体的有效状态也会因压缩交互历史、检索记忆库、事实更新等操作而不断变化,其可靠性是整个运行系统的寿命属性,而非基础模型的快照。基准测试在智能体部署第一天进行,然后持续数月。

智能体arXiv论文/研究

5月23日

星期六 · 1 条
00:16
Hugging Face:Blog(RSS)
AI 评分 50/100
专业化胜过规模:Dharma 发布 DharmaOCR,3B 专用模型在 OCR 基准上超越商业前沿 API

4月,Dharma 发布 DharmaOCR——一对 3B 参数专用小语言模型,用于结构化 OCR,同时开源基准与论文。在巴西葡萄牙语 OCR 基准上,该 3B 专用模型通过全微调实现综合得分 0.911,超过所有测试的商业前沿 API(Claude Opus 4.6 0.833、Gemini 3.1 Pro 0.820、GPT-5.4 0.750)。每百万页成本仅为 Claude Opus 4.6 的约 1/52,质量与成本均占据 Pareto 前沿。结果表明:当训练数据与部署任务充分对齐时,参数规模不再是决定性变量,专业化微调能以极低代价实现更高性能。

arXivHugging Face数据/训练现象/趋势

5月17日

星期日 · 1 条
21:10
Rohan Paul@rohanpaul_ai
AI 评分 63/100
智能体设计中,精确搜索(grep)是否优于向量检索?

研究指出,在编码智能体需精确定位证据(如符号、函数名、错误信息)的任务中,基于grep的精确字符串搜索比向量检索更具优势。关键在于,检索性能高度依赖智能体的设计框架——结果呈现方式(内联、文件或CLI)会极大影响搜索效果。论文挑战了“智能体栈必须始于嵌入”的默认假设,强调应区分任务类型:是语义发现问题,还是证据定位问题。对于后者,为模型提供原始工具、清晰上下文和精确搜索的框架,往往比构建复杂索引更有效。向量数据库在模糊语义搜索和大规模场景中仍有价值。

智能体arXiv大佬观点搜索

5月11日

星期一 · 1 条
00:58
elvis@omarsar0
AI 评分 57/100
智能体AI工作流的可扩展模式

智能体RAG流程的瓶颈通常不在大语言模型调用,而在于底层数据平面的序列化与分布式协调开销。新研究提出的AAFLOW是一个统一分布式运行时,将智能体工作流建模为基于Apache Arrow和Cylon的算子抽象,通过零拷贝数据平面直接连接预处理、嵌入和检索环节,并采用资源确定性调度与异步批处理降低协调成本。该方案实现了高达4.64倍的流水线加速,嵌入与更新阶段性能提升2.8倍,且所有收益均源于数据流优化,并未涉及大语言模型推理加速。

智能体arXiv论文/研究部署/工程

5月1日

星期五 · 1 条
17:40
Rohan Paul@rohanpaul_ai
AI 评分 51/100
经济论文揭示AI行业的结构性杰文斯悖论与垄断趋势

一篇经济学论文直接建模了AI行业正在发生的“结构性杰文斯悖论”。研究发现,尽管大语言模型的运行成本下降,但总计算能耗却爆炸式增长。数学模型证明,数字智能单位成本的降低,导致对复杂AI代理及其支撑基础设施的总需求呈指数级上升,并催生需要人力管理的新下游生态。这形成一个悖论:AI使用价格下降并未节约成本,反而激励开发者构建消耗指数级算力的更复杂代理。持续进步使得基于大模型开发简单应用的小公司被核心AI吸收的功能所淘汰。竞争动态中,性能完善的模型一旦有更智能的版本出现即失去经济价值。最终,巨大的计算成本与持续的用户数据需求,共同推动整个AI行业走向不可避免的垄断。

arXiv论文/研究

4月8日

星期三 · 1 条
00:00
Berkeley RDI:Blog(AI 安全与评测)精选
AI 评分 87/100
我们如何攻破顶级AI Agent基准测试及未来展望

伯克利研究团队开发自动化扫描代理,系统审计SWE-bench、WebArena等八个主流AI Agent基准测试,发现全部存在可被利用的漏洞。通过修改测试配置、植入木马包装器、读取标准答案等手段,该代理在未实际解决任何任务的情况下,于Terminal-Bench、SWE-bench Verified等测试中获得100%满分,WebArena接近100%。研究揭示了当前AI基准测试评分机制存在系统性安全缺陷,高分不等于真实能力。

arXiv安全/对齐评测/基准
另有 2 家信源报道Hacker News 热门(buzzing.cc 中文翻译)Berkeley RDI:Blog(AI 安全与评测)
推荐理由:伯克利团队从内部挨个拆解了八大主流基准,发现全都能被零能力 agent 打满分。这不只是打脸,他们给出了一份评估构建清单,以后做基准的人必须过了这一关才算及格。
共 19 条,没有更多了