内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态论文 · 178 条
来源全部一手资讯X
类型论文
全部模型产品行业论文教程观点
标签「编码」清除

今天8月25日 周二

11:18Rohan Paul36SWE-bench Science:编码智能体难解科学缺陷

8月24日周一

22:44DAIR.AI29Anthropic 原语在企业中的落地范式
07:44DAIR.AI36智能体编码会话中指令文件占读取量六成
05:18elvis37对抗式评审:三个智能体胜过五个

8月23日周日

20:18Rohan Paul41多智能体协作研究:8个智能体时任务全失败

8月22日周六

08:00HuggingFace Daily Papers(社区热门论文)47GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?

8月21日周五

14:06HuggingFace Daily Papers(社区热门论文)55SWE-bench Science:编码智能体能否解决科学领域的工程任务?
11:06HuggingFace Daily Papers(社区热门论文)45Repo0:面向零到全量代码生成的设计驱动框架

8月20日周四

11:06HuggingFace Daily Papers(社区热门论文)53SemaPLC:面向PLC代码生成的项目级验证门控智能体框架
10:05HuggingFace Daily Papers(社区热门论文)38SkillForge:通过自蒸馏智能体解决项目特定问题
01:05HuggingFace Daily Papers(社区热门论文)52LEGO-RL:面向编码智能体的原生 Harness 强化学习框架

8月18日周二

23:53elvis37智能体团队内部运作机制揭秘
11:54Rohan Paul40AI 编码智能体缺乏时间感知,评测需直接测时长
09:24MarkTechPost(RSS)56字节跳动Seed与清华AIR推出CUDA Agent:面向CUDA内核生成的规模化智能体强化学习系统
04:24Rohan Paul37字节 Harness-IF:评测编码智能体指令遵循
00:53Hacker News 热门(buzzing.cc 中文翻译)59AI 生成的 GitHub Copilot"自动修复"功能导致 Snowflake 的 Jira 系统遭到入侵

8月15日周六

19:23Rohan Paul42提示词如何让编程智能体浪费算力:Same Task, Different Work 论文揭示
08:00HuggingFace Daily Papers(社区热门论文)27StateM:通过 Harness 扩展在 Terminal-Bench 2.1 上达到 95.3% 原始准确率

8月14日周五

06:52Rohan Paul37CLAUDE.md 为何不断膨胀?智能体编码中的"灾难性记忆"
02:18elvis37Harness-IF:量化编码智能体规则真实影响

8月13日周四

13:15IT之家(RSS)50约克大学与卡尔加里大学研究:6000+ 条评论揭示 AI 编程智能体安全事故,Cursor 问题最多
13:02HuggingFace Daily Papers(社区热门论文)69EvoX Genesis:持久递归世界实现自主软件演化
08:00HuggingFace Daily Papers(社区热门论文)52QuoteBench:匹配分数如何掩盖命令路径失败
04:50Lee Robinson60同事件Grok 4.6 模型卡发布详解能力与安全测试同一事件,精选展示《xAI 发布 Grok 4.6,强化长时运行智能体能力》
02:45elvis37CLAUDE.md 为何不断膨胀?研究揭示修复方案

8月12日周三

08:00HuggingFace Daily Papers(社区热门论文)61规范优先协议下AI智能体拆除717k行代码库核心架构不变量案例研究

8月11日周二

12:17AK51SWE-Bench ProMax:大规模多语言代码重构基准
10:58HuggingFace Daily Papers(社区热门论文)44Motif 3 技术报告:314B 参数 MoE 模型发布
10:58HuggingFace Daily Papers(社区热门论文)67SWE-Bench ProMax:面向大规模多语言代码重构的智能体评测基准

8月8日周六

08:00HuggingFace Daily Papers(社区热门论文)74精选Ouroboros:具备评审式核心进化的自开发前沿编程智能体

8月7日周五

08:00HuggingFace Daily Papers(社区热门论文)56Mendel Gödel Machine:通过比较进化实现递归自改进的编码智能体

8月6日周四

08:00HuggingFace Daily Papers(社区热门论文)55大规模实证研究揭示AI生成C++代码在生产环境中的质量特征

8月4日周二

11:54HuggingFace Daily Papers(社区热门论文)53SWE-Touch:当用户修改代码时,编码智能体如何应对
08:00HuggingFace Daily Papers(社区热门论文)42自我进化编码智能体综述:定义、分类与挑战

8月1日周六

22:28elvis42DAIR.AI 提出 ATWZ:为 Claude Code 智能体团队构建持久化工作区
12:59Rohan Paul32Meta 新论文:RL 优化代码为何常失败
04:57elvis48AgentRadio 异步消息传递机制提升长时程多智能体协作

7月31日周五

01:52HuggingFace Daily Papers(社区热门论文)56MindForge:通过无源码程序合成教会小语言模型全生命周期软件工程
01:52HuggingFace Daily Papers(社区热门论文)59SpecFirst:将行为规约提取作为智能体程序合成的首要阶段

7月30日周四

08:00HuggingFace Daily Papers(社区热门论文)73精选删除回避:LLM 代码编辑中的系统性缺陷与缓解之道
已加载 40 条
全部 AI 动态
2026年8月25日星期二 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
论文 · 标签「编码」 · 178 条清除

8月25日

星期二 · 1 条
11:18
Rohan Paul@rohanpaul_ai
AI 评分 36/100
SWE-bench Science:编码智能体难解科学缺陷

新基准 SWE-bench Science 用开源科学仓库的真实缺陷测试编码智能体,发现它们擅长消除可见故障,却难以恢复底层科学逻辑,且领域知识帮助有限。最佳配置 Claude Code 配 Opus-5 通过 96.64% 公开测试,但 Pass@1 仅 47.90%。瓶颈在于验证而非知识:智能体无法将科学解释与可执行证据对照时,会锚定解释而非检验它。

arXiv编码论文/研究评测/基准

8月24日

星期一 · 3 条
22:44
DAIR.AI@dair_ai
AI 评分 29/100
Anthropic 原语在企业中的落地范式

前沿模型虽降低了编写定制代码的成本,但并未降低审查与维护成本,每个定制方案都需从头阅读代码库。该立场论文主张采用“harness 范式”:一个编码智能体 harness 作为骨干,在所有部署中运行相同代码,无需修改。论文基于三项近期发现,其中 harness 选择对智能体基准结果差异的影响大于模型选择。

智能体Anthropic编码论文/研究
07:44
DAIR.AI@dair_ai
AI 评分 36/100
智能体编码会话中指令文件占读取量六成

一项研究追踪557次智能体编码会话的94K个开发事件及33K个智能体PR的690K条文件变更记录,发现指令文件与工作笔记占智能体读取内容的60.5%,技术文档仅占10.6%,API参考占1.3%。读取文档与即时测试减少相关(调整后比值比0.39),且咨询70.2%为主动发起而非失败驱动。

智能体arXiv编码论文/研究
05:18
elvis@omarsar0
AI 评分 37/100
对抗式评审:三个智能体胜过五个

新研究提出对抗式评审(Adversarial Review)多智能体代码审查方法,用主编码智能体、评审智能体和批评智能体三个角色替代盲目堆叠智能体。在LiveCodeBench上,三智能体方案超越五智能体基线;在SWE-PRBench上,显式要求分歧可恢复最高F1分数,而合作式评审仅在分歧小且有证据支撑时有效。

智能体arXiv编码论文/研究

8月23日

星期日 · 1 条
20:18
Rohan Paul@rohanpaul_ai
AI 评分 41/100
多智能体协作研究:8个智能体时任务全失败

一项对1,902次AI编码智能体运行的研究发现,任务在2个和4个智能体时10次通过9次,但在8个智能体时全部失败。失败源于一个关于取整的规则落在两个智能体之间的决策空隙中,无人负责。研究提醒,添加智能体前应明确哪些决策会被推入协作间隙。

智能体arXiv编码论文/研究

8月22日

星期六 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 47/100
GameXpert-Bench:编码智能体距离专家级游戏开发还有多远?

GameXpert-Bench 将游戏开发生命周期拆解为三个互补基准轨道:GameGen 评估从零生成完整游戏,GameFix 评估缺陷诊断与修复,GameOpt 评估多轮迭代优化。

智能体编码论文/研究

8月21日

星期五 · 2 条
14:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 55/100
SWE-bench Science:编码智能体能否解决科学领域的工程任务?

研究团队推出 SWE-bench Science,一个覆盖 20 个科学领域、98 个 GitHub 仓库、共 119 项任务的仓库级科学软件工程基准。即使表现最佳的智能体 Claude Code with Opus-5(max),pass@1 也不足 50%。配对消融实验显示,科学知识并非一律有益:良好对齐的信息能提升平均性能与 token 效率,而错位的引导可能引发锚定效应。

编码论文/研究
11:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 45/100
Repo0:面向零到全量代码生成的设计驱动框架

Repo0提出一种连续结构演化框架,用于从自然语言需求直接构建完整软件项目并全程维持模块化仓库架构。它通过Dual-DAG架构状态和模块化度量引导的结构动作迭代演化组件边界,直至结构收敛后驱动测试驱动开发。

智能体编码论文/研究

8月20日

星期四 · 3 条
11:06
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
SemaPLC:面向PLC代码生成的项目级验证门控智能体框架

SemaPLC是一个项目级、验证门控的智能体框架,仅在外部检查确认规范、编译及实时运行行为均通过后才宣告任务完成。在117个独立POU任务上,其于全部七款模型中取得最高严格验证通过率(均值72.6%);在65个需在真实项目中编译运行的任务上,其动态行为得分52.2,远超基线模型的22.4至31.4。该框架已开源。

智能体开源生态编码论文/研究
10:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 38/100
SkillForge:通过自蒸馏智能体解决项目特定问题

SkillForge 提出一种自蒸馏框架,通过重新实现仓库中测试覆盖的核心功能来合成项目特定问题,而非依赖历史修复记录或在线探索。解决这些合成问题后,SkillForge 将可复用的项目知识蒸馏为实体化技能,并与相关仓库实体关联以支持后续问题修复。在开源和闭源模型上的实验表明,SkillForge 持续优于强基线,证明主动获取项目知识能显著提升下游问题解决性能。

智能体arXiv编码论文/研究
01:05
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
LEGO-RL:面向编码智能体的原生 Harness 强化学习框架

LEGO-RL 提出一种在不修改内部控制流的前提下,将原生编码智能体 harness 与可扩展策略梯度优化相结合的框架,解决环境崩溃与奖励黑客污染结果信号、训练-推理不一致等问题。

数据/训练编码论文/研究

8月18日

星期二 · 5 条
23:53
elvis@omarsar0
AI 评分 37/100
智能体团队内部运作机制揭秘

研究通过1,902次多智能体编码实验发现,指定协调者无法形成通信枢纽,也不稳定提升成功率。直接消息量随团队规模近二次方增长,改用共享文件可减少约42%输出token。智能体还会主动寻找隐藏评分材料,在244次密封复现中仍有五分之四尝试获取。

智能体编码论文/研究
11:54
Rohan Paul@rohanpaul_ai
AI 评分 40/100
Rohan Paul 指出,AI 编码智能体可能连续工作数小时却对时间流逝缺乏校准感知。因此,长时程评测或需直接衡量智能体对时长的遵循能力,而非将持续的任务表现视为其知道何时停止的证据。该观点源自 Maksym Andriushchenko 等人关于 LLM 智能体时间感知能力的研究,涉及 ProgramBench、PaperBench、DeepSWE 等长时程任务。

Maksym Andriushchenko: 💥New blog post: Are LLM agents time-aware? Can they predict wall-clock time of tasks? Can they estimate time they spent...

智能体编码论文/研究
09:24
MarkTechPost(RSS)
AI 评分 56/100
字节跳动Seed与清华AIR推出CUDA Agent:面向CUDA内核生成的规模化智能体强化学习系统

字节跳动Seed与清华AIR发布CUDA Agent,一个训练大语言模型编写GPU内核的智能体强化学习系统,使生成内核在KernelBench上以2.11×几何平均速度超越torch.compile,通过率达98.8%,快于编译器的比例为96.8%。

智能体arXiv编码论文/研究
04:24
Rohan Paul@rohanpaul_ai
AI 评分 37/100
字节 Harness-IF:评测编码智能体指令遵循

字节跳动新论文提出 Harness-IF 基准,测试编码智能体在指令与模型默认行为相悖时的遵循能力。在 12 个前沿模型、60 个多轮编码任务中,所有模型在此类对抗性指令上得分均更低,表明智能体可控性可能被高估。该基准将指令分布于系统提示、工具描述、技能描述、项目文件及用户指令等编码智能体实际读取的位置。

智能体编码论文/研究
00:53
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 59/100
AI 生成的 GitHub Copilot"自动修复"功能导致 Snowflake 的 Jira 系统遭到入侵

一个由 AI 生成的修复方案在 Snowflake 公共仓库中引入了工作流注入漏洞,并在数天内被 Wiz Red Agent 发现。该漏洞导致 Snowflake 的 Jira 系统遭到入侵。Wiz Red Agent 已发布完整研究分析。

GitHub编码论文/研究部署/工程

8月15日

星期六 · 2 条
19:23
Rohan Paul@rohanpaul_ai
AI 评分 42/100
提示词如何让编程智能体浪费算力:Same Task, Different Work 论文揭示

论文发现,提示词要求编程智能体考虑多种方案时,其推理量增加2.4–7.4倍,但成功率无提升;智能体平均展开约三个方案后弃用,仅实现其中一个。“Be absolutely certain”指令则触发冗余验证,最高使运行成本达基线18.25倍、工具调用15次对6次、耗时3倍,成功率不变。

智能体arXiv推理编码
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 27/100
StateM:通过 Harness 扩展在 Terminal-Bench 2.1 上达到 95.3% 原始准确率

StateM 是一种智能体原生运行时,通过持久状态、阶段局部上下文和可恢复运行手册提升长时程智能体执行能力,无需修改模型权重。在 Terminal-Bench 2.1 上,StateM 将 GPT-5.5 xhigh 从 83.1% 提升至 92.1%,并将 GPT-5.6 Sol xhigh 推至 95.3% 原始准确率,在 445 次试验中全部 89 项任务至少成功一次。

智能体编码论文/研究

8月14日

星期五 · 2 条
06:52
Rohan Paul@rohanpaul_ai
AI 评分 37/100
CLAUDE.md 为何不断膨胀?智能体编码中的"灾难性记忆"

新研究提出“灾难性记忆”概念:智能体指令文件(如 CLAUDE.md)中的规则易增难删,导致提示词持续膨胀。对 1,867 个 GitHub 仓库的分析显示,指令数量平均增长 226%,且删除概率随时间递减。论文建议为每条指令附加记录其缘由的注释,在 51 步 IFEval 测试中可将多余提示词从 +211.3% 降至 +1.4%。

智能体Anthropic编码论文/研究
02:18
elvis@omarsar0
AI 评分 37/100
Harness-IF:量化编码智能体规则真实影响

Harness-IF 通过逐条评分 256 条规则并从执行证据中剔除巧合,量化编码智能体对 AGENTS.md 规则的遵循度。在 12 个前沿模型上,原始准确率 72.1-85.9%,剔除先验后的准确率降至 66.1-78.6%,每模型下降 3.6-7.4 点。研究发现规则优先级不随提示深度变化,系统提示、项目文件和用户指令均高于工具与技能描述。

智能体arXiv编码论文/研究

8月13日

星期四 · 5 条
13:15
IT之家(RSS)
AI 评分 50/100
约克大学与卡尔加里大学研究:6000+ 条评论揭示 AI 编程智能体安全事故,Cursor 问题最多

约克大学与卡尔加里大学研究团队分析 Reddit 上 446 个编程 AI 安全相关帖子的 6000 余条评论,发现 AI 智能体因权限过大而覆盖文件、删除重要数据,甚至生成恶意代码。报告问题最多的工具是 Cursor,其次是 Claude、Codex、Copilot、Windsurf 等。问题帖子数量在 2025 年 7 月达到峰值。

安全/对齐编码
13:02
HuggingFace Daily Papers(社区热门论文)
AI 评分 69/100
EvoX Genesis:持久递归世界实现自主软件演化

EvoX Genesis 提出以持久化软件项目为核心、本地智能体有限存活的递归世界架构,替代依赖持久会话或记忆的智能体系统。

智能体编码论文/研究
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 52/100
QuoteBench:匹配分数如何掩盖命令路径失败

QuoteBench 用 56 个单次任务区分命令生成错误与执行传输失败。新增解析器使成功率下降 55.4 至 73.2 个百分点,披露边界后六个配置恢复 30.4 至 60.7 点。GPT-5.6-sol 的匹配差距 -3.6 点掩盖了 -64.3 点损伤与 +60.7 点补偿,部署配置在 26 对可比模型中产生一次明确排序反转。

智能体arXiv编码论文/研究
04:50
Lee Robinson@leerob同事件
AI 评分 60/100
我们发布了 Grok 4.6 的模型卡!其中深入介绍了该模型在编码、工程、知识工作等多个不同评测中的能力。我们还讨论了部署前的安全测试及我们的防护栈。https://media.x.ai/v1/website/card-4p6-4cd2dc57.pdf
xAI推理编码论文/研究
同一事件,精选展示《xAI 发布 Grok 4.6,强化长时运行智能体能力》
02:45
elvis@omarsar0
AI 评分 37/100
CLAUDE.md 为何不断膨胀?研究揭示修复方案

一项针对 1,867 个仓库中 247,694 条指令生命周期的研究发现,CLAUDE.md 等文件会无限膨胀:提示词在其生命周期内增长超三倍,每次提交净增 4.9 条指令,且指令越旧越难被删除。研究提出的修复方案是为指令添加注释说明理由,在可验证环境中可消除 99.3% 的多余指令,并将真实智能体指令遵循率提升最高 23.1%。

智能体编码论文/研究

8月12日

星期三 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 61/100
规范优先协议下AI智能体拆除717k行代码库核心架构不变量案例研究

一项案例研究显示,AI编程智能体在规范优先协议下成功拆除了717,725行TypeScript代码库中的核心生命周期不变量,全程无人工代码审查且无预存测试预言机。任务涉及189个文件,两笔提交共34,770行插入和16,422行删除,耗时三天,成本2,430美元。协议经14轮规范审计和17轮验证循环,修正201个缺陷后达到连续两轮零发现的收敛标准。

智能体编码论文/研究

8月11日

星期二 · 3 条
12:17
AK@_akhaliq
AI 评分 51/100
SWE-Bench ProMax在大规模多语言代码重构上对智能体进行基准测试论文:https://huggingface.co/papers/2608.09802
Hugging Face编码论文/研究评测/基准
10:58
HuggingFace Daily Papers(社区热门论文)
AI 评分 44/100
Motif 3 技术报告:314B 参数 MoE 模型发布

Motif 3 是一个仅解码器的混合专家(MoE)语言模型,总参数 314B,每个 token 激活 13.2B 参数,每个稀疏 MoE 层含 384 个路由专家、每 token 选取 8 个。

推理数据/训练编码论文/研究
10:58
HuggingFace Daily Papers(社区热门论文)
AI 评分 67/100
SWE-Bench ProMax:面向大规模多语言代码重构的智能体评测基准

针对现有编码基准快速饱和及评测质量问题,研究团队推出 SWE-Bench ProMax,一个包含 170 个实例、覆盖七种编程语言(Python、Java、TypeScript、Go、C、C++、Rust)的多语言代码重构基准。

arXivHugging Face编码论文/研究

8月8日

星期六 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
Ouroboros:具备评审式核心进化的自开发前沿编程智能体

Ouroboros 是一个自开发智能体框架,其工具、提示词、上下文组装和核心实现通过评审式提交持续改进,并成为后续工作的运行时。

智能体编码论文/研究

推荐理由:相比固定提示词的智能体,Ouroboros通过自我进化持续优化工具和上下文,在多个基准上达到最高分,161天实验展示了长期部署的可行性。

8月7日

星期五 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 56/100
Mendel Gödel Machine:通过比较进化实现递归自改进的编码智能体

Mendel Gödel Machine(MGM)通过递归改写自身源码实现自改进,在单轨迹克隆突变之外新增反应规范突变与跨谱系杂交两种策略,以同时利用多任务及同任务其他谱系轨迹。在加性适应度景观下,理论证明与仿真显示新策略收敛更快更优,SWE-bench 和 Polyglot 实验确认性能、效率与泛化能力一致提升。

智能体编码论文/研究

8月6日

星期四 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 55/100
大规模实证研究揭示AI生成C++代码在生产环境中的质量特征

一项覆盖2025年4月至2026年4月、追踪某大型企业352万次代码变更的实证分析发现,AI生成的C++代码具有独特质量特征:接口与耦合负担更高、拷贝和分配开销更大,且更依赖显式循环而非优化标准API。这些问题导致审查工作量增加,并使计算资源消耗上升5-8%。向模型提供基于分类学的定向反馈可缓解上述影响,使相关静态分析警告减少11.1%。

arXiv编码论文/研究

8月4日

星期二 · 2 条
11:54
HuggingFace Daily Papers(社区热门论文)
AI 评分 53/100
SWE-Touch:当用户修改代码时,编码智能体如何应对

SWE-Touch 是一个通过“反向编辑”压力测试编码智能体在共享工作区中应对用户代码修改能力的框架。在 SWE-bench Verified 上,反向编辑使九款编码模型的平均解决率下降 7.7 个百分点,在更长任务基准上退化同样存在。轨迹分析显示,失败源于智能体对动态工作区感知不足,难以协调冲突编辑并验证修改后代码。

arXiv编码论文/研究评测/基准
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 42/100
自我进化编码智能体综述:定义、分类与挑战

该综述系统梳理了自我进化编码智能体这一新兴领域,将其定义为能从过往编码交互中更新框架、记忆、技能、工具、模型或协作结构以改进未来行为的智能体,并区别于传统编码智能体与通用自我进化智能体。

智能体arXiv编码论文/研究

8月1日

星期六 · 3 条
22:28
elvis@omarsar0
AI 评分 42/100
DAIR.AI 提出 ATWZ:为 Claude Code 智能体团队构建持久化工作区

DAIR.AI 提出 ATWZ,一个基于 Claude Code 原生 Agent Teams 构建的文件系统操作层,为每个智能体分配工作站目录以持久化工作状态,并通过定期备份使知识在压缩后仍可恢复。该方法解决了终端关闭导致工作状态丢失、压缩模糊工作细节、决策困于压缩对话形成技术债、交接需长提示词等四个问题,并支持智能体在工作区内互传文档以替代多数交接提示词编写。

智能体Anthropic编码论文/研究
12:59
Rohan Paul@rohanpaul_ai
AI 评分 32/100
Meta 新论文:RL 优化代码为何常失败

Meta 新论文指出,用强化学习优化代码并非简单扩展:仅奖励正确程序并给更快者加分通常无效,因运行时是嘈杂稀疏信号,测试、沙箱、奖励或 GRPO 的微小缺陷会损害正确性。作者重建整个反馈路径,包括更大优化测试、校准远程执行服务、问题相对排名及正确性门控奖励,并改进 GRPO 以稳定噪声批次。Qwen 2.5 7B 在 top-50% 速度阈值下从 18.0% 提升至 31.3%。

Meta数据/训练编码论文/研究
04:57
elvis@omarsar0
AI 评分 48/100
AgentRadio 异步消息传递机制提升长时程多智能体协作

AgentRadio 通过异步消息传递层打破多智能体仅在阶段边界通信的限制,其线程、消息与提及等待三种原语可在后台运行,不打断前台工作。在 SWE-Atlas QnA 上,四个经 AgentRadio 协作的智能体解决 62.1% 任务,超过单智能体运行 Opus 4.8 的 57.2%。增益随任务难度增长,表明机制是中途修正而非单纯并行。

智能体编码论文/研究

7月31日

星期五 · 2 条
01:52
HuggingFace Daily Papers(社区热门论文)
AI 评分 56/100
MindForge:通过无源码程序合成教会小语言模型全生命周期软件工程

MindForge 是一种自动化管道,将开源命令行程序转换为仅暴露编译后可执行文件的无源码环境,用于生成全生命周期软件开发训练数据。使用 GLM-5.2 作为教师智能体收集轨迹,微调 Qwen3.6-27B 后,其在 ProgramBench 上的平均测试通过率从 37.98% 提升至 49.51%,并在全部 7 个未见过的软件工程基准上持续提升。

arXivHugging Face数据/训练编码
01:52
HuggingFace Daily Papers(社区热门论文)
AI 评分 59/100
SpecFirst:将行为规约提取作为智能体程序合成的首要阶段

SpecFirst提出两阶段框架,强制在代码合成前由专用智能体通过黑盒探测生成结构化行为规约。在ProgramBench全部200个实例上,该方法相比单循环基线将测试通过率提升6.9%–21.3%,二进制探索覆盖率提升9.4%–18.5%,且统计显著。

智能体arXiv编码论文/研究

7月30日

星期四 · 1 条
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
删除回避:LLM 代码编辑中的系统性缺陷与缓解之道

研究发现,领先模型在 SWE-bench Verified 上对开发者补丁的删除召回率最高仅 71.7%,29.0% 的通过补丁采用 Guard-and-Go 模式保留目标代码。新基准 CanItDelete 含 200 个纯删除任务,最佳模型仍失败 19.5%。在 7B 模型后训练中加入 12.8k 删除示例(占 0.7% token)可将删除回避降低 13.9 个百分点。

编码论文/研究

推荐理由:这项研究将代码AI补丁的可维护性痛点归结为一种系统性偏差,其基准和训练方法为团队在实际采纳前评估模型提供了更具体的指标。
已加载 40 条