精选归档 · 第 46 页
第 901–920 条 · 共 1,108 条
20:00
多智能体系统将GPU内核性能提升38%我们与NVIDIA合作,利用自主运行的多智能体系统,在为期三周内对235个真实CUDA内核进行了优化。该系统从零开始构建并优化Blackwell GPU内核直至汇编级别,实现了38%的几何平均速度提升,其中63%的问题超越基线,19%实现超2倍优化。这些内核直接影响AI训练与推理效率,传统上需资深工程师耗时数月乃至数年的优化工作,该系统在数周内即自主完成,并能探索更广阔解决方案空间,突破了人工逐项优化的限制。
推荐理由:Cursor 把自家多 Agent 系统拉去优化 CUDA 内核,38% 的 geomean 提速不算炸裂,但真正值得看的是它证明了 Agent 可以在无人干预下跑三周啃硬骨头,这对做 Agent 产品的人是个强信号。
08:00
HuggingFace Daily Papers(社区热门论文)精选
现实世界威胁下的移动 GUI 智能体:我们准备好了吗?研究人员推出了一款应用内容插桩框架及配套测试套件,包含122个动态任务和3000余个静态场景,用于评估移动 GUI 智能体在含第三方内容(如广告、用户生成内容)的真实环境中的表现。实验显示,现有开源及商业智能体均受显著影响,在动态和静态环境下的平均误导率分别为42.0%和36.1%,表明当前技术在大规模部署前仍需加强安全性验证。
推荐理由:这篇论文系统揭示了移动 GUI 智能体的安全盲区,第三方恶意内容只需平均 10 个 token 就能让智能体误操作,视觉模态反而更脆弱,安全部署还有很长的路。
08:00
HuggingFace Daily Papers(社区热门论文)精选
ClawGUI:GUI Agent训练、评估与部署的统一开源框架ClawGUI是面向GUI Agent的开源全栈框架,统一解决训练、评估与部署的基础设施瓶颈。ClawGUI-RL首创支持并行虚拟环境与真实设备的开源强化学习管道,集成GiGPO与过程奖励模型;ClawGUI-Eval在6项基准实现95.8%基线复现率;ClawGUI-Agent支持部署至Android、HarmonyOS、iOS及12个以上聊天平台。经该管道训练的ClawGUI-2B在MobileWorld GUI-Only任务达17.1%成功率,较同规模基线提升6.0%。
推荐理由:这是 GUI agent 方向久等的工程基座,第一次把在线 RL 训练、标准化评估和真实设备部署装进同一个开源框架,2B 模型就能跑赢大尺寸模型,做移动 agent 的团队可以直接上手复现。
08:00
HuggingFace Daily Papers(社区热门论文)精选
智能体安全盲点:良性用户指令如何暴露计算机使用智能体的关键漏洞研究人员发布OS-BLIND基准测试,包含300个人工构建任务,覆盖12个类别与8个应用,用于评估计算机使用智能体(CUA)在非预期攻击条件下的安全性。测试显示,多数前沿模型攻击成功率超90%,Claude 4.5 Sonnet达73.0%,而在多智能体系统中该比例升至92.7%。研究表明,现有安全防御难以应对良性用户指令场景,安全对齐机制仅在前几步激活,且多智能体架构通过子任务分解进一步掩盖有害意图。
推荐理由:这篇论文揭开了计算机使用智能体的安全盲区,良性指令竟然也能导致大规模攻击成功,多智能体场景更危险,做 CUA 的团队应该连夜读一下。
00:00
顾问策略:为智能体提供智能升级Anthropic 在 Claude Platform 推出 advisor tool 测试版,实现"顾问策略":以 Opus 为顾问模型,Sonnet 或 Haiku 为执行模型。执行模型全程主导任务,仅在遇到决策难题时咨询 Opus 获取指导。该方案让 Sonnet 在 SWE-bench Multilingual 基准上性能提升 2.7 个百分点,同时成本降低 11.9%;Haiku 搭配 Opus 在 BrowseComp 得分达 41.2%,是单独 Haiku(19.7%)的两倍多,且比单独 Sonnet 成本低 85%。开发者只需在 API 请求中添加 advisor_20260301 工具即可启用,无需额外上下文管理。
另有 2 家信源报道X:Claude (@claudeai)X:Testing Catalog (@testingcatalog)
推荐理由:我觉得这个 advisor 模式是今年最实用的 API 设计之一,用最小的架构改动换来近 Opus 级的 agent 智能,账单却和 Sonnet 差不多,做复杂 agent 的团队可以直接套用。
20:00
Bugbot 现可通过学习规则实现自我改进Bugbot 的 bug 解决率已从 2025 年 7 月正式推出时的 52% 提升至近 80%,领先其他 AI 代码审查产品。其核心改进在于引入了规则学习机制,能够从实时代码审查反馈(如开发者反应、回复和人工评审意见)中自主学习,取代了原先依赖离线实验的更新模式。自测试版推出以来,已有超过 11 万个仓库启用该功能,生成了逾 4.4 万条规则。这些规则可根据信号积累被激活或禁用,帮助 Bugbot 更精准地识别问题。用户可在 Cursor Dashboard 中管理学习规则,以优化审查效果。
推荐理由:AI code review 赛道卷了两年,Bugbot 78% 的解决率终于把第二名甩开 15 个点,关键不是分数而是它开始从真实 PR 反馈里自动学规则,做 code review 工具的该认真看看这套闭环逻辑。
10:41
GLM-5.1开源:一个独立工作8小时的模型智谱推出开源模型GLM-5.1,支持独立工作长达8小时。模型可直接部署使用,无需人工频繁干预,适用于长周期自动化任务场景。
另有 2 家信源报道IT之家(RSS)公众号:智谱(GLM)
推荐理由:智谱把 GLM-5.1 开源,并且主打 8 小时独立工作,这个定位切中了 agent 场景下长任务执行的痛点,想做自动化流程的可以跑起来试试。
08:00
Claude Platform:开发者版本说明(RSS)精选
Claude 推出 Managed Agents 公开测试版与 ant CLI 命令行客户端Claude 发布 Managed Agents 公开测试版,这是一个完全托管的智能体框架,支持通过 API 创建智能体、配置容器并运行会话,具备安全沙箱、内置工具和 SSE 流式传输。同时推出 ant CLI 命令行客户端,可加速与 Claude API 的交互,原生集成 Claude Code,并支持以 YAML 文件管理 API 资源版本。
推荐理由:Claude Managed Agents 把沙箱化代理从第三方方案变成了平台原生能力,ant CLI 则把 API 调用纳入了版本控制,这对习惯了 Claude Code 的开发团队是个自然升级,beta 阶段值得先占坑。
05:57
Andrej Karpathy@karpathy精选 AI赋能民众提升政府透明度与问责制Something I've been thinking about - I am bullish on people (empowered by AI) increasing the visibility, legibility and accountability of their governments.Historically, it is the governments that act to make society legible (e.g. "Seeing like a state" is the common reference), but with AI, society can dramatically improve its ability to do this in reverse. Government accountability has not been constrained by access (the various branches of government publish an enormous amount of data), it has been constrained by intelligence - the ability to process a lot of raw data, combine it with domain expertise and derive insights. As an example, the 4000-page omnibus bill is "transparent" in principle and in a legal sense, but certainly not in a practical sense for most people. There's a lot more like it: laws, spending bills, federal budgets, freedom of information act responses, lobbying disclosures... Only a few highly trained professionals (investigative journalists) could historically process this information. This bottleneck might dissolve - not only are the professionals further empowered, but a lot more people can participate.Some examples to be precise: Detailed accounting of spending and budgets, diff tracking of legislation, individual voting trends w.r.t. stated positions or speeches, lobbying and influence (e.g. graph of lobbyist -> firm -> client -> legislator -> committee -> vote -> regulation), procurement and contracting, regulatory capture warning lights, judicial and legal patterns, campaign finance... Local governments might be even more interesting because the governed population is smaller so there is less national coverage: city council meetings, decisions around zoning, policing, schools, utilities...Certainly, the same tools can easily cut the other way and it's worth being very mindful of that, but I lean optimistic overall that added participation, transparency and accountability will improve democratic, free societies.(the quoted tweet is half-ish related, but inspired me to post some recent thoughts)译AI正赋能民众反向提升政府透明度与问责制。历史上政府使社会"可读",而AI让民众具备解析政府海量数据的能力。政府问责的瓶颈并非数据公开,而是处理原始信息的智能--如冗长法案虽法律透明却难以实用理解。AI不仅赋能专业记者,更让普通民众能解析预算、立法差异、游说关系等复杂信息,地方政府场景同样适用。尽管技术存在双刃剑风险,但作者对民主社会因参与度和透明度提升而改善持乐观态度。Harry Rushworth: The British Government is a complicated beast. Dozens of departments, hundreds of public bodies, more corporations than ...
推荐理由:AI让普通人能读懂4000页法案,政府透明度与问责制将迎来质变
03:59
Meta Engineering Blog(RSS)精选
KernelEvolve:Meta的Ranking Engineer Agent如何优化AI基础设施Meta的Ranking Engineer Agent系列博客第二篇,聚焦其底层基础设施优化能力。该自主AI代理能够优化支撑广告排名模型运行的低层基础设施,旨在提升系统性能与效率。本篇承接首篇介绍的机器学习实验自主探索功能,进一步展示了该代理在硬件与系统层面的自动化优化实践。
推荐理由:Meta 内部工具展示 AI 自动化优化基础设施,工程师可借鉴实践。
08:00
Google Developers Blog(RSS)精选
通过 Gemma 4 将先进的智能体能力引入边缘Google DeepMind 发布了 Gemma 4 系列开源模型,旨在直接在设备端实现多步骤规划和自主智能体工作流。该版本包含用于实验“智能体技能”的 Google AI Edge Gallery,以及为开发者提供显著速度提升和结构化输出的 LiteRT-LM 库。Gemma 4 采用 Apache 2.0 许可,支持超过 140 种语言,并兼容移动设备、台式机及树莓派等多种物联网硬件平台。
推荐理由:开源 agentic 模型支持端侧运行,开发者可快速构建本地智能应用。
08:00
Cursor 3.0 发布:以 Agent 为核心的统一开发空间Cursor 3.0 正式发布,重构为以 Agent 为核心的统一工作空间。新界面原生支持多仓库协作,可并行运行本地与云端 Agent(覆盖移动端、Slack、GitHub 等入口),支持会话在环境间无缝迁移以便离线运行或本地迭代。完整保留 IDE 能力:文件编辑、LSP、内置浏览器及插件市场。基于自研 Composer 2 模型,目标是通过多 Agent 自主协作实现"代码库自动驾驶"。
推荐理由:Cursor 3 重磅发布:原生 Agent 工作流、云地无缝切换与多仓库管理
07:41
Claude Code:GitHub Releases(RSS)精选
Claude Code v2.1.90 版本更新Claude Code 发布 v2.1.90 版本。新增 /powerup 交互式教程命令,通过动画演示教授功能使用;增加环境变量支持离线环境保留 marketplace 缓存。修复多项关键 bug:解决速率限制对话框崩溃、--resume 缓存未命中、编辑操作与 format-on-save 冲突等问题。性能方面优化 MCP 工具缓存、SSE 传输及长对话转录效率。同时移除 DNS 缓存查询自动权限以增强隐私,并加固 PowerShell 工具权限检查。
推荐理由:Claude Code新增/powerup交互式教程与多项性能优化,提升开发体验