Topic · 主题全部主题 →

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

9,105条收录
1,107条精选

精选归档 · 第 35 页

681700 条 · 共 1,107

5月20日

星期三 · 2 条
01:48
Google DeepMind:Blog(RSS)精选
AI 评分 81/100
介绍 Google Antigravity 2.0

Google Antigravity 2.0 是一款全新独立桌面应用,支持 macOS、Linux 和 Windows,无 IDE 绑定,由最新 Gemini 模型驱动,面向企业。核心为智能体,支持同步与异步交互。新增动态子智能体(主智能体可动态创建子智能体并行完成子任务)、异步任务管理、JSON 格式钩子(可拦截并控制智能体行为)、定时任务(通过 /schedule 命令设置周期或一次性触发)。引入“项目”概念替代“工作区”,可跨多个文件夹并独立设置权限与规则。新增斜杠命令:/goal 自动执行至完成、/grill-me 实施前反向确认、/browser 显式控制浏览器。语音输入改为实时转录。


推荐理由:Antigravity 从 IDE 里的一个面板变成独立桌面应用,代理优先的体验终于不用绑着代码编辑器了,新加的计划任务和实时语音转录让它更像一个通用 AI 工作台。
00:39
Hacker News:AI 热帖精选
AI 评分 70/100
InsForge:面向编程智能体的一体化开源后端平台

InsForge是一个专为AI编码智能体设计的一站式开源后端平台。它通过MCP Server和CLI+Skills两种接口,让智能体能像后端工程师一样直接操作数据库、认证、存储、边缘函数、模型网关等全套后端服务,从而端到端地构建全栈应用。平台支持云托管与基于Docker的自托管,可一键部署至Railway、Zeabur等主流平台。


推荐理由:这个项目把后端全家桶变成 MCP 工具,AI 代理可以直接管理数据库和部署,对于正在折腾 agent 的团队,比东拼西凑要快得多。

5月19日

星期二 · 7 条
08:59
Claude Code:GitHub Releases(RSS)精选
AI 评分 65/100
Claude AI助手v2.1.144版本更新

Claude AI助手发布了v2.1.144版本。此次更新主要新增了对后台会话的/resume支持,并将“extra usage”更名为“usage credits”。同时包含了多项重要修复:优化了网络异常处理,解决启动卡顿问题;修复了窗口大小调整和长时间会话导致的终端显示错乱;解决了macOS特定文件夹下的崩溃问题。此外,还改进了模型选择持久化、文件读取、工具调用以及MCP服务器分页工具列表的处理,并减少了在VS Code中的渲染故障。本次更新显著提升了工具的稳定性和用户体验。


推荐理由:如果你被 Claude Code 启动卡住 75 秒折磨过,这次更新终于修了,还支持后台会话 /resume,体验好了一个档次。
08:00
Claude Platform:开发者版本说明(RSS)精选
AI 评分 72/100
Claude Platform 发布 MCP Tunnels 与托管智能体更新

Claude Platform 推出 MCP Tunnels 研究预览,支持连接私有网络内的 MCP 服务器。Claude Managed Agents 新增自托管沙箱选项,并支持在活跃会话中更新智能体的 MCP 服务器与工具配置。当工具输出超过 100K 字符(约 25K tokens)时,系统自动将完整内容溢出至沙箱文件,模型仅接收含文件路径的截断预览。


推荐理由:自托管沙箱和 MCP tunnels 是 Claude 平台向企业开发者伸出的橄榄枝,合规与内网连接痛点被明确回应,对生产环境部署是实质性补丁。
05:11
xAI:News(网页)精选
AI 评分 68/100
Grok平台技能功能上线

xAI于2026年5月18日正式推出Grok的“Skills”功能,旨在提供持久的专业知识支持。该功能允许用户对Grok进行一次性的偏好、格式规则或工作流程设置,即可在所有对话中持续生效,无需重复说明。Skills功能已在网页、iOS和Android平台全面上线,内置了创建与编辑Word文档、PPT演示文稿、Excel电子表格及处理PDF文件等开箱即用的技能。用户可以覆盖内置技能进行自定义,也能够通过对话快速创建新技能,从而实现工作流自动化与专业文档的便捷生成。


推荐理由:Grok 终于有了自己的「GPTs」式技能系统,文档、表格、PPT 一把抓,对办公场景的覆盖比单纯的对话助手实用多了,值得 Grok 用户上手一试。
01:06
Anthropic:Newsroom(网页)精选
AI 评分 64/100
Anthropic收购SDK与MCP服务器工具开发商Stainless

Anthropic宣布收购SDK与MCP服务器工具开发商Stainless。Stainless自2022年成立以来,一直为Anthropic官方SDK的生成提供支持,其工具能将API规范转化为TypeScript、Python、Go等多语言的SDK、命令行工具及MCP服务器。此次收购旨在增强Claude平台的开发者体验,提升AI代理连接外部数据与工具的能力,从而在MCP协议基础上进一步拓展连接生态。


推荐理由:Anthropic收购Stainless,表面是SDK团队整合,深层是给Claude的Agent连接能力铺路。未来MCP服务器的质量和数量可能会跨一个台阶,做Agent开发的值得关注。
00:51
Cursor Blog精选
AI 评分 74/100
Composer 2.5 发布与技术解析

Cursor 平台发布了智能与行为表现大幅提升的 Composer 2.5。该模型更擅长执行复杂指令和长期任务。其改进基于训练规模的扩大、更复杂的强化学习环境及新的学习方法。关键技术包括:使用文本反馈进行针对性强化学习以纠正具体错误;采用基于真实代码库、规模达前代25倍的合成数据进行训练;并引入分片Muon优化器等新架构。模型基于Moonshot的开源检查点构建。开发团队正合作训练一个计算量十倍的更大模型,并在大规模训练中发现了新型奖励作弊问题。


推荐理由:Cursor的Composer 2.5不只是换个模型,它在长任务上的耐性和指令跟随的准确性提升肉眼可见,训练细节里藏的’文本反馈修正‘方法,对做AI产品的应该会有所启发。

5月18日

星期一 · 2 条
22:52
Hugging Face:Blog(RSS)精选
AI 评分 64/100
Hugging Face 推出开放 AI 智能体排行榜(Open Agent Leaderboard)

Hugging Face 发布开放 AI 智能体排行榜,用于比较完整智能体系统而非仅底层模型,并同时报告成功率和每次任务成本。排行榜统一了六项已有基准测试(SWE-Bench Verified、BrowseComp+、AppWorld、tau2-Bench Airline & Retail、tau2-Bench Telecom),覆盖代码修复、网络研究、个人任务、客服和技术支持。通过统一协议,各智能体系统以相同接口连接所有基准。结果显示相同模型搭配不同智能体系统会产生显著不同的分数和成本。配套 Exgentic 框架用于运行和复现评估,相关论文开源。


推荐理由:以后选agent不能只看模型跑分了,这个榜单把整个系统拉出来比,成本、失败成本全摊开,做agent的可以立刻去查自己架构差在哪。
10:45
IT之家(RSS)精选
AI 评分 70/100
腾讯 AI 设计智能体 Ardot 公测:一句话生成可编辑设计稿,一键转代码

腾讯云正式公测自研AI设计智能体平台Ardot。该平台核心功能包括:用户通过一句话指令即可生成App页面、官网、海报等可编辑设计稿;支持调用团队自有组件库生成规范稿,并能直接导入Figma文件保留原有设计。同时,Ardot具备设计稿一键转换为代码的能力,可对接CodeBuddy等开发工具实现代码还原。平台还提供多人在线实时评论、标注反馈和版本对比等协作功能,其微信小程序即将上线。


推荐理由:一句话生成可编辑设计稿不稀奇,但一键转代码加兼容 Cursor 这套组合拳让 Ardot 成了产设研协作的一个新选项,做项目和产品的可以上手试试。

5月17日

星期日 · 6 条
21:50
Google DeepMind:Blog(RSS)精选
AI 评分 55/100
Gemini for Science:面向科学的AI实验与工具,开启发现新时代

Google 推出 Gemini for Science 项目,发布一系列基于 Gemini 模型的科学工具与实验性应用。该项目旨在扩展科学探索的规模与精度,通过人工智能辅助研究人员处理复杂计算、模拟实验系统并加速数据分析流程。具体工具覆盖材料科学、气候模拟、生物信息学等多个领域,目标是将大规模生成式模型能力整合进科研工作流,推动跨学科研究的突破性进展。

另有 3 家信源报道X:Google AI (@GoogleAI)X:Google DeepMind (@GoogleDeepMind)X:Google AI for Developers (@googleaidevs)
推荐理由:Google DeepMind把Co-Scientist和AlphaEvolve打包成实验工具集,试图用AI智能体加速假设生成、计算实验和文献综述。虽然还只是原型,但这是科学AI走向产品化的信号,科研人员可以试试。
09:02
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
Zerostack--一款采用纯Rust语言编写、受Unix启发的编程代理

Zerostack是一款采用纯Rust语言编写、受Unix哲学启发的编程代理工具,已正式发布1.0.0版本并在Rust包管理平台crates.io上提供。该发布在技术社区Hacker News上获得115点关注,反映出开发者对其的高度兴趣。Rust语言以内存安全和性能见称,Unix设计强调简洁与模块化,Zerostack结合两者优势,旨在提升编程效率,为代码辅助领域带来新选择。


推荐理由:不走 IDE 插件的老路,Zerostack 把编程代理做成命令行管道,Rust 纯血、Unix 哲学,适合喜欢拼接工具的开发者尝鲜。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
从可运行到可交付:基于多智能体测试驱动的开发范式用于从需求生成全栈Web应用

针对编码智能体生成的Web应用超70%不满足需求的问题,本文提出TDDev框架。该框架通过三阶段实现自动化闭环:先将需求转化为结构化测试,再通过浏览器模拟交互验证应用,最后将故障转化为修复报告。首次针对Web应用生成的TDD实证研究发现,引入TDD基础设施可提升质量34-48个百分点。关键结论是最佳协议需与模型生成风格匹配,不匹配将完全抵消TDD优势并最多增加25倍Token消耗。用户研究证实,该框架使人工干预降为零,开发转向自主反馈优化。


推荐理由:把TDD塞进多智能体代码生成,直接把Web应用的正确率从不到30%拉到70%以上,更重要的是他们发现给不同模型配错了开发协议反而会雪崩,做Agent工程的必读。
04:21
xAI@xai精选
AI 评分 65/100
Hermes Agent 现支持 X Premium 订阅与帖子搜索You can now use X Premium subscriptions in Hermes Agent, and Hermes Agent can now search X posts.https://x.ai/news/grok-hermes你现在可以在 Hermes Agent 中使用 X Premium 订阅,并且 Hermes Agent 现在可以搜索 X 帖子。 https://x.ai/news/grok-hermes 【引用 @xai】:You can now use your @grok subscription inside @NousResearch Hermes Agent. http://x.ai/news/grok-hermes

xAI: You can now use your @grok subscription inside @NousResearch Hermes Agent. http://x.ai/news/grok-hermes


推荐理由:xAI 把 Grok 和 X 搜索带到 Hermes Agent,看着是功能更新,其实在把自家数据和模型能力向第三方 agent 开放,这一步比新模型更值得追踪,做 agent 的该看看。
00:51
Ant Ling@AntLingAGI精选
AI 评分 80/100
社区协作再创佳绩,vLLM支持万亿级模型Another day0 collaboration, another community win. Thanks @vllm_project team for the always reliable support~ 🫡🫡又一次Day0协作,又一次社区胜利。感谢@vllm_project团队始终可靠的支持~ 🫡🫡

vLLM: Congrats to @AntLingAGI on Ring-2.6-1T going open! 🎉 The thinking sibling of Ling-2.6-1T — trillion-scale, built for ag...


推荐理由:蚂蚁百灵把万亿参数的 thinking 模型开源,vLLM 第一天就能跑,想自己搭 agent 推理服务的可以直接动手了,开源生态的齿轮转得比想象中快。

5月16日

星期六 · 3 条
15:42
IT之家(RSS)精选
AI 评分 75/100
突发!OpenAI 大规模重组,总裁 Brockman 夺权挂帅

OpenAI宣布进行史上最大规模重组,将ChatGPT、Codex和API三大核心产品线合并为统一组织。联合创始人兼总裁Greg Brockman正式全面接管产品战略,成为实际掌权者,而ChatGPT原负责人Nick Turley被调离核心岗位。此次重组旨在整合资源,聚焦“智能体时代”,并秘密开发集成多项功能的“超级应用”桌面端产品。与此同时,竞争对手Anthropic估值飙升至9000亿美元,使OpenAI面临严峻挑战。


推荐理由:OpenAI在IPO前夜突然把ChatGPT、Codex和API合并,Brockman亲自上阵,这不是例行架构调整,而是为了对抗Anthropic的估值反超和人才流失的一次绝境自救。想看懂OpenAI接下来怎么打Agent这张牌,这篇必须看。
15:17
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 56/100
销售团队如何使用 Codex

销售团队可利用 Codex 基于实际工作输入,自动生成一系列关键销售文档。具体功能包括创建管道简报、会议准备材料、预测审核、客户计划以及停滞交易诊断。这一应用将日常沟通与数据转化为结构化、可操作的销售支持内容,帮助团队提升效率与决策质量。


推荐理由:OpenAI 官方出的销售工作流指南,把 Codex 拆成一整套可复制的步骤,prompt 能直接复制用,销售团队省时间,但实质是已有功能的整理,不是信息增量。
06:57
Claude Code:GitHub Releases(RSS)精选
AI 评分 61/100
Claude Code v2.1.143 版本更新:插件管理与用户体验增强

Claude Code 发布 v2.1.143 版本,重点增强了插件管理功能,包括强制执行插件依赖关系,并新增了插件市场的预估上下文成本显示。为方便直接编辑工作副本,增加了 worktree.bgIsolation: "none" 设置。多项体验得到改进:后台会话唤醒后保留模型与努力级别设置;Windows PowerShell 工具默认绕过执行策略;claude agents 命令新增多个参数以配置默认会话。此外,本次更新修复了大量错误,包括修复损坏的 .credentials.json 文件导致 CLI 启动卡住、Windows Terminal 中的右键粘贴问题、后台会话错误捕获 IDE 文件引用,以及 macOS 上后台作业读取特定目录文件的权限错误等。


推荐理由:Claude Code 的 v2.1.143 是个纯修补版本,修了一大堆边缘 bug 外加几个小优化,对重度用户可能是救命稻草,其他人可以等下次大版本。