Topic · 主题全部主题 →

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

9,105条收录
1,107条精选

精选归档 · 第 52 页

1,0211,040 条 · 共 1,107

1月27日

星期二 · 1 条
09:53
Hugging Face:Blog(RSS)精选
AI 评分 83/100
解锁GPT-OSS的智能体强化学习训练:一项实践回顾

LinkedIn团队探索了将GPT-OSS模型作为智能体应用核心进行强化学习的可行性。实验发现,由于GPT-OSS采用的混合专家架构在两次前向传播中可能产生路由差异,导致在同策略PPO训练中出现重要性采样比率偏离、KL散度爆炸及奖励不增长的问题。团队通过一个关键修复——在同策略条件下强制将旧对数概率设置为新计算值(并分离梯度),确保了重要性采样比率为1,从而恢复了PPO同策略训练的完整性。该修复方案适用于GPT-OSS-20B及GPT-OSS-120B模型。


推荐理由:为MoE模型RL训练提供实用调试方案,提升代理AI开发效率。

1月22日

星期四 · 1 条
01:05
Nathan Lambert:Interconnects(RSS)精选
精通 Agents

AI Agents 的能力正逼近关键临界点,其性能飞跃已超出传统工作模式的承载范围。这要求从业者必须重新界定工作范畴、重构项目管理流程并革新任务执行策略。从需求规划到交付标准,现有方法论面临全面调整,组织与个人亟需掌握与智能体协作的新范式,以适应这一技术变革带来的深层影响。


推荐理由:Agent工具迫使开发者重构工作流,资深研究者分享进阶路径

1月21日

星期三 · 1 条
14:25
Hugging Face:Blog(RSS)精选
AI 评分 70/100
AssetOpsBench:弥合AI智能体基准测试与工业现实的差距

IBM Research在Hugging Face发布AssetOpsBench,这是一个工业资产运维的AI智能体基准测试框架。它基于真实场景构建,包含多行业数据集和超1000个运维事件,通过多阶段指标测试智能体的诊断、决策等能力,注重动态适应性、多模态处理和安全推理,以推动AI智能体走向实际工业应用。


推荐理由:首个面向工业资产运维场景的 Agent 基准,填补学术评测与真实落地的鸿沟

1月20日

星期二 · 1 条
08:00
Hugging Face:Blog(RSS)精选
AI 评分 73/100
Overworld发布实时交互式视频扩散模型Waypoint-1

Overworld推出实时交互式视频扩散模型Waypoint-1,用户可通过文本、鼠标和键盘实时控制生成可步入的虚拟世界。该模型基于帧因果校正流变换器架构,在1万小时游戏视频及对应控制数据上训练,从一开始就专注于交互体验,支持零延迟的自由操控。其配套的高性能推理库WorldEngine在消费级硬件上可实现流畅运行,例如Waypoint-1-Small在RTX 5090上能以30 FPS(4步去噪)或60 FPS(2步去噪)生成画面。模型采用扩散强制预训练和自我强制后训练来确保生成长序列的稳定性。


推荐理由:零延迟交互式视频生成,游戏和创意应用开发者的福音。

1月12日

星期一 · 1 条
22:23
Hacker News:AI 热帖精选
Agent-of-empires:OpenCode 与 Claude Code 会话管理器

Agent-of-empires(AoE)是一款支持 Linux 与 macOS 的 AI 编码代理会话管理器,兼容 Claude Code、OpenCode 等 9 种主流 AI 工具。该工具基于 tmux 实现会话持久化,支持在多分支代码库上并行运行多个代理,提供 Docker 沙盒隔离、Git worktrees 管理及实时状态检测,并可通过 Web 仪表板或 Cloudflare 隧道从手机远程访问,解决多代理协作时的状态追踪与工作环境隔离问题。


推荐理由:同时管理多个AI编码代理,手机远程监控不再乱套

1月10日

星期六 · 1 条
01:42
Nathan Lambert:Interconnects(RSS)精选
Claude Code 与众不同

Claude Code 集成 Opus 4.5 模型实现关键突破,编程智能体跨越重要能力阈值。此次升级标志着编码代理在自主性和工程处理能力上达到新水平,可应对更复杂的开发任务。Opus 4.5 显著提升了代码生成、调试及复杂问题解决的表现,使 AI 辅助编程从基础工具向高效协作伙伴转变,为开发者带来质的不同的使用体验与效率提升。

另有 3 家信源报道Nathan Lambert:Interconnects(RSS)X:Kim (@kimmonismus)Gary Marcus:The Road to AI We Can Trust(RSS)
推荐理由:编码 Agent 跨越关键门槛,Claude Code 能力跃升将重塑开发者工作流

1月9日

星期五 · 1 条
00:00
Anthropic:Engineering(事故复盘 + 工程实践 · 网页)精选
AI 评分 75/100
揭秘AI智能体评估:构建可靠系统的关键

有效的评估能帮助团队更自信地发布AI智能体,避免陷入仅在生产环境被动发现问题、修复可能引发新问题的循环。智能体因其多轮操作的自主性与灵活性,评估更为复杂。一个完整的评估结构包含任务、评分器、记录、结果、评估框架与评估套件等核心组件。缺乏系统评估将导致团队无法区分真实的质量倒退与随机波动。建立评估体系能帮助团队在智能体规模化过程中持续监控质量、自动测试变更并量化改进效果,其价值在智能体整个生命周期内持续累积。


推荐理由:Anthropic 把内部踩过的坑全摊开了,从 eval 设计到 grader 选型到 transcript 审读,是目前最完整的 Agent 评估工程指南,做 Agent 产品的团队可以直接当手册用。

1月1日

星期四 · 1 条
00:00
Dario Amodei:Blog(网页)精选
技术的青春期

Dario Amodei 将当前 AI 发展阶段定义为「技术的青春期」,认为人类即将获得难以想象的力量,但社会和政治系统是否具备驾驭成熟度仍存疑。文章强调需避免「末日论」式恐慌,以务实、基于事实的方式讨论风险,同时承认 AI 发展速度和风险的不确定性。作者主张通过企业自愿行动与精准政府监管相结合,在避免过度干预的前提下应对潜在危险,为可能到来的更强有力行动储备证据和方案。

另有 1 家信源报道Dario Amodei:Blog(网页)
推荐理由:Anthropic CEO 长文剖析 AI 文明风险与治理路径,值得深读。

12月30日

星期二 · 1 条
08:00
xAI:News(网页)精选
xAI推出Grok Business与Enterprise企业版

xAI发布Grok Business和Grok Enterprise企业版。Business版定价30美元/座位/月,支持自助开通,提供团队管理、统一账单及Google Drive集成(保留原文件权限),并承诺用户数据永不用于模型训练。Enterprise版面向大型组织,提供Custom SSO、Directory Sync及高级审计控制;可选的Enterprise Vault插件提供独立数据平面与客户自管加密密钥(CMEK),实现应用级加密隔离。平台支持实时使用监控、安全对话共享及Projects功能。


推荐理由:xAI 推出 Grok 企业版,主打隐私保护与 Agent 能力,月费 30 美元起

12月29日

星期一 · 1 条
02:11
Jim Fan@DrJimFan精选
机器人领域的三大困境:硬件可靠性、基准测试与VLA局限Everyone's freaking out about vibe coding. In the holiday spirit, allow me to share my anxiety on the wild west of robotics. 3 lessons I learned in 2025.1. Hardware is ahead of software, but hardware reliability severely limits software iteration speed.We've seen exquisite engineering arts like Optimus, e-Atlas, Figure, Neo, G1, etc. Our best AI has not squeezed all the juice out of these frontier hardware. The body is more capable than what the brain can command. Yet babysitting these robots demands an entire operation team. Unlike humans, robots don't heal from bruises. Overheating, broken motors, bizarre firmware issues haunt us daily. Mistakes are irreversible and unforgiving.My patience was the only thing that scaled.2. Benchmarking is still an epic disaster in robotics.LLM normies thought MMLU & SWE-Bench are common sense. Hold your 🍺 for robotics. No one agrees on anything: hardware platform, task definition, scoring rubrics, simulator, or real world setups. Everyone is SOTA, by definition, on the benchmark they define on the fly for each news announcement. Everyone cherry-picks the nicest looking demo out of 100 retries.We gotta do better as a field in 2026 and stop treating reproducibility and scientific discipline as second-class citizens.3. VLM-based VLA feels wrong.VLA stands for "vision-language-action" model and has been the dominant approach for robot brains. Recipe is simple: take a pretrained VLM checkpoint and graft an action module on top. But if you think about it, VLMs are hyper-optimized to hill-climb benchmarks like visual question answering. This implies two problems: (1) most parameters in VLMs are for language & knowledge, not for physics; (2) visual encoders are actively tuned to *discard* low-level details, because Q&A only requires high-level understanding. But minute details matter a lot for dexterity.There's no reason for VLA's performance to scale as VLM parameters scale. Pretraining is misaligned. Video world model seems to be a much better pretraining objective for robot policy. I'm betting big on it.硬件方面,Optimus等虽工程精湛,但可靠性不足严重限制软件迭代,且维护成本高昂。基准测试领域仍处混乱,缺乏统一的硬件平台、任务定义和评分标准,cherry-picking现象普遍,可复现性堪忧。VLA(Vision-Language-Action)方法基于VLM存在本质缺陷:VLM为视觉问答优化,参数侧重语言知识而非物理理解,且视觉编码器丢弃低层细节,不利于精细操作。作者认为视频世界模型是更优的预训练目标。

推荐理由:NVIDIA科学家揭示机器人学三大痛点:硬件拖累迭代、基准混乱、VLA路线存在根本缺陷

12月27日

星期六 · 1 条
03:22
Jim Fan@DrJimFan精选
2024:AI 是 copilot 2025+:人类是 copilot Copilot 是新的工程技能。离开驾驶座并不容易--我们必须学会用 AI 的方式思考,并适应陌生的工作流。帮助 AI 帮助我们自己。 【引用 @karpathy】:作为程序员,我从未感到如此落后。这个职业正在被剧烈重构,因为程序员贡献的比特越来越稀疏且穿插其间。我感觉如果能恰当地串联起过去大约一年里出现的东西,我可以强大 10 倍,而未能获得这种提升感觉绝对是技能问题。除了下面通常的层之外,还有一个新的可编程抽象层需要掌握,涉及代理、子代理、它们的提示词、上下文、记忆、模式、权限、工具、插件、技能、钩子、MCP、LSP、斜杠命令、工作流、IDE 集成,以及需要建立一个全面的心理模型来理解那些本质上随机的、易错的、不可理解的且不断变化的实体的优势和陷阱,这些实体突然与过去那种传统的工程实践交织在一起。显然某种强大的外星工具被传递开来,只是它没有附带说明书,每个人都必须弄清楚如何握持和操作它,而由此产生的 9 级地震正在震撼这个职业。卷起袖子以免落后。2024: AI is the copilot 2025+: humans are the copilot Copilot is the new engineering skill. It’s not easy to leave the driver seat - we must learn to think the AI way and adapt to the alien workflows. Help AI help ourselves.2024:AI 是 copilot 2025+:人类是 copilot Copilot 是新的工程技能。离开驾驶座并不容易--我们必须学会用 AI 的方式思考,并适应陌生的工作流。帮助 AI 帮助我们自己。 【引用 @karpathy】:作为程序员,我从未感到如此落后。这个职业正在被剧烈重构,因为程序员贡献的比特越来越稀疏且穿插其间。我感觉如果能恰当地串联起过去大约一年里出现的东西,我可以强大 10 倍,而未能获得这种提升感觉绝对是技能问题。除了下面通常的层之外,还有一个新的可编程抽象层需要掌握,涉及代理、子代理、它们的提示词、上下文、记忆、模式、权限、工具、插件、技能、钩子、MCP、LSP、斜杠命令、工作流、IDE 集成,以及需要建立一个全面的心理模型来理解那些本质上随机的、易错的、不可理解的且不断变化的实体的优势和陷阱,这些实体突然与过去那种传统的工程实践交织在一起。显然某种强大的外星工具被传递开来,只是它没有附带说明书,每个人都必须弄清楚如何握持和操作它,而由此产生的 9 级地震正在震撼这个职业。卷起袖子以免落后。

Andrej Karpathy: I've never felt this much behind as a programmer. The profession is being dramatically refactored as the bits contribute...


推荐理由:顶级研究者警示编程职业正被重构,掌握Agent编排成为工程师新必修课

12月23日

星期二 · 1 条
03:57
Saining Xie@sainingxie精选
不想陷入哲学辩论,但这本书确实改变了我对这个话题的看法,让我更加谦逊。人类智能令人印象深刻,但称其为"通用"并不太客观。我的猫会不同意。 在我看来,人类智能更应被视为社会驱动的认知适应,而且我们仍不理解、也远未用当前 AI 复现的智能领域还有巨大 WORLD。 【引用 @demishassabis】:Yann 在这里完全错了,他把通用智能和 universal intelligence 混淆了。 大脑是我们在宇宙中所知最精致、最复杂的现象(迄今为止),而且它们实际上极其通用。 显然,没有人能规避 no free lunch theorem,因此在实际且有限的系统中,总是必须围绕正在学习的目标分布有一定程度的专门化。 但关于通用性的要点在于,理论上,在 Turing Machine 的意义上,这种通用系统的架构能够在给定足够时间和内存(以及数据)的情况下学习任何可计算的东西,而人脑(和 AI foundation models)是近似 Turing Machines。 最后,关于 Yann 对国际象棋棋手的评论,人类竟然能发明国际象棋(以及现代文明的所有其他方面,从科学到 747s!),更不用说像 Magnus 这样的人能下得如此出色,这本身就令人惊叹。他可能不是严格最优的(毕竟他有有限的记忆和有限的决策时间),但考虑到我们的大脑是为狩猎采集而进化的,他以及我们能用大脑做到这些,实在令人难以置信。not getting into a philosophical debate, but this book really changed how I see the topic and made me feel more humble. human intelligence is impressive, but calling it ‘general’ isn’t very objective. my cat would disagree. to me human intelligence is better seen as socially driven cognitive adaptations, and there’s a huge WORLD of intelligence we still don’t understand, and are nowhere near recreating with current AI不想陷入哲学辩论,但这本书确实改变了我对这个话题的看法,让我更加谦逊。人类智能令人印象深刻,但称其为"通用"并不太客观。我的猫会不同意。 在我看来,人类智能更应被视为社会驱动的认知适应,而且我们仍不理解、也远未用当前 AI 复现的智能领域还有巨大 WORLD。 【引用 @demishassabis】:Yann 在这里完全错了,他把通用智能和 universal intelligence 混淆了。 大脑是我们在宇宙中所知最精致、最复杂的现象(迄今为止),而且它们实际上极其通用。 显然,没有人能规避 no free lunch theorem,因此在实际且有限的系统中,总是必须围绕正在学习的目标分布有一定程度的专门化。 但关于通用性的要点在于,理论上,在 Turing Machine 的意义上,这种通用系统的架构能够在给定足够时间和内存(以及数据)的情况下学习任何可计算的东西,而人脑(和 AI foundation models)是近似 Turing Machines。 最后,关于 Yann 对国际象棋棋手的评论,人类竟然能发明国际象棋(以及现代文明的所有其他方面,从科学到 747s!),更不用说像 Magnus 这样的人能下得如此出色,这本身就令人惊叹。他可能不是严格最优的(毕竟他有有限的记忆和有限的决策时间),但考虑到我们的大脑是为狩猎采集而进化的,他以及我们能用大脑做到这些,实在令人难以置信。

Demis Hassabis: Yann is just plain incorrect here, he’s confusing general intelligence with universal intelligence. Brains are the most ...


推荐理由:顶级科学家对AGI本质的深刻思辨,重新定义通用智能的边界与局限

12月22日

星期一 · 2 条
08:00
xAI:News(网页)精选
以 AI 支持 DOW 的使命

xAI 被美国战争部(DOW)选中,为其 GenAI.Mil 套件提供 Frontier AI 系统。基于 Grok 模型的解决方案将覆盖 DOW 旗下 300 万军事和文职人员,支持 Impact Level 5(IL5)级别的企业 AI 和关键任务用例,可嵌入从五角大楼到战术边缘的日常工作流,并支持机密作战工作负载。DOW 用户还可独家获取 X 平台实时全球洞察。

另有 1 家信源报道xAI:News(网页)
推荐理由:xAI获美国国防部大单,Grok将覆盖300万军事人员并提供实时情报支持
00:00
智谱:研究(网页内嵌数据)精选
GLM-4.7:更强的 Coding

GLM-4.7 发布,编程能力显著提升。SWE-bench 达 73.8%(+5.8%),Terminal Bench 2.0 达 41%(+16.5%),支持 Claude Code 等主流智能体框架。新增交错式思考、保留式思考和轮级思考功能,可控制推理过程以降低延迟或提高准确性。同步改进 UI 生成、工具调用和数学推理能力,可通过 API 或本地部署使用。


推荐理由:智谱发布GLM-4.7,编程Agent能力大幅提升,支持Claude Code等主流框架和Vibe Coding。

12月18日

星期四 · 1 条
08:00
OpenRouter:Announcements(RSS)精选
AI 评分 61/100
Response Healing:将 JSON 缺陷减少 80% 以上

OpenRouter 推出新功能 Response Healing,可在 LLM 生成的畸形 JSON 响应抵达用户应用前自动修复。该功能旨在将 JSON 格式错误减少超过 80%,直接提升 API 响应的结构完整性与可靠性,减少下游应用的处理负担。


推荐理由:做 Agent 的人最怕 JSON 解析炸掉整个 pipeline,OpenRouter 这个 Response Healing 相当于在网关层加了自动纠错,接入成本几乎为零,值得试试。

12月17日

星期三 · 1 条
08:00
xAI:News(网页)精选
xAI 发布 Grok Voice Agent API

xAI 开放 Grok Voice Agent API,基于自研语音栈(VAD、tokenizer、音频模型),Big Bench Audio 基准排名第一,首音频延迟低于 1 秒(比竞品快近 5 倍),定价 $0.05/分钟。支持数十种语言自动切换、实时搜索 X 和网页、调用自定义工具,已深度集成特斯拉车机。提供 Ara、Eve 等多种自然声线,支持 [whisper] 等听觉标签,兼容 OpenAI Realtime API 规范。


推荐理由:xAI发布Grok语音Agent API,延迟低于1秒且定价仅为OpenAI一半,已集成至Tesla车载系统

12月16日

星期二 · 1 条
00:01
Hugging Face:Blog(RSS)精选
AI 评分 83/100
CUGA 登陆 Hugging Face:普及可配置的通用 AI 智能体

开源可配置通用智能体 CUGA 现已集成至 Hugging Face Spaces,便于开发者便捷实验。该智能体在复杂任务基准测试中表现卓越,在包含 457 个 API、750 个真实任务的 AppWorld 基准排名第一,在 WebArena 基准也位居前列。其核心提供可配置的推理模式以平衡性能与成本,支持计算机使用与多工具无缝集成,并能与 Langflow 结合进行低代码工作流设计。采用 Apache 2.0 许可的 CUGA 支持多种开源模型,在高性能推理平台(如 Groq)上运行能显著提升效率。


推荐理由:开源AI代理框架性能领先,集成Hugging Face和Langflow,开发者可快速构建复杂任务。

12月9日

星期二 · 1 条
00:00
Claude:Blog(网页)精选
Anthropic调研:2026年企业AI智能体应用趋势

Anthropic与Material调研500余位技术领导者显示,57%企业已将AI智能体用于多阶段工作流,16%实现跨职能部署。编码是核心场景,90%用于开发辅助,86%用于生产代码,平均节省近六成时间。80%受访者称投资已产生可衡量回报,如Thomson Reuters将法律检索从数小时缩短至分钟级。2026年81%企业计划处理更复杂用例,但面临系统集成、数据质量和变革管理三大挑战。


推荐理由:Anthropic发布企业AI Agent深度调研,揭示2026年应用趋势与头部企业实战案例

12月8日

星期一 · 1 条
00:00
智谱:研究(网页内嵌数据)精选
GLM-4.6V:支持原生工具调用的开源多模态模型

智谱开源GLM-4.6V系列多模态模型,含106B-A12B基础版与9B轻量版Flash,支持128k tokens上下文。首次原生集成Function Call能力,支持图像、截图直接作为工具参数,并能理解工具返回的视觉内容。具备复杂文档理解、视觉网页搜索、前端代码生成及交互式编辑能力,适用于构建多模态Agent。已上架GitHub、Hugging Face及魔搭社区。


推荐理由:智谱开源 GLM-4.6V,原生支持工具调用的多模态 Agent 底座

12月3日

星期三 · 1 条
21:45
蚂蚁 inclusionAI:GitHub 新仓库精选
AI 评分 63/100
蚂蚁集团开源AState:面向强化学习的高性能状态管理系统

蚂蚁集团开源了AState,这是一个专为强化学习设计的高性能通用状态数据管理系统。它旨在解决RL训练与推理中的I/O效率低下、权重同步性能不足及状态恢复不鲁棒等核心挑战。系统采用三层架构:提供张量原生接口的API层、支持多种部署模式的服务层以及具备高效可扩展传输能力的基础层。其关键特性包括统一的张量级API、高性能权重同步和拓扑感知设计。在万亿参数规模下,AState能在约6秒内完成权重同步,远低于业界常见的分钟级延迟,目前已作为ASystem的关键组件在蚂蚁内部生产环境部署。


推荐理由:蚂蚁把万亿参数 RL 训练的权重同步从分钟级压到 6 秒,这套 AState 系统是真刀真枪的工程解法,做大规模 RL infra 的团队值得拆一拆它的 RDMA P2P 架构。