Topic · 主题全部主题 →

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

9,103条收录
1,107条精选

精选归档 · 第 41 页

801820 条 · 共 1,107

5月6日

星期三 · 4 条
03:12
Tomer Tunguz 博客(VC 分析)精选
AI 评分 55/100
优化软件工厂

软件工程团队中AI与人力比例的选择核心在于韧性而非吞吐量。在10/90比例下,约20名工程师使用Copilot等AI工具,保持传统层级结构;50/50比例时,12名工程师管理代理群,角色转向解决方案架构;90/10比例则仅需3名工程师核心操控自主代理,负责生成、测试和部署,无管理层级。高AI比例虽提升效率,但知识集中于少数人,团队利用率达100%,一旦人员离职将引发严重风险。借鉴制造业70-90%利用率原则,保持冗余可增强系统稳健性。因此,目前大多数初创公司不宜过度依赖AI。


推荐理由:Tomer Tunguz 把 AI 团队比作工厂,点出反直觉结论,AI Agent 不是越多越好,关键在于预留弹性,避免单点故障。做工程管理的读完会重新算一算配比。

5月5日

星期二 · 12 条
17:32
Runway:News(网页)精选
AI 评分 80/100
从单张图像构建实时视频智能体:Runway Characters技术解析

Runway公司推出“Characters”实时视频智能体,它能将任意单张参考图像(如真人、卡通或幻想生物照片)实时转化为具有自然对话表现力的视频角色。该技术基于其通用世界模型GWM-1,无需微调即可生成每秒24帧的高清视频,并同步口型、表情和头部运动。其核心突破在于通过自回归逐帧生成、流程优化与并行化,实现了每帧仅37毫秒的模型处理时间,以及从用户停止说话到角色开始响应仅1.75秒的服务器端延迟,从而满足了实时交互对话的严苛要求。


推荐理由:把单张图变成实时对话角色这件事,Runway 做到了 24fps 且 1.75 秒响应。不是预录,是真实时,还带了知识库和工具调用,做虚拟角色产品的可以直接拿来集成。
12:17
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 75/100
MolmoAct2:面向真实世界部署的动作推理模型

MolmoAct2 是一个为实际部署设计的全开放动作推理模型,在五个方面取得进展。其核心是专为空间与具身推理训练的 VLM 骨干 MolmoER,基于 330 万样本语料库训练。团队发布了三个新数据集,包括迄今最大开放双手数据集 MolmoAct2-BimanualYAM(720 小时遥操作轨迹),并开源了动作分词器 OpenFAST。模型采用层间 KV 缓存条件化架构,嫁接连续动作专家,还引入自适应深度推理变体 MolmoThink,以极低延迟保持几何基础。在广泛实证研究中,MolmoAct2 在 7 个仿真与真实世界基准上超越 Pi-05 等基线,MolmoER 在 13 个具身推理基准上超过 GPT-5 和 Gemini Robotics ER-1.5。模型权重、训练代码与数据均已公开。


推荐理由:开源具身动作推理模型首次全面超越 GPT-5 和 Gemini Robotics,还附赠最大的双手操作数据集和全套训练代码,做机器人的同学本周必读。
12:16
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
AI 评分 62/100
OpenAI 与 PwC 合作重塑 CFO 办公室

OpenAI 与普华永道宣布合作,旨在通过AI智能体帮助企业自动化财务工作流程、改进预测、强化控制并实现首席财务官职能的现代化。双方将把OpenAI的企业版ChatGPT等工具整合到普华永道的服务中,为数千名员工提供高级AI访问权限,以处理财务分析、税务、咨询等任务。这一合作标志着专业服务公司首次大规模应用生成式AI,目标是提升效率、减少人工错误并推动财务职能的战略转型。


推荐理由:OpenAI 和普华永道的合作,算是 AI 代理攻入企业财务腹地的正式信号,如果你是 CFO 或财务转型负责人,可以看看他们打算怎么重构风控和预测,但普通开发者可以跳过。
11:17
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 70/100
T^2PO:面向稳定多轮智能体强化学习的不确定性引导探索控制框架

多轮强化学习训练常因探索效率低下而不稳定。为此,研究团队提出T^2PO框架,在细粒度层面实施不确定性引导的探索控制。在令牌级别,它监测不确定性动态,当边际变化低于阈值时触发思考干预;在轮次级别,它识别探索进展可忽略的交互并动态重采样,以避免无效计算。在WebShop、ALFWorld和Search QA等多个环境中的评估表明,T^2PO显著提升了训练稳定性与任务性能,并实现了更高效的探索。相关代码已开源。


推荐理由:多轮 agent 训练最怕训着训着崩了,这篇从 token 和 turn 两级控制探索的思路很妙,直接把低效 rollout 砍掉,稳定性和效率都上去了,做 RLHF 或 agent RL 的可以认真看一下。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 73/100
RLDX-1技术报告

为提升视觉-语言-动作模型在复杂现实任务中的功能覆盖,研究团队推出通用机器人策略RLDX-1。该模型基于多流动作变换器架构,整合运动感知、记忆决策与物理传感等异构模态,并辅以合成罕见场景数据、仿人操作学习流程及实时推理优化等系统设计。在仿真与真实测试中,RLDX-1全面超越前沿模型π_{0.5}和GR00T N1.6,尤其在ALLEX人形机器人任务上取得86.8%的成功率,显著高于对照模型的约40%,标志着其在接触密集型动态灵巧操作领域取得关键进展。


推荐理由:在 ALLEX 人形任务上把成功率从 40% 拉到 86.8%,RLDX-1 证明了多模态流架构对灵巧操作的价值,做机器人的同学可以重点关注一下。
07:30
Apple Machine Learning Research(RSS)精选
AI 评分 66/100
PORTool: 基于奖励树和重要性感知的策略优化方法,用于多工具集成推理

研究团队提出PORTool算法,以解决多工具集成推理中仅依靠结果奖励导致的信用分配模糊问题。该方法通过重要性感知策略优化,在结果级监督下强化智能体的工具使用能力,同时实现步骤级奖励分配。PORTool生成奖励树来明确关键决策步骤,从而更精确地引导模型学习有效的工具调用序列,提升复杂任务解决的效率和可靠性。


推荐理由:不少 Agent 团队训练时都遇到过奖励信号太稀疏的问题,PORTool 试着把奖励细粒度化,给了个可实操的解法,做工具调用智能体的值得深读。
07:16
Claude Code:GitHub Releases(RSS)精选
AI 评分 60/100
v2.1.128版本更新

本次更新包含多项功能优化与错误修复。主要功能上,/color 命令支持无参数随机选色,/mcp 命令显示已连接服务器的工具数量,--plugin-dir 参数新增支持 .zip 插件包。用户体验方面,优化了 /model 选择器的显示。关键问题修复包括:解决了通过标准输入传输超大文件时导致的崩溃循环、修复了长 URL 在全屏模式下无法逐行点击的问题,以及修正了并行 Shell 工具调用中一个命令失败会错误取消同级调用的问题。此外,还处理了 MCP 服务器重连时工具列表刷屏等多个稳定性问题。


推荐理由:Claude Code 的日常维护版本,修了一堆小 bug 并给了 /color 随机色、插件支持 zip 等细节提升,重度用户建议升,非用户不必关注。
02:18
Rohan Paul@rohanpaul_ai精选
AI 评分 74/100
桌面AI代理KroWork发布:将对话转化为持久本地软件,解决会话即失痛点Newly launched KroWork, a desktop AI agent, is targeting the biggest weakness of AI agents: every useful run usually dies with the session.So with KroWork, you describe a task once, the AI agent builds the workflow, and then you can save it as software you actually keep.The conversation becomes something persistent, local, and reusable.Everything runs on your machine. Your files, your data, your device. Nothing leaves. No cloud dependency.No programming background needed. Open the app, describe what you need, done.新推出的桌面AI代理KroWork旨在解决传统AI代理工作流随会话结束而消失的核心痛点。用户通过自然语言描述任务,AI即可自动构建并执行端到端工作流,最终可将完整流程保存为名为"Kro App"的持久性本地应用程序。该软件可一键安装至系统菜单,像常规软件一样运行,后续使用无需消耗tokens或重新构建。所有流程均在用户本地设备运行,无云端依赖,不泄露数据,且无需编程背景。其核心理念是实现从"聊天"到"交付"的跨越,将对话转化为用户真正拥有的可重用资产。

KroWork: Your AI chatbot can't ship. It answers. It suggests. It generates code you still have to wire up yourself. Close the tab...


推荐理由:KroWork 把 AI 会话固化成本地软件,一键安装,这个思路解决了 Agent 最大的痛点,每次重跑都得重新教它。做个人自动化的可以立即上手试试。
01:16
Simon Willison 博客精选
AI 评分 75/100
Redis 数组类型交互式体验平台上线

Redis创始人Salvatore Sanfilippo提交了为Redis新增数组数据类型的PR,引入了包括ARCOUNT、ARDEL、ARGREP等在内的18个新命令。其中最引人注目的是ARGREP命令,它利用新集成的TRE正则表达式库,可直接在服务器端对数组值进行正则搜索。目前该功能已在一个分支中实现,开发者Simon Willison借助Claude Code构建了一个交互式在线沙盒,通过运行在浏览器中的WASM版Redis子集,供用户体验这些新命令。Salvatore还撰文详细介绍了在AI辅助下开发此功能的历程。


推荐理由:Redis 加数组类型可能改变很多缓存设计,Simon 这个 WASM playground 是把 PR 变成可试产品的最快路径,后端同学可以直接上手体会 ARGREP 的快乐。

5月4日

星期一 · 4 条
23:00
03:50
Peter Steinberger 🦞@steipete精选
AI 评分 74/100
开源维护机器人自动化处理流程This is the most useful tooling I built for OpenClaw to date. It's open source, runs on codex and you can fork and use it for any repo.For all the hard working oss folks that drown in issues and PRs, this is for you.这是我迄今为止为 OpenClaw 构建的最有用的工具。它是开源的,运行在 codex 上,你可以 fork 并将其用于任何代码库。 献给所有在 issue 和 PR 中辛勤工作的开源贡献者们,这是为你们准备的。

OpenClaw🦞: ClawSweeper 0.2.0 🦞 The OpenClaw maintenance bot now handles the loop: issue → @clawsweeper fix/build → guarded PR → re...


推荐理由:开源维护者的救命稻草,把 issue 到 automerge 的冗长循环扔给 ClawSweeper 自动修复,保守但足够实用,fork 就能用在任何仓库。
01:51
Tibo@thsottiaux精选
AI 评分 75/100
OpenAI发布Auto-Review模式,审批效率提升200倍Last week, we released *Auto-Review* mode in Codex! It is now the default within OpenAI and reduces amount of approvals needed by ~200X. Amazing work from our alignment team.Read the blog at https://alignment.openai.com/auto-review上周,我们在 Codex 中发布了 *Auto-Review* 模式!它现已成为 OpenAI 内部的默认设置,并将所需的批准数量减少了约 200 倍。我们的对齐团队完成了出色的工作。 阅读博客:https://alignment.openai.com/auto-review

Maja Trebacz: Clicking the "Approve permission" button is difficult. We show that agents can do that for you. Check out our alignment ...


推荐理由:Codex 这个自动审查模式把审批量砍了 200 倍,而且已经成了 OpenAI 内部默认设置。这意味着 AI 编程 Agent 真正开始被信任,做 Agent 工作流的人可以认真研究一下。