精选归档 · 第 2 页
第 21–40 条 · 共 236 条
21:29
OpenBMB@OpenBMB精选 面壁智能ALIGN:自动对齐智能体与环境接口Everyone building LLM agents pours effort into the agent's strategy or into harder environments. The interface between them gets almost no attention, and it is often where agents actually break.Case in point in ALFWorld: an agent tries examine shelf 1, but the env requires go to first, so it just returns "Nothing happens", and the agent concludes the shelf is empty. Simply rewording that feedback lifts a Qwen2.5-7B agent from 13.4% to 31.3%.ALIGN from @TsinghuaNLP (OpenBMB member) automatically generates aligned interfaces to fix this misalignment.
Paper: https://arxiv.org/abs/2505.21055
Code: https://github.com/THUNLP-MT/ALIGN1⃣️ The problem is agent-environment misalignment: the agent's expectation of what an action does diverges from the environment's real transitions, because implicit rules and under-specified observations are never surfaced. The paper shows this is a pervasive bottleneck, not an agent reasoning failure.2⃣️ ALIGN wraps the environment with two modules. INFERRULES surfaces static rules and constraints (preconditions, action ordering) before the task; WRAPSTEP intercepts each action and enriches the raw observation with success/failure conditions. It is a lightweight Python wrapper, no changes to agent logic or environment code.3⃣️ Interfaces are generated iteratively by an Analyzer (diagnoses misalignments from failed trajectories) and an Optimizer (synthesizes and refines the interface as Python functions). Both run experimental verification against the live environment to fight hallucination; ablating it collapses accuracy.4⃣️ Across four benchmarks in embodied, web, and tool-use, gains reach +45.67% success on ALFWorld and cut consecutive invalid actions by 65%. Interfaces transfer plug-and-play across agent architectures (ReAct, Self-Consistency, Planning...) and across LLM backbones (Qwen, Llama) with no regeneration.译面壁智能与清华NLP团队提出ALIGN,自动生成对齐接口解决智能体与环境间的失配问题。仅改写反馈措辞即可将Qwen2.5-7B智能体在ALFWorld上的成功率从13.4%提升至31.3%。该方法在四个基准上最高提升45.67%成功率,并减少65%连续无效动作,且接口可跨智能体架构和LLM骨干迁移。
推荐理由:做 agent 的人都知道环境对齐是个隐形的坑,这篇论文不仅把问题讲透了,还给了开箱即用的 wrapper,ALFWorld 上成功率从 13% 拉到 31%,原因只是改写了反馈措辞,我觉得这是今年 agent 工程最被低估的发现。
08:52
llm-chat-completions-server 0.1a0 发布Simon Willison 发布 llm-chat-completions-server 0.1a0 插件,可在本地 9001 端口启动一个兼容 OpenAI Chat Completions API 的服务器,暴露 LLM 工具中所有已安装的模型。
推荐理由:Simon 把 LLM 工具变成了兼容 OpenAI 的 API 服务器,开发者可以本地直接用任何模型,省去适配工作,安装即用,实用性强。
18:04
实测 ego lite:给 Codex 浏览器自动化加到 2.5 倍速开源浏览器自动化项目 ego lite(5.9k star)实测:基于 Chromium 内核定制的独立浏览器,让人和 Agent 共享同一浏览器但各自独立 Space 工作,支持迁移 Chrome 登录态。
推荐理由:作者实测发现,从内核提取结构化信息再批量执行脚本,可大幅降低自动化任务的Token消耗和操作轮次,尤其在多账号场景下比外挂式方案更稳定。
08:56
OpenRouter:Announcements(RSS)精选
OpenRouter 推出专用 LangChain 集成包,支持 400+ 模型与自动故障切换OpenRouter 发布了 langchain-openrouter(Python)和 @langchain/openrouter(TypeScript)专用包,让 LangChain 应用无需改造即可调用 400+ 模型和 70+ 提供商。ChatOpenRouter 自动处理负载均衡与故障切换,切换模型只需修改 provider/model 格式的字符串。
推荐理由:OpenRouter官方的LangChain专用包,替换掉了用ChatOpenAI加base_url的老路子,但从零折腾一次安装配置的必要性,只对已绑定OpenRouter的团队成立。
00:27
Gemini API Managed Agents 默认升级为 3.6 Flash,新增环境钩子与免费套餐Google DeepMind 将 Gemini API Managed Agents 的默认模型升级为 Gemini 3.6 Flash,并支持显式选择 3.5 Flash 或 3.5 Flash-Lite。新增环境钩子允许在沙箱内工具调用前后执行自定义脚本,用于安全审查或代码格式化。此外,还推出了免费套餐、预算控制和基于 cron 的定时触发功能。
推荐理由:Gemini 的 managed agents 把钩子机制和预算控制做进了官方 API,对重度依赖 agent 做代码审计和任务的团队是个实用升级,Offdeal 已经用上了。
15:52
豆包搜索开放服务,为Agent提供实时、权威、可信的搜索能力火山引擎正式上线豆包搜索服务,为企业和开发者构建AI Agent提供跨语言、多模态、多垂类的联网信息查询引擎。该服务支持API、Skill、MCP等多种接入形态,也可在Agent Plan中一键配置启用,并提供每月500次免费搜索额度。豆包搜索已在SimpleQA、FreshQA、BrowseComp-ZH等多项公开评测中表现优异,并服务国内9成TOP手机厂商的智能助手。
推荐理由:搜索服务从单次查询升级为 Agent 的持续信息流,权威分级过滤低质内容,Agent Plan 一键接入降低了企业构建深度联网 Agent 的集成成本。
02:27
用Claude和Python构建技能驱动的金融分析智能体本教程基于Anthropic的financial-services仓库,用纯Python复现其技能驱动架构。通过解析SKILL.md文件构建可搜索技能注册表,并创建可复用SkillAgent,将金融分析剧本注入Anthropic Messages API,支持迭代工具调用循环。
推荐理由:这个教程把手教你将 Anthropic 的金融技能库打包成可运行的 Python 代理,不是概念演示而是完整工作流,做金融 AI 落地的可以直接抄。
20:30
百度搭子更新:电脑手机接力、桌面端内嵌浏览器上线,复杂任务可跨端连续执行百度搭子在近期AI Day上推出多项升级,支持电脑与手机双端互联,同步任务上下文与执行进度,用户可跨设备接力完成复杂工作。桌面端内嵌浏览器正式上线,能自动打开多个网页执行调研、下载等操作,手机端支持云端远程操控。智能路由自动匹配任务模式,平均任务耗时降低20%,Token利用率提升25%;简单任务完成度达100%,复杂任务高交付率94%,积分消耗最高降低75%。
推荐理由:百度搭子这次把跨端协同和浏览器自动化做成了标配,从'能不能用'到'好不好用',真正解放打工人的复杂工作流,实用度很高。
19:11
Google AI:DEV 作者专属(RSS)精选
Google Cloud Agent Skills 完整指南:从基础到高级云运维Google Cloud 推出官方 Agent Skills 开源指令集,旨在让 AI 编码智能体安全、高效地执行多步骤云操作。该仓库基于 agentskills.io 开放标准,目前收录 70 多项技能,涵盖安全审计、无服务器部署、BigQuery 优化等 8 个类别。技能采用渐进式披露模型,通过验证工作流、安全门控和上下文感知机制,防止智能体盲目执行破坏性命令。
推荐理由:这是 Google Cloud Skills 系列教程第一篇,从安装到触发讲得很细,把 Agent Skills 的“渐进式披露”和安全门机制都拆解了,适合想让 AI 编码代理帮你管云资源的开发者。
02:20
Cursor 发布智能模型路由系统 Cursor RouterCursor 推出 Cursor Router,可自动将每个编码请求分配给最合适的模型。在线 A/B 测试显示,Auto Intelligence 模式在用户满意度接近 Fable 的同时,成本降低约 60%;Auto Balance 模式满意度超过 Opus 4.8,成本降低约 36%。
推荐理由:Cursor Router 把模型路由从个人选择变成团队策略,实测成本降低 30-50% 且满意度不降,对管理 AI 预算的工程 Leader 来说是个值得立刻试点的新功能。
08:20
不会代码也能做产品:一份从0开始的Vibe Coding保姆级教程本文面向零代码用户,提供一套使用国产大模型(Kimi、GLM、Qwen等)从零开发并上线产品的完整流程。核心步骤包括购买Coding Plan、下载官方Agent编程产品、注册域名与服务器并同步做ICP备案,然后通过Agent的Plan模式描述需求并让AI自动执行开发。上线后建议建立分支保护与测试流程,并强调即使不懂代码,也必须对系统架构了如指掌。
推荐理由:我觉得这是目前最适合非技术人的中文实操指南,把从买服务器到上线的坑都填平了,独家skill也开源了,跟着做能少走很多弯路。
13:46
LLM cliché highlighter:一款识别AI写作套话的检测工具Simon Willison 用 Fable 5 开发了一款 LLM cliché highlighter 应用,用于高亮 LLM 生成文本中常见的十种套话模式,例如“no fluff, no filler, no jargon”这类陈词滥调。该工具旨在帮助读者快速识别并过滤掉充斥在文章中的 AI 写作风格化表达。
推荐理由:Simon 做了一个小工具,能一键揪出 LLM 生成文本里的“陈词滥调”,看完后你可能会克制用“真香”写标题。
15:43
Patter SDK 教程:构建餐厅预订电话智能体,支持动态变量、护栏、延迟仪表盘与评估检查Patter SDK 发布教程,演示如何构建一个餐厅预订场景的语音智能体工作流。该流程支持动态调用变量、注册可调用工具、应用输出护栏(如PII脱敏、脏话过滤、话题范围限制),并可在无需实时电话凭证的情况下运行脚本化通话模拟。教程还涵盖延迟与成本指标追踪、回归式评估检查,以及将智能体逻辑、工具调用、安全检查和通话模拟整合为单一结构化管线。
推荐理由:这个教程把 Patter SDK 的语音代理从模拟到部署跑了一遍,代码能直接抄,想上手电话 AI 的开发者可以当样板,不过工具本身还比较新,生态有待验证。
09:40
MiniMax Code 2.0 桌面端焕新:底层架构全面升级,金融模块即将上线MiniMax Code 2.0 桌面端发布,基于 Pi Agent 框架重构底层架构,显著提升会话启动速度与长程复杂任务的执行稳定性。新版本优化了图表加载与文件预览框选编辑功能,并已与恒生金融数据库、企查查 MCP 打通,金融模块即将上线,支持多源数据实时检索与专业报告生成。桌面端现已开放下载,本月还将上线远程控制、浏览器操控等功能。
推荐理由:MiniMax Code 2.0 把底层推倒重来,金融模块直接打通恒生和企查查,从写代码变成能出分析报告,做二级市场的可以认真看看。