BestBlogs 早报 · 07-24
Claude 语音模式 / skill-up / DeepSeek 持续学习 / Agent 评测 / 模型路由
【1】 ★ 精讲|在语音模式下思考难题 | Anthropic 的 Claude Claude 语音模式把 Opus 与 Sonnet 加入原先仅用 Haiku 的实时对话,并允许会话中切换模型、承接文本上下文与连接工具。Anthropic 给出的价值不只在语音输入,而是让用户先用对话澄清问题,再经明确授权把结论写入日历、邮件或 Canva;语言仍需手动选择。 来源:Claude Blog https://www.bestblogs.dev/article/fb29a3820b
【2】 ★ 精讲|4 小时、118 个回答,梁文锋内部交流回应一切 腾讯科技整理的投资者交流实录呈现了梁文锋在融资后的技术与经营判断:DeepSeek 把 Agent 之后的持续学习视为下一道能力阶梯,同时承认算力与高质量数据标注仍是主要约束。文中关于国产芯片、开源和竞争格局的结论属于创始人主张,读者可据此观察公司资源投入是否与路线图一致。 来源:腾讯科技 https://www.bestblogs.dev/article/2e0954c4fc
【3】 ★ 精讲|阿里开源 skill-up:让 Agent Skill 可评测可回归 阿里开源的 skill-up 把 Agent Skill 评测从人工试跑变成可进 CI 的声明式回归:先用 expect 做确定性检查,再按需调用 rule、script 或 agent judge。它还支持多轮会话、跨引擎回放和产物级证据;内部案例将约 1200 行零散编排收敛为本地与 CI 共享的评测声明。 来源:阿里技术 https://www.bestblogs.dev/article/59f799691b
【4】 用于生产环境安全运营的多智能体 AI:5G 核心网中的 A2A 与 MCP 架构 本文提出了一种用于 5G 核心网安全运营的鲁棒多智能体架构,利用 A2A 和 MCP 协议,结合异常门控 LLM 推理和策略即代码(Policy-as-Code)安全约束,以确保生产级别的可靠性。 来源:InfoQ https://www.bestblogs.dev/article/2d3b12f69c
【5】 复杂业务场景下 RCA Agent 的探索实践 快手工程师分享了基于大模型的业务排障 RCA Agent 体系,围绕让 AI 理解业务、对抗告警噪声、衡量不确定性、对抗模型幻觉四大挑战,阐述了从 Workflow 到 Agent 的演进路径、Multi-Agent 架构设计与自进化机制。 来源:快手技术 https://www.bestblogs.dev/article/ee34489479
【6】 Notion 如何摆脱 Token 困境 【视频】 Notion AI 工程负责人 Sarah Sachs 说明,借助模型可选性、任务感知路由、确定性工具、治理机制与可审查的智能体工作流,AI 产品才能避免在成本和运营上被 Token 束缚。 来源:AI Engineer https://www.bestblogs.dev/video/a243063ca
【7】 Andrew Ng 宣布推出 OpenWorker:一个能够交付完成工作的开源 AI 智能体 Andrew Ng 宣布推出 OpenWorker,这是一个开源的 AI 智能体,能够生成精美文档、发送 Slack 消息、更新日历条目,并跨越你的文件和日常工具。 来源:Andrew Ng(@AndrewYNg) https://www.bestblogs.dev/status/2080333504446108104
【8】 GitHub 上 AI 智能体 Pull Request 的频率、结构与合并冲突率 本文展示了针对 GitHub 上 AI 智能体生成的 Pull Request 的首次实证研究,测量了智能体内与跨智能体配对之间的并发率及合并冲突特征。 来源:Hacker News - Newest: 「AI Agent」 https://www.bestblogs.dev/article/d1c48f6209