# Claude语音升级深度推理，阿里开源Skill评测框架

- 来源：ginobefun (@hongming731)
- 发布时间：2026-07-24 07:44
- AIHOT 分数：44
- AIHOT 链接：https://aihot.virxact.com/items/cmry62jif00d0roeuvfwcwst2
- 原文链接：https://x.com/hongming731/status/2080438822425534580

## AI 摘要

Anthropic为Claude语音模式加入Opus与Sonnet模型，付费用户可在会话中切换，支持复杂推理与工具调用，语言扩展至多语种但需手动切换。阿里开源skill-up，通过声明式评测框架让Agent Skill可回归验证，支持多轮会话、跨引擎回放与分层断言。DeepSeek完成超500亿元首轮融资，梁文锋在4小时交流中强调持续学习为下一能力阶梯，并承认算力与高质量数据标注仍是主要约束。

## 正文

http://x.com/i/article/2080436962432098304

# BestBlogs 早报|Claude 把深度推理带进语音，skill-up 让 Agent 能力可回归，梁文锋内部交流

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容，如果你希望它基于你的兴趣和阅读习惯整理，可以体验「我的早报」。

## 导语

今天的三篇精讲分别落在交互、工程和公司路线三个尺度。

Claude 把 Opus 与 Sonnet 放进实时语音，让口头讨论从快速问答延伸到需要推敲的决策；阿里的 skill-up 则试图把 Agent Skill 从「跑起来了」推进到有用例、有证据、可回归；梁文锋的长篇交流给出 DeepSeek 对持续学习、算力、数据与开源的内部判断。

三者不必被拼成一条趋势，但都提醒我们：能力演示之后，真正困难的是如何建立连续、可检验、受约束的工作系统。

## ★ 精讲一：在语音模式下思考难题 | Anthropic 的 Claude

Anthropic 这次更新的关键变化很具体：Claude 语音模式此前只运行强调速度的 Haiku，现在付费用户可以使用为复杂推理设计的 Opus 与 Sonnet，并在会话途中切换模型。语音模式会默认沿用最近一次文本聊天使用的模型，文本和语音之间也能承接上下文。它仍采用轮流对话--用户说完，Claude 停下来思考再回答--并不是持续打断式的实时共说，但这恰好给复杂讨论保留了推敲空间。详见

Anthropic 给出的场景不是简单的语音输入：练习重要谈话并检查表达方式、检验客户提案的逻辑缺口、讨论产品路线并做竞争研究，或者为一次内容传播提出多种解释。共同点是，用户一开始往往只有半成形的想法，需要模型持续追问、复述假设和比较选项。对这类任务，语音的优势不在省去打字，而在降低「必须先把问题写清楚」的门槛，让思路在对话中逐渐成形。更强模型能否保持足够低的延迟，决定这种体验是自然的思考伙伴，还是一串令人分心的等待。

这里也要区分「更容易说出来」和「结论更可靠」。口语包含省略、改口和含混指代，模型若过早替用户补全意图，可能把一次探索式谈话带向错误方向。更适合的使用方式，是让 Claude 在关键节点复述当前假设、列出尚未确认的信息，并在执行前把决定转成可检查的文字。对于客户提案或职业选择这类高影响任务，语音可以帮助展开思路，证据核对仍应回到原始材料。

产品的第二层变化是从讨论走向执行。对话得出结论后，Claude 可以通过连接器推迟 Google Calendar 会议、把客户提案整理成 Canva 单页，或汇总邮件并起草回复；每次使用连接工具前都要请求许可。这个边界很重要：语音会让授权显得更轻松，但日历、邮件和文档都是有外部后果的系统，确认动作不能因为入口更自然就被弱化。免费计划可使用 Haiku、一个连接工具和新增语言，付费计划可访问更多模型与全部已连接工具；语音对话计入正常用量。

语言范围也扩大到英语、法语、德语、印地语、日语、韩语等多种语言，但 Claude 不会自动识别并切换语言，用户需要在语音设置中选择，或明确说出切换指令；此前的语言设置也不会自动继承到语音模式。因而这仍是一项 beta 产品更新，而非无摩擦的全双工助理。结合近期 BestBlogs 对 Claude 长时程任务和连接器安全的报道来看，Anthropic 正把「理解上下文-获得授权-调用工具」做成连续体验；现在值得观察的指标，是长对话的延迟、工具误操作率和授权提示能否始终清晰，而不只是模型名称是否更强。

## ★ 精讲二：阿里开源 skill-up：让 Agent Skill 可评测可回归

Agent Skill 的质量问题经常藏在「看起来还能用」之下：改动一段 SKILL.md 后，Agent 可能不再调用预期工具；同一提示换一个执行引擎，输出结构可能漂移；本地验证和 CI 又常由两套脚本拼起来，评测意图散落在命令与中间文件里。阿里开源的 skill-up 针对的正是这类回归风险，它用 evals/eval.yaml 和用例文件声明运行环境、Agent 引擎、输入、轮次、超时与判定方式，再由一条命令回放并生成结构化报告。详见

它的判断体系不是把所有结果都交给另一个模型打分。最便宜、最确定的检查放在第一层 expect：退出码、文件是否存在、回复是否包含或匹配指定内容，都可以直接验证。遇到结构化规则，再使用 rule；需要读取产物、执行定制逻辑时使用 script；只有语义质量无法由确定规则表达时，才调用 agent judge。这个顺序把成本和不确定性控制在必要范围内，也让失败证据更容易复现。对 Skill 工程来说，重要的不是「拥有一个 AI 评委」，而是先把能写成契约的行为全部写成契约。

skill-up 还支持多轮会话、跨引擎回放，以及对文件等产物进行断言。多轮能力可以检验澄清、执行、修正是否形成完整链路；跨引擎对比能暴露某项能力是否依赖特定 Agent 的隐式行为；产物级证据则避免只看最后一句回复。阿里在内部案例中把约 1200 行分散的编排代码收敛为本地与 CI 共用的声明式评测，让新增用例和定位失败不再需要理解整套脚本。这是案例结果，不等于任何 Skill 都会获得同样的代码缩减，但它说明评测语义从编排实现中抽离后，维护成本可以显著下降。

评测用例本身也需要版本治理。模型输出具有随机性，如果把整段自然语言逐字匹配，门禁会频繁误报；如果只检查退出码，又会放过语义退化。比较合理的分层是：副作用和文件结构使用确定性断言，关键业务规则用脚本检查，开放式质量再由 judge 评估，并保存输入、轨迹、产物与判定理由。跨模型升级时先在同一批用例上并跑，观察失败分布，而不是只比较一个平均分。

站内此前关于阿里智能分析 Skills 和 Harness 自主迭代的材料，讨论的是如何组织上下文、工具和执行循环；skill-up 补上的则是变更后如何证明行为没有悄悄退化。两者的边界需要保留：一套 Harness 可以让 Agent 更会做事，却不会自动告诉团队「什么算做好」；评测框架也只能验证已经写下的预期，无法替代对真实用户任务的选择。最稳妥的实践路径是从最昂贵、最常出错的 5 到 10 个任务开始，把输入、产物、允许的副作用和失败条件固化，再进入 CI；若先追求覆盖所有场景，评测本身也会成为难以维护的新系统。

## ★ 精讲三：4 小时、118 个回答，梁文锋内部交流回应一切

腾讯科技整理的材料来自一场近 4 小时的投资者交流，共 118 条回答。报道同时称 DeepSeek 已完成首轮外部融资，募资总额超过 500 亿元人民币、投前估值约 3675 亿元，并列出梁文锋、腾讯、宁德时代等出资方。由于这些融资数字与会议内容来自媒体获得的交流材料，本文把它们作为腾讯科技的报道，而不是独立审计结果。更值得细读的是融资之后公司如何解释技术优先级、资源约束和开源策略，因为这些主张今后可以被产品发布与投入节奏检验。详见

梁文锋把 Agent 之后的下一道能力阶梯描述为持续学习：模型不仅在一次上下文中调用工具，还要从新的经验中更新能力。但他也承认，算力与高质量数据标注仍是主要约束。这个表述的价值在于把愿景与瓶颈放在同一张路线图里。持续学习不是把更多会话无差别写入记忆；它需要区分短期上下文、可检索记忆与真正的参数更新，还要处理错误经验污染、用户隐私、灾难性遗忘和评测基线漂移。若后续发布只增加记忆长度而没有可验证的学习机制，就不能视为路线兑现。

判断持续学习是否取得实质进展，可以看三类证据。第一，模型能否从新任务获得能力，同时保持旧任务表现；第二，新经验的来源、筛选和撤回是否可追踪；第三，更新成本是否低到足以持续发生，而不是每次都重新做大规模训练。公司若公开时间跨度更长的评测、学习曲线和失败案例，会比单一演示更能说明问题。反之，只有「记住了用户偏好」并不足以证明模型学会了新的通用能力。

交流中的另一组判断涉及开源和商业化。梁文锋强调「克制」与愿景驱动，认为开源和不急于争夺用户利益有助于提高实现 AGI 的概率；同时他又表示公司一直存在 C 端用户和 B 端收入，并非完全不做商业化。这里存在值得持续观察的张力：大额融资会带来算力采购、人才与回报要求，而开放权重会让生态更容易采用，也可能削弱单一产品的锁定。创始人的叙述提供方向，但不能代替经营数据；真正的证据会来自模型开放范围、许可证、推理价格、企业收入以及资本支出如何变化。

他对国产芯片、竞争格局和组织方式的评论也应被视为公司立场，而非行业共识。站内近期一篇关于模型、算力和具身智能的投资人判断，可以作为对照：资本侧更关心供应链、成本曲线和兑现窗口，创始人则强调长期技术概率。把两种视角并置，读者更容易发现需要验证的变量--持续学习是否出现可复现实验，算力短缺是否通过算法或供应改善得到缓解，开源是否持续产生外部开发者回流，以及「无 KPI 的愿景驱动」在组织扩大后能否维持。118 条回答信息量很大，但判断公司路线，仍应以之后可观察的行为而不是表达力度为准。

## 速览

复杂业务场景下 RCA Agent 的探索实践

快手把业务排障拆成四个难点：理解业务语义、过滤可能超过 75% 的告警噪声、量化诊断不确定性，以及抑制模型在数值和趋势上的幻觉。案例中，Feed 请求量上涨的表象最终追到推荐质量下降和跨服务配置变化，说明业务故障不能只靠单一指标或固定 Workflow。文章给出的 Multi-Agent 与自进化路线，价值在于让诊断过程同时保留业务上下文、证据和不确定性，而不是让模型直接猜根因。详见

这也延续了快手此前从稳定性诊断、智能 Code Review 到研发范式升级的实践：单点模型能力只有接入业务拓扑、历史变更和评价闭环后，才能改变组织级效率。落地时应先记录 Agent 引用了哪些指标和变更，再衡量根因命中率与误导成本。

Notion 如何摆脱 Token 困境

Notion AI 工程负责人 Sarah Sachs 把 Token 成本视为产品架构风险：复杂分析可以使用前沿模型，收件箱分类或确定性转换则不应按同一价格执行。她建议建立共享的系统记录，按任务复杂度路由模型，保留供应商与开放权重模型的可选性，并用沙箱、可见性和受控持久化约束智能体。判断 AI 功能是否健康，不只看单次调用价格，还要看每项能力每秒成本、延迟和工具失败率。详见

模型可选性也不是换一个 API 名称那么简单。提示、工具参数和输出结构可能暗含供应商特性，因此路由层需要共享任务契约与持续评测；否则所谓多模型只会把不一致转移给用户。

用于生产环境安全运营的多智能体 AI：5G 核心网中的 A2A 与 MCP 架构

这套 5G 核心网安全架构先用 Isolation Forest 过滤常规遥测，只把新颖异常交给 LLM；窄职责 Agent 通过 A2A 协作、经 MCP 读取环境，所有外部动作再由 OPA 策略和 Kyverno 准入约束。作者报告 MTTD 与 MTTR 各降低约 40%，但明确这些数字来自单一运营商内部基线。更可迁移的原则是：高风险系统先构建 reviewer 和人工升级路径，再谈自动执行。详见

文中把结果分成自动执行、自动拒绝和升级人工三种终态，并为敏感资产、爆炸半径、置信度和可逆性分别设规则。安全团队可以调整风险阈值而不改 Agent 提示，这使变更能被版本控制和独立测试。

GitHub 上 AI 智能体 Pull Request 的频率、结构与合并冲突率

这项研究把 AI Coding 的讨论从产码速度移到并发协作：它测量 GitHub 上智能体提交 PR 时，同一智能体与不同智能体任务之间的重叠和冲突特征。对团队而言，风险不只是单个 PR 写错，而是多个 Agent 同时修改相邻文件、基于不同仓库状态行动。采用多 Agent 前，应把分支隔离、所有权划分、合并顺序和冲突率纳入吞吐指标。详见

更高的 PR 数量若同时拉长等待审查与返工时间，交付周期并不会缩短。团队应把从任务创建到合并后的总时间作为结果指标，并记录冲突是由共享文件、依赖顺序还是需求重叠造成。

Andrew Ng 宣布推出 OpenWorker：一个能够交付完成工作的开源 AI 智能体

Andrew Ng 与 Rohit Prasad 推出的 OpenWorker 主打跨文件和日常工具交付成品：生成文档、发送 Slack 消息、更新日历，并支持 OpenAI、Anthropic、Google、开放权重模型和本地 Ollama。项目强调数据默认留在本地，除非用户明确选择外部提供商。开放与模型无关降低了锁定，但涉及消息和日历时，权限范围、操作预览与失败回滚才决定它是否能成为可靠同事。详见

Andrew Ng 此前强调 Agent 软件开发中的反馈循环，这次把循环延伸到办公工具。下一步应观察项目是否提供细粒度授权、可重放轨迹和跨模型一致性测试，而不只看它能连接多少应用。

AI 数据可观测性：为何智能体会出错

VentureBeat 提醒，智能体在上线数月后自信答错，原因可能不是模型或提示变差，而是价格、政策、规格已经更新，知识库仍在提供旧文档。传统管道通常检查数据是否可取和相关，却不检查内容是否仍然正确。生产系统应追踪来源版本、更新时间、字段完整性和失效条件，并把「检索成功但事实过期」视为独立故障类型。详见

这类故障的危险在于监控面板可能全部为绿色：索引更新成功、检索有结果、模型也正常响应。治理需要把事实所有者和刷新时限写入数据契约，并用抽样核验检查高影响答案。

AI 实验室在「鹈鹕骑车」上刷榜了吗？

Dylan Castillo 用 8 种动物乘 6 种交通工具构成 48 条提示，在 7 个模型上各运行 3 次，并借助两个模型辅助评价，检查实验室是否特别训练了「鹈鹕骑自行车」图像。结果没有发现刻意刷这一趣味基准的证据。这个实验的启发不是为模型排名，而是用对照组、重复采样和透明结果替代凭几张示例图形成的阴谋推断。详见

这类小基准也提醒我们，可复述的轶事不等于可推广的证据。测试提示、抽样次数、评审模型和失败定义都会改变结论；公开完整矩阵让读者能够检查替代解释，也比只展示最成功或最失败的图片更接近可信评测，结论也更能经受复查。

## 补充阅读

感知智能体：让电脑操作更可靠的共享上下文闭环

Antje Barth 认为电脑操作 Agent 的瓶颈是跨系统完成任务后还能确认结果，而不只是会点击和调用 API。她提出共享渲染上下文，并持续执行感知、规划、行动、验证闭环；当知识工作缺少像代码测试那样清晰的判据时，可靠性来自每一步都能看到环境变化并校验目标。详见

LLM 知识图谱为何必须保留可追溯的来源链

Daniel Chalef 以医疗中的「患者对青霉素过敏」为例：结论可能综合电子病历、化验与患者填写信息，静态来源 ID 无法解释合并、更新或删除后的事实。LLM 知识图谱需要保存来源、可信度、变更与删除传播关系，才能在审计和纠错时回答「这条结论如何形成」。详见

测开的困局与突破：AI 让迟到已久的理想有了可能

京东技术把问题从「AI 会不会替代测开」改写为「测开本应创造什么价值」：如果工作只剩把手工用例翻译为脚本，自动生成会直接压缩岗位空间；若把业务规则、历史缺陷和风险判断沉淀为框架、门禁与自测能力，AI 反而降低建设这些资产的成本。详见

小红书引擎架构团队 OSDI 2026 新成果：HELMSMAN 重塑大规模向量检索基础设施

HELMSMAN 把大规模 ANNS 从高成本 DRAM 迁移到 NVMe SSD，并结合定制存储栈、学习式剪枝和 GPU 构建。小红书称约 40 台全闪存服务器承载了原先约 35000 个 CPU Core 与 350 TB DRAM 的负载，硬件成本节省超过 90%；这些生产数据为向量检索的成本-性能取舍提供了明确参照。详见

一文讲透 Agent 三件套：MCP、Skill、Hook 如何给大模型装上护栏

腾讯云开发者用三层分工解释 Agent 工程：MCP 暴露工具、资源和提示，Skill 编排业务流程，Hook 在工具或脚本执行前后拦截高风险参数并记录审计。它与今日 skill-up 的差别值得留意：Hook 控制运行时边界，评测则证明变更没有破坏预期，两者不能互相替代。详见

AWS 老兵的智能体工程蓝图：从规格到验证的交付闭环

Haider Lesa 把 Agent 看作扩大工程师责任范围的工具，而不是替代判断的捷径。由人探索需求、写清规格、让 Agent 执行、再用测试和业务语境验证结论，团队才能保留对系统的理解与责任；速度若没有规格和验证，只会把审查压力推向交付末端。详见

## 今日阅读路径

如果只有 15 分钟，先读 Claude，理解语音如何从输入方式变成「讨论-授权-执行」的产品链；再读 skill-up，看看怎样把 Agent 行为写成可回归证据；最后读梁文锋交流，区分公司路线、资源约束与仍待验证的创始人判断。若你负责生产系统，可把 5G 安全架构和数据可观测性接在后面，分别检查动作边界与知识时效。

阅读时不妨思考两个问题：你的 Agent 系统里，哪些行为已经能被确定性契约验证，哪些仍依赖主观观感？当模型开始代表用户调用外部工具时，授权、数据新鲜度和回滚分别由谁负责？欢迎打开原文核对证据，也欢迎在评论区分享你的实践与反例。

## 👉 近期早报

- BestBlogs 早报 · 2026-07-23

- BestBlogs 早报 · 2026-07-22

- BestBlogs 早报 · 2026-07-21

- BestBlogs.dev 第 104 期：判断力回归

- BestBlogs.dev 第 103 期：系统新信号

- BestBlogs.dev 第 102 期：智能的账单

BestBlogs 是 AI 驱动的私人阅读助手，帮助你发现真正适合你的高质量内容，关注你感兴趣的来源和主题，每天生成一份更适合自己的「我的早报」，欢迎体验和关注我们。
