# 姚顺雨入腾讯300天，混元改革待检验

- 来源：ginobefun (@hongming731)
- 发布时间：2026-08-03 08:15
- AIHOT 分数：30
- AIHOT 链接：https://aihot.virxact.com/items/cmscit1eq09dyroeunwrfp8qp
- 原文链接：https://x.com/hongming731/status/2084070619461918768

## AI 摘要

姚顺雨加入腾讯300天，负责混元大模型与AI Infra，团队重新聚焦并重建训练研发体系，混元3被视为团队磨合的交付而非追赶证明。腾讯计划建设强化学习平台，与WorkBuddy、元宝等产品形成反馈闭环，但尚未大规模铺开。微信VLM与混元大概率长期并存，改革成效仍需第三方基准和真实使用数据检验。

## 正文

http://x.com/i/article/2084069865128853504

BestBlogs 早报|Igor Babuschkin 谈模型开发未来,Whatnot 反思默认 PM 配置,姚顺雨入腾讯 300 天的调整

在线阅读本期早报

BestBlogs.dev 是 AI 驱动的私人阅读助手。这是面向所有人的每日早报内容,如果你希望它基于你的兴趣和阅读习惯整理,可以体验「我的早报」。

导语

一个组织应该把能力放在哪里,往往比能力本身更难回答。前 xAI 联合创始人 Igor Babuschkin 把这个问题落在模型训练、个人 Agent 与本地硬件上;Whatnot 的 CPO Tom Verrilli 则从产品团队内部追问,为什么 PM 不该按固定比例成为默认岗位;《晚点聊》观察的,是姚顺雨加入腾讯后,混元怎样在人、模型和业务之间重新建立连接。

这三篇材料并不构成一条统一结论。第一篇是创业者对未来技术路线的判断,第二篇是一家公司的组织实践,第三篇则是媒体对大厂内部变化的复盘。把它们并排阅读的价值,在于分清愿景、方法和已发生的组织事实各自能支持多强的判断。

如果时间有限,可以依次读 River AI 的三项押注、Whatnot 对 PM 中间层问题的处理,再看腾讯混元的改革为何仍要接受产品结果检验。昨天的早报讨论了长时程 Agent 的训练与评测,本期则进一步把「可验证」带进模型路线和组织设计:说法是否成立,最终仍取决于反馈闭环能否运转。

★ 精讲一:xAI 联合创始人 Igor Babuschkin 解读模型开发的未来

Igor Babuschkin 的判断从一个已发生的变化出发:编程 Agent 之所以率先变得可用,很大程度上因为代码能够执行、测试和比较,模型可以得到清晰奖励。数学也有类似条件,Lean 等形式化工具能帮助检查证明。可一旦 Agent 进入材料科学、基础物理或其他真实世界任务,想法是否有效往往要靠实验反馈,数据闭环变慢,奖励也不再容易定义。因而,从「会写代码」外推到「会完成任意长期工作」之间,还隔着环境、评测和反馈基础设施。

这也是他创办 River AI 后选择三个项目的背景。第一项是面向企业的强化学习与微调服务 River API,目标是把后训练做得更便宜、可靠并可扩展,让拥有专有数据的组织能够塑造自己的模型。这里的机会来自开放权重模型进步与企业数据之间的组合:基础模型提供通用能力,企业的任务轨迹和反馈决定专业表现。但数据独特并不自动带来优势,组织仍需能把业务结果转成训练信号,并持续验证模型有没有学到真正需要的行为。

第二项押注是个性化 Agent。现有模型通常汇总大量用户反馈,优化一个适合「平均用户」的行为;Babuschkin 希望模型能从单个用户的持续交互中学习,让表达方式、偏好与行动选择逐渐因人而异。这听起来接近个人助理的理想形态,却也把隐私、偏好漂移和目标定义推到前台:系统既要知道用户想要什么,也要避免把短期点击或一时情绪误当成长远利益。访谈将它作为仍处早期的研究方向,而非已经验证的产品答案。

第三项是把更强的推理算力带到办公室或家庭的本地设备。Babuschkin 认为,若训练和推理始终只发生在少数公司的数据中心,个人对模型访问、数据和行为边界的控制就会受制于平台。本地硬件有望让敏感数据留在用户一侧,也可能支持更深的个人化;代价则是算力、能耗、散热、模型更新与安全维护都要在设备端重新权衡。这条路线的吸引力在控制权,难点却不是简单把云端模型缩小。

访谈还谈到开放权重与专有模型的竞争。Babuschkin 预期,若专有模型的领先幅度收窄,企业会更愿意基于开放模型做分布式后训练;但开放降低门槛的同时,也会放大安全与治理争议。Reuters 能独立确认他曾在 DeepMind、OpenAI 工作并参与创办 xAI,但 River AI 的三项路线及其对行业格局的预测仍是创业者观点。阅读时更值得追踪的是三个可观察变量:企业后训练是否形成可复用闭环,个性化是否带来稳定而非偶然的改善,本地设备能否在成本与体验上接近云端服务。

来源:跨国串门儿计划 · BestBlogs 评分:90

★ 精讲二:Why Whatnot 的 CPO 认为产品经理不应成为默认配置

Whatnot CPO Tom Verrilli 的主张并不是「公司不需要产品经理」,而是不要因为工程师数量增加,就按固定比例自动补充 PM。他回顾产品管理成为专业岗位的过程:团队规模扩大后,需要有人汇总客户、商业和技术信息;但当 PM 长期承担传话与协调,工程师和设计师可能逐渐失去直接接触客户、理解业务取舍并形成判断的机会。岗位填补了信息缺口,也可能固化信息缺口。

因此,Whatnot 更倾向于在出现具体问题时招聘 PM,例如跨团队决策失速、用户洞察无人负责,或某个复杂系统需要长期产品判断,而不是把 PM 当作每支工程团队的默认配置。Verrilli 看重的也不是单纯的利益相关者管理,而是候选人能否同时理解宏观系统和微观细节,快速验证假设,并在信息不完整时作出清晰决定。这个标准把 PM 的价值从「维持流程」转向「提高团队判断质量」。

访谈给出两项很实用的工作方法。其一是保留强 IC 路径,让资深产品人持续靠近实际问题,而不是只能通过扩大管理范围获得成长;其二是在实验启动前,同时写下成功和失败时可能出现的结果。后者迫使团队提前讨论指标的多种解释,避免数据出来后只挑选支持原假设的故事。AI 数据工具则可以加快群体分析和异常回归定位,但它仍不能替团队定义什么结果对用户和业务真正重要。

这种组织方式要求工程师与设计师承担更多产品责任,也要求创始人和领导者愿意共享足够上下文。若业务高度受监管、跨部门依赖密集,或团队成员缺少用户研究能力,减少 PM 可能只是把协调成本转移给其他人。反过来,如果 PM 的主要工作是排期、转述和主持会议,那么增加岗位也不会自动改善产品质量。判断是否需要 PM,最好从具体决策为何变慢、谁离客户太远、哪些责任无人承担开始。

来源:Lenny's Podcast · BestBlogs 评分:92

★ 精讲三:176: 姚顺雨,来到腾讯 300 天

《晚点聊》把姚顺雨加入腾讯后的变化放回混元的发展史中观察。腾讯并非没有模型、人才和场景,而是长期存在多支团队、不同目标与资源分配机制:混元追求通用模型能力,微信 VLM 更贴近微信自身的隐私要求和产品规则,游戏等业务也有各自的模型探索。姚顺雨负责混元大模型与 AI Infra 后,报道认为团队重新聚焦,引入年轻研究者,调整关键岗位,并重建训练与研发体系;但节目也记录了老员工的不适应和新旧团队磨合。

模型发布是这轮调整最容易被外部观察的结果。节目把混元 3 视作团队磨合和稳定节奏的一次交付,而不是已经完成追赶的证明;团队对后续版本的期待包括更大文本规模、多模态能力,以及继续优化刚重建的数据与基础设施。InfoWorld 的独立报道可确认,Hy3 预览版是腾讯招募姚顺雨后首个重要混元版本,但时间上的先后不能证明模型进步来自某一个人,更不能代替第三方基准和真实使用数据。

组织调整的另一面,是模型与产品的连接。节目提到腾讯内部计划建设可供不同业务使用的强化学习平台,先与 WorkBuddy、元宝等产品形成更紧密反馈,让产品数据进入后训练。这个方向比「统一所有模型」更现实:业务团队保留自己的场景和指标,混元提供训练能力与通用底座。按照节目采访时的进度,该平台仍准备进一步推进,尚未大规模铺开,所以更关键的问题是业务反馈能否被合法、准确地转成模型改进,而不只是部门之间增加新的接口。

微信与混元的关系尤其能说明边界。微信的 Agent 会按场景调用微信自有模型、DeepSeek 或混元,元宝则更多转向混元;双方会合作、也有人才流动,但节目判断微信 VLM 与混元大概率长期并存。微信面对全民级产品的隐私、稳定性与交互规则,不能只追求模型上限;混元则需要更广泛的训练和商业化场景。并存会带来资源竞争,却也避免一个统一模型强行承担差异巨大的产品约束。

姚顺雨公开表示 AI 是长期竞赛,并点名 coding Agent、多模态与具身智能仍有机会。节目进一步讨论,商业化可能从 coding 扩展到更广泛的知识工作,但腾讯是否能把社交、办公、内容和游戏场景转成高质量反馈,仍受部门边界、用户需求和执行效率制约。这篇复盘的价值,不在给改革提前盖章,而在提供一组后续观察指标:人才与研发体系能否稳定、平台能否形成产品闭环、模型发布能否获得独立验证,以及微信与混元的分工是否减少而非增加重复建设。

来源:晚点聊 LateTalk · BestBlogs 评分:91

速览

AWS 老兵:新的软件开发生命周期

在 AWS 工作 11 年的 Heitor Lessa 把 Agent 驱动的软件开发拆成从产品发现、规范、实现到合并检查的完整循环,并将这套工作流用于 1400 名工程师的组织场景。他强调,Agent 可以加速执行,但需求背景、验收标准和产品判断必须先被团队表达清楚。

他用一次重构消耗约 2 亿 Token 的经历说明,盲目让高端模型持续探索会迅速放大成本。更可控的做法是按任务选择模型,在探索阶段保留强推理,在实施和审查阶段使用合适成本的模型,并以命令、Hooks、条件审查员和自定义 lint 把质量约束写进循环。

这套方法的重点不是增加更多自动化步骤,而是让每一步都能被检查、停止和修正。团队可以先从一条高频变更链路试行,记录 Token 成本、返工率和缺陷,再决定哪些环节值得固化。

来源:跨国串门儿计划 · BestBlogs 评分:90

英伟达、斯坦福联合发布新工作:机器人上下文扩至 8K,意味着什么?

NVIDIA GEAR、Stanford 与 UT Austin 团队提出 RoboTTT,用 Fast Weights 让机器人策略处理最长 8,000 个时间步的视觉-动作上下文,目标是在跨越数分钟的任务中保存更长工作记忆。

它并非把全部历史原样塞进注意力窗口,而是在测试时根据近期经历更新快速变化的参数,使策略能记住先前动作、识别偏差并从错误中恢复。实验关注的因此不只是首次成功率,也包括长序列中的恢复能力。

8K 上下文扩大了机器人可利用的历史,却没有消除计算开销、错误累积和真实环境分布变化。判断这类方案时,应同时看记忆长度、任务完成率、恢复质量与端侧延迟,而不能把时间步数量直接等同于可靠自主性。

来源:十字路口Crossing · BestBlogs 评分:89

何时终结「刷榜」顽疾:让 AI 基准回归真实人类价值

Nick Heiner 认为,公开 AI 基准一旦成为实验室优化目标,就可能从测量工具变成训练方向,分数持续上升,却与人类实际感受到的帮助、安全和可靠性逐渐脱节。

可信评测需要昂贵而细致的设计:避免题目泄漏,持续更新任务,由领域专家定义标准,并检查模型是否通过投机捷径得分。更重要的是,评测样本与评分规则要对应真实用户关心的结果,而不是只追求一个稳定、易比较的排行榜数字。

这意味着团队不能把单一榜单当作采购或发布依据。更稳妥的组合是公开基准用于横向筛选,私有任务集验证自己的场景,再用真实用户反馈检查评测是否仍在测量有意义的能力。

来源:AI Engineer · BestBlogs 评分:90

MCP Tasks:为何持久化异步工具依然棘手

Cornelia Davis 以发票处理为例说明,MCP Tasks 的难点并非让工具异步运行,而是让一个任务在客户端断连、服务重启、外部系统失败和人工审批后仍能恢复,并让调用者知道它当前处于什么状态。

一个可靠生命周期需要持久化任务标识、状态转换、结果与错误,区分安全重试和重复执行,并处理取消、超时与权限变化。涉及人工审批时,系统还要能暂停并在授权后继续,而不是让长连接承担全部状态。

因此,Tasks 更像一份分布式工作流契约,而不是异步函数语法。实现者应先定义状态机、幂等边界和恢复语义,再决定轮询、通知或队列等传输方式,否则「后台执行」只会把失败藏得更深。

来源:AI Engineer · BestBlogs 评分:90

微软、Meta 同日交财报:小扎把现金流烧到只剩 7.84 亿美元,纳德拉靠 Azure 赚疯了

微软与 Meta 同日发布财报,呈现两种 AI 投资回报节奏:微软通过 Azure 与 Copilot 把算力投入更直接地连接到云服务收入,Meta 的广告业务仍在增长,但大规模资本开支显著压低现金流。

两家公司都在增加 AI 基础设施投入,差别在于现有商业模式吸收成本的路径。微软可以按云资源和软件席位收费;Meta 更多依靠推荐与广告效率改善来间接回收投入,基础模型和新设备的回报周期也更长。

单季现金流不能判定长期战略成败,却能提醒投资者关注收入确认与资本开支之间的时间差。比较 AI 公司时,除了模型能力,还应看利用率、折旧、增量收入和主营业务是否能持续承担建设成本。

来源:InfoQ 中文 · BestBlogs 评分:88

GitHub AI Agent 翻车:攻击者不用黑客技术,只写一句话就能窃取数据

研究者展示了一类间接提示注入:攻击者在公开 GitHub Issue 中嵌入指令,当拥有更高权限的 AI Agent 读取 Issue 并执行工作流时,可能被诱导访问私有仓库信息并把数据带出。

漏洞机制利用的是「不可信文本」与「高权限工具」进入同一上下文。对 Agent 来说,用户需求、仓库内容和攻击指令都可能只是自然语言;若工作流缺少来源标记、最小权限和输出限制,模型无法可靠地仅凭语义区分哪条指令可以执行。

防护不能只靠提示词要求模型忽略恶意内容。团队需要隔离公开输入、限制令牌权限、为敏感读取与外发设置确定性策略,并把 Agent 生成的变更与网络请求纳入审计。

来源:InfoQ 中文 · BestBlogs 评分:89

「热爱一个行业 15 年的理由是什么?」|对谈汪天凡:我要投真正的快乐、投最纯的愿景、投人性的光辉[公路播客]

BAI 资本合伙人汪天凡回顾 15 年 VC 经历,认为 AI 时代的投资判断不能只靠覆盖热门项目:投资人既要形成自上而下的价值判断,也要亲自使用产品和模型,在一线验证概念。

他提出「智能会通胀,智慧仍稀缺」,并把智慧理解为智能加入反馈、经验、反思与个人 context 后形成的取舍。由此,他更关注能帮助用户反思、建立关系和活在当下的产品,而不只是把效率继续推高的工具。

这些观点带有明确的投资立场,也与其被投项目有关,不能直接当成市场规律。对创业者更有用的追问是:产品收集的 context 是否获得用户信任,交互是否改善真实生活,以及价值主张能否由留存和行为变化支持。

来源:十字路口Crossing · BestBlogs 评分:91

补充阅读

AdaMAST:自适应失败分类法,改进 LLM 智能体

AdaMAST 从目标 Agent 的执行轨迹中自动归纳失败代码,并沿固定维度组织成适应该系统的分类法,再用于 best-of-N 评估、运行时编码反馈和搜索优化。它把「失败了」细化成可定位、可比较的问题类型,但分类质量仍取决于轨迹覆盖与证据标注。

来源:Hacker News - Newest: "LLM" · BestBlogs 评分:90

什么是 Self-evolving / self-improving / RSI ?一篇文章搞懂自进化

文章把自进化按优化对象分为 Artifacts、Harness 与 Model:分别改进产出物、提示词与工具脚手架,以及模型参数本身。这个分类有助于区分今天已经常见的工作流迭代,与风险和难度更高的递归自我改进。

来源:青稞AI · BestBlogs 评分:90

AI 来了,大厂中层不好混了

五位大厂中层的访谈显示,AI 正让信息汇总、任务拆解和进度跟踪更容易自动化,部分管理岗位面临收缩与考核重构。个体经历不能代表所有公司,但它提示中层价值需要从传递信息转向判断、协调复杂冲突和培养团队。

来源:人人都是产品经理 · BestBlogs 评分:88

不是所有产品都适合 AI 化:一个 AI 产品经理的判断框架

文章用四层框架检查一个场景是否值得 AI 化,重点考察问题是否需要模糊判断、数据是否可得、错误是否可承受,以及 AI 是否让用户流程更简单。它提醒团队先验证用户任务和失败成本,再决定接入模型。

来源:人人都是产品经理 · BestBlogs 评分:89

Android互操作性的重大胜利 - Open Home Foundation

欧盟委员会依据 DMA 的互操作要求,要求 Google 向第三方助手开放包括唤醒词检测与传感器访问在内的 11 项 Android 功能,并按平等条件提供。开放接口扩大了用户选择,但实际效果仍要看实现期限、权限边界和第三方能否获得稳定体验。

来源:Hacker News · BestBlogs 评分:87

关于 AI 发展的公开信

Simon Willison 汇总三封近期公开信,呈现围绕开放权重模型、蒸馏以及是否应放慢自动化 AI 发展的分歧。把这些文本并读,可以看见开放创新、安全外部性与权力集中之间没有简单共识。

来源:Simon Willison's Weblog · BestBlogs 评分:88

知名搜索框架 Firecrawl 开源的 Web Agent。

Firecrawl 开源其用于深度网络研究的 Web Agent 框架,支持自主搜索、并行任务和模块化部署。开源降低了复杂网页自动化的实现门槛,采用者仍需自行约束抓取权限、来源引用与失败恢复。

来源:逛逛GitHub · BestBlogs 评分:89

GitHub - pochenai/nano-llm-posttraining:在单张 8GB GPU 上进行的极简、可读的 LLM 后训练实验,度量遗忘、随机种子方差与 RL 涌现

nano-llm-posttraining 在单张 8GB GPU 上展示 SFT、DPO 与 GRPO 等后训练实验,并显式测量遗忘、随机种子差异和推理行为。它适合学习实验机制,但小模型与教学规模的结果不能直接外推到生产模型。

来源:Hacker News - Newest: "LLM" · BestBlogs 评分:88

只用一张卡,做出了声称是 100M 参数以内最好的小模型?

BarunLM-35M 用单张 H200 完成训练,并以局部与全局注意力混合架构参加九项零样本评测;作者报告平均准确率 41.01%。项目开放权重、代码和评测,但「100M 参数以内最好」仍应结合训练数据、基准污染和复现结果判断。

来源:机器之心 · BestBlogs 评分:87

在消费级硬件上测试 LLM 并发 - ai.2it.onl

一组在 RTX 5060 上完成的 19 个模型、456 次运行测试显示,并发可以显著提高总吞吐,MiniCPM5 1B 的峰值达到 983 tok/s;同时,一些模型受首 Token 延迟、隐藏推理和显存限制影响,规模扩大后体验反而变差。

来源:Hacker News - Newest: "LLM" · BestBlogs 评分:87

延伸探索

其余材料可以沿四组主题继续阅读:模型与平台包括 GPT-5.6 Luna 降价、OpenAI 开放平台转向、Astra 数学进展、DeepSeek V4 与 Kimi K3;工程实践覆盖 RAG 证据链、上下文压缩、Token 节省、Jotai Store 和 React Compiler 的 Rust 迁移;Agent 方向则连接网络安全基准、AI 同事、Claude Code 工作流与 Karpathy 的 Three.js 实验。

多模态与物理世界是另一组线索:MiniMax H3 与 Seedance 2.5 的多篇实测讨论生成能力和创作方法,日本机器人、Jeff Dean 的自进化 Agent 判断以及 LA 山火 3D 扫描把视野扩展到硬件、空间与真实环境。这些内容适合按具体兴趣探索,不必从标题中的强结论直接推断模型、产品或研究已经得到独立验证。

今日阅读路径

只有十分钟,先读 Igor Babuschkin 对「可验证领域」与 River AI 三项押注的拆解,建立模型路线判断;再读 Whatnot,检查自己的团队是否把 PM 当作默认中间层;最后读腾讯混元复盘,看组织调整如何落到模型发布、训练平台与业务反馈。如果还有时间,再补读 MCP Tasks 和 GitHub Agent 提示注入,它们分别对应可恢复性与权限安全。

建议按 River AI、Whatnot、腾讯混元的顺序阅读,并思考两个问题:你的团队当前最缺的是模型能力、反馈闭环,还是清晰的责任分配?哪些组织变化已经能由产品结果验证,哪些仍只是有待观察的路线选择?欢迎打开原文继续阅读,并在评论区分享你的判断与实践。

👉 近期早报

• BestBlogs 早报 · 2026-08-02

• BestBlogs 早报 · 2026-08-01

• BestBlogs 早报 · 2026-07-31

• BestBlogs.dev 第 106 期:1% 法则

• BestBlogs.dev 第 105 期:明与暗

• BestBlogs.dev 第 104 期:判断力回归

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。
