关键要点
- 微博新推出的 VibeThinker-3B 仅有三十亿参数,但在数学和编程基准测试中,其表现却能与体积大出 333 倍的顶尖模型相媲美。
- 这一性能得益于对阿里巴巴基础模型进行的多阶段后训练。然而,在需要广泛事实知识的任务上,这个小模型则远远落后。
- 研究人员得出结论:结构化逻辑推理依赖的模式较少,因此压缩效果好;而广泛的世界知识仍然需要大模型来承载。
一个仅有三十亿参数的中文语言模型,在数学和编程任务上有时能与体积大百倍的模型匹敌。其背后的研究人员提出了一种关于 AI 能力如何构成的假说。
微博母公司新浪发布了一款小型语言模型,在困难的数学和编程任务上与当今顶尖模型竞争。根据一份技术报告,VibeThinker-3B 在 AIME26 等竞争性基准测试中,表现与 DeepSeek V3.2 和 Kimi K2.5 相当。这两款模型的参数数量是其 200 到 333 倍。
新浪将这款模型定位为一次实验,旨在探究一个模型究竟需要多少算力才能跻身顶尖水平。其前代产品 VibeThinker-1.5B 于 2025 年 11 月发布。新版本则更进一步,探讨一个小模型能否达到真正的顶级性能,而不仅仅是“在其尺寸范围内表现良好”。

逻辑可以缩放,事实知识则不能
结果呈现出两种不同的情况。在具有明确可验证解决方案的结构化任务上,例如数学奥林匹克竞赛或编程挑战,VibeThinker-3B 的表现与 GLM-5 或 Gemini 3 Pro 等模型相当。在 LiveCodeBench 上,它击败了所有参数低于 200 亿的其他模型。
事实知识则是另一回事。在知识密集型的 GPQA-Diamond 基准测试中,该模型远远落后于其体积大得多的竞争对手。

为了排除数据污染的可能性,研究团队让该模型参加了2026年4月底至5月底期间举办的LeetCode竞赛,此时训练已经结束。VibeThinker-3B在首次尝试中就解决了128道题目中的123道。这一成绩使其超越了GPT-5.2、Qwen3-Max、Kimi K2.5和Claude Opus 4.6。它仅落后于GPT-5.3-Codex、Gemini 3.1 Pro和Gemini 3 Flash,但差距并不大。
后训练承担了主要工作
VibeThinker-3B基于阿里巴巴的Qwen2.5-Coder-3B构建。新浪的贡献在于后训练阶段,即通用预训练(在大规模数据集上进行)之后的所有环节。根据报告,正是后训练让一个3B参数的模型接近了顶尖水平。
后训练分阶段进行。首先,模型通过监督式微调学习广泛的任务,涵盖数学、编程和通用对话。随后,它针对困难的多步骤推理问题进行专门优化。
接下来是强化学习,依次应用于数学、编程和STEM领域。然后通过知识蒸馏将每个阶段习得的技能整合到单一模型中。最后一步确保模型能更好地遵循指令。

在微调过程中,研究团队有意构建了多样化的解题路径。强化学习随后会强化那些有效的路径。其核心观点是,性能的提升源于训练方法、数据质量和可靠的验证信号,而非更多的参数。
这对AI能力运作方式意味着什么
基于这些结果,作者提出了他们所谓的“参数压缩-覆盖假说”。不同的AI能力具有不同的结构,因此需要不同数量的参数。
逻辑推理,比如逐步解决数学问题,依赖于少数几种反复出现的模式:搜索、检查条件、纠正错误、组合中间结果。这类技能可以压缩成一个紧凑的核心。世界知识则运作方式不同。回答跨多个领域的开放式问题需要广泛覆盖,这意味着需要大量参数来存储大量事实。
研究人员表示,这重新定义了小型模型的用途。它们不仅仅是针对低成本推理而构建的廉价、轻量级版本,而是一条与传统扩展逻辑并行的独立研究路径。在任务可验证且具有清晰解决结构的情况下,参数数量不再是瓶颈。
VibeThinker-3B 已在 Hugging Face 和 GitHub 上公开发布。
小型模型在特定任务上追赶规模大得多的系统正成为一种趋势。今年 4 月,阿里巴巴的 Qwen3.6-27B 在所有编程基准测试中均超越了其规模大 15 倍的前代产品。据其开发者称,来自阿布扎比的 Falcon H1R 7B 达到了其规模 2 到 7 倍的模型的性能水平。早期关于小型模型逻辑缺陷的研究表明,它们在多步推理上通常会遇到瓶颈。而 VibeThinker 在可验证任务上的结果恰恰挑战了这一假设。