# OpenBMB发布UltraData两大开源数据集，登顶HuggingFace趋势榜

- 来源：OpenBMB (@OpenBMB)
- 发布时间：2026-06-01 21:01
- AIHOT 分数：78
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmpv8b6wa04jvsl0zc4newlns
- 原文链接：https://x.com/OpenBMB/status/2061432928492810535

## 精选理由

面壁开源了两个王炸数据集，预训练的 600B+ token 中文合成数据史上最大，SFT 那边 1500 万条带思考链的指令更是头一回见，做中文基础模型的可以无脑下载了。

## AI 摘要

OpenBMB联合清华NLP与Modelbest发布两个开源数据集：Ultra-FineWeb-L3（预训练合成数据）包含600B+ tokens（超400B英文、200B+中文），是迄今最大开源中文预训练合成数据集；UltraData-SFT-2605（后训练SFT数据）包含15M+样本，是中国首个开源且包含思考与非思考标注的大规模SFT数据集，覆盖数学、代码、知识和指令遵循。两者均基于UltraData L0-L4框架构建，并在MiniCPM5-1B训练中完成验证。数据集已在HuggingFace免费开放。

## 正文

🏆 重磅消息！UltraData 刚刚登顶 HuggingFace 全球趋势榜第 1 名和第 2 名！🎉

由 OpenBMB × 清华NLP × Modelbest 联合发布--两个大规模开源数据集现已免费开放给所有人：

🔥 Ultra-FineWeb-L3（网络预训练合成数据）→ 6000 亿+ 模型 token（4000 亿+ 英文，2000 亿+ 中文）→ 迄今规模最大的开源中文预训练合成数据集 → 专为最大化每个模型 token 的可学习性而构建

🔥 UltraData-SFT-2605（后训练 SFT 数据）→ 中国首个拥有 1500 万+ 条 SFT 数据且同时包含思维与非思维标注的开源数据集 → 涵盖数学、代码、知识与指令遵循 → 完全可追溯的数据流水线

🧱 两个数据集均基于 UltraData L0-L4 五层数据管理框架构建，并已在 MiniCPM5-1B 训练中完成端到端验证。

即刻免费下载 👇 https://huggingface.co/datasets/openbmb/Ultra-FineWeb-L3 https://huggingface.co/datasets/openbmb/UltraData-SFT-2605 #OpenSource #LLM #AI #HuggingFace #MiniCPM #UltraData
