OpenBMB发布UltraData两大开源数据集,登顶HuggingFace趋势榜

OpenBMB · @OpenBMB · X·2026-06-01 21:01·84天前
AI 导读

OpenBMB联合清华NLP与Modelbest发布两个开源数据集:Ultra-FineWeb-L3(预训练合成数据)包含600B+ tokens(超400B英文、200B+中文),是迄今最大开源中文预训练合成数据集;UltraData-SFT-2605(后训练SFT数据)包含15M+样本,是中国首个开源且包含思考与非思考标注的大规模SFT数据集,覆盖数学、代码、知识和指令遵循。两者均基于UltraData L0-L4框架构建,并在MiniCPM5-1B训练中完成验证。数据集已在HuggingFace免费开放。

OpenBMB@OpenBMB
精选
78AI 编辑部评分,满分 100

OpenBMB发布UltraData两大开源数据集,登顶HuggingFace趋势榜

2026-06-01 21:01· 84天前
AI 导读

OpenBMB联合清华NLP与Modelbest发布两个开源数据集:Ultra-FineWeb-L3(预训练合成数据)包含600B+ tokens(超400B英文、200B+中文),是迄今最大开源中文预训练合成数据集;UltraData-SFT-2605(后训练SFT数据)包含15M+样本,是中国首个开源且包含思考与非思考标注的大规模SFT数据集,覆盖数学、代码、知识和指令遵循。两者均基于UltraData L0-L4框架构建,并在MiniCPM5-1B训练中完成验证。数据集已在HuggingFace免费开放。

推荐理由

面壁开源了两个王炸数据集,预训练的 600B+ token 中文合成数据史上最大,SFT 那边 1500 万条带思考链的指令更是头一回见,做中文基础模型的可以无脑下载了。

正文 · AI 翻译

🏆 重磅消息!UltraData 刚刚登顶 HuggingFace 全球趋势榜第 1 名和第 2 名!🎉

由 OpenBMB × 清华NLP × Modelbest 联合发布--两个大规模开源数据集现已免费开放给所有人:

🔥 Ultra-FineWeb-L3(网络预训练合成数据)→ 6000 亿+ 模型 token(4000 亿+ 英文,2000 亿+ 中文)→ 迄今规模最大的开源中文预训练合成数据集 → 专为最大化每个模型 token 的可学习性而构建

🔥 UltraData-SFT-2605(后训练 SFT 数据)→ 中国首个拥有 1500 万+ 条 SFT 数据且同时包含思维与非思维标注的开源数据集 → 涵盖数学、代码、知识与指令遵循 → 完全可追溯的数据流水线

🧱 两个数据集均基于 UltraData L0-L4 五层数据管理框架构建,并已在 MiniCPM5-1B 训练中完成端到端验证。

即刻免费下载 👇 https://huggingface.co/datasets/openbmb/Ultra-FineWeb-L3 https://huggingface.co/datasets/openbmb/UltraData-SFT-2605 #OpenSource #LLM #AI #HuggingFace #MiniCPM #UltraData