🏆 重磅消息!UltraData 刚刚登顶 HuggingFace 全球趋势榜第 1 名和第 2 名!🎉
由 OpenBMB × 清华NLP × Modelbest 联合发布--两个大规模开源数据集现已免费开放给所有人:
🔥 Ultra-FineWeb-L3(网络预训练合成数据)→ 6000 亿+ 模型 token(4000 亿+ 英文,2000 亿+ 中文)→ 迄今规模最大的开源中文预训练合成数据集 → 专为最大化每个模型 token 的可学习性而构建
🔥 UltraData-SFT-2605(后训练 SFT 数据)→ 中国首个拥有 1500 万+ 条 SFT 数据且同时包含思维与非思维标注的开源数据集 → 涵盖数学、代码、知识与指令遵循 → 完全可追溯的数据流水线
🧱 两个数据集均基于 UltraData L0-L4 五层数据管理框架构建,并已在 MiniCPM5-1B 训练中完成端到端验证。
即刻免费下载 👇 https://huggingface.co/datasets/openbmb/Ultra-FineWeb-L3 https://huggingface.co/datasets/openbmb/UltraData-SFT-2605 #OpenSource #LLM #AI #HuggingFace #MiniCPM #UltraData