Topic · 主题全部主题 →

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

3,231条收录
242条精选

精选归档 · 第 3 页

4160 条 · 共 242

7月31日

星期五 · 2 条
15:05
IT之家(RSS)精选
AI 评分 73/100
国家发改委:人工智能相关行业保持 30% 以上高增长,全国智能算力规模达去年同期 2.8 倍

国家发展改革委在 7 月新闻发布会上介绍,上半年人工智能自主创新加快,首个全国产 10 万卡人工智能超集群正式投用,截至 6 月底全国智能算力规模达去年同期 2.8 倍。深度求索、月之暗面等本土企业发布多个万亿级参数开源大模型,国产大模型全球总下载量突破 100 亿次。相关行业保持 30% 以上高增长,上半年规模以上工业企业集成电路产量同比增长 23.1%,出口额同比增长 88.7%。


推荐理由:这是发改委首次披露上半年AI产业核心数据,算力暴增2.8倍,国产大模型下载破百亿,这些数字会直接写进下半年投资报告的支撑页。虽然只是发布会口径,但数据含金量高,做AI基础设施和政策的从业者值得记下来。
13:27
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 78/100
Show HN:将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制

一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。


推荐理由:CTGT 这个实验设计得很聪明,用匹配对和四家实验室裁判,直接回应了蒸馏会不会传审查的争论。自蒸馏效果一样好,开源模型和评估集让结论可复现,对中国开源模型使用者是个重要信号。

7月30日

星期四 · 1 条
01:50
LMSYS:Blog(Chatbot Arena 团队)精选
AI 评分 69/100
Miles 在 Blackwell 架构上实现端到端 MXFP8 与逐 token NVFP4 强化学习方案

Miles 团队在 Blackwell 架构上实现了两种原生低精度强化学习方案:端到端 MXFP8 和 MoE 专家权重的逐 token NVFP4。在 8x B200 上对 Qwen3-30B-A3B 的消融实验中,BF16 与所有五种低精度配置的原始奖励曲线高度重合,且 MXFP8 和 NVFP4 减少了推理时间。


推荐理由:虽然只针对Blackwell,但这份报告把MXFP8和NVFP4在RL里的实现细节讲清楚了,从量化合约到每token缩放都给了可复现配置,做大规模RL训练的能直接上手。

7月29日

星期三 · 1 条
04:40
Andrew Ng@AndrewYNg精选
AI 评分 78/100
Andrew Ng 创办 LearnVector,用 AI 实现一对一学习Fifteen years ago, @Coursera and online courses changed education. It worked better than almost anyone expected, expanding access by opening up where you can learn. But how you learn remains largely the same as it has for centuries: it is still one-size-fits-all, taught the same way to each person who shows up.We now have an opportunity to change how learning happens. With advances in AI, we can now build a custom learning guide for each person. We will turn learning from one‑to‑many to one‑to‑one. I'm starting LearnVector to invent this next generation of learning. We are starting with a $100M investment from Coursera, and plan to collaborate closely with Coursera and Udemy.Good learning needs much more than just a chatbot. Research shows that chatbots without guardrails harm learning. They help complete tasks and enable students to do better on homework. But cognitive offloading to a chatbot results in them being less skilled. And, you cannot always trust what a chatbot tells you.In contrast, LearnVector will plan a path with you, adapt to how you learn, and patiently stay with you until you’ve mastered new skills.One thing has not changed in all this time. People want learning they can trust: material that is accurate, relevant, and worth the effort you put into it. Anything less wastes the most valuable thing a learner has: time. Coursera has a trusted library of materials from authoritative sources. LearnVector plans to work with Coursera to bring this trustworthy learning to everyone. I'm grateful to Greg Hart and the entire Coursera team for supporting LearnVector.I look forward to working with our talented team to change how we learn, and accelerate human development.http://learnvector.aiAndrew Ng 宣布创办 AI 教育公司 LearnVector,获 Coursera 1 亿美元投资,旨在将学习从"一对多"转变为"一对一"。LearnVector 将利用 AI 为每位学习者定制学习路径,而非提供无约束的聊天机器人--研究表明后者会损害学习效果。平台将结合 Coursera 的权威课程库,提供准确、可信任的个性化学习体验。另有 1 家信源报道Hacker News 热门(buzzing.cc 中文翻译)
推荐理由:Andrew Ng 不是发论文,是真金白银押注 AI 教育,1 亿美元和 Coursera 背书,意味着个性化学习终于要从PPT走向产品了,教育产品人该反复读他的理念。

7月28日

星期二 · 2 条
15:04
IT之家(RSS)精选
AI 评分 73/100
德里高等法院裁定 OpenAI 利用 ANI 内容训练 AI 未侵犯版权

德里高等法院认定 OpenAI 利用亚洲国际新闻(ANI)社的内容训练人工智能不构成侵犯版权。法官 Amit Bansal 认为该行为符合印度《版权法》中研究类“合理使用”例外情形,且 ANI 未能证明 ChatGPT 直接复制其受版权保护内容。法院同时指出,现阶段颁布临时禁令将不利于印度正在开发的 LLM 及大量免费使用 ChatGPT 的用户。

另有 1 家信源报道The Decoder:AI News(RSS)
推荐理由:印度法院认定训练数据属于合理使用,这是 OpenAI 在版权战中的首次重要胜利,可能影响全球类似案件的走向,值得关注。
13:25
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
FeyNoBg 发布:开源自动背景去除模型,在四项基准上达到 SOTA

Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。


推荐理由:FeyNoBg 在多个背景去除基准上达到或接近最佳,还开源了训练库,做图像处理的产品可以直接集成,是个实在的工具发布。

7月23日

星期四 · 1 条
03:23
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 76/100
GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace Tokenizers

GigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。


推荐理由:GigaToken 把分词速度直接拉到 GB/s 级别,对处理大规模文本的团队是实打实的效率提升,数据集预处理不再是瓶颈。

7月22日

星期三 · 1 条
00:00
Google Developers Blog(RSS)精选
AI 评分 63/100
Google 推出 Tunix:基于 JAX 的高吞吐智能体后训练库

Google 发布 Tunix,一个基于 JAX 的原生后训练库,旨在消除多轮、使用工具的 LLM 推理智能体训练中的 TPU 闲置瓶颈。Tunix 通过高并发异步 rollout 与解耦的生产者-消费者流水线最大化硬件吞吐量,确保训练器持续获得数据。该库提供即插即用抽象和持续宏观级性能分析,便于集成自定义环境。


推荐理由:Google 这个训练库直接解决 agent 训练中 TPU 空转的隐性成本,对做后训练的团队可能是基础设施级改进,值得跟进。

7月21日

星期二 · 5 条
14:22
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 81/100
五家美国科技巨头因不透明AI融资隐性债务飙升至1.65万亿美元

日经研究显示,Meta、Oracle等五家美国科技巨头的隐性债务在约四年内膨胀八倍,达到约1.65万亿美元,超过其实际债务。这些债务主要来自数据中心租赁和GPU供应合同,其中Meta的表外债务约4200亿美元,是其透明债务的近三倍。隐性债务的激增使投资者更难评估风险。


推荐理由:日经的这项研究把AI军备竞赛的财务风险摊在桌面上,1.65万亿美元隐性债务比这些公司的账面债务高出数倍,押注AI长期增长的人都得看一眼这个黑洞。
10:49
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 79/100
法官批准Anthropic就盗版书籍训练Claude一案达成15亿美元和解协议

美国联邦法官批准Anthropic支付15亿美元,和解其使用盗版书籍训练Claude聊天机器人的集体诉讼。约91%的48.2万本涉案书籍已被作者或出版商认领,每本书赔偿约3000美元。原告律师称这是“历史上已知最大的版权追偿”,Anthropic则强调法院此前已裁定AI训练书籍属于合理使用。

另有 3 家信源报道The Decoder:AI News(RSS)Ars Technica:AI(RSS)The Verge:AI(RSS)
推荐理由:这是 AI 训练数据版权案中第一个重大和解,每个作者赔三千,看似不多但总额达 15 亿,给仍在诉讼中的 OpenAI、Meta 等案打了个样,做版权内容的该认真看看。
10:49
IT之家(RSS)精选
AI 评分 73/100
Anthropic 与作家群体15亿美元版权和解获批

美国旧金山联邦法官批准了Anthropic与作家群体达成的15亿美元(约101.67亿元人民币)版权和解协议,这是美国金额最大的版权赔偿案。此前法院裁定Anthropic对书籍进行AI训练属于合理使用,但保存超700万本盗版书籍侵犯了作者权利。Anthropic称超91%的受约束作者和出版商已领取赔偿。


推荐理由:这是AI版权诉讼的首个重大和解,15亿美元金额创纪录,为所有使用版权数据训练模型的公司敲响警钟,创作者权益的保护从此有了可参照的司法标尺。
09:20
公众号:数字生命卡兹克精选
AI 评分 64/100
一个随机数就能识别AI模型身份:行为指纹技术可检测API中转站偷换模型

布拉格经济大学研究员托马什·布鲁克纳发现,通过让模型反复输出1到100的随机数,可生成独一无二的“行为指纹”。对165个模型各问30次后发现,GPT-4o偏爱42和37,Claude Sonnet 5疯狂输出47,Qwen3-Max则30次全部回答42。该方法仅需约120条请求即可识别模型身份,错误率约10.6%,为验证API是否被偷换模型提供了轻量级方案。


推荐理由:一个Token识别模型的妙招,轻巧但准确率高,对于被API中转站坑过的人来说简直是照妖镜,而且读起来像在破案。
02:49
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 74/100
ArXiv上超30%新投稿文本特征与AI撰写一致

一项对12,750篇ArXiv论文全文的检测显示,截至2026年7月,约32%的新投稿文本特征与AI撰写一致,该比例在2026年初峰值接近39%。计算机科学领域最高(65%),数学领域最低(0.7%)。检测器在0.4%假阳性率下可识别85%的AI学术文本。


推荐理由:用 0.4% 假阳性门槛做锚,测出 ArXiv 上 AI 写作比例已超三成,计算机科学高达 65%,这是我见过最严谨的同类测量。

7月20日

星期一 · 2 条
20:49
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 70/100
LoRA Speedrun 公开排行榜:6分05秒微调Qwen2.5-1.5B达GSM8K 61.1%准确率

LoRA Speedrun项目推出公开排行榜,在固定硬件(单张L40S)上比拼Qwen2.5-1.5B的微调运行时间。当前纪录由@Saivineeth147以6分05秒保持,采用序列打包与仅完成损失掩码技术,相比基线11分57秒提速约2倍且准确率更高(61.1%)。项目提供免费Modal沙箱验证,任何提交需经3次独立复现确认。


推荐理由:LoRA 微调领域的 nanoGPT speedrun,在固定硬件和任务上比墙钟时间,公开透明且可复现,做微调的开发者可以下场试试。
15:48
IT之家(RSS)精选
AI 评分 70/100
上海科学智能研究院开放科学多模态基础模型"神珍"

上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。


推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。

7月19日

星期日 · 1 条
21:30
公众号:面壁智能(MiniCPM)精选
AI 评分 68/100
MiniCPM5-2B发布:4B以下全球性能第一,适配9款芯片

面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。


推荐理由:2B 参数做到 4B 以下综合第一,而且把数据治理和 Agent 训练流程也开源了,做端侧智能体的可以盯一下,只是还没正式开源,暂时摸不到。

7月17日

星期五 · 3 条
16:13
MarkTechPost(RSS)精选
AI 评分 70/100
NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一

NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。


推荐理由:嵌入模型不是最热的赛道,但决定了你 Agent 看到什么——NVIDIA 把 1B 模型压缩到 RTEB 第二,NVFP4 量化后精度几乎不变,做 RAG 的值得换上。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 75/100
NexForge:通过需求驱动任务合成扩展LLM智能体能力

NexForge提出需求驱动框架,无需领域特定基础设施即可自动合成多样化可执行智能体任务与专家轨迹。该框架生成3.6K终端和2K办公任务,将Qwen3.5-35B-A3B Base在Terminal-Bench 2.0上从22.5%提升至52.0%,GDPval Elo从813提升至1338。


推荐理由:NexForge 抛弃了靠人工造工具和仓库的老路,从需求出发自动合成训练数据,让 Qwen 基座在终端任务上逼近 Claude Opus,还开源了模型,做 agent 训练的值得细看数据生成思路。
08:00
HuggingFace Daily Papers(社区热门论文)精选
AI 评分 74/100
从预训练到后训练:理解推理能力的强化学习缩放规律

一项新研究以国际象棋为受控实验平台,系统探究了预训练与强化学习(RL)在推理任务中的交互关系。研究发现,给定RL计算量下的后训练性能可由预训练损失准确预测,且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上,更长预训练的检查点在RL下性能更高、提升更快。


推荐理由:这篇论文提出一个将预训练与RL联系起来的缩放定律,用国际象棋当试验场,发现RL在不同难度问题上的效果很不一样,做训练的人可以据此重新想想算力怎么分。

7月16日

星期四 · 1 条
11:30
公众号:千问APP(阿里)精选
AI 评分 61/100
千问APP联合武汉发布举办AI求职实战课,演示简历诊断与办公自动化

千问APP与武汉发布在武汉举办AI求职实战课,现场演示了用千问进行简历诊断、PPT制作和表格分析。产品经理提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并展示了将486行杂乱销售数据浓缩为一页结论PPT的“建、理、算、析、呈”方法论。


推荐理由:千问官方出的这套办公Prompt,从简历诊断到PPT救场再到经营数据清洗,方法论清晰可套用,求职者和日常办公的人可以直接拿来用,比泛泛的教程实在。