内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
内部员工登录
精选全部日报更多
反馈
内部员工登录

精选

AIHT7月17日 · 周五
最新精选
全部模型产品行业论文技巧
标签「数据/训练」清除

7月16日周四

11:30公众号:千问APP(阿里)61千问APP联合武汉发布举办AI求职实战课,演示简历诊断与办公自动化千问官方出的这套办公Prompt,从简历诊断到PPT救场再到经营数据清洗,方法论清晰可套用,求职者和日常办公的人可以直接拿来用,比泛泛的教程实在。
01:09OpenAI:官网动态(RSS · 排除企业/客户案例)67OpenAI 发布 GPT-Red:通过自动化红队测试提升模型鲁棒性OpenAI 用自博弈训练出的红队模型 GPT-Red,把直接提示注入攻击成功率压到了 0.05%,而且没有降低模型能力。做 AI 安全的人应该好好读一下他们怎么实现这个飞轮的。

7月15日周三

02:35TechCrunch:AI(RSS)70Google 因 AI 训练再遭出版商集体诉讼出版商集体诉讼谷歌,这次带上了内部文件警告‘可能面临千亿美元罚款’的弹药,是版权方对AI训练最有力的一次反击,值得关注后续发展。

7月14日周二

10:30公众号:面壁智能(MiniCPM)61面壁智能CTO曾国洋专访:端侧模型是AI落地关键路径面壁选择了一条少有人走的端侧之路,这篇 CTO 专访把落地的真实困难、原创方法和他们的思考都摊开了,对做模型和做产品的人都有启发。

7月12日周日

23:34Satya Nadella75纳德拉提出"反向信息悖论":企业使用AI时需保护自身知识Satya 提出的「反向信息悖论」直指企业 AI 部署的核心顾虑,建议具体可操作,尤其是评估集控制和编排层解耦,做企业 AI 的产品人现在就该读。

7月10日周五

08:20Google Research:Blog(网页)70Google Research 推出 SensorFM:面向可穿戴健康数据的通用基础模型SensorFM 在 500 万人、万亿分钟传感器数据上训练出一个通用生理基础模型,35 项任务全面领先,自动调参的代理教室也很有想法,做健康 AI 的人值得细读。
08:00HuggingFace Daily Papers(社区热门论文)78GenCeption:视频生成模型作为通用视觉学习器这篇论文提出用视频生成模型做通用视觉预训练,在深度、分割、姿态估计等一堆任务上吊打专业模型,甚至只用1/500的数据就追平D4RT。我觉得这可能是CV领域的‘GPT时刻’前兆,做视觉基础模型的人该认真看看。
06:21Hacker News 热门(buzzing.cc 中文翻译)72社交媒体AI生成内容泛滥:LinkedIn超过40%长文为AI写作LinkedIn上40%的长文都是AI写的,这个数据比什么‘我感觉’都有说服力,所有做内容策略的人都该看一眼这篇报告。

7月9日周四

21:16IT之家(RSS)71法国对英伟达反垄断调查接近尾声,聚焦 CUDA 生态和产业投资法国快成为全球首个正式指控英伟达反垄断的监管机构,争议在CUDA生态紧耦合与芯片投资,这个案子能不能动摇AI芯片供应链,是所有人都该关心的节点信号。
07:27Anthropic:Research(发表成果 · 网页)68面向AI模型双重用途知识的"开关":Anthropic与AE Studio提出GRAM方法这是Anthropic在模型安全对齐上的一个新尝试,提出可拆卸模块来精细控制有毒知识,同时保留一般性能。方法还未上Claude,但实验结果表明这条路可能比简单的拒绝训练更鲁棒。

7月8日周三

09:43Hacker News 热门(buzzing.cc 中文翻译)75Pulpie:用于清理网络的Pareto最优模型做网页清洗的同行该更新工具了,Pulpie 以二十分之一的成本追平 SOTA 质量,而且开箱即用,是今年数据管线里最值得换的组件之一。
01:10BAIR:Berkeley AI Research Blog62智能免费,然后呢?--Data Systems for, of, and by Agents当推理成本趋近免费,数据系统将经历从服务人到服务智能体的根本变革,这篇文章把'为智能体设计系统、用智能体运行系统、让智能体构建系统'三大挑战梳理得很清晰,做数据和 agent 基础设施的人应该读。

7月7日周二

23:10Apple Machine Learning Research(RSS)55DynaMiCS:带性能约束的大语言模型动态混合微调苹果这篇论文做了一件不太起眼但有用的事——让模型在学新领域时自动平衡旧能力,不用手动调混合权重,对需要多任务微调又怕遗忘的团队是个小进步,不过算不上范式级突破。
01:18TechCrunch:AI(RSS)75Google 更新隐私设置,默认用媒体数据训练 AI,用户可手动退出Google 悄悄把用户上传的媒体数据默认用于训练 AI,这篇教程是及时且实用的避坑指南,花两分钟改设置就能保护隐私,所有 Google 用户都该看看。

7月6日周一

17:06Hacker News 热门(buzzing.cc 中文翻译)75AT&T 1956年专利法令:公共天才的私有化用贝尔实验室专利释放的历史对照今天前沿实验室的语料抓取,论证清晰且有新意。提出的“语料版税”虽非万能,但为互联网公共品被私人捕获提供了集体补救思路,每个在网上留下痕迹的人都该看一眼。

7月3日周五

12:07IT之家(RSS)80阿里达摩院发布超导材料发现AI智能体Elements Claw我认为这是 AI for Science 的标志性突破,AI 智能体第一次从头设计并实验证实了全新的超导材料,把 AI 角色从辅助推到「独立发现」,对做材料模拟和科学发现的团队是个转折点。
10:34HuggingFace Daily Papers(社区热门论文)74Program-as-Weights:一种面向模糊函数的编程范式这篇论文把模糊任务从调用大模型API变成了本地轻量函数,0.6B就能跑赢32B,省掉几十倍成本。对需要处理日志、JSON修复等经常性模糊任务的开发者是个真信号。
08:00HuggingFace Daily Papers(社区热门论文)72SkillOpt-Lite:更快更好的智能体自我进化,只需一行代码把复杂 agent 优化砍到一个最小可行管线,小模型靠它打大模型,VSCode Copilot 用一条 vibe 就能进化技能,做 agent 的人别错过。
01:08Apple Machine Learning Research(RSS)56VideoFlexTok:可变长度粗到细视频分词把视频 tokenization 从固定网格改成变长 coarse-to-fine,训练效率提升明显,还能做更长的视频。研究角度挺漂亮,但离产品落地还有距离,做视频生成的可以追一下。

7月2日周四

17:06MarkTechPost(RSS)72Google Health API 推出 CLI:ghealth 是一款针对 Fitbit 数据的开源工具把 Google Health API 封装成终端和 AI 代理友好的 CLI,一次性解决了认证、JSON 输出和分页这些烦人细节,想用 Fitbit 数据做健康分析或喂给代理的人可以直接上手,但它的影响仅限于个人健康数据爱好者这个小圈层。
02:02TechCrunch:AI(RSS)72Cloudflare新政策:默认屏蔽混合爬虫,推动AI公司付费Cloudflare用基础设施商的话语权重新划定了AI内容付费线,默认屏蔽混合爬虫这一刀切下去,从Google到创业公司都躲不开,出版商到底该分多少钱的讨论终于有了一个落地的支点。
01:39Meta Engineering Blog(RSS)71Meta 大规模 AI 存储蓝图Meta的存储架构复盘给出了一条明确路径,从重写元数据到分层缓存,他们把GPU利用率和研究者迭代速度同时提升了一个档次,做AI训练平台的值得细读。

6月30日周二

05:35Ars Technica:AI(RSS)75韩国将投入1万亿美元扩大存储芯片生产和发展人形机器人韩国砸 1 万亿美元砸向内存芯片和机器人,不只是产能竞赛,更是试图锁住 AI 硬件供应链的关键位置。但工会抗议和芯片暴利税收争议也浮现,值得追踪。
05:26Emad79美团LongCat Owl Alpha:OpenRouter最流行模型,1.6万亿MoE,国产ASIC训练中国团队用 5 万块自研 ASIC 训练出 1.6tr 参数 MoE,性能堪比 Gemini,还在 OpenRouter 悄悄成了最热模型——非 GPU 路线跑到量产的第一个真实信号,做推理部署的都应该看一眼。
05:01SemiAnalysis77Rubin Ultra取消,新版尺寸性能减半NVIDIA 原版 Rubin Ultra 取消并减半规格是今年硬件领域最大的意外,所有依赖下一代算力增长的公司都得重估路线图。
04:34Tomer Tunguz 博客(VC 分析)58Anthropic:当AI成本超过工程师薪酬Tomer Tunguz 用数据把 AI 公司的烧钱速度拆得很细,Anthropic 每个工程师年算力成本 51.5 万美元,是工资的 2.3 倍,这个数字对重新理解 SaaS 毛利率很有冲击力。
00:00Google Research:Blog(网页)76Google Research 推出 TabFM:用于表格数据的零样本基础模型TabFM 把表格预测变成一次前向传播,不再需调参和特征工程,数据科学家可以少熬夜了。BigQuery 集成让使用门槛降到 SQL,这是表格 ML 的零样本时刻。
00:00Google Research:Blog(网页)61Google Research 将建筑屋顶反射率数据集扩展至全球 50+ 城市谷歌把屋顶反照率数据的精度做到30厘米,覆盖50+城市,还给了免费App,城市防暑从模糊规划变成可量化的工程,做气候韧性的人可以直接拿这个数据做方案,虽然只是特定领域应用,但AI落地真实场景的路径值得参考。

6月29日周一

15:01IT之家(RSS)71SK 集团会长崔泰源:到 2035 年建设 15GW AI 数据中心,总投资达 1000 万亿韩元SK 集团喊出 1000 万亿韩元建 AI 数据中心,数字唬人但周期长达十年,更像一种姿态宣示,真正改变算力市场格局还得看后续执行力和融资落地。

6月28日周日

18:50Elon Musk70Grok 4.5 私测于 SpaceX 和 Tesla,性能接近 OpusElon 亲自宣布 Grok 4.5 内部测试,性能可能超过 Opus,虽然还没公开可用,但每月从零训练新模型的节奏,意味着算力军备竞赛还在加速。

6月27日周六

09:59IT之家(RSS)71国家统计局:1-5月规上工业企业利润增18.8%,电子行业利润增103.9%贡献43.1%国家统计局这组数据让AI不再是融资故事,电子行业利润增长103.9%,AI需求是实实在在的引擎,硬件供应链的价值该被重估了。

6月26日周五

23:51Dwarkesh Patel:Podcast & Blog(RSS)61下一个重大突破:AI在工作中学习RLVR 范式能否通向 AGI?Dwarkesh 指出关键瓶颈在于样本效率和 grindability,他提出的 OPSD 和 dreaming 方案重新定义了「学习中」的边界,虽然离落地尚远,但值得每一个关心 AI 下一步的人细读。
03:01Hacker News 热门(buzzing.cc 中文翻译)78IBM 首度推出亚纳米级芯片技术IBM 把芯片制程推进到亚纳米,0.7nm 意味着 AI 芯片能塞进两倍晶体管,这对生成式 AI 的算力瓶颈是个好消息。虽然量产还要五年,但技术路线图清晰,值得关注。
00:37TechCrunch:AI(RSS)71General Intuition 完成 3.2 亿美元融资,用游戏数据训练通用 AI 智能体用游戏按键数据训练世界模型,并在真机上八分钟完成适配,这个思路让具身智能看到了一条可规模化的路径。投资人押注的其实是 Medial 独有的动作标注数据飞轮。

6月25日周四

11:29Hacker News 热门(buzzing.cc 中文翻译)75Anthropic称阿里巴巴非法获取了Claude AI模型的功能Anthropic正式指控阿里巴巴非法提取Claude能力,这不是普通知识产权纠纷,而是头部AI公司对模型能力窃取的首次公开控诉,可能重塑API和开源生态的游戏规则。
00:15Hugging Face:Blog(RSS)66NVIDIA NeMo AutoModel:一行代码加速Transformer MoE模型微调英伟达的 NeMo AutoModel 把 MoE 模型微调速度提高了三倍多,内存省了近三分之一,代码只需改一行 import,做训练的可以立刻升级。

6月20日周六

16:27Hacker News 热门(buzzing.cc 中文翻译)72GPT-5.5幻觉率达86%,GLM-5.2仅28%--大模型越大越不可靠这篇实测对比揭示了大型模型的致命幻觉问题,GPT-5.5 幻觉率高达 86% 远超 GLM-5.2 的 28%,模型选型不能只看 Benchmark 排名,「会不会不懂装懂」才是真分水岭。
08:00HuggingFace Daily Papers(社区热门论文)74可验证搜索不是可学习的链式思维这篇论文给CoT蒸馏泼了盆冷水,证明回溯搜索这种过程是学不会的,模型只能记住验证步骤。做推理微调的团队该重新审视自己的数据生成策略了。
01:14Dwarkesh Patel:Podcast & Blog(RSS)60AI中心的数据黑洞Dwarkesh 把 AI 的‘笨’归因于数据效率远低于人类,计算虽简但直指要害,他给出的一个逆向洞察是开源模型四个月追上闭源,正是数据驱动进步的最好证据。

6月19日周五

15:55HuggingFace Daily Papers(社区热门论文)75HumanScale:自我中心人类视频在具身预训练中可超越真实机器人数据让机器人看人类干活视频,预训练效果居然比直接用真实机器人数据更好,这个反直觉发现可能彻底改变具身智能的数据策略,做机器人的值得认真读一读。
精选
2026年7月17日星期五 · AI 自动挑选的高价值内容
全部模型产品行业论文技巧

7月16日

星期四 · 2 条
11:30
公众号:千问APP(阿里)精选
61
千问APP联合武汉发布举办AI求职实战课,演示简历诊断与办公自动化

千问APP与武汉发布在武汉举办AI求职实战课,现场演示了用千问进行简历诊断、PPT制作和表格分析。产品经理提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并展示了将486行杂乱销售数据浓缩为一页结论PPT的“建、理、算、析、呈”方法论。

教程/实践数据/训练

推荐理由:千问官方出的这套办公Prompt,从简历诊断到PPT救场再到经营数据清洗,方法论清晰可套用,求职者和日常办公的人可以直接拿来用,比泛泛的教程实在。
01:09
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
67
OpenAI 发布 GPT-Red:通过自动化红队测试提升模型鲁棒性

OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。

OpenAI安全/对齐数据/训练
另有 4 家信源报道X:Greg Brockman (@gdb)IT之家(RSS)The Decoder:AI News(RSS)X:OpenAI (@OpenAI)
推荐理由:OpenAI 用自博弈训练出的红队模型 GPT-Red,把直接提示注入攻击成功率压到了 0.05%,而且没有降低模型能力。做 AI 安全的人应该好好读一下他们怎么实现这个飞轮的。

7月15日

星期三 · 1 条
02:35
TechCrunch:AI(RSS)精选
70
Google 因 AI 训练再遭出版商集体诉讼

包括 Hachette、Cengage、Elsevier 及作家 Scott Turow 在内的出版商与作者团体对 Google 提起集体诉讼,指控其未经授权使用受版权保护的作品训练 Gemini 模型,并故意移除或篡改版权信息以掩盖这一行为。原告称 Google 将原本仅用于 Google Books 搜索片段展示的书籍副本,以及 Google Play 商店上传的图书,非法用于 AI 训练。诉讼援引 Google 内部文件,其中指出此举可能带来“100 亿至 1000 亿美元的潜在罚款”。该案在纽约南区联邦地区法院提起。

Google政策/监管数据/训练
另有 1 家信源报道IT之家(RSS)
推荐理由:出版商集体诉讼谷歌,这次带上了内部文件警告‘可能面临千亿美元罚款’的弹药,是版权方对AI训练最有力的一次反击,值得关注后续发展。

7月14日

星期二 · 1 条
10:30
公众号:面壁智能(MiniCPM)精选
61
面壁智能CTO曾国洋专访:端侧模型是AI落地关键路径

面壁智能CTO曾国洋指出,端侧模型是AI落地的关键路径。其原创方法论“模型风洞”可在小规模实验中预测完整训练效果,并基于“知识密度”提出“面壁定律”:知识密度每3.5个月翻一番。2B参数的MiniCPM表现优于同期8B竞品。面壁已完成高通、联发科、英特尔、英伟达、AMD等芯片适配,新发布的BitCPM-CANN模型系列可在华为昇腾芯片上让同一内存多装约6倍模型。全双工全模态模型MiniCPM-o4.5支持实时打断与情绪调整。团队开发了全球首个完全由AI编写的生产级训练框架ForgeTrain,并引入行为模式库实现无需开口的“默契系统”。

大佬观点数据/训练端侧

推荐理由:面壁选择了一条少有人走的端侧之路,这篇 CTO 专访把落地的真实困难、原创方法和他们的思考都摊开了,对做模型和做产品的人都有启发。

7月12日

星期日 · 1 条
23:34
Satya Nadella@satyanadella精选
75
纳德拉提出"反向信息悖论":企业使用AI时需保护自身知识

微软CEO萨提亚·纳德拉提出“反向信息悖论”:AI时代,买家为使用AI支付金钱,同时必须暴露专有知识(提示词、工具使用、纠正反馈等),这些“智力废气”被模型学习,导致信息不对称向卖家倾斜。企业需要真正的信任边界,确保自身数据、痕迹、评估、适配权重和记忆在边界内积累,未经同意不得外泄。纳德拉呼吁企业拥有私有评估、保留组织记忆所有权,并主张企业应有权使用模型输出微调或训练自有模型,以控制自身学习循环。

Microsoft大佬观点数据/训练
另有 5 家信源报道X:小互 (@xiaohu)X:Berry Xia (@berryxia)IT之家(RSS)TechCrunch:AI(RSS)The Decoder:AI News(RSS)
推荐理由:Satya 提出的「反向信息悖论」直指企业 AI 部署的核心顾虑,建议具体可操作,尤其是评估集控制和编排层解耦,做企业 AI 的产品人现在就该读。

7月10日

星期五 · 3 条
08:20
Google Research:Blog(网页)精选
70
Google Research 推出 SensorFM:面向可穿戴健康数据的通用基础模型

Google Research 发布 SensorFM,一个在超过 100 万亿分钟多模态传感器数据上预训练的大规模基础模型,数据来自 500 万同意参与者,涵盖 100 多个国家及 20 余款 Fitbit 和 Pixel Watch 设备。SensorFM 学习通用的人体生理表征,可迁移至心血管、代谢、睡眠、心理健康及生活方式等 35 项健康预测任务,支持标签高效适配与数据填充,并可作为个人健康智能体的基础工具。该模型旨在解决传统可穿戴健康模型针对单一终点、难以泛化的问题。

Google多模态数据/训练模型发布

推荐理由:SensorFM 在 500 万人、万亿分钟传感器数据上训练出一个通用生理基础模型,35 项任务全面领先,自动调参的代理教室也很有想法,做健康 AI 的人值得细读。
08:00
HuggingFace Daily Papers(社区热门论文)精选
78
GenCeption:视频生成模型作为通用视觉学习器

论文提出 GenCeption,利用预训练文本到视频扩散模型作为前馈感知骨干,通过文本指令驱动完成深度估计、表面法线、相机位姿、指代分割和 3D 关键点预测等多种视觉任务。GenCeption 在多个基准上达到 SOTA,匹配或超越 DepthAnything3、SAM3、D4RT、VGGT-Omega 等专用模型。视频生成预训练骨干在同等设置下优于 V-JEPA 和 Video MAE 等替代范式。GenCeption 展现出数据与模型缩放特性,仅用 7 到 500 倍更少的训练数据即可达到 D4RT 和 VGGT-Omega 的同等性能。模型仅用合成人类视频训练,即可泛化到真实场景及动物、机器人等分布外物体类别。

多模态数据/训练论文/研究

推荐理由:这篇论文提出用视频生成模型做通用视觉预训练,在深度、分割、姿态估计等一堆任务上吊打专业模型,甚至只用1/500的数据就追平D4RT。我觉得这可能是CV领域的‘GPT时刻’前兆,做视觉基础模型的人该认真看看。
06:21
Hacker News 热门(buzzing.cc 中文翻译)精选
72
社交媒体AI生成内容泛滥:LinkedIn超过40%长文为AI写作

安全公司Pangram通过Chrome扩展收集超100万条帖子,分析发现社交媒体AI生成内容泛滥。整体AI检测率13.8%,长文(超250词)中25.72%完全由AI生成。LinkedIn最为严重,超40%长文帖子被标记为完全AI生成,占全部AI内容的62%;X/Twitter近一半文章(23.9%完全AI+22.9%混合)为AI写作。Reddit整体AI率仅4.4%,但顶层帖子AI率达11.6%。分析使用Pangram 3.3模型,假阳性率0.01%。Substack上长文AI率反而略低。

数据/训练现象/趋势
另有 2 家信源报道IT之家(RSS)The Decoder:AI News(RSS)
推荐理由:LinkedIn上40%的长文都是AI写的,这个数据比什么‘我感觉’都有说服力,所有做内容策略的人都该看一眼这篇报告。

7月9日

星期四 · 2 条
21:16
IT之家(RSS)精选
71
法国对英伟达反垄断调查接近尾声,聚焦 CUDA 生态和产业投资

法国竞争管理局确认,对英伟达的反垄断调查已近尾声,即将发布正式异议声明。调查聚焦两大问题:市场对CUDA平台的严重依赖,以及英伟达对CoreWeave等AI云计算公司的投资。英伟达占全球AI加速器超70%份额。若认定滥用市场支配地位,最高可处全球年营业额10%罚款。法国是首个准备正式指控英伟达的监管机构。

政策/监管数据/训练

推荐理由:法国快成为全球首个正式指控英伟达反垄断的监管机构,争议在CUDA生态紧耦合与芯片投资,这个案子能不能动摇AI芯片供应链,是所有人都该关心的节点信号。
07:27
Anthropic:Research(发表成果 · 网页)精选
68
面向AI模型双重用途知识的"开关":Anthropic与AE Studio提出GRAM方法

Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过在Transformer每层添加可移除的神经元模块,使模型在训练时将病毒学、网络安全、核物理、专业编程语言等双重用途知识仅路由到对应模块,而非扩散至全局。训练后删除模块即可消除该能力,保留则供可信部署使用。实验在合成数据、真实数据及50M到5B参数模型上测试,GRAM效果与数据过滤相当,移除模块不降低通用性能,且比事后“遗忘”技术更难恢复。该研究为平衡双重用途知识的安全访问与有益使用提供了更鲁棒的方案。

Anthropic安全/对齐数据/训练

推荐理由:这是Anthropic在模型安全对齐上的一个新尝试,提出可拆卸模块来精细控制有毒知识,同时保留一般性能。方法还未上Claude,但实验结果表明这条路可能比简单的拒绝训练更鲁棒。

7月8日

星期三 · 2 条
09:43
Hacker News 热门(buzzing.cc 中文翻译)精选
75
Pulpie:用于清理网络的Pareto最优模型

Pulpie是一族Pareto最优模型,用于从HTML页面提取主要内容。其最小模型pulpie-orange-small(210M参数)在WebMainBench上取得0.862的ROUGE-5 F1分数,接近600M参数的Dripper(0.864),但成本仅1/20。在NVIDIA L4 GPU上,Pulpie处理速度13.7页/秒,Dripper仅0.68页/秒。清理10亿页HTML,Pulpie成本约$7,900,Dripper需$159,000。模型采用编码器架构,单次前向传播即可标记每个HTML块为内容或模板,已在HuggingFace开源。

Hugging Face开源生态数据/训练模型发布

推荐理由:做网页清洗的同行该更新工具了,Pulpie 以二十分之一的成本追平 SOTA 质量,而且开箱即用,是今年数据管线里最值得换的组件之一。
01:10
BAIR:Berkeley AI Research Blog精选
62
智能免费,然后呢?--Data Systems for, of, and by Agents

AI推理成本急剧下降。GPT-4级能力从2023年初每百万token约30美元降至今天不到1美元,部分供应商已低于0.10美元。推理价格每年下降9至900倍,中位数约50倍。知识工作级智能即将近乎免费。这给数据系统带来三重变革:面向智能体的数据系统需支持智能体推测式探索——单个

智能体大佬观点数据/训练

推荐理由:当推理成本趋近免费,数据系统将经历从服务人到服务智能体的根本变革,这篇文章把'为智能体设计系统、用智能体运行系统、让智能体构建系统'三大挑战梳理得很清晰,做数据和 agent 基础设施的人应该读。

7月7日

星期二 · 2 条
23:10
Apple Machine Learning Research(RSS)精选
55
DynaMiCS:带性能约束的大语言模型动态混合微调

DynaMiCS是一种动态混合优化器,将多领域微调建模为带性能约束的优化问题。它通过短领域特定探测运行估计跨领域效应斜率矩阵,再基于概率单纯形优化计算混合权重,在提升目标领域性能的同时将约束领域损失维持在参考水平以下。实验表明,DynaMiCS相比固定混合基线取得更强的目标领域提升和约束满足,且计算成本更低,无需参考模型、逐样本评分或手动调节混合权重。

数据/训练论文/研究

推荐理由:苹果这篇论文做了一件不太起眼但有用的事——让模型在学新领域时自动平衡旧能力,不用手动调混合权重,对需要多任务微调又怕遗忘的团队是个小进步,不过算不上范式级突破。
01:18
TechCrunch:AI(RSS)精选
75
Google 更新隐私设置,默认用媒体数据训练 AI,用户可手动退出

Google 于 6 月通过客户邮件低调更新了搜索服务隐私设置,新增“搜索服务历史”和“个性化推荐”两项开关,默认将用户上传的图片、文件、音频和视频录制等媒体数据保存并用于训练 AI 模型。该更新适用于搜索、地图、购物、航班、酒店、翻译、新闻等服务。用户可通过取消勾选“保存媒体”框来退出,同时可设置数据自动删除周期(3/18/36 个月)。此前独立的网络与应用活动设置不再影响搜索服务数据保留。Meta 等其他公司也在大规模收集用户媒体数据用于 AI 训练。

Google教程/实践数据/训练

推荐理由:Google 悄悄把用户上传的媒体数据默认用于训练 AI,这篇教程是及时且实用的避坑指南,花两分钟改设置就能保护隐私,所有 Google 用户都该看看。

7月6日

星期一 · 1 条
17:06
Hacker News 热门(buzzing.cc 中文翻译)精选
75
AT&T 1956年专利法令:公共天才的私有化

1956年1月24日,全球最大私营公司AT&T签署专利法令,将其7,820项未过期专利免费授权给所有美国企业,并承诺未来专利按“合理费率”许可。作为交换,AT&T得以保留Western Electric,但被禁止进入电信以外的业务。贝尔实验室69%的非电信专利(涵盖化学、半导体、光学等)迅速公开,在短短几年内催生了约35亿美元衍生专利价值,并直接推动了肖克利半导体、仙童半导体及英特尔的诞生。戈登·摩尔称该法令是“商业半导体行业最重要的进展之一”,为美国硅谷的起飞奠定了基础。

政策/监管数据/训练现象/趋势

推荐理由:用贝尔实验室专利释放的历史对照今天前沿实验室的语料抓取,论证清晰且有新意。提出的“语料版税”虽非万能,但为互联网公共品被私人捕获提供了集体补救思路,每个在网上留下痕迹的人都该看一眼。

7月3日

星期五 · 4 条
12:07
IT之家(RSS)精选
80
阿里达摩院发布超导材料发现AI智能体Elements Claw

7月3日,阿里达摩院联合中国人民大学、中国科学院大学发布首个超导材料发现AI智能体Elements Claw。该智能体采用“专通融合”架构,基于1.25亿分子/晶体结构预训练的1B参数原子基础模型Elements,判断超导性AUC达0.996,预测临界温度平均误差小于1K。AI仅用28个GPU小时筛选240万晶体结构,预测出6.8万个候选材料,其中4种(Hf₂₁Re₂₅、Zr₄VRe₇、HfZrRe₄、Zr₃ScRe₈)已合成并验证超导性,临界温度最高6.5K。全部240万稳定晶体数据库已开放。

智能体arXiv数据/训练论文/研究

推荐理由:我认为这是 AI for Science 的标志性突破,AI 智能体第一次从头设计并实验证实了全新的超导材料,把 AI 角色从辅助推到「独立发现」,对做材料模拟和科学发现的团队是个转折点。
10:34
HuggingFace Daily Papers(社区热门论文)精选
74
Program-as-Weights:一种面向模糊函数的编程范式

Program-as-Weights (PAW) 提出模糊函数编程范式,将自然语言描述的函数编译为紧凑、可本地执行的神经制品。PAW 使用在 10M 示例数据集 FuzzyBench 上训练的 4B 编译器,为冻结的轻量级解释器输出参数高效适配器。0.6B 的 Qwen3 解释器执行 PAW 程序性能匹敌直接提示 Qwen3-32B,推理内存仅约五十分之一,在 MacBook M3 上达 30 tokens/s。该方法将基础模型从每次输入的求解器重新定义为工具构建器,一次函数定义后生成的制品可离线廉价复用。

推理数据/训练论文/研究部署/工程

推荐理由:这篇论文把模糊任务从调用大模型API变成了本地轻量函数,0.6B就能跑赢32B,省掉几十倍成本。对需要处理日志、JSON修复等经常性模糊任务的开发者是个真信号。
08:00
HuggingFace Daily Papers(社区热门论文)精选
72
SkillOpt-Lite:更快更好的智能体自我进化,只需一行代码

SkillOpt-Lite 将智能体技能优化形式化为零阶优化,提出文件系统轨迹探索、共识属性挖掘与独立验证门控三条原则。相比完整 SkillOpt,它加速收敛并在 LiveMath 上提升 GPT-5.5 达 +8.8 点、GPT-5.4-nano 达 +25.4 点,使 nano 模型超越标准 SkillOpt 优化的 GPT-5.4。该框架已集成至 VSCode Copilot,开发者仅需一行代码即可进化技能。框架还可泛化为完整工具链优化(HarnessOpt),在 SpreadsheetBench 上令 GPT-5.4-nano 达到 0.7758 准确率,超越运行标准流程的更大模型 GPT-5.5(0.7620)。代码已开源。

智能体数据/训练论文/研究

推荐理由:把复杂 agent 优化砍到一个最小可行管线,小模型靠它打大模型,VSCode Copilot 用一条 vibe 就能进化技能,做 agent 的人别错过。
01:08
Apple Machine Learning Research(RSS)精选
56
VideoFlexTok:可变长度粗到细视频分词

VideoFlexTok提出一种可变长度token序列的视频表示方法,采用粗到细结构——首个token捕捉语义和运动等抽象信息,后续token添加精细细节,生成流解码器支持任意token数量的视频重建。相比传统3D网格分词,该结构允许根据下游需求调整token数,在相同预算下编码更长视频。在类别和文本到视频生成任务中,VideoFlexTok以1.1B参数(5.2B的1/5)达到可比生成质量(gFVD和ViCLIP Score)。训练一个处理10秒81帧视频的文本到视频模型仅需672个token,比同等3D网格分词器少8倍。

数据/训练视频论文/研究

推荐理由:把视频 tokenization 从固定网格改成变长 coarse-to-fine,训练效率提升明显,还能做更长的视频。研究角度挺漂亮,但离产品落地还有距离,做视频生成的可以追一下。

7月2日

星期四 · 3 条
17:06
MarkTechPost(RSS)精选
72
Google Health API 推出 CLI:ghealth 是一款针对 Fitbit 数据的开源工具

ghealth 是一款封装 Google Health API v4 的开源命令行工具,以单个 Go 二进制文件发布(Apache 2.0 协议)。它提供 40 种已验证的数据类型(包括步数、心率、睡眠、体重、血氧饱和度、心率变异性等)的结构化 JSON 输出。工具采用 Agent 优先设计,具备确定性退出码、--dry-run 和 --raw 标志,并附带两个 SKILL.md 文件供 AI 智能体使用。用户需自行创建 OAuth 凭据,通过 PKCE S256 认证。数据来源覆盖 Fitbit、Pixel Watch 及连接的第三方设备。

GoogleMCP/工具开源/仓库数据/训练

推荐理由:把 Google Health API 封装成终端和 AI 代理友好的 CLI,一次性解决了认证、JSON 输出和分页这些烦人细节,想用 Fitbit 数据做健康分析或喂给代理的人可以直接上手,但它的影响仅限于个人健康数据爱好者这个小圈层。
02:02
TechCrunch:AI(RSS)精选
72
Cloudflare新政策:默认屏蔽混合爬虫,推动AI公司付费

Cloudflare宣布,自2026年9月15日起,其默认设置将屏蔽同时用于搜索、AI智能体及训练的“混合用途”爬虫访问托管广告的页面,除非站点所有者手动调整。此举旨在保护出版商内容不被无偿使用。同时将原有的“Pay Per Crawl”模式升级为“Pay Per Use”,允许出版商在内容创造价值时向AI公司收费,初期合作方为Ceramic.ai和You.com。Cloudflare数据显示,AI爬虫超过50%的抓取流量浪费在重复获取未变更页面上。新政策适用于新客户、现有客户的新站点及所有现有免费客户。

搜索数据/训练行业动态

推荐理由:Cloudflare用基础设施商的话语权重新划定了AI内容付费线,默认屏蔽混合爬虫这一刀切下去,从Google到创业公司都躲不开,出版商到底该分多少钱的讨论终于有了一个落地的支点。
01:39
Meta Engineering Blog(RSS)精选
71
Meta 大规模 AI 存储蓝图

Meta 运营数百 EB 级存储集群,基于 Tectonic 分层存储层构建 BLOB 存储架构,以应对两大挑战:最大化 GPU 利用率与研究迭代速度。传统 BLOB 架构的多层元数据查询可导致数百毫秒延迟,使 GPU 因 I/O 等待停顿。新架构将训练栈逐步迁移到 BLOB 存储接口上,利用闪存提供可预测的低 pMax 延迟,避免单 GPU 慢速拖慢整批任务。同时,统一的数据湖访问支持地理分布 GPU 间的数据高速注入与跨区移动,提升研究效率。

Meta数据/训练现象/趋势部署/工程

推荐理由:Meta的存储架构复盘给出了一条明确路径,从重写元数据到分层缓存,他们把GPU利用率和研究者迭代速度同时提升了一个档次,做AI训练平台的值得细读。

6月30日

星期二 · 6 条
05:35
Ars Technica:AI(RSS)精选
75
韩国将投入1万亿美元扩大存储芯片生产和发展人形机器人

韩国政府与三星、SK海力士等承诺1万亿美元实施三大旗舰项目。三星和SK海力士投资5850亿美元新建芯片工厂,目标五年内将DRAM产量翻倍;SK集团、GS集团和Naver投资3570亿美元在偏远省份建设AI数据中心;物理AI被指定为国家战略产业,现代汽车投资58亿美元建设机器人工厂和AI数据中心,计划到2028年每年生产3万台Atlas人形机器人,并在10大行业实现商业化。但现代汽车工会已批准罢工谈判,要求利润分享和岗位保护。

具身智能数据/训练端侧行业动态

推荐理由:韩国砸 1 万亿美元砸向内存芯片和机器人,不只是产能竞赛,更是试图锁住 AI 硬件供应链的关键位置。但工会抗议和芯片暴利税收争议也浮现,值得追踪。
05:26
Emad@EMostaque精选
79
美团LongCat的1.6万亿参数MoE模型Owl Alpha成为OpenRouter上最流行模型,累计消耗10万亿tokens,性能达Gemini/Opus 4.6级别。该模型使用35万亿tokens训练,完全在5万块国产ASIC上完成。据官方推文,Owl Alpha上线后每日调用量全球Top3,在Hermes Agent排名#1,Claude Code排名#2,OpenClaw排名#3。该模型即将退役,后续版本待公布。

Meituan LongCat: 你们有些人猜对了。👀 Owl Alpha 已经上线 @OpenRouter -- 那就是我们。 自上线以来,Owl Alpha 的日活量已跻身全球前三,并在 Hermes Agent 上排名第一,在 Claude Code 上排名第二,在...

开源生态数据/训练模型发布

推荐理由:中国团队用 5 万块自研 ASIC 训练出 1.6tr 参数 MoE,性能堪比 Gemini,还在 OpenRouter 悄悄成了最热模型——非 GPU 路线跑到量产的第一个真实信号,做推理部署的都应该看一眼。
05:01
SemiAnalysis@SemiAnalysis_精选
77
有意思:在GTC 2026宣布Rubin Ultra仅3个月后,原4-die Rubin Ultra因制造执行问题被取消。新的"Rubin Ultra"尺寸减半,实际性能约为原版的一半。1/4🧵
数据/训练行业动态

推荐理由:NVIDIA 原版 Rubin Ultra 取消并减半规格是今年硬件领域最大的意外,所有依赖下一代算力增长的公司都得重估路线图。
04:34
Tomer Tunguz 博客(VC 分析)精选
58
Anthropic:当AI成本超过工程师薪酬

Anthropic在算力上的支出达到每位工程师每年51.5万美元,是其完全薪资(22.4万美元)的2.3倍。相比之下,顶尖1%软件公司的算力支出为8.9万美元,中位数仅为1.37万美元。三个2029年情景预测了这一差距的缩小路径。

Anthropic大佬观点数据/训练

推荐理由:Tomer Tunguz 用数据把 AI 公司的烧钱速度拆得很细,Anthropic 每个工程师年算力成本 51.5 万美元,是工资的 2.3 倍,这个数字对重新理解 SaaS 毛利率很有冲击力。
00:00
Google Research:Blog(网页)精选
76
Google Research 推出 TabFM:用于表格数据的零样本基础模型

Google Research 发布 TabFM,一种基于上下文学习(ICL)的零样本基础模型,专为表格数据的分类与回归任务设计。TabFM 将整个数据集(包含训练样本与待预测行)作为统一提示输入,在推理时直接从上下文中学习行列关系,无需模型训练、超参数调优或特征工程。与需大量人工调优的传统方法(如 XGBoost)不同,TabFM 通过单次前向传播即可在新表格上生成高质量预测。该模型已在 Hugging Face 和 GitHub 上开源。

Google开源生态数据/训练模型发布

推荐理由:TabFM 把表格预测变成一次前向传播,不再需调参和特征工程,数据科学家可以少熬夜了。BigQuery 集成让使用门槛降到 SQL,这是表格 ML 的零样本时刻。
00:00
Google Research:Blog(网页)精选
61
Google Research 将建筑屋顶反射率数据集扩展至全球 50+ 城市

Google Research 发布扩展的建筑屋顶反射率数据集,覆盖全球 50 多个城市,旨在帮助城市规划者优先部署冷屋顶方案以缓解极端高温。该数据集融合 Sentinel-2 卫星数据与 30 厘米分辨率的 Airbus Pléiades Neo 卫星图像生成,可通过新的高分辨率 Heat Resilience Earth Engine App 开放获取。相关方法论发表于《Nature Communications》。此前 2024 年的试点已覆盖 14 个城市,其数据曾指导制定冷屋顶条例与适应计划。

Google产品更新多模态数据/训练

推荐理由:谷歌把屋顶反照率数据的精度做到30厘米,覆盖50+城市,还给了免费App,城市防暑从模糊规划变成可量化的工程,做气候韧性的人可以直接拿这个数据做方案,虽然只是特定领域应用,但AI落地真实场景的路径值得参考。

6月29日

星期一 · 1 条
15:01
IT之家(RSS)精选
71
SK 集团会长崔泰源:到 2035 年建设 15GW AI 数据中心,总投资达 1000 万亿韩元

SK 集团会长崔泰源 6 月 29 日宣布,计划到 2035 年建成 15GW AI 数据中心容量,作为韩国国家级基础设施和实体 AI 时代核心底座。项目总投资 1000 万亿韩元(约 4.4 万亿元人民币),未来 10 年保持年均 100 万亿韩元以上国内投资,旨在实现从出口传统商品向智能服务的转变,构建韩国智能市场。此外,SK 海力士将向韩国西南部投资 400 万亿韩元,半导体供应项目总投资达 1100 万亿韩元(约 4.84 万亿元人民币)。

数据/训练行业动态部署/工程

推荐理由:SK 集团喊出 1000 万亿韩元建 AI 数据中心,数字唬人但周期长达十年,更像一种姿态宣示,真正改变算力市场格局还得看后续执行力和融资落地。

6月28日

星期日 · 1 条
18:50
Elon Musk@elonmusk精选
70
Grok 4.5,基于我们的1.5T V9基础模型,并在补充训练中加入Cursor数据,现已在SpaceX和Tesla进入私测。初步评估显示其性能接近,或许超越Opus。 强化学习仍在持续显著改进模型,Grok Build工具链也在日益完善。 所有参与者的出色工作! 今年,@SpaceX 将每月发布完全从头训练的新模型。
xAI数据/训练模型发布

推荐理由:Elon 亲自宣布 Grok 4.5 内部测试,性能可能超过 Opus,虽然还没公开可用,但每月从零训练新模型的节奏,意味着算力军备竞赛还在加速。

6月27日

星期六 · 1 条
09:59
IT之家(RSS)精选
71
国家统计局:1-5月规上工业企业利润增18.8%,电子行业利润增103.9%贡献43.1%

1—5月全国规上工业企业利润同比增18.8%。电子行业利润增103.9%,贡献率43.1%,主因全球AI技术变革推动高端算力芯片和存储芯片需求爆发。原材料制造业利润增83.1%,其中有色增117.1%、化工增71.6%。高技术制造业利润增44.7%,电子专用材料制造增665.4%。企业每百元营收成本降0.59元,营收利润率5.56%,为2024年以来累计最高。

数据/训练行业动态

推荐理由:国家统计局这组数据让AI不再是融资故事,电子行业利润增长103.9%,AI需求是实实在在的引擎,硬件供应链的价值该被重估了。

6月26日

星期五 · 3 条
23:51
Dwarkesh Patel:Podcast & Blog(RSS)精选
61
下一个重大突破:AI在工作中学习

AI实验室的研究赌注是:在数千个多样化RL环境中训练模型完成数百万可验证任务,就能构建AGI。这种训练会培养出能连续数周处理开放任务、应对错误和歧义的问题解决技能。虽然模型训练时的样本效率仅为人类的百万分之一,但训练成本是一次性的,可摊销到数十亿次用户会话中;真正重要的是模型在单个会话内的智能和样本效率,而这随着RL训练正在提升。持续学习或许不再必要——如果上下文内的学习能力足够强、时间跨度足够长,就无需将经验蒸馏回权重。Transformer架构创新已能大幅扩展上下文存储,未来可能实现任意大的上下文窗口。论文还指出,一个领域不仅需要可验证性,还需要可碾压性——能在确定性、可重播的模拟器中并行运行大量rollout。

大佬观点推理数据/训练

推荐理由:RLVR 范式能否通向 AGI?Dwarkesh 指出关键瓶颈在于样本效率和 grindability,他提出的 OPSD 和 dreaming 方案重新定义了「学习中」的边界,虽然离落地尚远,但值得每一个关心 AI 下一步的人细读。
03:01
Hacker News 热门(buzzing.cc 中文翻译)精选
78
IBM 首度推出亚纳米级芯片技术

IBM 于 2026 年 6 月 25 日发布全球首款亚纳米级芯片技术,采用 0.7 nm(7 埃米)节点与全新三维纳米堆叠(nanostack)架构。指甲盖大小的芯片集成近 1000 亿个晶体管,密度约为 IBM 2021 年 2 nm 芯片的两倍。相比 2 nm 芯片,性能最高提升 50%,能效最高提升 70%。纳米堆叠架构还实现 SRAM 面积缩减 40%,有助于支撑先进 AI 工作负载的高带宽需求。该技术已在 VLSI 2026 会议上验证,IBM 预计 5 年内量产。

推理数据/训练论文/研究

推荐理由:IBM 把芯片制程推进到亚纳米,0.7nm 意味着 AI 芯片能塞进两倍晶体管,这对生成式 AI 的算力瓶颈是个好消息。虽然量产还要五年,但技术路线图清晰,值得关注。
00:37
TechCrunch:AI(RSS)精选
71
General Intuition 完成 3.2 亿美元融资,用游戏数据训练通用 AI 智能体

General Intuition 以 23 亿美元估值完成 3.2 亿美元融资,累计披露融资 4.54 亿美元。公司从旗下游戏剪辑平台 Medal 获取数亿小时含精确按键动作标签的游戏操作数据,训练单一模型同时驾驭 Fortnite 等虚拟环境和四足机器人。演示中,AI 智能体在游戏中连续运行 100 小时,机器人仅靠 8 分钟真实街道数据微调即可自主探索办公室。本轮由 Khosla Ventures 领投,General Catalyst、Jeff Bezos、Eric Schmidt 等参投。资金将用于通过 CoreWeave 扩大计算规模、预训练下一代模型,计划夏末前开放 API。

智能体具身智能数据/训练行业动态

推荐理由:用游戏按键数据训练世界模型,并在真机上八分钟完成适配,这个思路让具身智能看到了一条可规模化的路径。投资人押注的其实是 Medial 独有的动作标注数据飞轮。

6月25日

星期四 · 2 条
11:29
Hacker News 热门(buzzing.cc 中文翻译)精选
75
Anthropic称阿里巴巴非法获取了Claude AI模型的功能

Anthropic指控阿里巴巴未经授权提取了其Claude AI模型的能力。该指控基于Anthropic的调查,认为阿里巴巴通过逆向工程或其他手段复制了Claude的核心技术。目前阿里巴巴尚未公开回应。

Anthropic数据/训练行业动态
另有 1 家信源报道Ars Technica:AI(RSS)
推荐理由:Anthropic正式指控阿里巴巴非法提取Claude能力,这不是普通知识产权纠纷,而是头部AI公司对模型能力窃取的首次公开控诉,可能重塑API和开源生态的游戏规则。
00:15
Hugging Face:Blog(RSS)精选
66
NVIDIA NeMo AutoModel:一行代码加速Transformer MoE模型微调

NVIDIA NeMo AutoModel 是基于 Transformers v5 的开源库,添加 Expert Parallelism、DeepEP 融合 all-to-all 调度和 TransformerEngine 内核。在 MoE 模型微调中,相比原生 v5,训练吞吐量提升 3.4–3.7 倍,GPU 内存减少 29–32%,仅需改动一行 import。在 16 节点 128 张 H100 上全微调 Nemotron 3 Ultra 550B A55B 时,v5 因内存不足无法运行,而 AutoModel 凭借 EP=64 专家并行使训练可行。单节点 30B MoE 模型(如 Qwen3-30B-A3B)同样获得可量化的性能优势。

开源/仓库教程/实践数据/训练

推荐理由:英伟达的 NeMo AutoModel 把 MoE 模型微调速度提高了三倍多,内存省了近三分之一,代码只需改一行 import,做训练的可以立刻升级。

6月20日

星期六 · 3 条
16:27
Hacker News 热门(buzzing.cc 中文翻译)精选
72
GPT-5.5幻觉率达86%,GLM-5.2仅28%--大模型越大越不可靠

GLM-5.2(MIT开源,753B参数,约40B活跃)在AA Intelligence Index上仅比GPT-5.5低4分、比Claude Fable 5低9分,但其幻觉率仅28%,远低于GPT-5.5的86%和DeepSeek V4 Pro(1.6T参数,49B活跃)的94%。后者在AA-Omniscience基准上仅6%的问题会承认不知道。实际代码测试中,GLM-5.2用12秒和800个推理token识别出技术悖论,而DeepSeek V4 Pro耗费3分26秒和近10倍推理token后仍给出错误答案。模型规模增长正导致幻觉率飙升而非智力提升。

DeepSeekOpenAI数据/训练现象/趋势

推荐理由:这篇实测对比揭示了大型模型的致命幻觉问题,GPT-5.5 幻觉率高达 86% 远超 GLM-5.2 的 28%,模型选型不能只看 Benchmark 排名,「会不会不懂装懂」才是真分水岭。
08:00
HuggingFace Daily Papers(社区热门论文)精选
74
可验证搜索不是可学习的链式思维

论文以九个确定性生成器推理任务为测试床,证明可验证搜索无法作为可学习的CoT进行蒸馏。Cryptarithm任务中,即使backbone规模从3B到671B、采用多种CoT设计、基于可验证奖励的强化学习和自训练,蒸馏后准确率始终为0.01–0.07,而搜索求解器回答71%实例。模型能正确计算97–100%的算术步骤并将正确密码排在候选前八(71%),但无法前向推导。干预实验揭示密码键后,同一实例准确率从0.03提升至0.57。只有移除搜索、预计算组合核心为目录,让模型仅做回忆加验证,才能学会该任务(Private LB 0.92)。结论:蒸馏学到的是记忆和验证,而非搜索。

推理数据/训练论文/研究

推荐理由:这篇论文给CoT蒸馏泼了盆冷水,证明回溯搜索这种过程是学不会的,模型只能记住验证步骤。做推理微调的团队该重新审视自己的数据生成策略了。
01:14
Dwarkesh Patel:Podcast & Blog(RSS)精选
60
AI中心的数据黑洞

智能的一种定义是样本效率,但近年AI进步主要靠扩充数据分布和增加算力。强化学习本质是合成数据生成——投入大量算力通过验证器筛选“好”数据,再训练模型预测正确输出。这一过程需要每个领域和技能的海量人类专家示例,数据行业年收入已达数十亿美元。近日Epoch报告,开源模型仅落后前沿闭源模型4个月,原因在于数据可从公开API蒸馏,而超参数等不易复制。人类一生接触约2亿token,前沿模型训练在数十到数百T token之间,相差近百万倍——机器人、自动驾驶等领域同样存在巨大效率差距。

大佬观点数据/训练现象/趋势

推荐理由:Dwarkesh 把 AI 的‘笨’归因于数据效率远低于人类,计算虽简但直指要害,他给出的一个逆向洞察是开源模型四个月追上闭源,正是数据驱动进步的最好证据。

6月19日

星期五 · 1 条
15:55
HuggingFace Daily Papers(社区热门论文)精选
75
HumanScale:自我中心人类视频在具身预训练中可超越真实机器人数据

HumanScale项目比较了自我中心人类视频与遥操作真实机器人轨迹作为具身基础模型预训练数据源。经精心设计的过滤与标注流程后,基于自我中心数据预训练的模型在真实机器人动作预测上验证损失降低24%,分布内任务成功率高52.5%,分布外任务成功率高90%。研究验证了一种可扩展范式:先以人类视频预训练学习多样世界表征,再以少量标注机器人数据微调对齐动作空间。

具身智能数据/训练论文/研究

推荐理由:让机器人看人类干活视频,预训练效果居然比直接用真实机器人数据更好,这个反直觉发现可能彻底改变具身智能的数据策略,做机器人的值得认真读一读。