内容
精选全部 AI 动态AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

精选

7月26日 · 周日
最新精选
全部模型产品行业论文技巧
标签「数据/训练」清除

7月23日周四

03:23Hacker News 热门(buzzing.cc 中文翻译)76GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace TokenizersGigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。推荐理由:GigaToken 把分词速度直接拉到 GB/s 级别,对处理大规模文本的团队是实打实的效率提升,数据集预处理不再是瓶颈。

7月22日周三

00:00Google Developers Blog(RSS)63Google 推出 Tunix:基于 JAX 的高吞吐智能体后训练库Google 发布 Tunix,一个基于 JAX 的原生后训练库,旨在消除多轮、使用工具的 LLM 推理智能体训练中的 TPU 闲置瓶颈。Tunix 通过高并发异步 rollout 与解耦的生产者-消费者流水线最大化硬件吞吐量,确保训练器持续获得数据。该库提供即插即用抽象和持续宏观级性能分析,便于集成自定义环境。推荐理由:Google 这个训练库直接解决 agent 训练中 TPU 空转的隐性成本,对做后训练的团队可能是基础设施级改进,值得跟进。

7月21日周二

14:22Hacker News 热门(buzzing.cc 中文翻译)81五家美国科技巨头因不透明AI融资隐性债务飙升至1.65万亿美元日经研究显示,Meta、Oracle等五家美国科技巨头的隐性债务在约四年内膨胀八倍,达到约1.65万亿美元,超过其实际债务。这些债务主要来自数据中心租赁和GPU供应合同,其中Meta的表外债务约4200亿美元,是其透明债务的近三倍。隐性债务的激增使投资者更难评估风险。推荐理由:日经的这项研究把AI军备竞赛的财务风险摊在桌面上,1.65万亿美元隐性债务比这些公司的账面债务高出数倍,押注AI长期增长的人都得看一眼这个黑洞。
09:20公众号:数字生命卡兹克64一个随机数就能识别AI模型身份:行为指纹技术可检测API中转站偷换模型布拉格经济大学研究员托马什·布鲁克纳发现,通过让模型反复输出1到100的随机数,可生成独一无二的“行为指纹”。对165个模型各问30次后发现,GPT-4o偏爱42和37,Claude Sonnet 5疯狂输出47,Qwen3-Max则30次全部回答42。该方法仅需约120条请求即可识别模型身份,错误率约10.6%,为验证API是否被偷换模型提供了轻量级方案。推荐理由:一个Token识别模型的妙招,轻巧但准确率高,对于被API中转站坑过的人来说简直是照妖镜,而且读起来像在破案。
02:49Hacker News 热门(buzzing.cc 中文翻译)74ArXiv上超30%新投稿文本特征与AI撰写一致一项对12,750篇ArXiv论文全文的检测显示,截至2026年7月,约32%的新投稿文本特征与AI撰写一致,该比例在2026年初峰值接近39%。计算机科学领域最高(65%),数学领域最低(0.7%)。检测器在0.4%假阳性率下可识别85%的AI学术文本。推荐理由:用 0.4% 假阳性门槛做锚,测出 ArXiv 上 AI 写作比例已超三成,计算机科学高达 65%,这是我见过最严谨的同类测量。

7月20日周一

20:49Hacker News 热门(buzzing.cc 中文翻译)70LoRA Speedrun 公开排行榜:6分05秒微调Qwen2.5-1.5B达GSM8K 61.1%准确率LoRA Speedrun项目推出公开排行榜,在固定硬件(单张L40S)上比拼Qwen2.5-1.5B的微调运行时间。当前纪录由@Saivineeth147以6分05秒保持,采用序列打包与仅完成损失掩码技术,相比基线11分57秒提速约2倍且准确率更高(61.1%)。项目提供免费Modal沙箱验证,任何提交需经3次独立复现确认。推荐理由:LoRA 微调领域的 nanoGPT speedrun,在固定硬件和任务上比墙钟时间,公开透明且可复现,做微调的开发者可以下场试试。
15:48IT之家(RSS)70上海科学智能研究院开放科学多模态基础模型"神珍"上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。

7月19日周日

21:30公众号:面壁智能(MiniCPM)68MiniCPM5-2B发布:4B以下全球性能第一,适配9款芯片面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。推荐理由:2B 参数做到 4B 以下综合第一,而且把数据治理和 Agent 训练流程也开源了,做端侧智能体的可以盯一下,只是还没正式开源,暂时摸不到。

7月18日周六

02:02宝玉81月之暗面在GTC 2026披露Kimi K2.5技术路线:用MuonClip、线性注意力与Agent Swarm重构三大基础组件月之暗面CEO杨植麟在GTC 2026演讲中提出用MuonClip优化器替代Adam,可将数据利用效率提升近一倍。同时推出Kimi Linear线性注意力,在百万Token上下文下全面超越全注意力;Agent Swarm已支持300个Agent并行工作。推荐理由:月之暗面把 Adam、全注意力和残差连接三大基础组件全换了,而且全部开源。这不是小修小补,是训练范式的替代路线,做模型训练的人应该仔细看看。

7月17日周五

16:13MarkTechPost(RSS)70NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。推荐理由:嵌入模型不是最热的赛道,但决定了你 Agent 看到什么——NVIDIA 把 1B 模型压缩到 RTEB 第二,NVFP4 量化后精度几乎不变,做 RAG 的值得换上。
08:00HuggingFace Daily Papers(社区热门论文)75NexForge:通过需求驱动任务合成扩展LLM智能体能力NexForge提出需求驱动框架,无需领域特定基础设施即可自动合成多样化可执行智能体任务与专家轨迹。该框架生成3.6K终端和2K办公任务,将Qwen3.5-35B-A3B Base在Terminal-Bench 2.0上从22.5%提升至52.0%,GDPval Elo从813提升至1338。推荐理由:NexForge 抛弃了靠人工造工具和仓库的老路,从需求出发自动合成训练数据,让 Qwen 基座在终端任务上逼近 Claude Opus,还开源了模型,做 agent 训练的值得细看数据生成思路。
08:00HuggingFace Daily Papers(社区热门论文)74从预训练到后训练:理解推理能力的强化学习缩放规律一项新研究以国际象棋为受控实验平台,系统探究了预训练与强化学习(RL)在推理任务中的交互关系。研究发现,给定RL计算量下的后训练性能可由预训练损失准确预测,且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上,更长预训练的检查点在RL下性能更高、提升更快。推荐理由:这篇论文提出一个将预训练与RL联系起来的缩放定律,用国际象棋当试验场,发现RL在不同难度问题上的效果很不一样,做训练的人可以据此重新想想算力怎么分。

7月16日周四

11:30公众号:千问APP(阿里)61千问APP联合武汉发布举办AI求职实战课,演示简历诊断与办公自动化千问APP与武汉发布在武汉举办AI求职实战课,现场演示了用千问进行简历诊断、PPT制作和表格分析。产品经理提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并展示了将486行杂乱销售数据浓缩为一页结论PPT的“建、理、算、析、呈”方法论。推荐理由:千问官方出的这套办公Prompt,从简历诊断到PPT救场再到经营数据清洗,方法论清晰可套用,求职者和日常办公的人可以直接拿来用,比泛泛的教程实在。
01:09OpenAI:官网动态(RSS · 排除企业/客户案例)67OpenAI 发布 GPT-Red:通过自动化红队测试提升模型鲁棒性OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。推荐理由:OpenAI 用自博弈训练出的红队模型 GPT-Red,把直接提示注入攻击成功率压到了 0.05%,而且没有降低模型能力。做 AI 安全的人应该好好读一下他们怎么实现这个飞轮的。

7月15日周三

02:35TechCrunch:AI(RSS)70Google 因 AI 训练再遭出版商集体诉讼包括 Hachette、Cengage、Elsevier 及作家 Scott Turow 在内的出版商与作者团体对 Google 提起集体诉讼,指控其未经授权使用受版权保护的作品训练 Gemini 模型,并故意移除或篡改版权信息以掩盖这一行为。原告称 Google 将原本仅用于 Google Books 搜索片段展示的书籍副本,以及 Google Play 商店上传的图书,非法用于 AI 训练。诉讼援引 Google 内部文件,其中指出此举可能带来“100 亿至 1000 亿美元的潜在罚款”。该案在纽约南区联邦地区法院提起。推荐理由:出版商集体诉讼谷歌,这次带上了内部文件警告‘可能面临千亿美元罚款’的弹药,是版权方对AI训练最有力的一次反击,值得关注后续发展。

7月14日周二

10:30公众号:面壁智能(MiniCPM)61面壁智能CTO曾国洋专访:端侧模型是AI落地关键路径面壁智能CTO曾国洋指出,端侧模型是AI落地的关键路径。其原创方法论“模型风洞”可在小规模实验中预测完整训练效果,并基于“知识密度”提出“面壁定律”:知识密度每3.5个月翻一番。2B参数的MiniCPM表现优于同期8B竞品。面壁已完成高通、联发科、英特尔、英伟达、AMD等芯片适配,新发布的BitCPM-CANN模型系列可在华为昇腾芯片上让同一内存多装约6倍模型。全双工全模态模型MiniCPM-o4.5支持实时打断与情绪调整。团队开发了全球首个完全由AI编写的生产级训练框架ForgeTrain,并引入行为模式库实现无需开口的“默契系统”。推荐理由:面壁选择了一条少有人走的端侧之路,这篇 CTO 专访把落地的真实困难、原创方法和他们的思考都摊开了,对做模型和做产品的人都有启发。

7月12日周日

23:34Satya Nadella75纳德拉提出"反向信息悖论":企业使用AI时需保护自身知识微软CEO萨提亚·纳德拉提出“反向信息悖论”:AI时代,买家为使用AI支付金钱,同时必须暴露专有知识(提示词、工具使用、纠正反馈等),这些“智力废气”被模型学习,导致信息不对称向卖家倾斜。企业需要真正的信任边界,确保自身数据、痕迹、评估、适配权重和记忆在边界内积累,未经同意不得外泄。纳德拉呼吁企业拥有私有评估、保留组织记忆所有权,并主张企业应有权使用模型输出微调或训练自有模型,以控制自身学习循环。推荐理由:Satya 提出的「反向信息悖论」直指企业 AI 部署的核心顾虑,建议具体可操作,尤其是评估集控制和编排层解耦,做企业 AI 的产品人现在就该读。

7月10日周五

08:20Google Research:Blog(网页)70Google Research 推出 SensorFM:面向可穿戴健康数据的通用基础模型Google Research 发布 SensorFM,一个在超过 100 万亿分钟多模态传感器数据上预训练的大规模基础模型,数据来自 500 万同意参与者,涵盖 100 多个国家及 20 余款 Fitbit 和 Pixel Watch 设备。SensorFM 学习通用的人体生理表征,可迁移至心血管、代谢、睡眠、心理健康及生活方式等 35 项健康预测任务,支持标签高效适配与数据填充,并可作为个人健康智能体的基础工具。该模型旨在解决传统可穿戴健康模型针对单一终点、难以泛化的问题。推荐理由:SensorFM 在 500 万人、万亿分钟传感器数据上训练出一个通用生理基础模型,35 项任务全面领先,自动调参的代理教室也很有想法,做健康 AI 的人值得细读。
08:00HuggingFace Daily Papers(社区热门论文)78GenCeption:视频生成模型作为通用视觉学习器论文提出 GenCeption,利用预训练文本到视频扩散模型作为前馈感知骨干,通过文本指令驱动完成深度估计、表面法线、相机位姿、指代分割和 3D 关键点预测等多种视觉任务。GenCeption 在多个基准上达到 SOTA,匹配或超越 DepthAnything3、SAM3、D4RT、VGGT-Omega 等专用模型。视频生成预训练骨干在同等设置下优于 V-JEPA 和 Video MAE 等替代范式。GenCeption 展现出数据与模型缩放特性,仅用 7 到 500 倍更少的训练数据即可达到 D4RT 和 VGGT-Omega 的同等性能。模型仅用合成人类视频训练,即可泛化到真实场景及动物、机器人等分布外物体类别。推荐理由:这篇论文提出用视频生成模型做通用视觉预训练,在深度、分割、姿态估计等一堆任务上吊打专业模型,甚至只用1/500的数据就追平D4RT。我觉得这可能是CV领域的‘GPT时刻’前兆,做视觉基础模型的人该认真看看。
06:21Hacker News 热门(buzzing.cc 中文翻译)72社交媒体AI生成内容泛滥:LinkedIn超过40%长文为AI写作安全公司Pangram通过Chrome扩展收集超100万条帖子,分析发现社交媒体AI生成内容泛滥。整体AI检测率13.8%,长文(超250词)中25.72%完全由AI生成。LinkedIn最为严重,超40%长文帖子被标记为完全AI生成,占全部AI内容的62%;X/Twitter近一半文章(23.9%完全AI+22.9%混合)为AI写作。Reddit整体AI率仅4.4%,但顶层帖子AI率达11.6%。分析使用Pangram 3.3模型,假阳性率0.01%。Substack上长文AI率反而略低。推荐理由:LinkedIn上40%的长文都是AI写的,这个数据比什么‘我感觉’都有说服力,所有做内容策略的人都该看一眼这篇报告。

7月9日周四

21:16IT之家(RSS)71法国对英伟达反垄断调查接近尾声,聚焦 CUDA 生态和产业投资法国竞争管理局确认,对英伟达的反垄断调查已近尾声,即将发布正式异议声明。调查聚焦两大问题:市场对CUDA平台的严重依赖,以及英伟达对CoreWeave等AI云计算公司的投资。英伟达占全球AI加速器超70%份额。若认定滥用市场支配地位,最高可处全球年营业额10%罚款。法国是首个准备正式指控英伟达的监管机构。推荐理由:法国快成为全球首个正式指控英伟达反垄断的监管机构,争议在CUDA生态紧耦合与芯片投资,这个案子能不能动摇AI芯片供应链,是所有人都该关心的节点信号。
07:27Anthropic:Research(发表成果 · 网页)68面向AI模型双重用途知识的"开关":Anthropic与AE Studio提出GRAM方法Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过在Transformer每层添加可移除的神经元模块,使模型在训练时将病毒学、网络安全、核物理、专业编程语言等双重用途知识仅路由到对应模块,而非扩散至全局。训练后删除模块即可消除该能力,保留则供可信部署使用。实验在合成数据、真实数据及50M到5B参数模型上测试,GRAM效果与数据过滤相当,移除模块不降低通用性能,且比事后“遗忘”技术更难恢复。该研究为平衡双重用途知识的安全访问与有益使用提供了更鲁棒的方案。推荐理由:这是Anthropic在模型安全对齐上的一个新尝试,提出可拆卸模块来精细控制有毒知识,同时保留一般性能。方法还未上Claude,但实验结果表明这条路可能比简单的拒绝训练更鲁棒。

7月8日周三

09:43Hacker News 热门(buzzing.cc 中文翻译)75Pulpie:用于清理网络的Pareto最优模型Pulpie是一族Pareto最优模型,用于从HTML页面提取主要内容。其最小模型pulpie-orange-small(210M参数)在WebMainBench上取得0.862的ROUGE-5 F1分数,接近600M参数的Dripper(0.864),但成本仅1/20。在NVIDIA L4 GPU上,Pulpie处理速度13.7页/秒,Dripper仅0.68页/秒。清理10亿页HTML,Pulpie成本约$7,900,Dripper需$159,000。模型采用编码器架构,单次前向传播即可标记每个HTML块为内容或模板,已在HuggingFace开源。推荐理由:做网页清洗的同行该更新工具了,Pulpie 以二十分之一的成本追平 SOTA 质量,而且开箱即用,是今年数据管线里最值得换的组件之一。
08:00HuggingFace Daily Papers(社区热门论文)88Agon:基于隐式对抗评分的跨模型竞争强化学习框架Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。推荐理由:这篇论文用「让两个模型互搏」代替了只看最终答案的RL训练,直接解决了推理模型「写得多、想得少」的毛病。0.6B小模型用这方法能超过4B的GRPO模型,做推理训练的人应该认真读一读。
01:10BAIR:Berkeley AI Research Blog62智能免费,然后呢?--Data Systems for, of, and by AgentsAI推理成本急剧下降。GPT-4级能力从2023年初每百万token约30美元降至今天不到1美元,部分供应商已低于0.10美元。推理价格每年下降9至900倍,中位数约50倍。知识工作级智能即将近乎免费。这给数据系统带来三重变革:面向智能体的数据系统需支持智能体推测式探索——单个推荐理由:当推理成本趋近免费,数据系统将经历从服务人到服务智能体的根本变革,这篇文章把'为智能体设计系统、用智能体运行系统、让智能体构建系统'三大挑战梳理得很清晰,做数据和 agent 基础设施的人应该读。

7月7日周二

23:10Apple Machine Learning Research(RSS)55DynaMiCS:带性能约束的大语言模型动态混合微调DynaMiCS是一种动态混合优化器,将多领域微调建模为带性能约束的优化问题。它通过短领域特定探测运行估计跨领域效应斜率矩阵,再基于概率单纯形优化计算混合权重,在提升目标领域性能的同时将约束领域损失维持在参考水平以下。实验表明,DynaMiCS相比固定混合基线取得更强的目标领域提升和约束满足,且计算成本更低,无需参考模型、逐样本评分或手动调节混合权重。推荐理由:苹果这篇论文做了一件不太起眼但有用的事——让模型在学新领域时自动平衡旧能力,不用手动调混合权重,对需要多任务微调又怕遗忘的团队是个小进步,不过算不上范式级突破。
01:18TechCrunch:AI(RSS)75Google 更新隐私设置,默认用媒体数据训练 AI,用户可手动退出Google 于 6 月通过客户邮件低调更新了搜索服务隐私设置,新增“搜索服务历史”和“个性化推荐”两项开关,默认将用户上传的图片、文件、音频和视频录制等媒体数据保存并用于训练 AI 模型。该更新适用于搜索、地图、购物、航班、酒店、翻译、新闻等服务。用户可通过取消勾选“保存媒体”框来退出,同时可设置数据自动删除周期(3/18/36 个月)。此前独立的网络与应用活动设置不再影响搜索服务数据保留。Meta 等其他公司也在大规模收集用户媒体数据用于 AI 训练。推荐理由:Google 悄悄把用户上传的媒体数据默认用于训练 AI,这篇教程是及时且实用的避坑指南,花两分钟改设置就能保护隐私,所有 Google 用户都该看看。

7月6日周一

17:06Hacker News 热门(buzzing.cc 中文翻译)75AT&T 1956年专利法令:公共天才的私有化1956年1月24日,全球最大私营公司AT&T签署专利法令,将其7,820项未过期专利免费授权给所有美国企业,并承诺未来专利按“合理费率”许可。作为交换,AT&T得以保留Western Electric,但被禁止进入电信以外的业务。贝尔实验室69%的非电信专利(涵盖化学、半导体、光学等)迅速公开,在短短几年内催生了约35亿美元衍生专利价值,并直接推动了肖克利半导体、仙童半导体及英特尔的诞生。戈登·摩尔称该法令是“商业半导体行业最重要的进展之一”,为美国硅谷的起飞奠定了基础。推荐理由:用贝尔实验室专利释放的历史对照今天前沿实验室的语料抓取,论证清晰且有新意。提出的“语料版税”虽非万能,但为互联网公共品被私人捕获提供了集体补救思路,每个在网上留下痕迹的人都该看一眼。

7月3日周五

12:07IT之家(RSS)80阿里达摩院发布超导材料发现AI智能体Elements Claw7月3日,阿里达摩院联合中国人民大学、中国科学院大学发布首个超导材料发现AI智能体Elements Claw。该智能体采用“专通融合”架构,基于1.25亿分子/晶体结构预训练的1B参数原子基础模型Elements,判断超导性AUC达0.996,预测临界温度平均误差小于1K。AI仅用28个GPU小时筛选240万晶体结构,预测出6.8万个候选材料,其中4种(Hf₂₁Re₂₅、Zr₄VRe₇、HfZrRe₄、Zr₃ScRe₈)已合成并验证超导性,临界温度最高6.5K。全部240万稳定晶体数据库已开放。推荐理由:我认为这是 AI for Science 的标志性突破,AI 智能体第一次从头设计并实验证实了全新的超导材料,把 AI 角色从辅助推到「独立发现」,对做材料模拟和科学发现的团队是个转折点。
10:34HuggingFace Daily Papers(社区热门论文)74Program-as-Weights:一种面向模糊函数的编程范式Program-as-Weights (PAW) 提出模糊函数编程范式,将自然语言描述的函数编译为紧凑、可本地执行的神经制品。PAW 使用在 10M 示例数据集 FuzzyBench 上训练的 4B 编译器,为冻结的轻量级解释器输出参数高效适配器。0.6B 的 Qwen3 解释器执行 PAW 程序性能匹敌直接提示 Qwen3-32B,推理内存仅约五十分之一,在 MacBook M3 上达 30 tokens/s。该方法将基础模型从每次输入的求解器重新定义为工具构建器,一次函数定义后生成的制品可离线廉价复用。推荐理由:这篇论文把模糊任务从调用大模型API变成了本地轻量函数,0.6B就能跑赢32B,省掉几十倍成本。对需要处理日志、JSON修复等经常性模糊任务的开发者是个真信号。
08:00HuggingFace Daily Papers(社区热门论文)72SkillOpt-Lite:更快更好的智能体自我进化,只需一行代码SkillOpt-Lite 将智能体技能优化形式化为零阶优化,提出文件系统轨迹探索、共识属性挖掘与独立验证门控三条原则。相比完整 SkillOpt,它加速收敛并在 LiveMath 上提升 GPT-5.5 达 +8.8 点、GPT-5.4-nano 达 +25.4 点,使 nano 模型超越标准 SkillOpt 优化的 GPT-5.4。该框架已集成至 VSCode Copilot,开发者仅需一行代码即可进化技能。框架还可泛化为完整工具链优化(HarnessOpt),在 SpreadsheetBench 上令 GPT-5.4-nano 达到 0.7758 准确率,超越运行标准流程的更大模型 GPT-5.5(0.7620)。代码已开源。推荐理由:把复杂 agent 优化砍到一个最小可行管线,小模型靠它打大模型,VSCode Copilot 用一条 vibe 就能进化技能,做 agent 的人别错过。
01:08Apple Machine Learning Research(RSS)56VideoFlexTok:可变长度粗到细视频分词VideoFlexTok提出一种可变长度token序列的视频表示方法,采用粗到细结构——首个token捕捉语义和运动等抽象信息,后续token添加精细细节,生成流解码器支持任意token数量的视频重建。相比传统3D网格分词,该结构允许根据下游需求调整token数,在相同预算下编码更长视频。在类别和文本到视频生成任务中,VideoFlexTok以1.1B参数(5.2B的1/5)达到可比生成质量(gFVD和ViCLIP Score)。训练一个处理10秒81帧视频的文本到视频模型仅需672个token,比同等3D网格分词器少8倍。推荐理由:把视频 tokenization 从固定网格改成变长 coarse-to-fine,训练效率提升明显,还能做更长的视频。研究角度挺漂亮,但离产品落地还有距离,做视频生成的可以追一下。

7月2日周四

17:06MarkTechPost(RSS)72Google Health API 推出 CLI:ghealth 是一款针对 Fitbit 数据的开源工具ghealth 是一款封装 Google Health API v4 的开源命令行工具,以单个 Go 二进制文件发布(Apache 2.0 协议)。它提供 40 种已验证的数据类型(包括步数、心率、睡眠、体重、血氧饱和度、心率变异性等)的结构化 JSON 输出。工具采用 Agent 优先设计,具备确定性退出码、--dry-run 和 --raw 标志,并附带两个 SKILL.md 文件供 AI 智能体使用。用户需自行创建 OAuth 凭据,通过 PKCE S256 认证。数据来源覆盖 Fitbit、Pixel Watch 及连接的第三方设备。推荐理由:把 Google Health API 封装成终端和 AI 代理友好的 CLI,一次性解决了认证、JSON 输出和分页这些烦人细节,想用 Fitbit 数据做健康分析或喂给代理的人可以直接上手,但它的影响仅限于个人健康数据爱好者这个小圈层。
02:02TechCrunch:AI(RSS)72Cloudflare新政策:默认屏蔽混合爬虫,推动AI公司付费Cloudflare宣布,自2026年9月15日起,其默认设置将屏蔽同时用于搜索、AI智能体及训练的“混合用途”爬虫访问托管广告的页面,除非站点所有者手动调整。此举旨在保护出版商内容不被无偿使用。同时将原有的“Pay Per Crawl”模式升级为“Pay Per Use”,允许出版商在内容创造价值时向AI公司收费,初期合作方为Ceramic.ai和You.com。Cloudflare数据显示,AI爬虫超过50%的抓取流量浪费在重复获取未变更页面上。新政策适用于新客户、现有客户的新站点及所有现有免费客户。推荐理由:Cloudflare用基础设施商的话语权重新划定了AI内容付费线,默认屏蔽混合爬虫这一刀切下去,从Google到创业公司都躲不开,出版商到底该分多少钱的讨论终于有了一个落地的支点。
01:39Meta Engineering Blog(RSS)71Meta 大规模 AI 存储蓝图Meta 运营数百 EB 级存储集群,基于 Tectonic 分层存储层构建 BLOB 存储架构,以应对两大挑战:最大化 GPU 利用率与研究迭代速度。传统 BLOB 架构的多层元数据查询可导致数百毫秒延迟,使 GPU 因 I/O 等待停顿。新架构将训练栈逐步迁移到 BLOB 存储接口上,利用闪存提供可预测的低 pMax 延迟,避免单 GPU 慢速拖慢整批任务。同时,统一的数据湖访问支持地理分布 GPU 间的数据高速注入与跨区移动,提升研究效率。推荐理由:Meta的存储架构复盘给出了一条明确路径,从重写元数据到分层缓存,他们把GPU利用率和研究者迭代速度同时提升了一个档次,做AI训练平台的值得细读。

6月30日周二

05:35Ars Technica:AI(RSS)75韩国将投入1万亿美元扩大存储芯片生产和发展人形机器人韩国政府与三星、SK海力士等承诺1万亿美元实施三大旗舰项目。三星和SK海力士投资5850亿美元新建芯片工厂,目标五年内将DRAM产量翻倍;SK集团、GS集团和Naver投资3570亿美元在偏远省份建设AI数据中心;物理AI被指定为国家战略产业,现代汽车投资58亿美元建设机器人工厂和AI数据中心,计划到2028年每年生产3万台Atlas人形机器人,并在10大行业实现商业化。但现代汽车工会已批准罢工谈判,要求利润分享和岗位保护。推荐理由:韩国砸 1 万亿美元砸向内存芯片和机器人,不只是产能竞赛,更是试图锁住 AI 硬件供应链的关键位置。但工会抗议和芯片暴利税收争议也浮现,值得追踪。
05:26Emad79美团LongCat Owl Alpha:OpenRouter最流行模型,1.6万亿MoE,国产ASIC训练美团LongCat的1.6万亿参数MoE模型Owl Alpha成为OpenRouter上最流行模型,累计消耗10万亿tokens,性能达Gemini/Opus 4.6级别。该模型使用35万亿tokens训练,完全在5万块国产ASIC上完成。据官方推文,Owl Alpha上线后每日调用量全球Top3,在Hermes Agent排名#1,Claude Code排名#2,OpenClaw排名#3。该模型即将退役,后续版本待公布。推荐理由:中国团队用 5 万块自研 ASIC 训练出 1.6tr 参数 MoE,性能堪比 Gemini,还在 OpenRouter 悄悄成了最热模型——非 GPU 路线跑到量产的第一个真实信号,做推理部署的都应该看一眼。
05:01SemiAnalysis77Rubin Ultra取消,新版尺寸性能减半有意思:在GTC 2026宣布Rubin Ultra仅3个月后,原4-die Rubin Ultra因制造执行问题被取消。新的“Rubin Ultra”尺寸减半,实际性能约为原版的一半。1/4🧵推荐理由:NVIDIA 原版 Rubin Ultra 取消并减半规格是今年硬件领域最大的意外,所有依赖下一代算力增长的公司都得重估路线图。
04:34Tomer Tunguz 博客(VC 分析)58Anthropic:当AI成本超过工程师薪酬Anthropic在算力上的支出达到每位工程师每年51.5万美元,是其完全薪资(22.4万美元)的2.3倍。相比之下,顶尖1%软件公司的算力支出为8.9万美元,中位数仅为1.37万美元。三个2029年情景预测了这一差距的缩小路径。推荐理由:Tomer Tunguz 用数据把 AI 公司的烧钱速度拆得很细,Anthropic 每个工程师年算力成本 51.5 万美元,是工资的 2.3 倍,这个数字对重新理解 SaaS 毛利率很有冲击力。
00:00Google Research:Blog(网页)76Google Research 推出 TabFM:用于表格数据的零样本基础模型Google Research 发布 TabFM,一种基于上下文学习(ICL)的零样本基础模型,专为表格数据的分类与回归任务设计。TabFM 将整个数据集(包含训练样本与待预测行)作为统一提示输入,在推理时直接从上下文中学习行列关系,无需模型训练、超参数调优或特征工程。与需大量人工调优的传统方法(如 XGBoost)不同,TabFM 通过单次前向传播即可在新表格上生成高质量预测。该模型已在 Hugging Face 和 GitHub 上开源。推荐理由:TabFM 把表格预测变成一次前向传播,不再需调参和特征工程,数据科学家可以少熬夜了。BigQuery 集成让使用门槛降到 SQL,这是表格 ML 的零样本时刻。
精选
2026年7月26日星期日 · AI 自动挑选的高价值内容
全部模型产品行业论文技巧

7月23日

星期四 · 1 条
03:23
Hacker News 热门(buzzing.cc 中文翻译)精选
76
GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace Tokenizers

GigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。

GitHub产品更新开源/仓库数据/训练

推荐理由:GigaToken 把分词速度直接拉到 GB/s 级别,对处理大规模文本的团队是实打实的效率提升,数据集预处理不再是瓶颈。

7月22日

星期三 · 1 条
00:00
Google Developers Blog(RSS)精选
63
Google 推出 Tunix:基于 JAX 的高吞吐智能体后训练库

Google 发布 Tunix,一个基于 JAX 的原生后训练库,旨在消除多轮、使用工具的 LLM 推理智能体训练中的 TPU 闲置瓶颈。Tunix 通过高并发异步 rollout 与解耦的生产者-消费者流水线最大化硬件吞吐量,确保训练器持续获得数据。该库提供即插即用抽象和持续宏观级性能分析,便于集成自定义环境。

Google产品更新数据/训练

推荐理由:Google 这个训练库直接解决 agent 训练中 TPU 空转的隐性成本,对做后训练的团队可能是基础设施级改进,值得跟进。

7月21日

星期二 · 3 条
14:22
Hacker News 热门(buzzing.cc 中文翻译)精选
81
五家美国科技巨头因不透明AI融资隐性债务飙升至1.65万亿美元

日经研究显示,Meta、Oracle等五家美国科技巨头的隐性债务在约四年内膨胀八倍,达到约1.65万亿美元,超过其实际债务。这些债务主要来自数据中心租赁和GPU供应合同,其中Meta的表外债务约4200亿美元,是其透明债务的近三倍。隐性债务的激增使投资者更难评估风险。

Meta数据/训练行业动态
另有 1 家信源报道IT之家(RSS)
推荐理由:日经的这项研究把AI军备竞赛的财务风险摊在桌面上,1.65万亿美元隐性债务比这些公司的账面债务高出数倍,押注AI长期增长的人都得看一眼这个黑洞。
09:20
公众号:数字生命卡兹克精选
64
一个随机数就能识别AI模型身份:行为指纹技术可检测API中转站偷换模型

布拉格经济大学研究员托马什·布鲁克纳发现,通过让模型反复输出1到100的随机数,可生成独一无二的“行为指纹”。对165个模型各问30次后发现,GPT-4o偏爱42和37,Claude Sonnet 5疯狂输出47,Qwen3-Max则30次全部回答42。该方法仅需约120条请求即可识别模型身份,错误率约10.6%,为验证API是否被偷换模型提供了轻量级方案。

arXiv数据/训练评测/基准

推荐理由:一个Token识别模型的妙招,轻巧但准确率高,对于被API中转站坑过的人来说简直是照妖镜,而且读起来像在破案。
02:49
Hacker News 热门(buzzing.cc 中文翻译)精选
74
ArXiv上超30%新投稿文本特征与AI撰写一致

一项对12,750篇ArXiv论文全文的检测显示,截至2026年7月,约32%的新投稿文本特征与AI撰写一致,该比例在2026年初峰值接近39%。计算机科学领域最高(65%),数学领域最低(0.7%)。检测器在0.4%假阳性率下可识别85%的AI学术文本。

数据/训练现象/趋势论文/研究

推荐理由:用 0.4% 假阳性门槛做锚,测出 ArXiv 上 AI 写作比例已超三成,计算机科学高达 65%,这是我见过最严谨的同类测量。

7月20日

星期一 · 2 条
20:49
Hacker News 热门(buzzing.cc 中文翻译)精选
70
LoRA Speedrun 公开排行榜:6分05秒微调Qwen2.5-1.5B达GSM8K 61.1%准确率

LoRA Speedrun项目推出公开排行榜,在固定硬件(单张L40S)上比拼Qwen2.5-1.5B的微调运行时间。当前纪录由@Saivineeth147以6分05秒保持,采用序列打包与仅完成损失掩码技术,相比基线11分57秒提速约2倍且准确率更高(61.1%)。项目提供免费Modal沙箱验证,任何提交需经3次独立复现确认。

GitHub开源/仓库数据/训练

推荐理由:LoRA 微调领域的 nanoGPT speedrun,在固定硬件和任务上比墙钟时间,公开透明且可复现,做微调的开发者可以下场试试。
15:48
IT之家(RSS)精选
70
上海科学智能研究院开放科学多模态基础模型"神珍"

上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。

GitHubHugging Face多模态开源/仓库

推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。

7月19日

星期日 · 1 条
21:30
公众号:面壁智能(MiniCPM)精选
68
MiniCPM5-2B发布:4B以下全球性能第一,适配9款芯片

面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。

数据/训练模型发布端侧
另有 2 家信源报道公众号:面壁智能(MiniCPM)IT之家(RSS)
推荐理由:2B 参数做到 4B 以下综合第一,而且把数据治理和 Agent 训练流程也开源了,做端侧智能体的可以盯一下,只是还没正式开源,暂时摸不到。

7月18日

星期六 · 1 条
02:02
宝玉@dotey精选
81
月之暗面在GTC 2026披露Kimi K2.5技术路线:用MuonClip、线性注意力与Agent Swarm重构三大基础组件

月之暗面CEO杨植麟在GTC 2026演讲中提出用MuonClip优化器替代Adam,可将数据利用效率提升近一倍。同时推出Kimi Linear线性注意力,在百万Token上下文下全面超越全注意力;Agent Swarm已支持300个Agent并行工作。

Jackywine: KIMI CEO杨植麟,一个视频带你彻底看懂大规模 AI 系统训练的秘密 自己看一遍比什么都重要

开源生态推理数据/训练论文/研究

推荐理由:月之暗面把 Adam、全注意力和残差连接三大基础组件全换了,而且全部开源。这不是小修小补,是训练范式的替代路线,做模型训练的人应该仔细看看。

7月17日

星期五 · 3 条
16:13
MarkTechPost(RSS)精选
70
NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一

NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。

检索增强数据/训练模型发布
另有 3 家信源报道X:Rohan Paul (@rohanpaul_ai)X:Kim (@kimmonismus)IT之家(RSS)
推荐理由:嵌入模型不是最热的赛道,但决定了你 Agent 看到什么——NVIDIA 把 1B 模型压缩到 RTEB 第二,NVFP4 量化后精度几乎不变,做 RAG 的值得换上。
08:00
HuggingFace Daily Papers(社区热门论文)精选
75
NexForge:通过需求驱动任务合成扩展LLM智能体能力

NexForge提出需求驱动框架,无需领域特定基础设施即可自动合成多样化可执行智能体任务与专家轨迹。该框架生成3.6K终端和2K办公任务,将Qwen3.5-35B-A3B Base在Terminal-Bench 2.0上从22.5%提升至52.0%,GDPval Elo从813提升至1338。

智能体arXiv开源生态数据/训练

推荐理由:NexForge 抛弃了靠人工造工具和仓库的老路,从需求出发自动合成训练数据,让 Qwen 基座在终端任务上逼近 Claude Opus,还开源了模型,做 agent 训练的值得细看数据生成思路。
08:00
HuggingFace Daily Papers(社区热门论文)精选
74
从预训练到后训练:理解推理能力的强化学习缩放规律

一项新研究以国际象棋为受控实验平台,系统探究了预训练与强化学习(RL)在推理任务中的交互关系。研究发现,给定RL计算量下的后训练性能可由预训练损失准确预测,且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上,更长预训练的检查点在RL下性能更高、提升更快。

推理数据/训练论文/研究

推荐理由:这篇论文提出一个将预训练与RL联系起来的缩放定律,用国际象棋当试验场,发现RL在不同难度问题上的效果很不一样,做训练的人可以据此重新想想算力怎么分。

7月16日

星期四 · 2 条
11:30
公众号:千问APP(阿里)精选
61
千问APP联合武汉发布举办AI求职实战课,演示简历诊断与办公自动化

千问APP与武汉发布在武汉举办AI求职实战课,现场演示了用千问进行简历诊断、PPT制作和表格分析。产品经理提出“给全材料、说明目标、定义标准、划定边界、索要可编辑文件”五步法,并展示了将486行杂乱销售数据浓缩为一页结论PPT的“建、理、算、析、呈”方法论。

教程/实践数据/训练

推荐理由:千问官方出的这套办公Prompt,从简历诊断到PPT救场再到经营数据清洗,方法论清晰可套用,求职者和日常办公的人可以直接拿来用,比泛泛的教程实在。
01:09
OpenAI:官网动态(RSS · 排除企业/客户案例)精选
67
OpenAI 发布 GPT-Red:通过自动化红队测试提升模型鲁棒性

OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。

OpenAI安全/对齐数据/训练
另有 5 家信源报道The Decoder:AI News(RSS)X:Greg Brockman (@gdb)X:OpenAI (@OpenAI)MarkTechPost(RSS)IT之家(RSS)
推荐理由:OpenAI 用自博弈训练出的红队模型 GPT-Red,把直接提示注入攻击成功率压到了 0.05%,而且没有降低模型能力。做 AI 安全的人应该好好读一下他们怎么实现这个飞轮的。

7月15日

星期三 · 1 条
02:35
TechCrunch:AI(RSS)精选
70
Google 因 AI 训练再遭出版商集体诉讼

包括 Hachette、Cengage、Elsevier 及作家 Scott Turow 在内的出版商与作者团体对 Google 提起集体诉讼,指控其未经授权使用受版权保护的作品训练 Gemini 模型,并故意移除或篡改版权信息以掩盖这一行为。原告称 Google 将原本仅用于 Google Books 搜索片段展示的书籍副本,以及 Google Play 商店上传的图书,非法用于 AI 训练。诉讼援引 Google 内部文件,其中指出此举可能带来“100 亿至 1000 亿美元的潜在罚款”。该案在纽约南区联邦地区法院提起。

Google政策/监管数据/训练
另有 1 家信源报道IT之家(RSS)
推荐理由:出版商集体诉讼谷歌,这次带上了内部文件警告‘可能面临千亿美元罚款’的弹药,是版权方对AI训练最有力的一次反击,值得关注后续发展。

7月14日

星期二 · 1 条
10:30
公众号:面壁智能(MiniCPM)精选
61
面壁智能CTO曾国洋专访:端侧模型是AI落地关键路径

面壁智能CTO曾国洋指出,端侧模型是AI落地的关键路径。其原创方法论“模型风洞”可在小规模实验中预测完整训练效果,并基于“知识密度”提出“面壁定律”:知识密度每3.5个月翻一番。2B参数的MiniCPM表现优于同期8B竞品。面壁已完成高通、联发科、英特尔、英伟达、AMD等芯片适配,新发布的BitCPM-CANN模型系列可在华为昇腾芯片上让同一内存多装约6倍模型。全双工全模态模型MiniCPM-o4.5支持实时打断与情绪调整。团队开发了全球首个完全由AI编写的生产级训练框架ForgeTrain,并引入行为模式库实现无需开口的“默契系统”。

大佬观点数据/训练端侧

推荐理由:面壁选择了一条少有人走的端侧之路,这篇 CTO 专访把落地的真实困难、原创方法和他们的思考都摊开了,对做模型和做产品的人都有启发。

7月12日

星期日 · 1 条
23:34
Satya Nadella@satyanadella精选
75
纳德拉提出"反向信息悖论":企业使用AI时需保护自身知识

微软CEO萨提亚·纳德拉提出“反向信息悖论”:AI时代,买家为使用AI支付金钱,同时必须暴露专有知识(提示词、工具使用、纠正反馈等),这些“智力废气”被模型学习,导致信息不对称向卖家倾斜。企业需要真正的信任边界,确保自身数据、痕迹、评估、适配权重和记忆在边界内积累,未经同意不得外泄。纳德拉呼吁企业拥有私有评估、保留组织记忆所有权,并主张企业应有权使用模型输出微调或训练自有模型,以控制自身学习循环。

Microsoft大佬观点数据/训练
另有 5 家信源报道IT之家(RSS)X:Berry Xia (@berryxia)X:小互 (@xiaohu)The Decoder:AI News(RSS)TechCrunch:AI(RSS)
推荐理由:Satya 提出的「反向信息悖论」直指企业 AI 部署的核心顾虑,建议具体可操作,尤其是评估集控制和编排层解耦,做企业 AI 的产品人现在就该读。

7月10日

星期五 · 3 条
08:20
Google Research:Blog(网页)精选
70
Google Research 推出 SensorFM:面向可穿戴健康数据的通用基础模型

Google Research 发布 SensorFM,一个在超过 100 万亿分钟多模态传感器数据上预训练的大规模基础模型,数据来自 500 万同意参与者,涵盖 100 多个国家及 20 余款 Fitbit 和 Pixel Watch 设备。SensorFM 学习通用的人体生理表征,可迁移至心血管、代谢、睡眠、心理健康及生活方式等 35 项健康预测任务,支持标签高效适配与数据填充,并可作为个人健康智能体的基础工具。该模型旨在解决传统可穿戴健康模型针对单一终点、难以泛化的问题。

Google多模态数据/训练模型发布

推荐理由:SensorFM 在 500 万人、万亿分钟传感器数据上训练出一个通用生理基础模型,35 项任务全面领先,自动调参的代理教室也很有想法,做健康 AI 的人值得细读。
08:00
HuggingFace Daily Papers(社区热门论文)精选
78
GenCeption:视频生成模型作为通用视觉学习器

论文提出 GenCeption,利用预训练文本到视频扩散模型作为前馈感知骨干,通过文本指令驱动完成深度估计、表面法线、相机位姿、指代分割和 3D 关键点预测等多种视觉任务。GenCeption 在多个基准上达到 SOTA,匹配或超越 DepthAnything3、SAM3、D4RT、VGGT-Omega 等专用模型。视频生成预训练骨干在同等设置下优于 V-JEPA 和 Video MAE 等替代范式。GenCeption 展现出数据与模型缩放特性,仅用 7 到 500 倍更少的训练数据即可达到 D4RT 和 VGGT-Omega 的同等性能。模型仅用合成人类视频训练,即可泛化到真实场景及动物、机器人等分布外物体类别。

多模态数据/训练论文/研究

推荐理由:这篇论文提出用视频生成模型做通用视觉预训练,在深度、分割、姿态估计等一堆任务上吊打专业模型,甚至只用1/500的数据就追平D4RT。我觉得这可能是CV领域的‘GPT时刻’前兆,做视觉基础模型的人该认真看看。
06:21
Hacker News 热门(buzzing.cc 中文翻译)精选
72
社交媒体AI生成内容泛滥:LinkedIn超过40%长文为AI写作

安全公司Pangram通过Chrome扩展收集超100万条帖子,分析发现社交媒体AI生成内容泛滥。整体AI检测率13.8%,长文(超250词)中25.72%完全由AI生成。LinkedIn最为严重,超40%长文帖子被标记为完全AI生成,占全部AI内容的62%;X/Twitter近一半文章(23.9%完全AI+22.9%混合)为AI写作。Reddit整体AI率仅4.4%,但顶层帖子AI率达11.6%。分析使用Pangram 3.3模型,假阳性率0.01%。Substack上长文AI率反而略低。

数据/训练现象/趋势
另有 2 家信源报道IT之家(RSS)The Decoder:AI News(RSS)
推荐理由:LinkedIn上40%的长文都是AI写的,这个数据比什么‘我感觉’都有说服力,所有做内容策略的人都该看一眼这篇报告。

7月9日

星期四 · 2 条
21:16
IT之家(RSS)精选
71
法国对英伟达反垄断调查接近尾声,聚焦 CUDA 生态和产业投资

法国竞争管理局确认,对英伟达的反垄断调查已近尾声,即将发布正式异议声明。调查聚焦两大问题:市场对CUDA平台的严重依赖,以及英伟达对CoreWeave等AI云计算公司的投资。英伟达占全球AI加速器超70%份额。若认定滥用市场支配地位,最高可处全球年营业额10%罚款。法国是首个准备正式指控英伟达的监管机构。

政策/监管数据/训练

推荐理由:法国快成为全球首个正式指控英伟达反垄断的监管机构,争议在CUDA生态紧耦合与芯片投资,这个案子能不能动摇AI芯片供应链,是所有人都该关心的节点信号。
07:27
Anthropic:Research(发表成果 · 网页)精选
68
面向AI模型双重用途知识的"开关":Anthropic与AE Studio提出GRAM方法

Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过在Transformer每层添加可移除的神经元模块,使模型在训练时将病毒学、网络安全、核物理、专业编程语言等双重用途知识仅路由到对应模块,而非扩散至全局。训练后删除模块即可消除该能力,保留则供可信部署使用。实验在合成数据、真实数据及50M到5B参数模型上测试,GRAM效果与数据过滤相当,移除模块不降低通用性能,且比事后“遗忘”技术更难恢复。该研究为平衡双重用途知识的安全访问与有益使用提供了更鲁棒的方案。

Anthropic安全/对齐数据/训练

推荐理由:这是Anthropic在模型安全对齐上的一个新尝试,提出可拆卸模块来精细控制有毒知识,同时保留一般性能。方法还未上Claude,但实验结果表明这条路可能比简单的拒绝训练更鲁棒。

7月8日

星期三 · 3 条
09:43
Hacker News 热门(buzzing.cc 中文翻译)精选
75
Pulpie:用于清理网络的Pareto最优模型

Pulpie是一族Pareto最优模型,用于从HTML页面提取主要内容。其最小模型pulpie-orange-small(210M参数)在WebMainBench上取得0.862的ROUGE-5 F1分数,接近600M参数的Dripper(0.864),但成本仅1/20。在NVIDIA L4 GPU上,Pulpie处理速度13.7页/秒,Dripper仅0.68页/秒。清理10亿页HTML,Pulpie成本约$7,900,Dripper需$159,000。模型采用编码器架构,单次前向传播即可标记每个HTML块为内容或模板,已在HuggingFace开源。

Hugging Face开源生态数据/训练模型发布

推荐理由:做网页清洗的同行该更新工具了,Pulpie 以二十分之一的成本追平 SOTA 质量,而且开箱即用,是今年数据管线里最值得换的组件之一。
08:00
HuggingFace Daily Papers(社区热门论文)精选
88
Agon:基于隐式对抗评分的跨模型竞争强化学习框架

Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。

arXiv推理数据/训练论文/研究

推荐理由:这篇论文用「让两个模型互搏」代替了只看最终答案的RL训练,直接解决了推理模型「写得多、想得少」的毛病。0.6B小模型用这方法能超过4B的GRPO模型,做推理训练的人应该认真读一读。
01:10
BAIR:Berkeley AI Research Blog精选
62
智能免费,然后呢?--Data Systems for, of, and by Agents

AI推理成本急剧下降。GPT-4级能力从2023年初每百万token约30美元降至今天不到1美元,部分供应商已低于0.10美元。推理价格每年下降9至900倍,中位数约50倍。知识工作级智能即将近乎免费。这给数据系统带来三重变革:面向智能体的数据系统需支持智能体推测式探索——单个

智能体大佬观点数据/训练

推荐理由:当推理成本趋近免费,数据系统将经历从服务人到服务智能体的根本变革,这篇文章把'为智能体设计系统、用智能体运行系统、让智能体构建系统'三大挑战梳理得很清晰,做数据和 agent 基础设施的人应该读。

7月7日

星期二 · 2 条
23:10
Apple Machine Learning Research(RSS)精选
55
DynaMiCS:带性能约束的大语言模型动态混合微调

DynaMiCS是一种动态混合优化器,将多领域微调建模为带性能约束的优化问题。它通过短领域特定探测运行估计跨领域效应斜率矩阵,再基于概率单纯形优化计算混合权重,在提升目标领域性能的同时将约束领域损失维持在参考水平以下。实验表明,DynaMiCS相比固定混合基线取得更强的目标领域提升和约束满足,且计算成本更低,无需参考模型、逐样本评分或手动调节混合权重。

数据/训练论文/研究

推荐理由:苹果这篇论文做了一件不太起眼但有用的事——让模型在学新领域时自动平衡旧能力,不用手动调混合权重,对需要多任务微调又怕遗忘的团队是个小进步,不过算不上范式级突破。
01:18
TechCrunch:AI(RSS)精选
75
Google 更新隐私设置,默认用媒体数据训练 AI,用户可手动退出

Google 于 6 月通过客户邮件低调更新了搜索服务隐私设置,新增“搜索服务历史”和“个性化推荐”两项开关,默认将用户上传的图片、文件、音频和视频录制等媒体数据保存并用于训练 AI 模型。该更新适用于搜索、地图、购物、航班、酒店、翻译、新闻等服务。用户可通过取消勾选“保存媒体”框来退出,同时可设置数据自动删除周期(3/18/36 个月)。此前独立的网络与应用活动设置不再影响搜索服务数据保留。Meta 等其他公司也在大规模收集用户媒体数据用于 AI 训练。

Google教程/实践数据/训练

推荐理由:Google 悄悄把用户上传的媒体数据默认用于训练 AI,这篇教程是及时且实用的避坑指南,花两分钟改设置就能保护隐私,所有 Google 用户都该看看。

7月6日

星期一 · 1 条
17:06
Hacker News 热门(buzzing.cc 中文翻译)精选
75
AT&T 1956年专利法令:公共天才的私有化

1956年1月24日,全球最大私营公司AT&T签署专利法令,将其7,820项未过期专利免费授权给所有美国企业,并承诺未来专利按“合理费率”许可。作为交换,AT&T得以保留Western Electric,但被禁止进入电信以外的业务。贝尔实验室69%的非电信专利(涵盖化学、半导体、光学等)迅速公开,在短短几年内催生了约35亿美元衍生专利价值,并直接推动了肖克利半导体、仙童半导体及英特尔的诞生。戈登·摩尔称该法令是“商业半导体行业最重要的进展之一”,为美国硅谷的起飞奠定了基础。

政策/监管数据/训练现象/趋势

推荐理由:用贝尔实验室专利释放的历史对照今天前沿实验室的语料抓取,论证清晰且有新意。提出的“语料版税”虽非万能,但为互联网公共品被私人捕获提供了集体补救思路,每个在网上留下痕迹的人都该看一眼。

7月3日

星期五 · 4 条
12:07
IT之家(RSS)精选
80
阿里达摩院发布超导材料发现AI智能体Elements Claw

7月3日,阿里达摩院联合中国人民大学、中国科学院大学发布首个超导材料发现AI智能体Elements Claw。该智能体采用“专通融合”架构,基于1.25亿分子/晶体结构预训练的1B参数原子基础模型Elements,判断超导性AUC达0.996,预测临界温度平均误差小于1K。AI仅用28个GPU小时筛选240万晶体结构,预测出6.8万个候选材料,其中4种(Hf₂₁Re₂₅、Zr₄VRe₇、HfZrRe₄、Zr₃ScRe₈)已合成并验证超导性,临界温度最高6.5K。全部240万稳定晶体数据库已开放。

智能体arXiv数据/训练论文/研究

推荐理由:我认为这是 AI for Science 的标志性突破,AI 智能体第一次从头设计并实验证实了全新的超导材料,把 AI 角色从辅助推到「独立发现」,对做材料模拟和科学发现的团队是个转折点。
10:34
HuggingFace Daily Papers(社区热门论文)精选
74
Program-as-Weights:一种面向模糊函数的编程范式

Program-as-Weights (PAW) 提出模糊函数编程范式,将自然语言描述的函数编译为紧凑、可本地执行的神经制品。PAW 使用在 10M 示例数据集 FuzzyBench 上训练的 4B 编译器,为冻结的轻量级解释器输出参数高效适配器。0.6B 的 Qwen3 解释器执行 PAW 程序性能匹敌直接提示 Qwen3-32B,推理内存仅约五十分之一,在 MacBook M3 上达 30 tokens/s。该方法将基础模型从每次输入的求解器重新定义为工具构建器,一次函数定义后生成的制品可离线廉价复用。

推理数据/训练论文/研究部署/工程

推荐理由:这篇论文把模糊任务从调用大模型API变成了本地轻量函数,0.6B就能跑赢32B,省掉几十倍成本。对需要处理日志、JSON修复等经常性模糊任务的开发者是个真信号。
08:00
HuggingFace Daily Papers(社区热门论文)精选
72
SkillOpt-Lite:更快更好的智能体自我进化,只需一行代码

SkillOpt-Lite 将智能体技能优化形式化为零阶优化,提出文件系统轨迹探索、共识属性挖掘与独立验证门控三条原则。相比完整 SkillOpt,它加速收敛并在 LiveMath 上提升 GPT-5.5 达 +8.8 点、GPT-5.4-nano 达 +25.4 点,使 nano 模型超越标准 SkillOpt 优化的 GPT-5.4。该框架已集成至 VSCode Copilot,开发者仅需一行代码即可进化技能。框架还可泛化为完整工具链优化(HarnessOpt),在 SpreadsheetBench 上令 GPT-5.4-nano 达到 0.7758 准确率,超越运行标准流程的更大模型 GPT-5.5(0.7620)。代码已开源。

智能体数据/训练论文/研究

推荐理由:把复杂 agent 优化砍到一个最小可行管线,小模型靠它打大模型,VSCode Copilot 用一条 vibe 就能进化技能,做 agent 的人别错过。
01:08
Apple Machine Learning Research(RSS)精选
56
VideoFlexTok:可变长度粗到细视频分词

VideoFlexTok提出一种可变长度token序列的视频表示方法,采用粗到细结构——首个token捕捉语义和运动等抽象信息,后续token添加精细细节,生成流解码器支持任意token数量的视频重建。相比传统3D网格分词,该结构允许根据下游需求调整token数,在相同预算下编码更长视频。在类别和文本到视频生成任务中,VideoFlexTok以1.1B参数(5.2B的1/5)达到可比生成质量(gFVD和ViCLIP Score)。训练一个处理10秒81帧视频的文本到视频模型仅需672个token,比同等3D网格分词器少8倍。

数据/训练视频论文/研究

推荐理由:把视频 tokenization 从固定网格改成变长 coarse-to-fine,训练效率提升明显,还能做更长的视频。研究角度挺漂亮,但离产品落地还有距离,做视频生成的可以追一下。

7月2日

星期四 · 3 条
17:06
MarkTechPost(RSS)精选
72
Google Health API 推出 CLI:ghealth 是一款针对 Fitbit 数据的开源工具

ghealth 是一款封装 Google Health API v4 的开源命令行工具,以单个 Go 二进制文件发布(Apache 2.0 协议)。它提供 40 种已验证的数据类型(包括步数、心率、睡眠、体重、血氧饱和度、心率变异性等)的结构化 JSON 输出。工具采用 Agent 优先设计,具备确定性退出码、--dry-run 和 --raw 标志,并附带两个 SKILL.md 文件供 AI 智能体使用。用户需自行创建 OAuth 凭据,通过 PKCE S256 认证。数据来源覆盖 Fitbit、Pixel Watch 及连接的第三方设备。

GoogleMCP/工具开源/仓库数据/训练

推荐理由:把 Google Health API 封装成终端和 AI 代理友好的 CLI,一次性解决了认证、JSON 输出和分页这些烦人细节,想用 Fitbit 数据做健康分析或喂给代理的人可以直接上手,但它的影响仅限于个人健康数据爱好者这个小圈层。
02:02
TechCrunch:AI(RSS)精选
72
Cloudflare新政策:默认屏蔽混合爬虫,推动AI公司付费

Cloudflare宣布,自2026年9月15日起,其默认设置将屏蔽同时用于搜索、AI智能体及训练的“混合用途”爬虫访问托管广告的页面,除非站点所有者手动调整。此举旨在保护出版商内容不被无偿使用。同时将原有的“Pay Per Crawl”模式升级为“Pay Per Use”,允许出版商在内容创造价值时向AI公司收费,初期合作方为Ceramic.ai和You.com。Cloudflare数据显示,AI爬虫超过50%的抓取流量浪费在重复获取未变更页面上。新政策适用于新客户、现有客户的新站点及所有现有免费客户。

搜索数据/训练行业动态

推荐理由:Cloudflare用基础设施商的话语权重新划定了AI内容付费线,默认屏蔽混合爬虫这一刀切下去,从Google到创业公司都躲不开,出版商到底该分多少钱的讨论终于有了一个落地的支点。
01:39
Meta Engineering Blog(RSS)精选
71
Meta 大规模 AI 存储蓝图

Meta 运营数百 EB 级存储集群,基于 Tectonic 分层存储层构建 BLOB 存储架构,以应对两大挑战:最大化 GPU 利用率与研究迭代速度。传统 BLOB 架构的多层元数据查询可导致数百毫秒延迟,使 GPU 因 I/O 等待停顿。新架构将训练栈逐步迁移到 BLOB 存储接口上,利用闪存提供可预测的低 pMax 延迟,避免单 GPU 慢速拖慢整批任务。同时,统一的数据湖访问支持地理分布 GPU 间的数据高速注入与跨区移动,提升研究效率。

Meta数据/训练现象/趋势部署/工程

推荐理由:Meta的存储架构复盘给出了一条明确路径,从重写元数据到分层缓存,他们把GPU利用率和研究者迭代速度同时提升了一个档次,做AI训练平台的值得细读。

6月30日

星期二 · 5 条
05:35
Ars Technica:AI(RSS)精选
75
韩国将投入1万亿美元扩大存储芯片生产和发展人形机器人

韩国政府与三星、SK海力士等承诺1万亿美元实施三大旗舰项目。三星和SK海力士投资5850亿美元新建芯片工厂,目标五年内将DRAM产量翻倍;SK集团、GS集团和Naver投资3570亿美元在偏远省份建设AI数据中心;物理AI被指定为国家战略产业,现代汽车投资58亿美元建设机器人工厂和AI数据中心,计划到2028年每年生产3万台Atlas人形机器人,并在10大行业实现商业化。但现代汽车工会已批准罢工谈判,要求利润分享和岗位保护。

具身智能数据/训练端侧行业动态

推荐理由:韩国砸 1 万亿美元砸向内存芯片和机器人,不只是产能竞赛,更是试图锁住 AI 硬件供应链的关键位置。但工会抗议和芯片暴利税收争议也浮现,值得追踪。
05:26
Emad@EMostaque精选
79
美团LongCat的1.6万亿参数MoE模型Owl Alpha成为OpenRouter上最流行模型,累计消耗10万亿tokens,性能达Gemini/Opus 4.6级别。该模型使用35万亿tokens训练,完全在5万块国产ASIC上完成。据官方推文,Owl Alpha上线后每日调用量全球Top3,在Hermes Agent排名#1,Claude Code排名#2,OpenClaw排名#3。该模型即将退役,后续版本待公布。

Meituan LongCat: 你们有些人猜对了。👀 Owl Alpha 已经上线 @OpenRouter -- 那就是我们。 自上线以来,Owl Alpha 的日活量已跻身全球前三,并在 Hermes Agent 上排名第一,在 Claude Code 上排名第二,在...

开源生态数据/训练模型发布

推荐理由:中国团队用 5 万块自研 ASIC 训练出 1.6tr 参数 MoE,性能堪比 Gemini,还在 OpenRouter 悄悄成了最热模型——非 GPU 路线跑到量产的第一个真实信号,做推理部署的都应该看一眼。
05:01
SemiAnalysis@SemiAnalysis_精选
77
有意思:在GTC 2026宣布Rubin Ultra仅3个月后,原4-die Rubin Ultra因制造执行问题被取消。新的"Rubin Ultra"尺寸减半,实际性能约为原版的一半。1/4🧵
数据/训练行业动态

推荐理由:NVIDIA 原版 Rubin Ultra 取消并减半规格是今年硬件领域最大的意外,所有依赖下一代算力增长的公司都得重估路线图。
04:34
Tomer Tunguz 博客(VC 分析)精选
58
Anthropic:当AI成本超过工程师薪酬

Anthropic在算力上的支出达到每位工程师每年51.5万美元,是其完全薪资(22.4万美元)的2.3倍。相比之下,顶尖1%软件公司的算力支出为8.9万美元,中位数仅为1.37万美元。三个2029年情景预测了这一差距的缩小路径。

Anthropic大佬观点数据/训练

推荐理由:Tomer Tunguz 用数据把 AI 公司的烧钱速度拆得很细,Anthropic 每个工程师年算力成本 51.5 万美元,是工资的 2.3 倍,这个数字对重新理解 SaaS 毛利率很有冲击力。
00:00
Google Research:Blog(网页)精选
76
Google Research 推出 TabFM:用于表格数据的零样本基础模型

Google Research 发布 TabFM,一种基于上下文学习(ICL)的零样本基础模型,专为表格数据的分类与回归任务设计。TabFM 将整个数据集(包含训练样本与待预测行)作为统一提示输入,在推理时直接从上下文中学习行列关系,无需模型训练、超参数调优或特征工程。与需大量人工调优的传统方法(如 XGBoost)不同,TabFM 通过单次前向传播即可在新表格上生成高质量预测。该模型已在 Hugging Face 和 GitHub 上开源。

Google开源生态数据/训练模型发布

推荐理由:TabFM 把表格预测变成一次前向传播,不再需调参和特征工程,数据科学家可以少熬夜了。BigQuery 集成让使用门槛降到 SQL,这是表格 ML 的零样本时刻。