内容
精选全部 AI 动态热点榜AI 日报主题收藏
接入
Agent 接入
更多
关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态
来源全部一手资讯X
类型全部
全部模型产品行业论文教程观点
标签「数据/训练」清除

今天8月8日 周六

00:55Simon Willison 博客56Token 消耗危机来临:企业正争相削减 AI 开支
00:31Databricks:Blog(RSS)57Databricks 推出 FILE 原生列类型,面向多模态数据

8月7日周五

23:53Apple Machine Learning Research(RSS)64精选扩展分类流映射(Categorical Flow Maps)规模
23:26Artificial Intelligence News(RSS)27Stanford Evo 2 AI模型生成可杀灭大肠杆菌的噬菌体
23:11Nathan Lambert57Nathan Lambert 发布后训练免费视频课程
22:11Nathan Lambert27线性注意力模型实现零训练推理偏差
20:10IT之家(RSS)51寒武纪 2026 上半年归母净利润 23.11 亿元,同比增长 122.61%
18:55HuggingFace Daily Papers(社区热门论文)53MameLoshnLM:首个开源意第绪语 8B 语言模型与评测基准
18:00公众号:小红书技术(dots.llm)65精选小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026
17:55HuggingFace Daily Papers(社区热门论文)38TCFM:面向多语言文本嵌入平衡适配的任务条件流匹配
17:55HuggingFace Daily Papers(社区热门论文)40持续学习的范式转变:从参数中心到系统级适应
17:12Rohan Paul61字节跳动预训练10万亿参数模型
16:43🚨 AI News | TestingCatalog47字节跳动预训练10T参数模型
16:10IT之家(RSS)58SK 海力士宣布向龙仁 Y2、清州 M17 晶圆厂合计投资 54 万亿韩元
13:55HuggingFace Daily Papers(社区热门论文)52PaDoc:面向文档解析的布局引导并行解码
11:55HuggingFace Daily Papers(社区热门论文)56EnvACE:通过世界预演内化环境动态的智能体强化学习方法
10:55HuggingFace Daily Papers(社区热门论文)52DyPES-VLA:学习共享动力学先验与具身特定控制,实现跨具身操作
10:55HuggingFace Daily Papers(社区热门论文)42多语言数学推理中的 On-Policy Delta Distillation(OPD2)研究
10:55HuggingFace Daily Papers(社区热门论文)55AgentOPSD:面向智能体强化学习的递归自蒸馏方法
10:55HuggingFace Daily Papers(社区热门论文)52CalibForge:用对抗性求解器校准扩展可学习终端任务
10:10IT之家(RSS)55斯坦福团队用 AI 首次设计完整病毒基因组,16 种新型噬菌体可杀死大肠杆菌
08:10IT之家(RSS)34DeepSeek 官宣拟大幅上调 API 定价;OpenAI 将 ChatGPT 免费用户默认模型升级为 GPT-5.6 Luna
07:10IT之家(RSS)45英伟达开源 cuFile API,让 SSD 充当额外显存减少游戏卡顿
03:44Alexandr Wang43Scale AI 创始人警告数据公司涉华合作风险
03:40AI Notkilleveryoneism Memes ⏸️76精选科学家首次用AI制造新病毒
00:11AK36多模态预训练物理机制探究

8月6日周四

23:53Apple Machine Learning Research(RSS)29锁定预训练权重:深度低秩残差蒸馏方法解析
22:10Nathan Lambert43Nathan Lambert 课程终章:性格训练导论
22:10IT之家(RSS)55字节跳动被曝正讨论训练超 5 万亿参数模型,为国内已知最大规模
19:31Thomas Wolf45宪法训练与RLVR需共享数据流形
18:56阑夕52张一鸣定调字节不走蒸馏捷径
17:40Chubby♨️44OpenAI 创始研究员转投脑机接口,训练读心模型
16:55HuggingFace Daily Papers(社区热门论文)56ABSeeker:通过答案回溯信用分配训练长程搜索智能体
15:08AYi55Jeff Dean 离职 Google 创办 Discovery Loop
12:08IT之家(RSS)33消息称张一鸣内部下死命令:字节跳动不会依赖 AI 蒸馏技术改进模型
12:08AYi65马斯克:AI内存需求年增200%,景气撑到2028
12:00公众号:百度智能云(文心)50百度沧海MetaDB入选国际顶级学术会议NSDI'27
11:55HuggingFace Daily Papers(社区热门论文)65K-EXAONE 2.0 技术报告:LG AI Research 开源 750B 参数多语言 MoE 模型
10:55HuggingFace Daily Papers(社区热门论文)52Poly-OPD:面向能力可选流模型的多教师同策略蒸馏框架
10:55HuggingFace Daily Papers(社区热门论文)55多模态预训练的物理机制:知识流动、模态协同、早期统一与训练配方
已加载 40 条
全部 AI 动态
2026年8月8日星期六 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
标签「数据/训练」 · 2427 条清除

8月8日

星期六 · 2 条
00:55
Simon Willison 博客
56
Token 消耗危机来临:企业正争相削减 AI 开支

埃森哲内部数据显示,token 消耗的主要推手并非工程师,而是大量非工程人员。该公司智能体 AI 战略负责人透露,将 PDF 转为图片再转成 markdown 文件是最大的 token 消耗源之一。企业正因此争相控制 AI 相关支出。

大佬观点数据/训练
00:31
Databricks:Blog(RSS)
57
Databricks 推出 FILE 原生列类型,面向多模态数据

Databricks 发布 FILE 原生列类型,用于在 Lakehouse 中直接存储和管理多模态数据。该类型将文件作为一等公民纳入表结构,支持图像、音频、视频等非结构化数据与结构化数据统一处理,简化了多模态数据管线的构建与查询。

产品更新多模态数据/训练

8月7日

星期五 · 24 条
23:53
Apple Machine Learning Research(RSS)精选
64
扩展分类流映射(Categorical Flow Maps)规模

连续扩散与流匹配模型有望成为语言建模中自回归方法的有力替代,可解锁加速采样与倾斜等连续模态优势。近期研究通过高斯分布与one-hot编码数据分布间的简单流匹配过程,实现离散数据的连续生成,并借助分类流映射(CFMs)验证了加速采样的可行性,样本质量具有竞争力。

数据/训练论文/研究

推荐理由:研究将分类流映射扩展到大规模语言建模,为连续扩散替代自回归提供了实验证据,可能影响模型架构选择。
23:26
Artificial Intelligence News(RSS)
27
Stanford Evo 2 AI模型生成可杀灭大肠杆菌的噬菌体

斯坦福大学研究人员利用Evo 2生成式AI模型产生的DNA序列,合成了近300种噬菌体,实验室测试筛选出16种对大肠杆菌具有特别强杀灭活性的噬菌体。该研究以噬菌体ΦX174(读作“FYE-ex-1-7-4”)为核心,由化学工程助理教授Brian Hie领导。

数据/训练行业动态
23:11
Nathan Lambert@natolambert
57
Nathan Lambert 发布后训练免费视频课程

Nathan Lambert 完成其夏季项目:一套 20 个视频的免费后训练课程,约 12 小时内容,配套幻灯片可修改复用。课程覆盖核心基础及他认为重要性将上升的研究方向,并附有代码练习。为庆祝发布,其书籍在 Manning 平台使用代码 PBLambert 可享 50% 折扣。

教程/实践数据/训练
22:11
Nathan Lambert@natolambert
27
研究团队在TorchTitan RL + vLLM上为Gated DeltaNet(Qwen3.5-9B/35B-A3B)实现训练/生成逐位一致,logprob差为0,为开源首个线性注意力模型达成此目标。异步RL下,offpolicy=32时标准栈偏差超0.065,新方法保持约0.035。代价是训练吞吐量降低2-3倍,团队建议将其作为调试工具而非生产默认。

Yichuan Wang: Zero Train-Inference Mismatch - now for linear attention, and under async RL 🎯 We got bitwise-exact trainer/generator p...

开源生态推理数据/训练论文/研究
20:10
IT之家(RSS)
51
寒武纪 2026 上半年归母净利润 23.11 亿元,同比增长 122.61%

寒武纪发布 2026 年上半年财报,营业总收入 59.96 亿元,同比增长 108.13%;归母净利润 23.11 亿元,同比增长 122.61%,扣非净利润 21.66 亿元,同比增长 137.3%,业绩大幅超出市场预期。基本每股收益 3.68 元,同比增长 119.05%。研发投入占营业收入比例降至 11.72%,同比减少 7.09 个百分点,主要得益于营收规模快速扩张。

数据/训练行业动态
18:55
HuggingFace Daily Papers(社区热门论文)
53
MameLoshnLM:首个开源意第绪语 8B 语言模型与评测基准

MameLoshnLM 是首个专为意第绪语构建的开源 8B 参数语言模型,基于 Llama 3.1 8B 继续预训练而来。研究同时推出 Oytser 高质量意第绪语预训练语料库和 Kashes 多任务评测基准。在基准任务上,MameLoshnLM 优于同规模开源基线,且更好地捕捉了意第绪语特有的词汇与形态模式。

arXiv数据/训练论文/研究
18:00
公众号:小红书技术(dots.llm)精选
65
小红书联合浙大、复旦提出 CULTURE-MT:首个面向社媒翻译的「文化有效性」评测基准,入选 ICML 2026

小红书联合浙江大学、复旦大学提出 CULTURE-MT,这是首个面向中英社媒笔记翻译、兼顾文化符号传递与情感共鸣的评测基准,并首次提出「文化有效性」评估标准与自动评估模型 JUDGER(准确率 86.03%)。

arXivHugging Face开源生态数据/训练

推荐理由:CULTURE-MT将翻译评测从字面准确拉到文化传递,自动评估模型与开放榜单提供了可复现的评测-训练闭环,让改进不再凭感觉。
17:55
HuggingFace Daily Papers(社区热门论文)
38
TCFM:面向多语言文本嵌入平衡适配的任务条件流匹配

研究者提出任务条件流匹配(TCFM)框架,针对不同任务采用差异化训练目标:翻译任务使用流匹配,检索、分类等任务则用更契合其学习动态的目标,并结合教师引导与三阶段课程实现稳定适配。在 Indic Massive Text Embedding Benchmark 上,TCFM 取得新 SOTA,并泛化至不同嵌入模型家族,代码与数据集将在论文接收后公开。

arXiv数据/训练论文/研究
17:55
HuggingFace Daily Papers(社区热门论文)
40
持续学习的范式转变:从参数中心到系统级适应

持续学习正从参数中心机制转向系统级适应,涵盖训练策略、架构设计及权重适配之外的更广范畴。该综述提出When、How、Where三维框架:How涵盖off-policy、on-policy与超越梯度的优化,When覆盖预训练至推理阶段,Where区分内部参数与外部结构约束,并系统梳理了代表性方法及未来挑战。

arXiv数据/训练论文/研究
17:12
Rohan Paul@rohanpaul_ai
61
FT:字节跳动据报正在预训练一个参数高达10万亿的AI模型,远超Kimi K3的2.8万亿参数规模。FT还报道称,字节跳动一年多来一直避免蒸馏竞争对手的模型,倾向于独立开发模型。如果上述训练成功,字节跳动将证明其能够在不依赖竞争对手模型作为教师的情况下,执行前沿规模的预训练。
数据/训练行业动态
16:43
🚨 AI News | TestingCatalog@testingcatalog
47
据英国《金融时报》报道,字节跳动正在预训练一个约 10T 参数的大模型。考虑到他们在视频生成领域轻松占据主导地位的表现,我们或许也会在通用领域看到一些重大惊喜。年底将会非常热闹 🔥
数据/训练模型发布
16:10
IT之家(RSS)
58
SK 海力士宣布向龙仁 Y2、清州 M17 晶圆厂合计投资 54 万亿韩元

SK 海力士董事会批准向龙仁 Y2、清州 M17 两座晶圆厂合计投资 54 万亿韩元(约合 2,567.16 亿元人民币)。其中 Y2 投资 35.2 万亿韩元,将作为 DRAM 生产基地,主要生产 HBM 等新一代产品,计划 2029 年 6 月启用首个无尘室;M17 投资 19.1 万亿韩元,扩展 NAND 闪存生产设施,计划 2028 年 12 月启用首个无尘室。

数据/训练行业动态
13:55
HuggingFace Daily Papers(社区热门论文)
52
PaDoc:面向文档解析的布局引导并行解码

PaDoc 将预测布局视为共享页面表示上的分支结构,使布局流与区域内容分支并行推进,将解码深度降至最长布局-内容路径。在 OmniDocBench Full 上,PaDoc 取得 Overall 布局 F1 91.1,端到端解析器中 Overall 得分 94.24,Text Edit 0.038,Formula CDM 95.59。

多模态数据/训练论文/研究
11:55
HuggingFace Daily Papers(社区热门论文)
56
EnvACE:通过世界预演内化环境动态的智能体强化学习方法

EnvACE 提出一种智能体强化学习方法,用世界预演替代训练中的外部环境交互:策略先生成工具调用,再扮演环境生成响应,并基于预演结果继续决策,两端通过任务成功奖励端到端联合优化。

智能体数据/训练论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
52
DyPES-VLA:学习共享动力学先验与具身特定控制,实现跨具身操作

DyPES-VLA 提出一种跨具身视觉-语言-动作模型,通过未来预测目标训练 VLM 学习共享动力学先验,并利用具身特定的 MoE 动作头直接在原生动作空间生成控制,无需手动对齐异构动作。作为通用策略,它在 LIBERO 上达到 98.0% 成功率,在 RoboCasa-GR1 上为 59.25%,在 RoboTwin 2.0 上为 89.02%,在仿真和真实世界评估中均取得 SOTA 性能。

具身智能数据/训练论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
42
多语言数学推理中的 On-Policy Delta Distillation(OPD2)研究

一项针对 Qwen3 的研究发现,On-Policy Delta Distillation(OPD2)在多语言数学推理中持续优于原始 OPD,尤其在韩语和日语上提升显著,并普遍缩小了英语与韩语的性能差距。研究还显示,仅用英语数据的 OPD 虽能提升韩语和日语表现,但常使回答偏向英语,凸显了多语言数据对保持目标语言回答的重要性。

推理数据/训练论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
55
AgentOPSD:面向智能体强化学习的递归自蒸馏方法

AgentOPSD 提出一种免评论家的递归回合级信用分配方法,将 token 级师生对数概率差聚合为回合级证据,并在 log-odds 空间递归更新贝叶斯信念状态,将稀疏结果监督转化为回合级信用信号。

智能体GitHub数据/训练论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
52
CalibForge:用对抗性求解器校准扩展可学习终端任务

CalibForge 提出一种自主终端任务合成系统,通过多求解器校准和对比校准,将任务构建为受约束的对抗性作者-求解器循环,使候选任务处于可证明可解但未被统一求解的“可学习区”。

智能体arXiv数据/训练论文/研究
10:10
IT之家(RSS)
55
斯坦福团队用 AI 首次设计完整病毒基因组,16 种新型噬菌体可杀死大肠杆菌

斯坦福大学研究人员使用 AI 技术首次成功设计出完整基因组,产出的 16 种新型噬菌体在实验室中可有效杀死大肠杆菌,不会对人类构成威胁。团队开发的 Evo1 和 Evo2 模型以病毒、细菌、植物和人类的遗传代码为训练数据,通过微调预测“生命语言”。研究被视为“非常重要的转折点”,或为抗生素耐药感染提供新治疗路径。

数据/训练论文/研究
另有 2 家信源报道Ars Technica:AI(RSS)The Decoder:AI News(RSS)
08:10
IT之家(RSS)
34
DeepSeek 官宣拟大幅上调 API 定价;OpenAI 将 ChatGPT 免费用户默认模型升级为 GPT-5.6 Luna

DeepSeek 发布公告,计划近期整体上调 API 服务定价,预计涨幅较大,当前 API 按输入输出 Token 分别计费,分缓存命中情况计价。OpenAI 宣布将 ChatGPT 免费用户默认模型升级为 GPT-5.6 Luna,并为 Plus 和 Pro 用户更新聊天界面至 GPT-5.6 Sol。

DeepSeekOpenAI数据/训练行业动态
07:10
IT之家(RSS)
45
英伟达开源 cuFile API,让 SSD 充当额外显存减少游戏卡顿

英伟达在 2026 年黑帽大会上宣布开源 cuFile API 及其底层存储软件栈,该技术可让 SSD 充当额外显存,改善游戏或 AI 场景运行表现。cuFile 依托 DMA 将 NVMe 硬盘数据直接送入 GPU 内存,绕过主内存中转,实现毫秒级低延迟,缓解分布式 GPU 阵列中的“GPU 饥饿”问题。

开源/仓库数据/训练部署/工程
03:44
Alexandr Wang@alexandr_wang
43
令人担忧的是,为美国政府服务的数据公司(mercor、surge)同时也在与中国 AI 实验室合作。服务美国政府不应是一种商业便利,而必须是初创公司的基石原则。【引用 @aakashsabharwal】:美国公司不应向中国 AI 实验室出售数据。@scale_AI 不做这类业务,我们为此拒绝了收入。那些这样做的公司正在损害美国 AI 的领导地位,并危及国家安全。

Aakash Sabharwal: American companies should not be selling data to Chinese AI labs. @scale_AI doesn't do this work, and we have turned dow...

大佬观点数据/训练
03:40
AI Notkilleveryoneism Memes ⏸️@AISafetyMemes精选
76
superebola/acc 🚀🚀🚀【引用 @nytimes】:突发新闻:科学家首次利用人工智能制造出新病毒,在为医学进步带来希望的同时,也引发了该技术有朝一日可能被用于制造危险病原体的担忧。https://nyti.ms/4bxx7Wy

The New York Times: 突发新闻:科学家首次利用人工智能创造出新病毒,这一进展既为医学进步带来希望,同时也引发了该技术未来某天可能被用于制造危险病原体的担忧。https://nyti.ms/4bxx7Wy

安全/对齐数据/训练
00:11
AK@_akhaliq
36
迈向多模态预训练的物理机制知识流动、模态协同、早期统一与配方论文:https://huggingface.co/papers/2608.05000
Hugging Face多模态数据/训练论文/研究

8月6日

星期四 · 14 条
23:53
Apple Machine Learning Research(RSS)
29
锁定预训练权重:深度低秩残差蒸馏方法解析

Apple 提出深度低秩残差蒸馏方法,在锁定预训练权重的同时实现模型压缩。该方法通过低秩残差结构蒸馏知识,避免直接修改原始权重,从而保留预训练模型的既有能力。研究展示了该方法在保持模型质量的同时,为开源权重模型的高效适配提供了新路径。

数据/训练论文/研究
22:10
Nathan Lambert@natolambert
43
Nathan Lambert 课程终章:性格训练导论

Nathan Lambert 在其课程最后一讲发布“性格训练”导论,称该主题已深耕约 18 个月,具备高现实影响力且被前沿实验室广泛使用,但相关实证文献几乎空白。讲座涵盖性格训练定义、模型规范与宪章差异、现实动机、推荐论文及开放问题,旨在吸引更多研究者进入该领域。

安全/对齐教程/实践数据/训练
22:10
IT之家(RSS)
55
字节跳动被曝正讨论训练超 5 万亿参数模型,为国内已知最大规模

字节跳动正讨论训练参数规模超 5 万亿的模型,超过阿里的 Qwen 3.8-Max(2.4 万亿参数)和月之暗面的 K3(2.8 万亿参数),为国内已知参数规模最大的模型,但计划仍处早期阶段。

数据/训练行业动态
19:31
Thomas Wolf@Thom_Wolf
45
你肯定不希望宪法训练和RLVR(基于可验证奖励的强化学习)停留在不同的数据流形上,但模型一直令人恼火地擅长将细微差别划分到各自独立的表征空间中。
Hugging Face大佬观点数据/训练
18:56
阑夕@foxshuo
52
张一鸣定调字节不走蒸馏捷径

张一鸣在字节Seed内部会上表态,不将蒸馏当作提升AI模型能力的捷径,即便模型表现暂时落后于竞争对手。Seed内部不仅禁止蒸馏美国模型,连中国开源模型也不允许,并设有硬检测机制。此举被解读为技术路线选择,判断蒸馏会干扰自身训练突破,不愿被一时榜单捆住手脚。

大佬观点数据/训练现象/趋势
另有 1 家信源报道X:阿易 AI Notes (@AYi_AInotes)
17:40
Chubby♨️@kimmonismus
44
OpenAI 创始研究员转投脑机接口,训练读心模型

前 OpenAI 创始研究员 Naomi Bashkansky 已离职并加入 Conduit 担任创始研究员,该公司正训练模型以非侵入方式读取人类思维。她主张通过大幅扩展数据收集规模(比学术界大数个数量级)来实现“思想到文本”的脑机接口,并预测 2035 年前后可能出现类似心灵感应的应用。

Naomi Bashkansky: Two weeks ago, I resigned from OpenAI to join Conduit as a founding researcher, where we're training models to non-invas...

OpenAI数据/训练行业动态
16:55
HuggingFace Daily Papers(社区热门论文)
56
ABSeeker:通过答案回溯信用分配训练长程搜索智能体

研究提出答案回溯信用分配(ABC)框架,将稀疏的轨迹级结果转化为密集的步骤级奖励,以区分长程搜索智能体中的有效与错误动作。基于该框架训练的ABSeeker(Qwen3.5-4B,仅8.5k示例)在BrowseComp上达37.3%、BrowseComp-ZH上达39.1%;启用上下文管理后分别提升至55.3%和52.9%,超越同规模(4B)智能体并匹配约30B更大模型的性能。

智能体搜索数据/训练论文/研究
15:08
AYi@AYi_AInotes
55
Jeff Dean 离职 Google 创办 Discovery Loop

Jeff Dean 在 Google 工作 27 年后离职,与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 共同创办新公司 Discovery Loop,Google 作为早期投资人提供云算力支持。

Jeff Dean: Tomorrow will be my last day at Google after 27 years, and watching it grow from 25 people to 190,000+ has been an amazi...

Google推理数据/训练行业动态
另有 4 家信源报道X:Kim (@kimmonismus)IT之家(RSS)X:Sundar Pichai (@sundarpichai)X:Elvis Saravia (@omarsar0, DAIR.AI)
12:08
IT之家(RSS)
33
消息称张一鸣内部下死命令:字节跳动不会依赖 AI 蒸馏技术改进模型

字节跳动创始人张一鸣在上月 Seed 团队全体会议上明确表示,即使暂时落后于竞争对手,公司也不会依赖 AI 蒸馏技术来改进模型。该决定很大程度上受字节跳动与美国政府因 TikTok 所有权产生的复杂关系影响。字节跳动未被 Anthropic 指控蒸馏其 Claude 模型,一直保持相对低调。

数据/训练行业动态
12:08
AYi@AYi_AInotes
65
马斯克:AI内存需求年增200%,景气撑到2028

马斯克在SpaceX Q2财报会上称,内存供给年增20%,而AI需求年增超200%,价格只会涨不会跌。xAI本季度AI资本开支达158亿美元,2027年算力目标10GW;HBM建厂到量产需3-5年,2029年才能释放产能,景气度至少持续到2028年。定价权握在美光、海力士、三星手中,MU此前涨700%或只是开始。

AYi: 大家都在刷SpaceX上市首份财报,没人注意Musk扔的王炸:@SpaceX 要把AI数据中心搬到太空去, 而且不是科幻和概念PPT, 明年就开始发射。 就在昨天的财报电话会上, Musk直接宣布: SpaceX未来所有的AI算力, 不管是...

数据/训练现象/趋势
12:00
公众号:百度智能云(文心)
50
百度沧海MetaDB入选国际顶级学术会议NSDI'27

百度沧海·存储团队与北京大学、阿姆斯特丹自由大学合作的论文《MetaDB》入选NSDI'27 Operational Systems Track。该系统让底层数据库理解目录树结构,高并发同目录操作下吞吐最高提升10.7倍,已在百度智能云生产环境稳定运行超5年,支撑EB级存储规模。

数据/训练论文/研究部署/工程
11:55
HuggingFace Daily Papers(社区热门论文)
65
K-EXAONE 2.0 技术报告:LG AI Research 开源 750B 参数多语言 MoE 模型

LG AI Research 发布 K-EXAONE 2.0,一款通过扩展架构升级而来的开源多语言 MoE 模型,总参数 750B,每 token 激活约 37B,容量为此前版本的三倍以上。模型支持 256K token 上下文,多语言覆盖从六种扩至十种,在智能体编码与长上下文理解上提升最大,并以 Apache 2.0 协议开源。

安全/对齐推理数据/训练模型发布
另有 1 家信源报道IT之家(RSS)
10:55
HuggingFace Daily Papers(社区热门论文)
52
Poly-OPD:面向能力可选流模型的多教师同策略蒸馏框架

Poly-OPD 通过像素桥与冻结 DINOv2 空间监督,将异构多教师的互补能力整合进单一紧凑的流匹配学生模型。将 FLUX.1-dev 和 Z-Image 蒸馏至 2.5B 的 SD3.5-Medium 学生模型后,GenEval 从 67.3 提升至 73.3,超越两个更大的教师模型,DrawBench HPSv3 从 9.34 提升至 11.35。

arXiv图像生成数据/训练论文/研究
10:55
HuggingFace Daily Papers(社区热门论文)
55
多模态预训练的物理机制:知识流动、模态协同、早期统一与训练配方

一项系统研究揭示多模态预训练的内在机制:语言、视觉理解与视觉生成在跨模态知识传递中呈现不同影响模式与不对称性;数据“复杂度”决定模态协同与否,共享注意力与归一化加模态特定前馈层可促进协同。从极早期统一模态联合训练优于后期对齐或顺序训练,但延迟整合会引发“视觉惰性”现象。该研究仅用5%计算预算即可实现强生成性能,并通过训练多个13.5B MoE模型、2T tokens验证了结论。

多模态数据/训练论文/研究
已加载 40 条