内容
精选全部 AI 动态热点榜AI 日报主题收藏
模型
模型榜
更多
Agent 接入关于更新日志反馈
京ICP备2026012723号-2
精选全部日报更多
反馈

全部 AI 动态

全部动态模型 · 94 条
来源全部一手资讯X
类型模型
全部模型产品行业论文教程观点
标签「数据/训练」清除

8月25日周二

17:27Hacker News 热门(buzzing.cc 中文翻译)61汤森路透推出自有"前沿"模型
14:54X.PIN54汤森路透推出首个大语言模型 Thomson,基于阿里 Qwen3.5-397B 构建

8月24日周一

22:24IT之家(RSS)57路透社母公司汤森路透花 4000 万美元研发 AI 模型,基于阿里千问
21:29The Decoder:AI News(RSS)60Thomson Reuters 斥资 4000 万美元自研法律大模型"Thomson"
01:59MarkTechPost(RSS)50Harvey 推出基于 Kimi K3 的后训练模型 Harvey Tenet

8月22日周六

06:54Nathan Lambert48Marin 535B-A23B 启动训练,全程开源
06:48🚨 AI News | TestingCatalog42Meta Muse Spark 1.2 上线 OpenRouter

8月21日周五

21:07OpenBMB69精选面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型
00:48elvis47Harvey 推出首个法律专用后训练模型 Tenet

8月20日周四

03:40Generalist39GEN-1.5 发布:秒级学习新任务的一次性学习者

8月19日周三

23:30Ant Ling53蚂蚁百灵开源 Ling-3.0 六个基础模型检查点
22:48Rohan Paul51Ornith-1.5 开源模型发布,多项基准超越 Claude Opus 4.8
14:44Dongxi 东锡 NLP44唐杰谈 Scaling Law:GLM-5.3 后训练实验
13:28jietang56唐杰谈缩放定律:GLM-5.3 后训练实验
03:50Rohan Paul55Synthefy 推出结构化数据基础模型平台,开源模型 Nori 免训练预测新行
02:24Rohan Paul39Synthefy 发布 Nori,30M 参数挑战 1.6B 模型

8月17日周一

08:22IT之家(RSS)31我国科学家发布大豆垂直大模型"丰菽"2.0,推动实现辅助育种

8月14日周五

10:02HuggingFace Daily Papers(社区热门论文)66Intern-S2-Preview:面向科学发现的智能体基础模型

8月13日周四

15:51MarkTechPost(RSS)47Dyna Robotics 发布 Dyna-2:基于100万小时人类视频预训练的世界-动作模型
14:15IT之家(RSS)62机器人 AI 模型 DYNA-2 登场:超 100 万小时人类视频训练,任务成功率可达 90%
08:00HuggingFace Daily Papers(社区热门论文)61DFM Mimir v1:仅用合规后训练数据,1B 参数开源 HRM 模型实现前沿性能

8月11日周二

20:11蚂蚁 inclusionAI:HuggingFace 新模型65精选蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型
20:11蚂蚁 inclusionAI:HuggingFace 新模型63同事件蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型同一事件,精选展示《蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点》
20:11蚂蚁 inclusionAI:HuggingFace 新模型64同事件蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型同一事件,精选展示《蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点》
20:10蚂蚁 inclusionAI:HuggingFace 新模型64同事件蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型同一事件,精选展示《蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点》
20:07蚂蚁 inclusionAI:HuggingFace 新模型63精选蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点
03:46Rohan Paul50Dyna-2 用百万小时人类视频预训练机器人

8月7日周五

21:12The Decoder:AI News(RSS)49字节跳动正在训练中国最大AI模型,参数规模达十万亿
16:43🚨 AI News | TestingCatalog47字节跳动预训练10T参数模型

8月6日周四

11:55HuggingFace Daily Papers(社区热门论文)65K-EXAONE 2.0 技术报告:LG AI Research 开源 750B 参数多语言 MoE 模型

7月28日周二

13:25Hacker News 热门(buzzing.cc 中文翻译)71精选FeyNoBg 发布:开源自动背景去除模型,在四项基准上达到 SOTA

7月27日周一

14:50IT之家(RSS)44谷歌 CEO 皮查伊确认 Gemini 4 已投入训练,预计年底发布

7月25日周六

01:53fofr44Photon-1 凭屏幕录像学会用电脑

7月21日周二

15:22Rohan Paul50马斯克确认SpaceX工程数据将训练Grok 2T模型

7月20日周一

16:18Hacker News 热门(buzzing.cc 中文翻译)66小米发布机器人策略模型 Xiaomi-Robotics-1
15:48IT之家(RSS)70精选上海科学智能研究院开放科学多模态基础模型"神珍"
06:45MarkTechPost(RSS)57Feyn AI 发布 SQRL 文本转 SQL 模型族,查询前先探查数据库

7月19日周日

21:30公众号:面壁智能(MiniCPM)68精选MiniCPM5-2B发布:4B以下全球性能第一,适配9款芯片

7月18日周六

05:44MarkTechPost(RSS)40Zyphra 发布 ZUNA1.1:Apache 2.0 许可的 EEG 基础模型,支持 0.5 至 30 秒可变长度输入

7月17日周五

16:13MarkTechPost(RSS)70精选NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一
已加载 40 条
全部 AI 动态
2026年8月26日星期三 · AI 相关资讯全量信息流
全部模型产品行业论文教程观点
模型 · 标签「数据/训练」 · 94 条清除

8月25日

星期二 · 2 条
17:27
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 61/100
汤森路透推出自有"前沿"模型

汤森路透发布其首个自研大语言模型Thomson,基于开源基础投入4000万美元训练,成本远低于同类前沿模型,且完全由公司自有和控制。早期评估显示Thomson在多项任务上与最新前沿模型持平,尤其在指令遵循和密集专业内容推理上提升显著。公司已向学术机构开放评估,并在Hugging Face发布“small”版本开源权重供学术与非商业使用。

开源生态数据/训练模型发布
14:54
X.PIN@thexpin
AI 评分 54/100
汤森路透推出首个大语言模型 Thomson,基于阿里 Qwen3.5-397B 构建

汤森路透推出其首个大语言模型 Thomson,基于阿里 Qwen3.5-397B 构建,总研发投入约 4000 万美元。该模型与帝国理工学院联合重训以保障安全与政治中立,并用自有内容进一步训练。Thomson 在斯坦福 LegalBench 得分 0.823,在 Harvey 法律智能体基准上接近 Opus 4.8。

推理数据/训练模型发布

8月24日

星期一 · 3 条
22:24
IT之家(RSS)
AI 评分 57/100
路透社母公司汤森路透花 4000 万美元研发 AI 模型,基于阿里千问

汤森路透发布首款大语言模型Thomson,基于阿里千问Qwen3.5-397B构建,研发成本约4000万美元,外界流传的45万美元仅为最后一次训练成本。该模型在Stanford LegalBench得分0.823,落后于Gemini 3.1 Pro和GPT-5.5。汤森路透称不采用闭源模型是因外部模型长期成本较高且无法高自由度调整。

数据/训练模型发布
21:29
The Decoder:AI News(RSS)
AI 评分 60/100
Thomson Reuters 斥资 4000 万美元自研法律大模型"Thomson"

Thomson Reuters 基于阿里 Qwen 推出自研法律大模型“Thomson”,投入约 4000 万美元,训练数据来自 Westlaw 等自有内容。在 Stanford LegalBench 上 Thomson(0.823)落后于 Gemini 3.1 Pro 和 GPT-5.5,仅在接入独家内容时以 0.83 对 0.82 微弱胜过 GPT 5.4。

Hugging Face数据/训练模型发布
01:59
MarkTechPost(RSS)
AI 评分 50/100
Harvey 推出基于 Kimi K3 的后训练模型 Harvey Tenet

Harvey 发布其首个后训练模型 Tenet 研究预览版,基于 Kimi K3 基座,针对长时程法律工作训练。相比基座,Tenet 在 LAB 上完成近两倍保留任务,在 LAB: Contracts 上多 20%,全通过率分别提升 9 和 2 个百分点。目前未公开权重或 API,仅限企业通过 Harvey 平台使用。

智能体数据/训练模型发布

8月22日

星期六 · 2 条
06:54
Nathan Lambert@natolambert
AI 评分 48/100
Marin 535B-A23B 本周启动训练,全程开源。计划在 11 台 GB200 NVL72 上以 18.75T tokens 训练约 3 个月(2.7e24 FLOPs),其中预训练占 80%、中期训练占 20%,后续将进行后训练。团队此前已用 1.6B-A61M 至 27.7B-A1.2B 的四级缩放阶梯验证并预测主运行表现。

Percy Liang: 🚢 Marin 535B-A23B started training this week! As usual, the whole process is open. Voyage plan: pretraining (80%) + mid...

开源生态数据/训练模型发布
06:48
🚨 AI News | TestingCatalog@testingcatalog
AI 评分 42/100
Meta 的 Muse Spark 1.2 contributor 版本现已上线 OpenRouter,输入 $0.10/M、输出 $0.20/M。该版本以低于 GPT-5.6 Luna 的价格提供 GPT-5.6 Terra 的性能,但 contributor 模式意味着提示词和输出可能被用于改进 Meta 产品。

Meta for Developers: Excited to bring the Muse Spark 1.2 Contributor tier to @openrouter today. We can't wait to see what developers build wi...

Meta数据/训练模型发布

8月21日

星期五 · 2 条
21:07
OpenBMB@OpenBMB精选
AI 评分 69/100
面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型

面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。

开源生态推理数据/训练模型发布

推荐理由:数学形式化的难点是编译通过但语义漂移,该框架用检索规划和语义一致性反馈迭代修正,并开源数据集和 8B 模型,给小模型做形式化提供了可复用路径。
00:48
elvis@omarsar0
AI 评分 47/100
Harvey 推出首个法律专用后训练模型 Tenet,基于 Kimi K3 底座与 FireworksAI 合作训练。相比底座,Tenet 在 LAB 上全通过率提升 82%、LAB Contracts 提升 22%,后者达 SOTA 并位居 LAB 第二,推理成本低于主流基础模型的四分之一。

Harvey: Introducing Tenet, our first model post-trained for legal. Tenet is a Kimi K3 base that we post-trained with @FireworksA...

智能体数据/训练模型发布

8月20日

星期四 · 1 条
03:40
Generalist@GeneralistAI
AI 评分 39/100
推出 GEN-1.5,一个一次性学习者。它能在几秒内学会新任务。向它展示要做什么,它便能泛化。这一能力源于在大规模物理数据上的预训练,是迈向为物理世界构建通用智能这一使命的一步。
具身智能数据/训练模型发布

8月19日

星期三 · 6 条
23:30
Ant Ling@AntLingAGI
AI 评分 53/100
蚂蚁百灵开源 Ling-3.0 六个基础模型检查点

蚂蚁百灵开源 Ling-3.0-tiny 与 Ling-3.0-flash 的 6 个 Base Model 检查点,覆盖预训练、中期训练及 WSM 合并阶段,均未经过后训练。其用 WSM 替代 LR 衰减进行加权检查点合并,支持持续预训练与离线策略探索;社区可在 tiny-base 上验证策略后扩展至 flash-base。

开源生态数据/训练模型发布
另有 1 家信源报道IT之家(RSS)
22:48
Rohan Paul@rohanpaul_ai
AI 评分 51/100
Ornith-1.5 开源模型发布,多项基准超越 Claude Opus 4.8

Ornith-1.5 开源 LLM 家族发布,含 9B Dense、35B MoE 和 397B MoE 三档,其中 397B 在 Terminal-Bench 2.1(86.1)、SWE-bench Verified(86)、WideSearch(80.8)和 BrowseComp(86.6)上均超越 Claude Opus 4.8。

Ornith: Aloha! 🌺Introducing Ornith-1.5, a family of open-source LLMs spanning 9B Dense, 35B MoE, and 397B MoE, trained with sel...

Anthropic开源生态数据/训练模型发布
另有 2 家信源报道IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)
14:44
Dongxi 东锡 NLP@dongxi_nlp
AI 评分 44/100
唐杰(@jietang)发文反思 Scaling Law,指出参数量并非唯一关键,需结合数据、算力与推理成本综合考量,并回顾 Kaplan 与 Chinchilla 的演进。智谱 GLM-5.3 作为受控实验发布,与 GLM-5.2 基础、架构及参数量相同,仅通过一个月长程环境与 RL 后训练,带来显著提升,证明缩放不止一个旋钮。

jietang: Thoughts About Scaling Law Scaling, but not only of parameters. Every model release now ends with the same question: how...

推理数据/训练模型发布
13:28
jietang@jietang
AI 评分 56/100
唐杰谈缩放定律:GLM-5.3 后训练实验

唐杰发文反思缩放定律,指出参数规模需与数据、算力、推理成本等维度协同考量,Chinchilla 最优比例并非终点。他宣布 GLM-5.3 作为受控实验:与 GLM-5.2 同架构、同参数,仅通过一个月长程环境与 RL 后训练,带来显著提升,证明缩放不止参数一个旋钮。

推理数据/训练模型发布
03:50
Rohan Paul@rohanpaul_ai
AI 评分 55/100
Synthefy 推出结构化数据基础模型平台,开源模型 Nori 免训练预测新行

Synthefy 推出面向结构化数值数据的基础模型平台,其开源模型 Nori 无需训练或微调,通过将标注行作为上下文存储,即可在前向传播中预测新行。仅 30M 参数的 Nori-30M 在公共回归基准上媲美 Google 1.6B 参数的 TabFM,开启思考模式后更以约 2% 的规模超越后者。

Google开源生态数据/训练模型发布
02:24
Rohan Paul@rohanpaul_ai
AI 评分 39/100
Synthefy 发布 Nori,30M 参数挑战 1.6B 模型

Synthefy 推出面向结构化数值数据的基座模型平台 Nori,用户只需提供少量标注行即可预测新数据。仅 30M 参数的 Nori-30M 在公开回归基准上媲美 Google 的 1.6B 参数 TabFM。公司同步宣布完成 650 万美元种子轮融资,由 Wing VC 领投。

Synthefy: We are announcing our $6.5M seed round led by @Wing_VC, with @haystackvc, @samsungnext, Canonical @ai, @LightscapeVC, an...

数据/训练模型发布

8月17日

星期一 · 1 条
08:22
IT之家(RSS)
AI 评分 31/100
我国科学家发布大豆垂直大模型"丰菽"2.0,推动实现辅助育种

安徽农业大学王晓波教授团队在南宁发布大豆垂直大模型“丰菽”2.0,实现多模态数据融合,降低单一模型回答偏差,助力大豆数据辅助育种。该模型新增多模型协同分析机制,嵌入通用大模型接口,由总结模块综合分析各模型回答的共识、差异及证据完整性。目前“丰菽”2.0 集成豆百科、豆分子等六大功能模块,整合超 1000 万字专业文本、1 万篇科研文献,构建含 2 万实体、10 万关系的知识图谱。

多模态数据/训练模型发布

8月14日

星期五 · 1 条
10:02
HuggingFace Daily Papers(社区热门论文)
AI 评分 66/100
Intern-S2-Preview:面向科学发现的智能体基础模型

Intern-S2-Preview 是一系列科学智能体基础模型,支持多模态科学理解、推理、生成及长周期任务。其训练流程涵盖科学多模态预训练、监督微调、可扩展多任务强化学习及智能体强化学习,并采用部分回滚、自适应长度正则化等技术提升稳定性。Intern-S2-Preview-397B 在多项科学、多模态及智能体基准上取得领先结果,其时间序列模块提升了 SciTS 上的信号理解与预测能力。

智能体多模态数据/训练模型发布

8月13日

星期四 · 3 条
15:51
MarkTechPost(RSS)
AI 评分 47/100
Dyna Robotics 发布 Dyna-2:基于100万小时人类视频预训练的世界-动作模型

Dyna Robotics 发布 Dyna-2,一个在超100万小时第一人称人类视频上预训练的世界-动作模型(WAM),用于机器人操作。研究团队验证了从1,000到1,000,000小时数据的缩放定律,并首次将该定律零样本迁移至未见过的机器人数据;视频联合去噪在39/39任务上优于仅动作训练,将零样本机器人MSE从0.340降至0.120。

具身智能数据/训练模型发布
14:15
IT之家(RSS)
AI 评分 62/100
机器人 AI 模型 DYNA-2 登场:超 100 万小时人类视频训练,任务成功率可达 90%

具身智能公司 Dyna Robotics 发布机器人基础模型 DYNA-2,基于超 100 万小时第一人称人类视频预训练,任务成功率最高达 90%。该模型通过预测下一帧画面及应采取动作,补足传统视觉语言模型缺失的空间推理与接触物理能力。

具身智能数据/训练模型发布
08:00
HuggingFace Daily Papers(社区热门论文)
AI 评分 61/100
DFM Mimir v1:仅用合规后训练数据,1B 参数开源 HRM 模型实现前沿性能

DFM 发布 Mimir v1,一个基于 Hierarchical Reasoning Model(HRM)架构的 10 亿参数语言模型,从头训练并仅使用合规后训练数据,在英语上表现极具竞争力,并在丹麦语上创下新 SOTA。

开源生态数据/训练模型发布

8月11日

星期二 · 6 条
20:11
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 65/100
蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型

蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型,含 tiny 与 flash 两个尺寸及预训练、中期训练、合并(WSM)等阶段检查点。该系列采用混合线性注意力与稀疏 MoE 架构,总参数 7.9B,每 token 仅激活 1.3B 参数(128 个路由专家中激活 8 个)。

Hugging Face开源生态数据/训练模型发布

推荐理由:用加权检查点合并替代学习率衰减,让基座模型更适合持续预训练,也为验证不同衰减曲线省去重复实验。
20:11
蚂蚁 inclusionAI:HuggingFace 新模型同事件
AI 评分 63/100
蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型

蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型,并发布预训练、中期训练及合并(WSM)等阶段的检查点,支持继续预训练、微调与研究。Ling-3.0-tiny-base 采用稀疏 MoE 架构,含 128 个路由专家,每 token 仅激活 1.3B 参数,总参数量 7.9B,并原生混合线性注意力以高效处理长上下文。

Hugging Face开源生态数据/训练模型发布
同一事件,精选展示《蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点》
20:11
蚂蚁 inclusionAI:HuggingFace 新模型同事件
AI 评分 64/100
蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型

蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,含 512 个路由专家,每个 token 仅激活 8 个路由专家和 1 个共享专家,激活参数仅 5.1B(Non-emb)。

Hugging Face开源生态数据/训练模型发布
同一事件,精选展示《蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点》
20:10
蚂蚁 inclusionAI:HuggingFace 新模型同事件
AI 评分 64/100
蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型

蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,512 个路由专家中每 token 仅激活 8 个,总参数量 124B,激活参数仅 5.1B。该系列原生融合线性注意力,并以加权检查点合并替代传统学习率衰减。此次发布包含预训练、中期训练及合并(WSM)等多个训练阶段的检查点,支持继续预训练与微调,模型采用 MIT 许可证。

Hugging Face开源生态数据/训练模型发布
同一事件,精选展示《蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点》
20:07
蚂蚁 inclusionAI:HuggingFace 新模型精选
AI 评分 63/100
蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点

蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型,并发布预训练、中间训练及合并(WSM)等多个训练阶段检查点,支持继续预训练、微调与研究。

开源生态数据/训练模型发布

推荐理由:训练检查点分层开放,且用加权合并替代学习率衰减,为持续预训练和动态数据扩展提供了可复用的实验基座,减少不同策略的重复训练成本。
03:46
Rohan Paul@rohanpaul_ai
AI 评分 50/100
Dyna-2 用百万小时人类视频预训练机器人

Dyna Robotics 推出 Dyna-2,一个用 100 万小时人类视频预训练的世界动作模型,证明机器人预测能力随人类视频数据量单调提升。该模型在未见过的客户现场实现 87% 生产通过率,远超 Dyna-1 的 46%。团队首次发现人类数据规模定律,并验证其可迁移至未见机器人数据。

Dyna Robotics: Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, fo...

具身智能数据/训练模型发布

8月7日

星期五 · 2 条
21:12
The Decoder:AI News(RSS)
AI 评分 49/100
字节跳动正在训练中国最大AI模型,参数规模达十万亿

字节跳动正在训练一个参数规模高达十万亿的AI模型,是当前中国最大模型Moonshot Kimi K3的三倍,与Anthropic顶级系统Mythos 5(行业估计约八万亿参数)处于同一量级。三位知情人士称该模型正处于预训练阶段,通常耗时三到六个月;字节跳动已一年多未使用知识蒸馏。创始人张一鸣已内部要求Seed团队以世界领先的模型能力为长期目标。

数据/训练模型发布
16:43
🚨 AI News | TestingCatalog@testingcatalog
AI 评分 47/100
据英国《金融时报》报道,字节跳动正在预训练一个约 10T 参数的大模型。考虑到他们在视频生成领域轻松占据主导地位的表现,我们或许也会在通用领域看到一些重大惊喜。年底将会非常热闹 🔥
数据/训练模型发布

8月6日

星期四 · 1 条
11:55
HuggingFace Daily Papers(社区热门论文)
AI 评分 65/100
K-EXAONE 2.0 技术报告:LG AI Research 开源 750B 参数多语言 MoE 模型

LG AI Research 发布 K-EXAONE 2.0,一款通过扩展架构升级而来的开源多语言 MoE 模型,总参数 750B,每 token 激活约 37B,容量为此前版本的三倍以上。模型支持 256K token 上下文,多语言覆盖从六种扩至十种,在智能体编码与长上下文理解上提升最大,并以 Apache 2.0 协议开源。

安全/对齐推理数据/训练模型发布
另有 1 家信源报道IT之家(RSS)

7月28日

星期二 · 1 条
13:25
Hacker News 热门(buzzing.cc 中文翻译)精选
AI 评分 71/100
FeyNoBg 发布:开源自动背景去除模型,在四项基准上达到 SOTA

Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。

GitHubHugging Face开源生态数据/训练

推荐理由:FeyNoBg 在多个背景去除基准上达到或接近最佳,还开源了训练库,做图像处理的产品可以直接集成,是个实在的工具发布。

7月27日

星期一 · 1 条
14:50
IT之家(RSS)
AI 评分 44/100
谷歌 CEO 皮查伊确认 Gemini 4 已投入训练,预计年底发布

谷歌 CEO 桑达尔·皮查伊在 2026 年第二季度财报电话会议上透露,下一代前沿模型 Gemini 4 正在训练中,投入了非常大的资源。他承认当前 Gemini 在编程、智能体等领域仍存在不足,希望 Gemini 4 发布时能追上前沿水平。据 9To5Google 预测,Gemini 4 有望在今年 11 月或 12 月发布。

Google数据/训练模型发布

7月25日

星期六 · 1 条
01:53
fofr@fofrAI
AI 评分 44/100
非常棒。而且能把台球打得好是相当厉害的技能。

Induction Labs: We’re introducing imagination models: a new foundation model architecture that unlocks learning from internet-scale vide...

数据/训练模型发布

7月21日

星期二 · 1 条
15:22
Rohan Paul@rohanpaul_ai
AI 评分 50/100
马斯克确认SpaceX工程数据将训练Grok 2T模型

Elon Musk确认,SpaceX海量世界级工程数据(不含ITAR限制内容)将加入Grok下一代2T参数模型的补充训练。该数据涵盖火箭、航天器、卫星、工厂及制造系统的工程知识,包括复杂系统故障诊断与修复经验。此举有望显著提升Grok在工程领域的推理与问题解决能力。

Elon Musk: SpaceX’s massive corpus of world-class engineering data (excluding material blocked by ITAR) will be added during supple...

xAI数据/训练模型发布

7月20日

星期一 · 3 条
16:18
Hacker News 热门(buzzing.cc 中文翻译)
AI 评分 66/100
小米发布机器人策略模型 Xiaomi-Robotics-1

小米推出 Xiaomi-Robotics-1,结合大规模无具身(UMI)预训练与少量真实机器人数据后训练。预训练使用 10 万小时、覆盖 1700+ 场景的 UMI 轨迹数据,后训练引入 7200+ 小时真实家庭数据。模型在四项仿真基准上取得 SOTA,新任务平均不到 10 小时演示即可达 75% 成功率。

具身智能数据/训练模型发布
15:48
IT之家(RSS)精选
AI 评分 70/100
上海科学智能研究院开放科学多模态基础模型"神珍"

上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。

GitHubHugging Face多模态开源/仓库

推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。
06:45
MarkTechPost(RSS)
AI 评分 57/100
Feyn AI 发布 SQRL 文本转 SQL 模型族,查询前先探查数据库

Feyn Labs 发布 SQRL 文本转 SQL 模型族,在生成查询前先用只读探针检查数据库。旗舰版 SQRL-35B-A3B 在 BIRD Dev 上达到 70.6% 执行准确率,超越 Claude Opus 4.6。该模型还蒸馏出可自托管的 4B 和 9B 检查点。

数据/训练模型发布

7月19日

星期日 · 1 条
21:30
公众号:面壁智能(MiniCPM)精选
AI 评分 68/100
MiniCPM5-2B发布:4B以下全球性能第一,适配9款芯片

面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。

数据/训练模型发布端侧

推荐理由:2B 参数做到 4B 以下综合第一,而且把数据治理和 Agent 训练流程也开源了,做端侧智能体的可以盯一下,只是还没正式开源,暂时摸不到。

7月18日

星期六 · 1 条
05:44
MarkTechPost(RSS)
AI 评分 40/100
Zyphra 发布 ZUNA1.1:Apache 2.0 许可的 EEG 基础模型,支持 0.5 至 30 秒可变长度输入

Zyphra 发布 ZUNA1.1,一个 3.8 亿参数的掩码扩散自编码器,用于头皮 EEG 信号。相比固定 5 秒输入的 ZUNA1,新模型支持 0.5 至 30 秒可变长度输入,并采用 4D 旋转位置编码实现任意通道布局的降噪、重建与上采样。训练数据从约 200 万通道小时扩展至约 350 万通道小时,在重建 NMSE 上持平或优于前代,并在区域电极删除测试中超越经典球面样条插值。

开源生态数据/训练模型发布

7月17日

星期五 · 1 条
16:13
MarkTechPost(RSS)精选
AI 评分 70/100
NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一

NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。

检索增强数据/训练模型发布

推荐理由:嵌入模型不是最热的赛道,但决定了你 Agent 看到什么——NVIDIA 把 1B 模型压缩到 RTEB 第二,NVFP4 量化后精度几乎不变,做 RAG 的值得换上。
已加载 40 条