汤森路透发布其首个自研大语言模型Thomson,基于开源基础投入4000万美元训练,成本远低于同类前沿模型,且完全由公司自有和控制。早期评估显示Thomson在多项任务上与最新前沿模型持平,尤其在指令遵循和密集专业内容推理上提升显著。公司已向学术机构开放评估,并在Hugging Face发布“small”版本开源权重供学术与非商业使用。
汤森路透发布其首个自研大语言模型Thomson,基于开源基础投入4000万美元训练,成本远低于同类前沿模型,且完全由公司自有和控制。早期评估显示Thomson在多项任务上与最新前沿模型持平,尤其在指令遵循和密集专业内容推理上提升显著。公司已向学术机构开放评估,并在Hugging Face发布“small”版本开源权重供学术与非商业使用。
汤森路透推出其首个大语言模型 Thomson,基于阿里 Qwen3.5-397B 构建,总研发投入约 4000 万美元。该模型与帝国理工学院联合重训以保障安全与政治中立,并用自有内容进一步训练。Thomson 在斯坦福 LegalBench 得分 0.823,在 Harvey 法律智能体基准上接近 Opus 4.8。
汤森路透发布首款大语言模型Thomson,基于阿里千问Qwen3.5-397B构建,研发成本约4000万美元,外界流传的45万美元仅为最后一次训练成本。该模型在Stanford LegalBench得分0.823,落后于Gemini 3.1 Pro和GPT-5.5。汤森路透称不采用闭源模型是因外部模型长期成本较高且无法高自由度调整。
Thomson Reuters 基于阿里 Qwen 推出自研法律大模型“Thomson”,投入约 4000 万美元,训练数据来自 Westlaw 等自有内容。在 Stanford LegalBench 上 Thomson(0.823)落后于 Gemini 3.1 Pro 和 GPT-5.5,仅在接入独家内容时以 0.83 对 0.82 微弱胜过 GPT 5.4。
Harvey 发布其首个后训练模型 Tenet 研究预览版,基于 Kimi K3 基座,针对长时程法律工作训练。相比基座,Tenet 在 LAB 上完成近两倍保留任务,在 LAB: Contracts 上多 20%,全通过率分别提升 9 和 2 个百分点。目前未公开权重或 API,仅限企业通过 Harvey 平台使用。
🚢 Marin 535B-A23B started training this week! As usual, the whole process is open. Voyage plan: pretraining (80%) + mid...
Excited to bring the Muse Spark 1.2 Contributor tier to @openrouter today. We can't wait to see what developers build wi...
面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。
Introducing Tenet, our first model post-trained for legal. Tenet is a Kimi K3 base that we post-trained with @FireworksA...
蚂蚁百灵开源 Ling-3.0-tiny 与 Ling-3.0-flash 的 6 个 Base Model 检查点,覆盖预训练、中期训练及 WSM 合并阶段,均未经过后训练。其用 WSM 替代 LR 衰减进行加权检查点合并,支持持续预训练与离线策略探索;社区可在 tiny-base 上验证策略后扩展至 flash-base。
另有 1 家信源报道IT之家(RSS)Ornith-1.5 开源 LLM 家族发布,含 9B Dense、35B MoE 和 397B MoE 三档,其中 397B 在 Terminal-Bench 2.1(86.1)、SWE-bench Verified(86)、WideSearch(80.8)和 BrowseComp(86.6)上均超越 Claude Opus 4.8。
Aloha! 🌺Introducing Ornith-1.5, a family of open-source LLMs spanning 9B Dense, 35B MoE, and 397B MoE, trained with sel...
另有 2 家信源报道IT之家(RSS)Hacker News 热门(buzzing.cc 中文翻译)Thoughts About Scaling Law Scaling, but not only of parameters. Every model release now ends with the same question: how...
唐杰发文反思缩放定律,指出参数规模需与数据、算力、推理成本等维度协同考量,Chinchilla 最优比例并非终点。他宣布 GLM-5.3 作为受控实验:与 GLM-5.2 同架构、同参数,仅通过一个月长程环境与 RL 后训练,带来显著提升,证明缩放不止参数一个旋钮。
Synthefy 推出面向结构化数值数据的基础模型平台,其开源模型 Nori 无需训练或微调,通过将标注行作为上下文存储,即可在前向传播中预测新行。仅 30M 参数的 Nori-30M 在公共回归基准上媲美 Google 1.6B 参数的 TabFM,开启思考模式后更以约 2% 的规模超越后者。
Synthefy 推出面向结构化数值数据的基座模型平台 Nori,用户只需提供少量标注行即可预测新数据。仅 30M 参数的 Nori-30M 在公开回归基准上媲美 Google 的 1.6B 参数 TabFM。公司同步宣布完成 650 万美元种子轮融资,由 Wing VC 领投。
We are announcing our $6.5M seed round led by @Wing_VC, with @haystackvc, @samsungnext, Canonical @ai, @LightscapeVC, an...
安徽农业大学王晓波教授团队在南宁发布大豆垂直大模型“丰菽”2.0,实现多模态数据融合,降低单一模型回答偏差,助力大豆数据辅助育种。该模型新增多模型协同分析机制,嵌入通用大模型接口,由总结模块综合分析各模型回答的共识、差异及证据完整性。目前“丰菽”2.0 集成豆百科、豆分子等六大功能模块,整合超 1000 万字专业文本、1 万篇科研文献,构建含 2 万实体、10 万关系的知识图谱。
Intern-S2-Preview 是一系列科学智能体基础模型,支持多模态科学理解、推理、生成及长周期任务。其训练流程涵盖科学多模态预训练、监督微调、可扩展多任务强化学习及智能体强化学习,并采用部分回滚、自适应长度正则化等技术提升稳定性。Intern-S2-Preview-397B 在多项科学、多模态及智能体基准上取得领先结果,其时间序列模块提升了 SciTS 上的信号理解与预测能力。
Dyna Robotics 发布 Dyna-2,一个在超100万小时第一人称人类视频上预训练的世界-动作模型(WAM),用于机器人操作。研究团队验证了从1,000到1,000,000小时数据的缩放定律,并首次将该定律零样本迁移至未见过的机器人数据;视频联合去噪在39/39任务上优于仅动作训练,将零样本机器人MSE从0.340降至0.120。
具身智能公司 Dyna Robotics 发布机器人基础模型 DYNA-2,基于超 100 万小时第一人称人类视频预训练,任务成功率最高达 90%。该模型通过预测下一帧画面及应采取动作,补足传统视觉语言模型缺失的空间推理与接触物理能力。
DFM 发布 Mimir v1,一个基于 Hierarchical Reasoning Model(HRM)架构的 10 亿参数语言模型,从头训练并仅使用合规后训练数据,在英语上表现极具竞争力,并在丹麦语上创下新 SOTA。
蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型,含 tiny 与 flash 两个尺寸及预训练、中期训练、合并(WSM)等阶段检查点。该系列采用混合线性注意力与稀疏 MoE 架构,总参数 7.9B,每 token 仅激活 1.3B 参数(128 个路由专家中激活 8 个)。
蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型,并发布预训练、中期训练及合并(WSM)等阶段的检查点,支持继续预训练、微调与研究。Ling-3.0-tiny-base 采用稀疏 MoE 架构,含 128 个路由专家,每 token 仅激活 1.3B 参数,总参数量 7.9B,并原生混合线性注意力以高效处理长上下文。
同一事件,精选展示《蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点》蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,含 512 个路由专家,每个 token 仅激活 8 个路由专家和 1 个共享专家,激活参数仅 5.1B(Non-emb)。
同一事件,精选展示《蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点》蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,512 个路由专家中每 token 仅激活 8 个,总参数量 124B,激活参数仅 5.1B。该系列原生融合线性注意力,并以加权检查点合并替代传统学习率衰减。此次发布包含预训练、中期训练及合并(WSM)等多个训练阶段的检查点,支持继续预训练与微调,模型采用 MIT 许可证。
同一事件,精选展示《蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点》蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型,并发布预训练、中间训练及合并(WSM)等多个训练阶段检查点,支持继续预训练、微调与研究。
Dyna Robotics 推出 Dyna-2,一个用 100 万小时人类视频预训练的世界动作模型,证明机器人预测能力随人类视频数据量单调提升。该模型在未见过的客户现场实现 87% 生产通过率,远超 Dyna-1 的 46%。团队首次发现人类数据规模定律,并验证其可迁移至未见机器人数据。
Today we are introducing Dyna-2, a world-action model pre-trained on one million hours of human video. At this scale, fo...
字节跳动正在训练一个参数规模高达十万亿的AI模型,是当前中国最大模型Moonshot Kimi K3的三倍,与Anthropic顶级系统Mythos 5(行业估计约八万亿参数)处于同一量级。三位知情人士称该模型正处于预训练阶段,通常耗时三到六个月;字节跳动已一年多未使用知识蒸馏。创始人张一鸣已内部要求Seed团队以世界领先的模型能力为长期目标。
LG AI Research 发布 K-EXAONE 2.0,一款通过扩展架构升级而来的开源多语言 MoE 模型,总参数 750B,每 token 激活约 37B,容量为此前版本的三倍以上。模型支持 256K token 上下文,多语言覆盖从六种扩至十种,在智能体编码与长上下文理解上提升最大,并以 Apache 2.0 协议开源。
另有 1 家信源报道IT之家(RSS)Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。
谷歌 CEO 桑达尔·皮查伊在 2026 年第二季度财报电话会议上透露,下一代前沿模型 Gemini 4 正在训练中,投入了非常大的资源。他承认当前 Gemini 在编程、智能体等领域仍存在不足,希望 Gemini 4 发布时能追上前沿水平。据 9To5Google 预测,Gemini 4 有望在今年 11 月或 12 月发布。
We’re introducing imagination models: a new foundation model architecture that unlocks learning from internet-scale vide...
Elon Musk确认,SpaceX海量世界级工程数据(不含ITAR限制内容)将加入Grok下一代2T参数模型的补充训练。该数据涵盖火箭、航天器、卫星、工厂及制造系统的工程知识,包括复杂系统故障诊断与修复经验。此举有望显著提升Grok在工程领域的推理与问题解决能力。
SpaceX’s massive corpus of world-class engineering data (excluding material blocked by ITAR) will be added during supple...
小米推出 Xiaomi-Robotics-1,结合大规模无具身(UMI)预训练与少量真实机器人数据后训练。预训练使用 10 万小时、覆盖 1700+ 场景的 UMI 轨迹数据,后训练引入 7200+ 小时真实家庭数据。模型在四项仿真基准上取得 SOTA,新任务平均不到 10 小时演示即可达 75% 成功率。
上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。
Feyn Labs 发布 SQRL 文本转 SQL 模型族,在生成查询前先用只读探针检查数据库。旗舰版 SQRL-35B-A3B 在 BIRD Dev 上达到 70.6% 执行准确率,超越 Claude Opus 4.6。该模型还蒸馏出可自托管的 4B 和 9B 检查点。
面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。
Zyphra 发布 ZUNA1.1,一个 3.8 亿参数的掩码扩散自编码器,用于头皮 EEG 信号。相比固定 5 秒输入的 ZUNA1,新模型支持 0.5 至 30 秒可变长度输入,并采用 4D 旋转位置编码实现任意通道布局的降噪、重建与上采样。训练数据从约 200 万通道小时扩展至约 350 万通道小时,在重建 NMSE 上持平或优于前代,并在区域电极删除测试中超越经典球面样条插值。
NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。