# 美团发布 LongCat-2.0：1.6T 参数开源 MoE 模型，原生支持 1M 上下文

- 来源：MarkTechPost（RSS）
- 作者：Asif Razzaq
- 发布时间：2026-07-06 05:25
- AIHOT 分数：71
- AIHOT 标记：同事件
- AIHOT 链接：https://aihot.virxact.com/items/cmr8bv56j00szsl0dlz1igwi6
- 原文链接：https://www.marktechpost.com/2026/07/05/meituan-releases-longcat-2-0-a-1-6t-parameter-open-moe-model-with-native-1m-context-and-longcat-sparse-attention

## AI 摘要

美团发布 LongCat-2.0，1.6 万亿总参数、每 token 约激活 48B 的混合专家（MoE）模型，专为智能体编程设计。原生支持 1M token 上下文窗口，训练与推理全程运行于国产 AI ASIC 超算集群。架构含零计算专家、LongCat Sparse Attention、135B 参数 N-gram 嵌入及 MOPD 后训练。基准测试：SWE-bench Pro 59.5（GPT-5.5 58.6），Terminal-Bench 2.1 70.8，SWE-bench Multilingual 77.3。对比前代 LongCat-Flash（560B/128K 上下文），参数与上下文大幅提升，硬件从 H800 转向国产 ASIC。以 MIT 许可证开源，权重即将开放。

## 正文

美团发布了 LongCat-2.0，这是一个大规模混合专家（MoE）语言模型。该模型拥有 1.6 万亿总参数量，每个 token 激活约 480 亿参数。它专为智能体编程场景设计：在智能体工作流中实现代码理解、生成与执行。

有两个事实尤为突出。首先，LongCat-2.0 支持原生 100 万 token 的上下文窗口。其次，其训练和推理服务完全运行在国产 AI ASIC 超级计算集群上。

什么是 LongCat-2.0？

LongCat-2.0 是美团推出的下一代万亿参数开源模型。它延续了 2025 年发布的 5600 亿参数模型 LongCat-Flash。其架构设计围绕一个核心目标：实现可靠、高效的智能体编程。

预训练过程消耗了超过 35 万亿个 token，累计使用数百万加速器小时。美团报告称，训练期间未出现回滚或不可恢复的损失尖峰。这一稳定性声明在工具链尚不成熟的非英伟达硬件上尤为重要。

架构：1.6T 模型如何保持低成本运行

该设计融合了四种降低规模化成本的思路，每种思路都值得单独理解。

零计算专家：并非每个 token 都需要大量计算。像标点符号这类简单 token 会被路由到零计算专家，原样返回。复杂 token 则会调用更多专家容量。一个 PID 控制器会调整专家偏置，使平均值保持在合理范围内。这产生了 330 亿至 560 亿参数的动态激活窗口，而非固定成本。MoE 主干采用捷径连接设计（ScMoE）以实现更高吞吐量。

LongCat 稀疏注意力（LSA）：标准注意力的计算量随上下文长度呈二次方增长。LSA 仅选择最相关的 token，将复杂度降至接近线性。美团将其描述为 DeepSeek 稀疏注意力（DSA）的演进版本。它融合了三种正交的索引方法：流感知索引将碎片化的内存读取转换为连续块；跨层索引在相邻层之间复用注意力显著性；层级索引采用由粗到精的两阶段过滤。三者协同作用，使得 100 万 token 窗口得以维持，而不会遇到内存瓶颈。

N-gram 嵌入：该设计新增了一个 1350 亿参数的 N-gram 嵌入模块。它在稀疏维度上与 MoE 专家模块正交排列。美团表示，该模块能够捕捉密集的局部 token 关系，同时在大批量解码过程中减少内存 I/O。

后训练（MOPD）：一条专用流水线（MOPD）融合了三组教师专家模块。这些模块分别涵盖智能体、推理和交互能力，最终整合为一个统一模型。

在服务部署方面，美团采用了六维并行方案和预填充-解码分离架构。同时还使用了“超级内核”和 L2 缓存权重预取技术来隐藏 I/O 延迟。

https://longcat.ai/blog/longcat-2.0/

基准测试

美团将 LongCat-2.0 定位为智能体式编程模型。以下所有数据均来自美团内部测试。

基准测试LongCat-2.0测试内容

SWE-bench Pro59.5真实世界软件工程任务

Terminal-Bench 2.170.8Shell 环境中的执行与错误恢复

SWE-bench Multilingual77.3跨语言仓库任务

在 SWE-bench Pro 上，美团报告 LongCat-2.0 以微弱优势领先 GPT-5.5（58.6）。美团还声称其整体性能与 Google 的 Gemini 3.1 Pro 相当。所报告的领先优势主要集中在软件工程领域。在更广泛的通用智能体基准测试（如 FORTE 和 BrowseComp）中，覆盖范围表明它落后于领先的前沿系统。目前尚无独立排行榜的确认结果。

LongCat-2.0 对比 LongCat-Flash

从纸面数据来看，相比上一代产品有大幅提升。下表使用各模型已公布的规格参数。

属性LongCat-2.0LongCat-Flash

总参数量1.6T560B

每个 token 激活参数量约 48B（33B–56B）约 27B（18.6B–31.3B）

上下文窗口100 万 token（原生）128K token

长上下文注意力机制LongCat 稀疏注意力多头潜在注意力

报告所用硬件国产 AI ASIC 超级计算集群（训练 + 服务部署）H800 GPU（报告用于推理）

最大输出128K token未指定

许可证MITMIT

发布时间2026 年 6 月 30 日2025 年 9 月

权重即将发布已开源

使用场景与示例

LongCat-2.0 针对智能体式的软件工作进行了调优，而非用于日常闲聊。以下几个具体模式能够发挥其优势。

全仓库推理：将整个中等规模的代码库喂入百万 token 上下文窗口。让模型一次性跨多个文件追踪 bug。这避免了短上下文窗口所迫使用的摘要式取巧方法。

多步骤终端任务：在具备 shell 访问权限的智能体循环中运行模型。它可以执行命令、读取错误信息并重试，直到任务通过。Terminal-Bench 2.1 基准测试正是针对这一工作流。

仓库级编辑：要求对跨多个模块和测试的代码进行重构。模型在提出协调一致的修改方案之前，会基于完整上下文进行推理。

跨语言迁移：利用 SWE-bench Multilingual 基准测试的优势处理多语言仓库。模型可以在不同语言之间移植逻辑，同时保持行为一致。

这些模式在标准智能体框架内运行。因此，开发团队无需构建新工具即可采用该模型。

如何获取

LongCat-2.0 可通过 LongCat API 平台访问。它同时提供兼容 OpenAI 和兼容 Anthropic 的端点。该模型也上线了 OpenRouter，并可在 Claude Code、OpenClaw、OpenCode 和 Codex 等框架中使用。目前尚不支持本地自托管，因为权重尚未发布。

兼容 OpenAI 的端点使用模型 ID LongCat-2.0。最大输出长度为 131072 个 token（128K）。以下代码片段调用了文档中描述的聊天补全端点。

# pip install openai from openai import OpenAI

client = OpenAI( api_key="YOUR_LONGCAT_API_KEY", base_url="https://api.longcat.chat/openai/v1", )

resp = client.chat.completions.create( model="LongCat-2.0", messages=[ {"role": "system", "content": "You are a coding agent."}, {"role": "user", "content": "Refactor utils.py to remove duplicate I/O logic."}, ], max_tokens=4096, # LongCat-2.0 supports up to 131072 (128K) )

print(resp.choices[0].message.content)

定价为每百万输入 token 0.75 美元，每百万输出 token 2.95 美元。发布促销价为 0.30 美元和 1.20 美元，缓存上下文读取免费。这些数据来自第三方报道，可能发生变化。

交互式说明

核心要点

以 MIT 许可证发布

LongCat-2.0 是一个 1.6 万亿参数的 MoE 模型，每个 token 激活约 480 亿参数（动态范围 330 亿至 560 亿）。

原生百万 token 上下文来自 LongCat 稀疏注意力机制，将长上下文成本从二次方降至线性。

训练和推理在 5 万张国产 AI ASIC 集群上运行，未使用英伟达硬件。

厂商报告的得分：SWE-bench Pro 59.5 分，Terminal-Bench 2.1 70.8 分，SWE-bench Multilingual 77.3 分。
