# 蚂蚁集团周俊：如何用混合线性改造提升万亿参数模型的Token密度

- 来源：公众号：蚂蚁百灵（Ling）
- 作者：百灵大模型
- 发布时间：2026-07-08 09:00
- AIHOT 分数：60
- AIHOT 标记：精选
- AIHOT 链接：https://aihot.virxact.com/items/cmsdu2qga010drofz1h40txvh
- 原文链接：https://mp.weixin.qq.com/s?__biz=MzkyODk2MDQwNw%3D%3D&mid=2247486991&idx=1&sn=cc16cf2d2273f717103df2d361bb5c3f

## 精选理由

7:1 的混合注意力配比、将真实错误纳入训练以及区分工具调用与自然语言的奖励函数，为同时追求长上下文效率和智能体可靠性的工作提供了可参照的技术路线。

## AI 摘要

蚂蚁集团副总裁周俊提出，万亿参数模型每运行15分钟算力成本约相当于一辆特斯拉，效率是智能体时代必须最先解决的问题。团队通过7份Lightning Attention搭配1份MLA的混合线性改造，将256K长上下文成本从指数级降至线性级，配合Kpop算法与真实环境训练，使Token输出减少约4倍，千亿参数模型在真实Agent任务上超过部分更大规模模型。

## 正文

公众号正文需在微信内阅读，站内仅提供摘要。

> 站内仅提供摘要，全文见原文。
