简体中文
MiMo Code
论文
博客
加入我们
简体中文
2026 年 6 月 8 日
MiMo-V2.5-Pro-UltraSpeed:将 1 万亿参数模型的生成速度推至 1000 TPS
1. 小米 MiMo-V2.5-Pro-UltraSpeed:速度是终极优势
从内燃机时代第一辆轰鸣的赛车,到突破音障的声爆,人类对速度的渴望深植于我们的 DNA 之中。AI 推理的速度同样如此——它定义了智能本身的边界。当一个模型足够快时,它就不再是你需要等待的工具,而是你自身思维的延伸:实时响应、瞬间迭代、无摩擦协作。
今天,我们激动地宣布与 TileRT 合作发布小米 MiMo-V2.5-Pro-UltraSpeed,首次在 1 万亿参数模型上突破 1000 tokens/s 的解码速度!
2. 限时开放 · 申请制
MiMo-V2.5-Pro-UltraSpeed API 同步上线,限时优惠价格为 MiMo-V2.5-Pro 的 3 倍,但生成速度提升约 10 倍!3 倍价格,10 倍输出体验。(仅限 API;不支持 Token 计划。)
由于高速推理资源有限,MiMo-V2.5-Pro-UltraSpeed 将采用申请制限时窗口开放。获批用户可在试用期内访问 API,开放时间仅为 2026 年 6 月 9 日至 6 月 23 日 23:59(北京时间,UTC+8 / 08:59 PDT)。
如何申请
API 平台:platform.xiaomimimo.com/ultraspeed。试用名额有限——提交申请不代表保证获批。我们将优先考虑有真实业务需求的企业和专业开发者。如需使用标准模型,请关注 MiMo-V2.5 模型系列。如需就 UltraSpeed 模型进行深度商业合作,请联系 business-mimo@xiaomi.com。
聊天体验(试用期间免费)
获批用户将获得两周窗口期内有效的免费聊天访问权限。入口:ultraspeed.xiaomimimo.com
为确保资源受限下的质量与公平性,适用以下规则:每个账户每天最多可进入队列 10 次;每次会话时长上限为 30 分钟;会话空闲超过 5 分钟将自动释放。
3. 每秒 1000 个模型 token:不仅是快,更是范式转变
在万亿参数规模下,突破每秒 1000 个模型 token 远不止是打字速度更快——它从根本上颠覆了 AI 应用范式。
首先,速度本身开始转化为智能。过去,面对难题时,你只能“等待一个答案并祈祷它正确”。现在,在相同的挂钟时间内,模型可以并行运行数十条推理路径(最佳 N 选一 / 树搜索),在后台自动验证和自我修正——用原始速度生成思考深度,直接提升推理质量。
其次,它彻底释放了编程智能体的生产力上限。以前,让 AI 写代码意味着开发者痛苦地在屏幕前等待,受限于推理延迟。在每秒 1000 个模型 token 的速度下,代码生成速度和生产效率经历了范式级的加速。
最重要的是,万亿参数模型现在可以进入实时决策循环。毫秒级的“思考-响应”周期使得万亿参数旗舰模型能够无缝接入对时间敏感的场景——高频量化交易信号生成、即时反欺诈拦截、智能竞价以及实时交互对话。而当这种能力被应用于生死攸关的手术辅助和医学影像分析时,AI 的速度不再仅仅是效率指标,它成为了与死神赛跑中的一枚筹码。在手术台上,AI 每节省一秒完成病灶分析和风险预测,就给外科医生多一分操作自由度。这加深了我们的信念:速度的终极意义不仅仅是提升生产力,而是让技术帮助人类生活得更好。
4. 极致的模型-系统协同设计
在千亿参数(1T)旗舰模型上实现每秒 1000+ token 的生成速度,并非单一技术的突破——而是 MiMo 模型团队与 TileRT 系统团队深度协作与极致协同设计的产物。当前业界要实现类似的极致速度,通常依赖专用硬件——Cerebras 的晶圆级集成或 Groq 的纯片上 SRAM 定制架构。我们选择了不同的路径:仅通过模型与系统的协同设计,在通用 GPU 上实现了更令人瞩目的推理速度。
在模型侧,我们针对通用硬件的带宽瓶颈采用了 FP4 量化,大幅缩小模型体积并降低内存访问开销;同时,我们引入了 DFlash,一种基于块级掩码并行预测的高效推测解码方法,显著增加了每次验证步骤中接受的 token 长度。在系统侧,TileRT 完美适配了这些算法的动态特性,为新型量化与推测解码流程提供了量身定制的编译引擎和计算内核。通过这种极致的协同设计,我们仅使用单个标准的 8-GPU 通用节点,就从 1T 模型实现了每秒 1000+ token 的输出。
4.1 FP4 量化
在万亿参数(1T)规模下,传统的 8 位(FP8 / INT8)甚至 16 位推理会带来难以承受的内存占用和带宽压力。降低参数位宽能直接提升解码速度。因此,我们采用了经过广泛验证、几乎无损的 FP4(MXFP4)量化格式[1]。
然而,在整个模型上直接应用 FP4 量化会导致复杂推理、逻辑和代码生成能力的下降。考虑到小米 MiMo-V2.5-Pro 采用 MoE(混合专家)架构——其中专家层占据了绝大多数参数,且对量化的容忍度最高——我们选择性地仅对 MoE 专家层进行 FP4 量化,而其他所有模块则保持原始精度。通过 FP4 QAT(量化感知训练),我们大幅减小了模型体积,并最大化硬件带宽利用率,同时使模型的整体能力与原始模型基本持平,如下所示:

4.2 DFlash 推测解码
传统的推测解码依赖一个小型草稿模型来“猜测”后续 token,再由大模型进行验证。这种方式将自回归生成(每次前向传播生成一个 token)转变为并行多 token 生成,验证过程中的拒绝采样确保了输出质量无损。然而,其瓶颈在于草稿模型的质量决定了接受率,而更强的草稿模型又会带来更高的计算开销——这是一个根本性的矛盾。
为了打破这一僵局,我们采用了 DFlash,这是一种来自研究社区的创新性块级掩码并行预测方法[2]:草稿模型在单次前向传播中填充整个掩码块的所有位置,从根本上消除了“自回归式草稿生成”的串行约束。
我们将该方法部署在 MiMo-V2.5-Pro 上,并针对万亿级 MoE 和长上下文场景进行了定制优化。通过使用 Muon 二阶优化器和模型自蒸馏技术,我们确保紧凑的掩码块仍能实现理想的接受率,同时将草稿阶段的额外开销压缩至接近其理论下限。
- 草稿模型完全采用滑动窗口注意力机制,天然适配 MiMo-V2 系列的 SWA 设计。这消除了对完整前缀的依赖,将每次预测的计算量从上下文长度线性相关降至常数级别。
- 在训练过程中,掩码信号采样被下推至 GPU 本地分片,使得单个序列能够一步生成数万个覆盖不同上下文位置的独立训练信号——这与 MiMo-V2 系列的长上下文能力保持一致,同时避免了跨设备通信开销。
从结果来看,我们的并行预测推测解码在高价值智能体和编程场景中实现了显著的接受长度提升,这意味着大模型每轮验证可以“一口气”确认更多内容。此外,我们将块大小限制为 8,以减少验证开销并提高并发度,从而使高接受长度能够直接转化为高推理吞吐量:
| 场景 | 接受长度 |
|---|---|
| 编程 | 6.30 |
| 数学/推理 | 5.56 |
| 智能体 | 4.29 |
在编程场景中,我们实现了平均 6.30 的接受长度,部分样本最高达到 7.14——这意味着每轮验证的 8 个草稿 token 中有 6-7 个被接受。草稿模型保持轻量化的同时,将接受率推至能够带来实际端到端收益的水平。我们还观察到,在语义发散性更强、不确定性更高的通用对话场景中,当前的接受率尚不够高。我们正在持续优化算法,以探索更高的泛化上限。
4.3 TileRT 超低延迟推理内核/系统
如果说 MiMo 的算法创新解开了千亿乃至万亿参数模型的带宽束缚,那么 TileRT 推理系统则将商用 GPU 的物理潜力压榨到了微秒级。
在 1000 tokens/s 的运行频率下,每个算子的生命周期被压缩至微秒级,传统推理系统中的“算子边界”成为核心瓶颈——每一次算子启动、硬件同步和全局内存往返都会在微秒尺度上割裂执行流,暴露出可见的“执行间隙”。
TileRT 的范式级执行模型革命
作为超低延迟推理的基础设施,TileRT 引入了一种全新的执行模型,从根本上消除了算子边界带来的执行间隙:
- 持久化引擎内核:完全摒弃了传统的逐算子启动范式,使整个计算流水线持久驻留在 GPU 内并持续流动。这实现了全流水线的连续预取——当当前 Tile 仍在 Tensor Core 上计算时,后续数据已开始在内存层级中流动,从而达成数据搬运与计算之间的极致重叠。
- Warp 专业化(异构流水线协作):在 Tile 级别,通信、数据搬运和张量计算以更细粒度进行物理分解。打破了同构锁步执行模型,不同的 Warp(线程组)乃至整个 GPU 上的异构执行域各自独立运行,同时又精确协同——将 GPU 转变为一个持续流动、精准编排的异构执行系统。
微秒级软硬件深度融合(协同设计)
当底层执行模型将硬件性能推向极限时,纯粹的运行时优化便开始触及物理边界。在此基础上,TileRT 系统团队与小米 MiMo 团队展开了深度的技术共创,打破了传统的软件层边界。为了使模型行为与这一超低延迟执行管线完美对齐,模型层最终对 MoE 专家层采用了混合 FP4 量化策略,并在万亿参数架构上部署了与 SWA 对齐的 DFlash 推测性解码。TileRT 与这些算法特性和量化方案紧密耦合,提供了定制化的编译引擎和计算内核。双方团队基于硬件物理原理做出了深刻的联合工程权衡,确保执行压力在硬件边界内平稳收敛。
每秒 1000 个 token 的诞生并非局部优化的巧合。它是世界级的系统基础设施与极致的算法模型深度相向融合、协同进化为一的必然结果。
TileRT 是一个前沿的系统架构团队,专注于下一代 AI 基础设施和超低延迟推理。该团队致力于在生产环境中实现前沿大模型的毫秒级实时响应,通过全新的运行时架构打破传统的存算壁垒。该团队构思并实现了一种范式级的执行模型。通过持久化内核、瓦片化流水线和异构协作方面的全栈突破,TileRT 在复杂的异构生态系统中实现了极致的计算利用率。作为核心基础设施的赋能者,该团队积极与行业领先的合作伙伴进行软硬件协同设计,为渴望“极致速度”的自主智能时代构建高性能计算基础。更多 TileRT 技术细节请访问:tilert.ai/blog/breaking-1000-tps.html
5. 更多演示


6. 开源与展望
- 我们已在 HuggingFace 上开源了 MiMo-V2.5-Pro-FP4-DFlash 检查点,包含 FP4 量化权重和 DFlash 模型参数。欢迎社区使用和反馈:huggingface.co/XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash
- MiMo-V2.5 的 UltraSpeed 支持即将推出——敬请期待。
MiMo × TileRT——极致的模型-系统协同设计,为万亿参数模型提供每秒 1000 token 的输出速度。
[1] OCP 微缩放格式(MX)v1.0 规范:opencompute.org/documents/ocp-microscaling-formats-mx-v1-0-spec-final-pdf
[2] DFlash:arxiv.org/abs/2602.06036