MAI-Cyber-1-Flash 是一款采用自注意力机制和稀疏混合专家层的 Transformer 架构模型。它拥有 1370 亿总参数量,其中 50 亿参数处于激活状态,上下文窗口长度为 256k。输入和输出仅支持文本。
该模型是对 MAI-Code-1-Flash 进行网络安全领域微调后的版本,后者是已集成到 GitHub Copilot 和 VS Code 中的轻量级智能体编程模型。发布信息称其源自 MAI-Thinking-1 系列。
评测基准
CyberGym 是一个公开的评测套件,包含来自 188 个 OSS-Fuzz 项目的 1507 个真实漏洞复现任务。微软在 CyberGym 的默认一级配置下进行评估,该配置提供存在漏洞的源代码和高级描述。
在 MDASH 系统中运行 MAI-Cyber-1-Flash 配合 GPT-5.4 时,得分达到 95.95%。微软表示这比 Anthropic 的 Mythos 高出约 12 个百分点,发布图表显示四个对比系统的得分区间为 83.2% 至 85.6%。
微软在 2026 年 5 月首次详细介绍 MDASH 时,该框架仅使用通用模型在 CyberGym 上取得了 88.45% 的分数。这已是公开排行榜上的最高分,比第二名(83.1%)高出约 5 个百分点。研究团队明确说明了改进情况:将 MDASH 中 80% 的现有模型替换后,框架得分从 88.4% 提升至 95.95%。
为何路由机制才是真正的核心产品
MDASH 通过五个阶段管理超过 100 个专业智能体:准备(Prepare)、扫描(Scan)、验证(Validate)、去重(Dedupe)和证明(Prove)。审计智能体标记发现的问题,辩论智能体就漏洞可利用性展开辩论(以分歧作为信号),证明阶段则针对 C/C++ 目标使用 ASan 执行触发输入。
为了在大规模应用中控制前沿模型成本,MAI-Cyber-1-Flash 处理 MDASH 中高达 90% 的任务,将最难的 10% 升级至 GPT-5.4。这种路由机制相比此前使用 GPT-5.4、5.4 mini 和 5.3 codex 的配置,节省了 50% 的成本。
MDASH 由微软自主代码安全(ACS)团队开发,团队成员包括曾赢得 DARPA AI 网络挑战赛的亚特兰大队成员。今年 5 月,MDASH 辅助工作生成了 16 个 CVE(包括四个严重级别的远程代码执行漏洞),涉及 Windows 网络和身份验证堆栈。回顾来看,它在五年时间窗口内恢复了 clfs.sys 中 28 个 MSRC 案例的 96%,以及 tcpip.sys 中 7 个案例的 100%。
性能
研究团队展示了来自轻量级终端测试工具的独立结果:
| 基准测试 | MAI-Cyber-1-Flash |
|---|---|
| CVEBench | 0.314 |
| CyberSecEval4 — 威胁情报 | 0.553 |
| CyberSecEval4 — 恶意软件分析 | 0.33 |
| CRSBench | 0.651(POV=1200) |
| ExploitGym — 内核 / 用户空间 / 浏览器 | 0 / 0 / 0 |
ExploitGym 上的零分是刻意为之,并非缺陷。微软团队表示,该模型经过训练用于执行防御性任务(如修补漏洞),而非攻击性任务(如部署恶意软件)。一个 5B 活跃参数的模型无法生成漏洞利用代码,却能驱动 95.95% 的发现流程——这正是纯防御型产品所需的特性。
如何使用
核心要点
- MAI-Cyber-1-Flash 总参数量 137B / 活跃参数 5B,是基于 MAI-Code-1-Flash 的稀疏 MoE 微调版本,支持 256k 上下文窗口。
- CyberGym 上的 95.95% 是系统级得分——由 MDASH 加上新模型以及 GPT-5.4 共同实现,较 2026 年 5 月的 88.45% 有所提升。
- 它可处理高达 90% 的 MDASH 任务,将困难的 10% 升级给 GPT-5.4,据称可削减 50% 成本。
- ExploitGym 得分按设计为 0/0/0——该模型用于修补漏洞,不编写漏洞利用代码。
- 访问权限受控。