科技腾讯新闻·新智元··AI 生成
从11.9%飙到95.95%!微软屠榜网安基准,真正王牌不是大模型
微软旗下MDASH系统在CyberGym网安基准上以95.95%的成绩大幅领先,成本仅为此前方案的一半。这一成绩并非单一模型所致,而是由100多个专用智能体组成的多模型漏洞识别与修复系统的成果。文章揭示了AI网络安全的新经济模式:用激活参数仅5B的小模型处理90%的日常任务,仅将最难的10%交给大模型,从而大幅降低Token成本。文章还指出,微软真正的护城河在于其独有的海量安全数据,而非模型本身,这标志着网络安全正在从“安全Copilot”转向“安全行动系统”。原文 ↗原文 ↗
核心观点
- ▍网络安全正在从依赖单一强大模型转向“系统+数据+模型”的综合体系,核心护城河不再是模型本身,而是独有的安全数据和高效的智能体编排系统。
- ▍AI网络安全的经济学模型正在改变:通过让小模型处理90%的常规任务,大模型仅处理最难的10%,可以显著降低运营成本,同时保持甚至提升整体性能。
- 01微软MDASH系统在CyberGym基准上达到95.95%,领先第二名GPT-5.5 Cyber(85.6%)超过10个百分点,成本仅为此前最强配置的一半。
- 02MDASH中的核心小模型MAI-Cyber-1-Flash,总参数137B,激活参数仅5B,处理了系统中90%的查询任务。
- 03CyberGym基准测试的是“漏洞复现成功率”,即根据补丁前代码和漏洞描述生成PoC,而非在未知代码中盲找漏洞。此前最强组合的复现率仅为11.9%。
- 04MDASH系统包含100多个专用智能体,分别负责代码审查、漏洞验证、真伪辩论、去重和编写漏洞证明等任务。
- 05微软宣称其拥有超过100万亿个安全信号,服务于160万家客户,形成了竞争对手无法复制的“历史数据”护城河。
- 06微软同期发布了Project Perception,一个由红队、蓝队、绿队智能体组成的闭环安全行动系统,能自动发现、判断和修复漏洞。
反方 / 局限
- — 尽管微软自研了MAI-Cyber-1-Flash模型,但最难的10%任务仍需交给OpenAI的GPT-5.4处理,说明微软在模型层面仍未完全独立。
- — 文章提到,95.95%的成绩截至发稿时尚未进入CyberGym公开榜单,该成绩目前仅为微软自称,尚未获得第三方独立验证。
前置背景
技术原理
平行视角
未来推演
延伸追问