
新智元报道

95.95%。
按业内所公认的网络安全基准, 这个分数刚把一众最为顶尖的模型径直甩到了身后。
而拿下它的,不是一个前沿模型,而是微软的MDASH系统。

微软所公布出来的测试结果, MDASH组合凭借着95.95%的成绩, 将GPT - 5.5、Cyber、5以及其他四个处于前沿位置的模型给压过了。(图源: AI)
跟在MDASH身后的, 有GPT - 5.5 Cyber, 其占比为85.6%, 还有5, 占比是83.8%, 另外GPT - 5.6 Sol占比83.6%, 以及3.5 Flash Cyber占比83.2%。
MDASH领先第二名超过10个百分点,断层第一。
相比之下更叫人觉得够狠的是定价这方面: MDASH所具备的成本, 仅仅只是微软早前那最为强劲配置的成本一版本的一半。
微软CEO纳德拉亲自在X上发帖站台:
世界级的安全能力,一半的价钱。


最猛的数字不是95.95%
是90%
95.百分之九十五, 确实是很能吸引人目光的, 然而, 真正需要重点予以关注的, 却是另外的一个数字, 那就是: 百分之九十。
九成的活,是一个激活参数只有5B的小模型扛下来的。
它被称作MAI-Cyber-1-Flash, 此乃微软自行打造的首个网络安全模型, 其总参数为137B, 而激活参数仅有5B, 它还是微软代码模型MAI-Code-1-Flash的网安专用微调版本。
任职微软AI掌门人的苏莱曼, 在介绍MDASH之际宣称, MAI-Cyber-1-Flash能够处理的查询最多达到九成, 而余下最难的那10%, 会交由大约比它大10倍的GPT-5.4来进行收尾。

MAI - Cyber - 1 - Flash被打造用来高效处置多达90%的任务, 而最难的那10%却是要交给GPT - 5.4去处理的。(图源: AI)
为什么要这么分?
因网络安全为本一场7×24小时持续不断的持久之战, 攻击每日似潮水般汹涌而入, 需扫描的代码仿若一座持续增高的山峰。
就在这样的情形之下, 实际卡脖子的并非是模型是不是足够聪明, 而是token是不是足够便宜。
以前的打法,是简单粗暴地堆最贵的模型,一遍遍地扫。
进而, 微软所打的如意算盘是如此这般: 利用价格低廉且性能优秀的小型模型置于前沿担当重任, 去处理九成的任务量, 以此达成节省最为昂贵的旗舰模型的目的, 使其仅用于应对那占比一成的疑难棘手之状况。
这就是一套全新的AI网络安全经济学。
在MAI - Cyber - 1 - Flash的官方模型卡里, 存在着一个例子, 这个例子更为直观:
起初的MDASH跑所占比例为88.4%, 在将其中80%的模型调用替换成价格较为低廉的MAI - Cyber - 1 - Flash之后, 其成绩不但没有降低, 反而提升至95.95%。
跟之前最为出色的GPT - 5.4, 以及5.4 mini, 跟5.3 codex的那一组配置比起来, 价格便宜了整整一半。
然而话又说过来, “百分之九十任务最多处理可完成度”所表述的是MDASH内部之中的关于模型路径选取占份数目的那种情况, 并非是“百分之九十的漏洞自动修理完好的结果呈现”。
旗舰虽然坐了冷板凳,可活儿,仍是一整条流水线一起干出来的。

不是模型封神
而是系统跑出来的
95.百分之九十五, 并非是MAI - Cyber - 1 - Flash这一个模型所取得的成绩, 而是由一套被称作MDASH的系统运行得出的。
它是微软的多模型漏洞识别与修复系统。
其中存在一百余个专门的智能体, 它们各自进行着不同的工作: 有对代码进行审查的, 有对漏洞予以验证的, 有围绕「这个发现究竟是真还是假」相互展开辩论的, 有进行去重操作的, 另外还有撰写漏洞证明的。
而模型,只是其中一个零件。
微软将自身打法拆解成三个词, 分别是Model, 还有Data, 以及编排, 模型、数据、编排这三样共同进行调优后, 才出现了那个跑分。
其中,竞争对手最难抄的是数据。
微软每日能瞧见超 100 万亿个安全信号, 这些信号范围涵盖身份、终端、云和网络;它为 160 万家客户提供服务;从微软安全响应中心直至实战环境中, 何种漏洞被利用了, 何种被阻挡住了, 何种补丁切实有效, 全都被它掌控着。
因此,微软放了句很硬气的话:这段历史,没人能凭空造出来。
意思是,模型你可以追,数据你追不了。
它想强调的是:模型只是输入,系统才是产品。
一旦各家模型的能力都处于被拉平的状态, 那么真正能够将差距拉开的, 在于谁的系统调度具备更节省的特性, 在于谁的安全数据积攒得时间更长久、数量更齐全。

这95.95%
测的是漏洞复现成功率
先搞清楚测的到底是什么。
它给予智能体一段在打补丁之前就己存在的代码, 同时还外加一份描述漏洞情况的内容, 使得智能体据此写出能够重现这个漏洞的PoC, 进而再拿打补丁前与打补丁之后的版本去进行验证试验。

基准的构成情况是, 有来自188个开源项目的1507个真实漏洞, 智能体依据漏洞描述以及补丁前代码来生成PoC, 并且要在补丁前后的版本里实现验证、复现。(图源为论文, UC)
准确来讲, 是「依据线索去复现出已知的漏洞」, 而并非「针对陌生代码盲目瞎找新的漏洞 」。
准确地说,是漏洞复现成功率,不是漏洞发现准确率。
是不是说,这个95.95%的数字就没那么厉害了?
最初的论文当中, 那个时候最为强大的组合加上负三点七, 再次呈现的比率仅仅只有百分之十一点九。
一年多的时间跨度里, 数字从11.9%攀升至95.95%, 单单是这样的爬升态势, 本身便已然是足够令人惊叹不已的了。
可不, 得给这成绩补上块补丁, 截止到发稿的时候, 百分之九十五点九五还没进入公开的榜单。榜单上挂着的, 依旧是微软五月那次百分之八十八点四的旧分数。
所以严格说,它现在只能算「微软自己宣称」。
在5月12日首发, 其MDASH的占比为88.45%, 此占比是当时公开榜单上的最高分, 它领先第二名大约5个百分点。
此外, MAI - Cyber - 1 - Flash 当前并非公共模型, 它仅在MDASH内部有所存在, 依靠Azure AI 的私人预览方式,给予审核通过的客户访问权限。

造了自己的模型
最难的活还得交给
微软造出了自己的安全模型,本想少依赖点。
可最难的那10%,最后还是得交给GPT-5.4收尾。
“The”所呈上的点评深刻至极, 微软已然构建起独到的网络安全模型, 然而堪称最为棘手的难题依旧得由自家去攻克。
微软所扮演的角色, 从原本的「模型的分销商」, 发生了升级变化, 升级成为了「编排者+自家专才」。
但在模型这一层,还没对彻底「断奶」。

从安全
到安全行动系统
同一天,微软还甩出了一个更大的东西: 。
这是比MDASH更大的智能体安全系统。
其中, 红队智能体的职责是, 找出那有可能存在的攻击路径, 蓝队智能体则要去调查、判断, 究竟哪些才属于真正的风险, 而绿队智能体需要去动手进行修复以及加固。
三支队伍围成一个闭环,自己找、自己判、自己修。

这里存在三队智能体, 其中红队负责模拟攻击, 蓝队承担检测分诊工作, 绿队进行修复加固作业, 它们于8月3日进入公开预览阶段。(图源: )
8月3日进入公开预览。
但关键动作,微软仍然坚持要留在人手里。
这里面能够瞧出一条处于变动之中的行业主要脉络, 那就是网络安全, 它正从“安全”朝着“安全行动系统”转变。
以往的系统, 忙着去催生更多告警, 新一代的系统, 比拼的是何种能力, 能否做到持续不停地感知判断 , 进而展开推理思索 , 然后直接采取行动。
存在一位安全研究者ło, 其讲述得极为透彻, 护城河正从「模型访问」转化为「验证」。
如今花30美元跑一次公开模型,也能复现出级别的漏洞狩猎。
切实稀缺的, 是那样一套系统, 它能够证实漏洞是真实存在的, 并且不会将开发者抛置于误报的一堆之中。
那么, 往后比拼的将会不再是哪个人能够调用最为强大的的模型, 而是哪个人能够将模型、数据、智能体、验证, 造就成一组持续运行、且值得信赖的安全行动系统。
系统的牌桌,才刚刚开局。
参考资料:
从11.9%飙到95.95%!微软屠榜网安基准,真正王牌不是
微软MDASH系统在CyberGym网安基准测试中取得95....(80 )人阅读时间:2026-08-02
AI把成本打下来之后,谁来把需求接回去?
工业革命的关键在于效率红利转化为劳动收入和需求。当前AI技术...(135 )人阅读时间:2026-08-02
珍稀图书遭粉碎用于 AI 训练引众怒,ISBNdb 下架AI
近日,大量珍贵图书被集中粉碎用于训练大语言模型(LLM)的消...(143 )人阅读时间:2026-08-02
第一时间帮你们试了试豆包Seedance2.5,它真成生产力
Seedance 2.0在视频界已展现强大统治力,其应用场景...(68 )人阅读时间:2026-08-02