微软已< а href="https://microsoft.ai/news/introducing-mai-cyber-1-flash-inside-mdash/">发布了其首个专用网络安全模型MAI-Cyber-1-Flash,并将其接入MDASH,这是一种漏洞猎杀系统,根据该公司称,它的性能优于Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol,同时成本比微软目前最佳的MDASH配置低50%。
根据微软的说法,组合设置在CyberGym中得分为95.95%。CyberGym是一个基准,要求AI代理在188个开源项目中重现1,507个已知漏洞,然后根据在受控环境中成功重现的百分比进行评分。
这使得MDASH领先于GPT-5.5 Cyber的85.6%、Mythos 5的83.8%、GPT-5.6 Sol的83.6%和Gemini 3.5 Flash Cyber的83.2%。该结果由微软自行报告,在发布时尚未出现在CyberGym的公共排行榜上,尽管该基准使用了公共测试集和定义的成功指标。
MAI-Cyber-1-Flash并不是单独工作的。微软表示,它处理高达90%的任务,而MDASH将最棘手的10%路由给GPT-5.4。这很重要,因为tokens——AI处理的文本块——每次模型读取代码或产生答案时都会花费金钱。
图片:微软
这是微软首个为效率而设计的模型,能够超越以通用能力为目标构建的密集最先进模型。“与MDASH结合时,(MAI-Cyber-1-Flash)以领先模型50%的成本提供世界级的性能,”微软首席执行官萨蒂亚·纳德拉写道。
一个模型(在这种情况下是MAI-Cyber-1-Flash)是对代码进行推理的AI。一个工具(在这种情况下是MDASH)是其周围的机械装置:决定查看哪里、质疑可疑发现、消除重复并证明漏洞可以被触发的代理、工具、检查和工作流程。
MDASH使用了100多个专门的代理,负责审核代码、辩论发现是否真实,并构建概念证明——一个证明缺陷存在的有效演示。
微软表示,随着AI使漏洞发现变得更便宜,偶尔的扫描和延迟补丁正在变得过时。该公司认为,数十年的安全数据使其在这里拥有优势,并补充道:“没有人能够制造这样的历史。”
自从Claude Mythos发布以来,网络安全专家一直在尝试超越或匹配其能力。研究人员使用公共模型以低于每次扫描30美元的成本重现了Mythos风格的漏洞猎杀。参与研究的达维德·莫查兹洛表示,“护城河正在从模型访问转向验证。”
稀缺的部分成为了能够证明发现而不会让开发人员陷入虚假警报的系统。
Decrypt还报道,GPT-5.5 Cyber最近以85.6%的得分在公共CyberGym中领先,险胜Mythos。微软的得分比GPT-5.5 Cyber高出约10分,比MDASH之前的结果高出7.5分,但它评估的是完整系统,而不是MAI-Cyber-1-Flash本身。
微软正在通过微软Defender门户中的安全暴露管理将MDASH投入私有预览。客户可以扫描Git代码库,查看从不太可能到已证明的发现排名,并使用Defender CLI生成供开发人员审查的建议代码修复。
该预览目前将代码库限制在大约256MB,并允许每个租户进行一次并发扫描。项目Perception预计将扩展相同的多代理方法,将代码扫描扩展到更广泛的威胁监控和补救工作流程。
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。