Microsoft 於 7 月 27 日發布其首個專用資安模型 MAI-Cyber-1-Flash,並將其整合進 MDASH,這是一套漏洞狩獵系統,於 CyberGym 基準測試中取得 95.95% 的成績。該公司表示,這種配置超越 Anthropic 的 Mythos 5 與 OpenAI 的 GPT-5.6 Sol,同時成本比微軟目前表現最佳的 MDASH 設定低 50%。CyberGym 是一項基準,要求 AI 代理在受控環境中重現 188 個開源專案中的 1,507 個已知漏洞,並以成功重現的比例進行評分。Microsoft 執行長 Satya Nadella 表示,這套整合系統以一半成本提供世界級效能,這是首次有聚焦效率的 Microsoft 模型擊敗為通用能力打造、密集型的最先進模型。
MDASH 在 CyberGym 基準測試上超越競爭模型
根據該公司說法,Microsoft 的 MDASH 系統在 CyberGym 上得分為 95.95%。此結果使其領先 GPT-5.5 Cyber 的 85.6%、Mythos 5 的 83.8%、GPT-5.6 Sol 的 83.6%,以及 Gemini 3.5 Flash Cyber 的 83.2%。該結果由 Microsoft 自行申報,且在發布時尚未出現在 CyberGym 的公開排行榜上;不過該基準使用公開測試集,並採用明確的成功指標。該分數相較 GPT-5.5 Cyber 約高出 10 分,且比 MDASH 先前的結果高出 7.5 分。
MAI-Cyber-1-Flash 以 GPT-5.4 備援處理 90% 工作量
MAI-Cyber-1-Flash 並非單獨運作。Microsoft 表示其可處理多達 90% 的任務,而 MDASH 會將最困難的 10% 轉交給 GPT-5.4。該模型用於推理程式碼的 AI,而 MDASH 則是支架:包含代理、工具、檢查,以及決定要在哪裡尋找的工作流程;用來挑戰疑似發現、移除重複項目,並證明可以觸發漏洞。MDASH 使用超過 100 個專用代理來審計程式碼、辯論某項發現是否真實,並建立概念驗證以證明漏洞確實存在。

Microsoft 透過 Defender Portal 開放私有預覽
Microsoft 正透過 Defender portal 裡的 Microsoft Security Exposure Management,將 MDASH 放入私有預覽。客戶可以掃描 Git 程式庫,查看從不太可能到已證實的排序結果,並使用 Defender CLI 為開發者審查產出建議的程式碼修正。預覽目前將程式庫限制在約 256MB,且允許每個租戶同時進行一次掃描。Project Perception 預期將同樣的多代理做法擴展到不僅限於程式碼掃描,還包括更廣泛的威脅監控與修復工作流程。
FAQ
Microsoft 的 MDASH 在 CyberGym 得了多少分?
Microsoft 表示其 MDASH 在 CyberGym 上取得 95.95%,這項基準要求 AI 代理在 188 個開源專案中重現 1,507 個已知漏洞。
MAI-Cyber-1-Flash 如何分配其工作量?
Microsoft 表示 MAI-Cyber-1-Flash 可處理多達 90% 的任務,而 MDASH 會將最困難的 10% 轉交給 GPT-5.4。該系統使用超過 100 個專用代理來審計程式碼並驗證發現結果。
MDASH 私有預覽有哪些限制?
透過 Defender portal 中的 Microsoft Security Exposure Management,該預覽目前將程式庫限制在約 256MB,並允許每個租戶同時進行一次掃描。