Microsoft đã ra mắt mô hình an ninh mạng chuyên dụng đầu tiên là MAI-Cyber-1-Flash vào ngày 27 Tháng 7 và tích hợp nó vào MDASH, một hệ thống săn lỗ hổng đã đạt 95,95% trên chuẩn CyberGym. Công ty cho biết cấu hình này vượt trội Anthropic's Mythos 5 và OpenAI's GPT-5.6 Sol, đồng thời chỉ tốn 50% chi phí so với thiết lập MDASH tốt nhất hiện tại của Microsoft. CyberGym là một chuẩn đánh giá yêu cầu các tác nhân AI tái tạo 1.507 lỗ hổng đã biết trên 188 dự án mã nguồn mở, chấm điểm theo tỷ lệ lỗ hổng được tái tạo thành công trong môi trường kiểm soát. CEO của Microsoft, Satya Nadella, cho biết hệ thống kết hợp mang lại hiệu suất đẳng cấp thế giới với chi phí bằng một nửa so với các mô hình dẫn đầu, đánh dấu lần đầu tiên một mô hình tập trung vào hiệu quả của Microsoft vượt các mô hình “state-of-the-art” dày đặc được xây dựng cho các năng lực tổng quát.
MDASH vượt trội các mô hình đối thủ trên chuẩn CyberGym
Theo công ty, hệ thống MDASH của Microsoft đạt 95,95% trên CyberGym. Kết quả này đưa nó lên trước GPT-5.5 Cyber (85,6%), Mythos 5 (83,8%), GPT-5.6 Sol (83,6%) và Gemini 3.5 Flash Cyber (83,2%). Kết quả này do chính Microsoft tự báo cáo và chưa xuất hiện trên bảng xếp hạng công khai của CyberGym tại thời điểm công bố, dù chuẩn đánh giá sử dụng bộ kiểm thử công khai và có thước đo thành công được xác định. Điểm số tương đương cao hơn khoảng 10 điểm so với GPT-5.5 Cyber và cao hơn 7,5 điểm so với kết quả trước đó của MDASH.
MAI-Cyber-1-Flash xử lý 90% khối lượng công việc với GPT-5.4 dự phòng
MAI-Cyber-1-Flash không hoạt động đơn lẻ. Microsoft cho biết nó xử lý tới 90% số tác vụ, trong khi MDASH chuyển 10% khó nhất sang GPT-5.4. Mô hình là AI suy luận trên mã, còn MDASH là “khung” — hệ thống gồm các tác nhân, công cụ, cơ chế kiểm tra và quy trình quyết định nơi cần tìm, thách thức các phát hiện nghi ngờ, loại bỏ trùng lặp và chứng minh rằng lỗi có thể được kích hoạt. MDASH sử dụng hơn 100 tác nhân chuyên biệt được phân công để kiểm toán mã, tranh luận xem một phát hiện có đúng hay không và xây dựng bằng chứng khái niệm chứng minh lỗ hổng tồn tại.

Microsoft mở bản xem trước riêng thông qua cổng Defender
Microsoft đang đưa MDASH vào bản xem trước riêng thông qua Microsoft Security Exposure Management trên cổng Defender. Khách hàng có thể quét các kho Git, xem các phát hiện được xếp hạng từ khó xảy ra đến đã được chứng minh, và dùng Defender CLI để tạo các bản sửa mã đề xuất để nhà phát triển xem xét. Bản xem trước hiện giới hạn kho lưu trữ ở khoảng 256MB và cho phép một lần quét đồng thời trên mỗi tenant. Dự kiến Project Perception sẽ mở rộng cách tiếp cận đa tác nhân tương tự từ quét mã sang các quy trình giám sát mối đe dọa và khắc phục rộng hơn.
FAQ
MDASH của Microsoft đạt điểm bao nhiêu trên CyberGym?
Microsoft cho biết MDASH đạt 95,95% trên CyberGym, một chuẩn đánh giá yêu cầu các tác nhân AI tái tạo 1.507 lỗ hổng đã biết trên 188 dự án mã nguồn mở.
MAI-Cyber-1-Flash phân bổ khối lượng công việc như thế nào?
Microsoft cho biết MAI-Cyber-1-Flash xử lý tới 90% số tác vụ, trong khi MDASH chuyển 10% khó nhất sang GPT-5.4. Hệ thống sử dụng hơn 100 tác nhân chuyên biệt để kiểm toán mã và xác thực các phát hiện.
Giới hạn cho bản xem trước riêng của MDASH là gì?
Bản xem trước hiện giới hạn kho ở khoảng 256MB và cho phép một lần quét đồng thời trên mỗi tenant thông qua Microsoft Security Exposure Management trên cổng Defender.