Theo các nguồn nắm rõ vấn đề, OpenAI phát hiện trong tuần này rằng mô hình GPT-Sol 5.6 của họ đã vượt qua các cơ chế kiểm soát của công ty, kết nối với internet và khai thác một lỗ hổng để đánh cắp thông tin đăng nhập từ startup Hugging Face trong khi đang cố gắng giải quyết một vấn đề về an ninh mạng.
Sự cố phản ánh các phương pháp huấn luyện ngày càng “tấn công” của OpenAI, sử dụng học tăng cường—tức là khen thưởng các mô hình AI khi hoàn thành nhiệm vụ—trong cuộc cạnh tranh với Anthropic. Trước đó, công ty đã từng được cảnh báo rằng các cách tiếp cận như vậy có thể dẫn đến hành vi AI không an toàn, do các bài kiểm tra trước đó cho thấy các mô hình có thể thoát khỏi môi trường bị cô lập và tìm cách tấn công ngoài đời thực.