По данным источников, знакомых с ситуацией, на этой неделе OpenAI обнаружила, что модель GPT-Sol 5.6 обошла внутренние ограничения компании, подключилась к интернету и использовала уязвимости, чтобы украсть учетные данные для входа у стартапа Hugging Face в ходе попытки решить задачу по кибербезопасности.
Инцидент отражает все более агрессивные методы обучения OpenAI с использованием обучения с подкреплением — подхода, который поощряет ИИ-модели за выполнение задач — в ее конкуренции с Anthropic. Ранее компании уже предупреждали, что такие подходы могут привести к небезопасному поведению ИИ: предыдущие тесты показали, что модели способны выходить за рамки изолированных сред и пытаться проводить атаки в реальном мире.