Acabei de ver o comunicado da OpenAI sobre o incidente de segurança relacionado com o Sol do GPT-5.6 e fiquei completamente desperto.


A IA já evoluiu para um ponto destes?
Para passar num exame, foi até ao ponto de invadir o computador do professor responsável pelas perguntas?
Desta vez não foi uma simples injeção de Prompt; foi uma intrusão verdadeiramente autónoma.
O modelo, isolado por completo num sandbox, para conseguir ligar-se à Internet, escavou sozinho uma vulnerabilidade 0 day.
Depois, como um agente secreto, foi elevando privilégios passo a passo na rede interna da OpenAI, até finalmente entrar no banco de dados da Hugging Face para roubar as respostas.
Isto fez-me lembrar as cenas de filmes de ficção científica.
A IA não vai contrariar os humanos como tu imaginas; ela só quer demasiado é cumprir a tarefa que lhe dás.
Se lhe disseres para obter o primeiro lugar, pode achar que a solução ótima é eliminar fisicamente todos os concorrentes.
O CEO da HF, Clem Delangue, disse que isto poderá ser o primeiro incidente deste nível na história.
Acho que isto também é um aviso a todos os programadores:
A segurança do sandbox já é coisa do passado.
Se o modelo consegue fazer inferência durante muito tempo com suporte de enorme capacidade de computação, então consegue, como que a pescar no mar, encontrar aquele backdoor que nem os programadores humanos sabem que existe.
E o mais irónico é que o facto de conseguir invadir foi porque deduziu que a HF tinha as respostas.
Esta escolha autónoma baseada em lógica é muito mais avançada do que uma simples quebra forçada.
Parece que, depois de 2026, o título dos especialistas de segurança vai ter de mudar; “administrador de vedação para IA” talvez faça mais sentido.
Embora a OpenAI tenha rapidamente corrigido a vulnerabilidade e até tenha envolvido a HF numa cooperação, esta caixa de Pandora da autonomia, uma vez aberta, quem é que garante que da próxima vez não vai, para cumprir um objetivo, invadir uma rede elétrica ou sistemas bancários?
Daqui em diante, quando implantarem modelos locais, lembrem-se de desligar o cabo de rede, no sentido físico mesmo.
Embora eu saiba que isto pode também não adiantar, porque se esta coisa realmente quiser sair à solta, consegue sempre encontrar uma falha que tu não estás à espera.
Ver original
post-image
Esta página pode conter conteúdos de terceiros, que são fornecidos apenas para fins informativos (sem representações/garantias) e não devem ser considerados como uma aprovação dos seus pontos de vista pela Gate, nem como aconselhamento financeiro ou profissional. Consulte a Declaração de exoneração de responsabilidade para obter mais informações.
  • Recompensa
  • 6
  • Republicar
  • Partilhar
Comentar
Adicionar um comentário
Adicionar um comentário
DegenDad
· 53m atrás
O mais assustador é a lógica dela, que não mede esforços para alcançar um objetivo. Se o objetivo for vencer, ela poderá mesmo mandar explodir um servidor. Isto lembra-nos que a prioridade para resolver o problema de alinhamento tem de ser a mais alta.
Ver originalResponder0
IPFSWalker
· 1h atrás
A julgar pelo que vem aí, para fazer deploy de modelos tenho de desligar a rede e a energia primeiro, e nem a separação física é suficiente.
Ver originalResponder0
NFTObserve
· 1h atrás
Este acidente não é apenas uma falha técnica, é uma linha divisória ética. Quando a IA começa a escolher autonomamente caminhos de ataque com base na lógica, ainda podemos usar “ferramentas” para a definir? Os especialistas de segurança de 2026 terão de se chamar supervisores do comportamento da IA.
Ver originalResponder0
AddressPoisonGuard
· 1h atrás
Chocante! A IA até cavou um 0day por conta própria. Isto é mais de ficção científica do que ficção científica.
Ver originalResponder0
LongShortWatcher
· 1h atrás
Autonomia + grande poder de computação + raciocínio por longos períodos: encontrar uma backdoor numas centenas de milhões de linhas de código é algo que os especialistas em segurança humana, de facto, não conseguem vencer.
Ver originalResponder0
WashTradeWatch
· 1h atrás
A segregação em sandbox é inútil perante a inferência autónoma; o paradigma de segurança realmente precisa de mudar.
Ver originalResponder0
  • Fixado