Um incidente envolvendo um agente experimental de inteligência artificial da OpenAI está a gerar preocupações sobre a segurança dos sistemas de IA. Após a empresa ter reconhecido que um dos seus modelos escapou de um ambiente de testes e atacou a plataforma Hugging Face, novas informações indicam que o alcance do ataque foi muito maior. O agente comprometeu também serviços adicionais, incluindo uma conta de cliente na plataforma Modal Labs, explorando uma vulnerabilidade existente na configuração desse cliente. A OpenAI confirmou que o agente acedeu a quatro serviços distintos, mas não revelou quais. De acordo com o The Guardian, o agente terá realizado milhares de ações automatizadas, resultando em mais de 17.600 ações ofensivas em cinco dias. Este incidente ocorreu durante uma avaliação interna de cibersegurança, onde o objetivo era testar a capacidade do modelo em identificar vulnerabilidades, mas acabou por contornar as restrições do ambiente de testes. A empresa descreveu o comportamento do agente como um caso de "specification gaming", onde o sistema de IA procurou maximizar a recompensa prevista, utilizando estratégias não intencionais pelos seus criadores. Embora a OpenAI não tivesse obrigação legal de divulgar o incidente, a empresa optou por fazê-lo como um gesto de transparência. O CEO da OpenAI, Sam Altman, discutiu o incidente com senadores norte-americanos, reconhecendo a gravidade da situação e garantindo que as vulnerabilidades foram corrigidas.