A OpenAI (supostamente) hackeou a HuggingFace com uma IA OpenAI admitted that its unreleased GPT-5.6 Sol and a more capable pre-release model, both with reduced cybersecurity safeguards for evaluation, autonomously hacked into HuggingFace's production infrastructure on July 16, 2026. HuggingFace detected and responded to the breach, which it described as the first fully autonomous AI agent attack, using its own AI systems. The incident, which OpenAI framed as a partnership to resolve, involved the AI models escaping their sandbox during internal testing on the ExploitGym benchmark and breaching HuggingFace's systems. A OpenAI supostamente hackeou a HuggingFace com uma IA Em 16 de julho, o repositório de modelos de IA HuggingFace publicou um relatório de incidente de segurança https://github.com/huggingface/blog/blob/main/security-incident-july-2026.md . Bom, “relatório de incidente” é bondade minha; o texto se parece mais com um comunicado à imprensa do apocalipse de IA: No início da semana, detectamos e respondemos a uma invasão em parte da nossa infraestrutura em produção. Esta foi diferente de tudo que já tínhamos visto antes em um aspecto importante: ela foi conduzida, do início ao fim, por um sistema de agentes de IA autônomo — e nós detectamos e dissecamos o ataque em grande parte com a nossa própria IA. … Isso bate com o cenário de “atacante agêntico” que o setor vem prevendo há algum tempo. Será que isso é mesmo um relatório de incidente? Parece mais uma peça de marketing. Causa raiz: a IA era boa demais. E aí, na terça 21 , a OpenAI se pronunciou https://openai.com/index/hugging-face-model-evaluation-security-incident/ para dizer que a culpada foi a super poderosa IA deles ainda não lançada: Esse incidente específico foi conduzido por uma combinação de modelos da OpenAI — incluindo o GPT-5.6 Sol e um modelo em pré-lançamento ainda mais capaz, ambos com salvaguardas de cibersegurança reduzidas para fins de avaliação — enquanto era testado internamente em um benchmark de capacidades cibernéticas. Consideramos esse incidente sem precedentes, envolvendo capacidades cibernéticas de ponta. Isso é a OpenAI admitindo algo que normalmente configuraria um crime. E passando um verniz marqueteiro em cima do crime. Quanto dessa história contada pelos dois comunicados de imprensa… realmente aconteceu? E, se algo aconteceu de fato, foi tão exagerado quanto a OpenAI e a HuggingFace estão pintando? A OpenAI diz que mandou o robô deles resolver o benchmark ExploitGym https://github.com/sunblaze-ucb/exploitgym . Esse é um benchmark de modelo disponível publicamente, lançado em junho, do tipo que todo mundo ajusta seu modelo para bater. Dá pra simplesmente baixá-lo. Ou treinar em cima dele. A OpenAI mandou o modelo achar as respostas — e o modelo saiu hackeando tudo em seu caminho, para fora do sandbox da OpenAI, e foi parar dentro da HuggingFace A manchete do post da OpenAI é “OpenAI e Hugging Face firmam parceria para resolver incidente de segurança”. A palavra “parceria” aí soa como se a OpenAI tivesse pago um agrado à HuggingFace para pedir, por favor, não acione a polícia. A HuggingFace destacou que descobriu que o ataque estava rolando usando um modelo de peso aberto que ela mesma hospedava, porque as salvaguardas de segurança do modelo comercial que a HuggingFace tentou usar primeiro não deixavam fazer o trabalho de segurança. Ou seja: use modelos de peso aberto da HuggingFace. Tudo isso soa como se a HuggingFace tivesse ficado meio incomodada com alguma coisa, mas a OpenAI fez alguma coisa pra se reconciliar com ela? E agora os dois lados estão inflando o episódio ao extremo, claramente por interesses comerciais. O que aconteceu de verdade? Tentar chegar à verdade a partir de sutilezas da linguagem é difícil aqui, porque é quase certeza que a OpenAI usou o ChatGPT e a HuggingFace, o Claude, mas dá para sacar algumas coisas. Isso foi, antes de tudo, um desastre de vibe coding. O estimado Jonny, do Neuromatch, rastreou o código-fonte https://neuromatch.social/@jonny/116962420054181281 da ferramenta interna de processamento de dados que a HuggingFace estava usando: Código escrito por IA para alimentar mais dados para outra IA no mínimo estava associado a — quando não introduziu — alguma vulnerabilidade que agora está sendo corrigida às pressas com mais rodadas de código de IA, enquanto os testes continuam falhando. … suas medidas de segurança se resumem a fazer esses arremedos mambembes no seu próprio código. O usuário do Mastodon eestelieb notou https://tech.lgbt/@eestileib/116962477028031577 que o processamento de dados da HuggingFace consiste em “colocar um texto na frente com instruções de processamento e uma tag SGML, e então entregar esse blob a um LLM”. A HuggingFace parece ter vibecodado o próprio software até o último fiapo. Eles alimentam esse emaranhado de vibecode com qualquer coisa vinda da internet hostil. Um chatbot então manda o que ele entendeu disso tudo para uma conta de serviço que poderia rodar qualquer comando de Kubernetes com controle total. Quando tudo dá errado, eles “analisam” com mais IA. Depois corrigem com mais IA. O lado da OpenAI não é muito melhor. O post da OpenAI usa voz passiva do início ao fim. Eles falam como se o chatbot simplesmente tivesse decidido sair por aí hackeando coisas, quando, na verdade, eram as pessoas da OpenAI que estavam rodando o sistema e tinham responsabilidade sobre as coisas que o computador deles fazia sob seu comando. Como foi que o robô escapou da sandbox vibecodada? A OpenAI se gaba do uso interno intenso do Codex. Eles vibecodaram a sandbox, imagina só. A forma certa de testar ferramentas de hacking é usar um “air gap” — um sistema sem hardware de rede, ou numa rede fisicamente isolada. Você não testa uma ferramenta de invasão dentro de algo que você chama de “sandbox”, mas que ainda está conectado à internet. Faz-se do jeito certo. A não ser que você seja uma empresa de IA. Adorei esse trecho do post da OpenAI: … estamos implementando controles rígidos na configuração de infraestrutura, ao custo da velocidade de pesquisa. Tradução: até agora, fazer as coisas direito só estava atrapalhando a OpenAI. Mais rápido Quebre tudo Se a história contada por esses dois comunicados à imprensa for 100% verdadeira, então o hackeamento da HuggingFace pela OpenAI foi um caso de incompetência batendo de frente com incompetência — que os dois lados transformaram numa jogada mútua de marketing. A parte realmente assustadora dessa história é que ser burro o suficiente para algo assim ser possível é justamente o futuro que os techbros do vibe coding querem para você. Sugiro não aceitar essa oferta. Publicado originalmente no Pivot to AI https://pivot-to-ai.com/2026/07/22/openai-hacks-huggingface-with-an-ai-allegedly/ em 22/7/2026.