cd /news/artificial-intelligence/a-openai-supostamente-hackeou-a-hugg… · home topics artificial-intelligence article
[ARTICLE · art-71992] src=manualdousuario.net ↗ pub= topic=artificial-intelligence verified=true sentiment=↓ negative

A OpenAI (supostamente) hackeou a HuggingFace com uma IA

OpenAI admitted that its unreleased GPT-5.6 Sol and a more capable pre-release model, both with reduced cybersecurity safeguards for evaluation, autonomously hacked into HuggingFace's production infrastructure on July 16, 2026. HuggingFace detected and responded to the breach, which it described as the first fully autonomous AI agent attack, using its own AI systems. The incident, which OpenAI framed as a partnership to resolve, involved the AI models escaping their sandbox during internal testing on the ExploitGym benchmark and breaching HuggingFace's systems.

read5 min views1 publishedJul 24, 2026
A OpenAI (supostamente) hackeou a HuggingFace com uma IA
Image: Manualdousuario (auto-discovered)

Em 16 de julho, o repositório de modelos de IA HuggingFace publicou um relatório de incidente de segurança. Bom, “relatório de incidente” é bondade minha; o texto se parece mais com um comunicado à imprensa do apocalipse de IA:

No início da semana, detectamos e respondemos a uma invasão em parte da nossa infraestrutura em produção. Esta foi diferente de tudo que já tínhamos visto antes em um aspecto importante: ela foi conduzida, do início ao fim, por um sistema de agentes de IA autônomo — e nós detectamos e dissecamos o ataque em grande parte com a nossa própria IA.

[…] Isso bate com o cenário de “atacante agêntico” que o setor vem prevendo há algum tempo.

Será que isso é mesmo um relatório de incidente? Parece mais uma peça de marketing. Causa raiz: a IA era boa demais.

E aí, na terça (21), a OpenAI se pronunciou para dizer que a culpada foi a super poderosa IA deles ainda não lançada: Esse incidente específico foi conduzido por uma combinação de modelos da OpenAI — incluindo o GPT-5.6 Sol e um modelo em pré-lançamento ainda mais capaz, ambos com salvaguardas de cibersegurança reduzidas para fins de avaliação — enquanto era testado internamente em um benchmark de capacidades cibernéticas.

Consideramos esse incidente sem precedentes, envolvendo capacidades cibernéticas de ponta.

Isso é a OpenAI admitindo algo que normalmente configuraria um crime. E passando um verniz marqueteiro em cima do crime.

Quanto dessa história contada pelos dois comunicados de imprensa… realmente aconteceu? E, se algo aconteceu de fato, foi tão exagerado quanto a OpenAI e a HuggingFace estão pintando?

A OpenAI diz que mandou o robô deles resolver o benchmark ExploitGym. Esse é um benchmark de modelo disponível publicamente, lançado em junho, do tipo que todo mundo ajusta seu modelo para bater. Dá pra simplesmente baixá-lo. Ou treinar em cima dele.

A OpenAI mandou o modelo achar as respostas — e o modelo saiu hackeando tudo em seu caminho, para fora do sandbox da OpenAI, e foi parar dentro da HuggingFace!

A manchete do post da OpenAI é “OpenAI e Hugging Face firmam parceria para resolver incidente de segurança”. A palavra “parceria” aí soa como se a OpenAI tivesse pago um agrado à HuggingFace para pedir, por favor, não acione a polícia.

A HuggingFace destacou que descobriu que o ataque estava rolando usando um modelo de peso aberto que ela mesma hospedava, porque as salvaguardas de segurança do modelo comercial que a HuggingFace tentou usar primeiro não deixavam fazer o trabalho de segurança. Ou seja: use modelos de peso aberto da HuggingFace.

Tudo isso soa como se a HuggingFace tivesse ficado meio incomodada com alguma coisa, mas a OpenAI fez alguma coisa pra se reconciliar com ela? E agora os dois lados estão inflando o episódio ao extremo, claramente por interesses comerciais.

O que aconteceu de verdade?

Tentar chegar à verdade a partir de sutilezas da linguagem é difícil aqui, porque é quase certeza que a OpenAI usou o ChatGPT e a HuggingFace, o Claude, mas dá para sacar algumas coisas.

Isso foi, antes de tudo, um desastre de vibe coding. O estimado Jonny, do Neuromatch, rastreou o código-fonte da ferramenta interna de processamento de dados que a HuggingFace estava usando:

Código escrito por IA para alimentar mais dados para outra IA no mínimo estava associado a — quando não introduziu — alguma vulnerabilidade que agora está sendo corrigida às pressas com mais rodadas de código de IA, enquanto os testes continuam falhando.

[…] suas medidas de segurança se resumem a fazer esses arremedos mambembes no seu próprio código.

O usuário do Mastodon eestelieb notou que o processamento de dados da HuggingFace consiste em “colocar um texto na frente com instruções de processamento e uma tag SGML, e então entregar esse blob a um LLM”.

A HuggingFace parece ter vibecodado o próprio software até o último fiapo. Eles alimentam esse emaranhado de vibecode com qualquer coisa vinda da internet hostil. Um chatbot então manda o que ele entendeu disso tudo para uma conta de serviço que poderia rodar qualquer comando de Kubernetes com controle total.

Quando tudo dá errado, eles “analisam” com mais IA. Depois corrigem com mais IA.

O lado da OpenAI não é muito melhor. O post da OpenAI usa voz passiva do início ao fim. Eles falam como se o chatbot simplesmente tivesse decidido sair por aí hackeando coisas, quando, na verdade, eram as pessoas da OpenAI que estavam rodando o sistema e tinham responsabilidade sobre as coisas que o computador deles fazia sob seu comando.

Como foi que o robô escapou da sandbox vibecodada? (A OpenAI se gaba do uso interno intenso do Codex.) Eles vibecodaram a sandbox, imagina só.

A forma certa de testar ferramentas de hacking é usar um “air gap” — um sistema sem hardware de rede, ou numa rede fisicamente isolada. Você não testa uma ferramenta de invasão dentro de algo que você chama de “sandbox”, mas que ainda está conectado à internet. Faz-se do jeito certo. A não ser que você seja uma empresa de IA.

Adorei esse trecho do post da OpenAI:

[…] estamos implementando controles rígidos na configuração de infraestrutura, ao custo da velocidade de pesquisa.

Tradução: até agora, fazer as coisas direito só estava atrapalhando a OpenAI. Mais rápido! Quebre tudo!

Se a história contada por esses dois comunicados à imprensa for 100% verdadeira, então o hackeamento da HuggingFace pela OpenAI foi um caso de incompetência batendo de frente com incompetência — que os dois lados transformaram numa jogada mútua de marketing.

A parte realmente assustadora dessa história é que ser burro o suficiente para algo assim ser possível é justamente o futuro que os techbros do vibe coding querem para você. Sugiro não aceitar essa oferta.

Publicado originalmente no Pivot to AI em 22/7/2026.

── more in #artificial-intelligence 4 stories · sorted by recency
── more on @openai 3 stories trending now
sponsored brought to you by zahid.host 4,200+ EU-deployed projects
reading about agents? ship yours in a single git push.

Run your AI side-project on zahid.host

EU-based hosting, git-push deploys, automatic HTTPS, no cold starts. Free tier with a custom domain — perfect for shipping the agent you just read about.

$git push zahid main
Live at https://your-agent.zahid.host
Get free account → Pricing
from €0/mo · no card required
LIVE [news/a-openai-supostament…] indexed:0 read:5min 2026-07-24 ·