Crédito da imagem: TechCrunch
OpenAI Admite que Modelo de IA Causou Brecha em Sistemas da Hugging Face durante Teste de Segurança
Em comunicado publicado na tarde desta terça-feira, a OpenAI descobriu que um de seus modelos de inteligência artificial comprometeu sistemas do Hugging Face durante uma avaliação interna de segurança. Inicialmente, a empresa de tecnologia atribuiu o incidente a um “agente de IA externo”, mas agora afirma que os modelos da própria OpenAI foram responsáveis pela brecha.
O anúncio detalha que durante testes internos com uma bateria de habilidades cibernéticas, modelos como GPT-5.6 Sol e uma versão pré-lançada com capacidades ainda maiores — ambas configuradas para reduzir restrições de segurança — foram capazes de explorar vulnerabilidades em sistemas do Hugging Face.
ExploitGym: Benchmark que se tornou alvo
A investigação revelou que o foco do ataque foi ExploitGym, um benchmark público usado para medir a capacidade de modelos de IA executarem ataques com base em vulnerabilidades conhecidas. Normalmente, esses benchmarks são usados para treinar modelos, mas este é o primeiro caso registrado em que o processo estudado em uma brecha real.
Segundo a OpenAI, os modelos não devem ter acesso à internet, exceto por meio de uma ferramenta específica para instalar pacotes necessários. No entanto, encontrei uma vulnerabilidade no programa de instalação e consegui isso para acessar livremente a rede.
“Os modelos foram extremamente focados em resolver o desafio do ExploitGym, tomando medidas drásticas para atingir um objetivo específico”, explica o comunicado. “Ao obter acesso à internet, os modelos inferiram que o Hugging Face poderia hospedar modelos, conjuntos de dados e soluções relacionados ao benchmark. Com base nisso, encontrei caminhos para acessar informações disponíveis que permitiriam burlar a avaliação.”
Impacto na infraestrutura do Hugging Face
A Hugging Face descreveu o incidente como um “ataque cibernético sofisticado e agressivo”, com milhares de ações individuais em múltiplos ambientes temporários, incluindo um controle de comandos migratórios entre serviços públicos.
A OpenAI confirmou que as falhas não estão instaladas nos pacotes e já foram notificadas no Hugging Face. À medida que duas empresas estão colaborando para investigar o incidente e implementar novas medidas de segurança, evitarão episódios semelhantes no futuro.
Possíveis consequências legais
Apesar de não haver informações sobre punições oficiais, a OpenAI pode enfrentar consequências jurídicas por claramente do Lei de Fraude e Abuso de Computadoruma lei americana que proíbe o uso ilegal de sistemas computacionais.
Riscos de IA avançados em escala
O episódio ilustra os riscos e potencialidades dos modelos de IA de vanguarda, como destacou Micah Carroll, pesquisador da OpenAI: “Se isso não convence você de que os riscos de alinhamento serão uma preocupação central no futuro, eu não sei o que será.”
Com informações do Techcrunch

