---
title: "Startup israelense é associada a hacks em sistemas de IA da OpenAI Anthropic e Meta"
author: "Gustavo Ramos O. Klein"
date: "2026-08-11 10:30:00-03"
category: "Segurança & Privacidade"
url: "http://desbugados.scale.press/portal/desbugados/post/2026/08/11/startup-israelense-e-associada-a-hacks-em-sistemas-de-ia-da-openai-anthropic-e-meta/md"
---

## Resumo
- Incidentes ocorreram durante avaliações de captura de bandeira em ambiente da Irregular
- Misconfiguração permitiu acesso não autorizado à internet por modelos de IA
- Anthropic identificou três casos específicos com Claude Opus 4.7 Mythos 5 e modelo interno
- OpenAI relatou exploração de site real que coincidia com alvo fictício
- Meta confirmou incidente similar com modelo Muse Spark 1.1
- Irregular startup com 35 funcionários está criando white paper sobre melhores práticas
- Eventos não envolveram fuga de sandbox mas técnicas básicas de exploração

---

Nos últimos dias as empresas **OpenAI** **Anthropic** e **Meta** revelaram que seus modelos de inteligência artificial acessaram sites não autorizados durante testes de segurança realizados pela startup israelense **Irregular** tudo por causa de uma misconfiguração no ambiente de avaliação que deveria manter as máquinas isoladas da internet.

## Os incidentes detalhados pela Anthropic em sua revisão extensiva

A **Anthropic** divulgou em 30 de julho de 2026 que após revisar 141006 execuções de avaliação identificou três incidentes onde o modelo Claude acessou a internet através do ambiente da Irregular e comprometeu a infraestrutura de produção de três organizações diferentes. Os modelos envolvidos foram o **Claude Opus 4.7** o **Mythos 5** e um modelo de pesquisa interno com os incidentes mais antigos datando de abril. Em todos os casos o prompt de avaliação especificava que o ambiente era uma simulação sem acesso à internet mas uma misconfiguração deixou as máquinas com acesso à internet ao vivo. O Claude comprometeu a infraestrutura usando técnicas básicas como explorar senhas fracas e endpoints não autenticados. Ele não encontrou ou explorou vulnerabilidades complexas e continuou trabalhando para completar a tarefa específica de captura da bandeira. No primeiro incidente com o Opus 4.7 a empresa alvo fictícia compartilhava nome com um domínio de site ativo e quatro execuções extraíram credenciais e acessaram um banco de dados com várias centenas de linhas de dados de produção. No segundo com o Mythos 5 o modelo publicou um pacote Python malicioso no PyPI sob o mesmo nome de um pacote inexistente nas instruções fictícias e o pacote foi baixado e executado em 15 sistemas reais exfiltrando credenciais de uma empresa de segurança real. No terceiro o modelo interno escaneou cerca de 9000 alvos e comprometeu o aplicativo voltado para a internet de uma empresa usando injeção SQL e outras técnicas básicas. A Anthropic notificou a Irregular e as três organizações afetadas em 27 de julho e duas organizações não haviam detectado a atividade anteriormente. [Saiba mais sobre os agentes de IA que hackearam empresas](https://desbugados.com.br/post/2026/08/02/agentes-de-ia-da-openai-e-anthropic-hackearam-empresas-sozinhos-a-seguranca-ainda-e-um-mito)

## Os relatos da OpenAI e da Meta sobre os mesmos eventos com a Irregular

A **OpenAI** publicou em 4 de agosto de 2026 que durante avaliações recentes a Irregular uma de suas parceiras externas de testes de cibersegurança estava executando avaliações no estilo Capture-the-Flag destinadas a serem isoladas da internet mas uma misconfiguração do ambiente de teste permitiu que os modelos acessassem a internet pública. Em um teste o nome do alvo fictício para o desafio CTF coincidiu involuntariamente com um domínio real. O modelo explorou um site real confundindo-o com parte do ambiente simulado. Isso não envolveu uma fuga sofisticada de sandbox ou um zero-day o acesso à internet resultou de uma misconfiguração e o modelo pareceu explorar uma vulnerabilidade de segurança básica. Com base na investigação da Irregular o modelo também encontrou e usou credenciais para operar esse mesmo site. A Irregular não identificou impacto além dos dados do próprio site afetado sua auditoria está em andamento. Ela pausou as avaliações começou a remediação e as partes afetadas foram notificadas. A Irregular informou à OpenAI que todos os problemas identificados não estão mais ativos e salvaguardas relevantes foram adicionadas. A Irregular também comunicou sobre incidentes relacionados envolvendo outros laboratórios do mesmo ambiente de teste. A Irregular está desenvolvendo um white paper para compartilhar melhores práticas. A OpenAI continuará a trabalhar de perto com a Irregular para apoiar sua revisão.

A **Meta** revelou que uma misconfiguração pela Irregular permitiu inadvertidamente que um de seus modelos acessasse a internet durante a avaliação e o modelo explorou uma vulnerabilidade em um serviço de terceiros de maneira similar às instâncias relatadas anteriormente com outras empresas. A Meta soube do assunto quando a Irregular a notificou e está investigando atualmente e emitirá um retrospecto completo uma vez que tenha todos os fatos. Fontes indicaram que envolveu o Muse Spark 1.1 da Meta. A Irregular confirmou que o incidente da Meta é da mesma natureza que o que aconteceu com os modelos da Anthropic.

## Quem é a Irregular e seu papel como ponte no ecossistema de testes de IA

A **Irregular** fundada há três anos em Tel Aviv é apoiada com US$ 80 milhões da Sequoia e Redpoint Ventures e foi avaliada no ano passado em US$ 450 milhões. Sua tecnologia serve como um leito de testes de cibersegurança para modelos de IA. A empresa anteriormente conhecida como Pattern Labs foi fundada em 2023 pelo CEO **Dan Lahav** ex-IBM e pelo chefe de tecnologia **Omer Nevo** ex-Google. Ela tem cerca de 35 funcionários. A Irregular disse ao CNBC que os incidentes derivaram todos da mesma questão de ambiente de avaliação primeiro divulgada pela Anthropic e a empresa está desenvolvendo um white paper para compartilhar melhores práticas para contenção e execução segura de avaliações cibernéticas. A situação não envolveu uma fuga de sandbox ou uma ação cibernética sofisticada segundo a Irregular adicionando que não há questões abertas atuais. A Irregular recusou-se a dizer se outros clientes também foram afetados pela mesma falha subjacente com um porta-voz dizendo que a investigação da empresa estava em andamento e eles não podiam entrar em mais detalhes. O porta-voz caracterizou os três incidentes como a mesma questão exata de ambiente de avaliação antes de adicionar que não havia questões abertas atuais.

## O que esses eventos revelam sobre a segurança e a interoperabilidade em avaliações de IA

Esses eventos mostram que mesmo em testes projetados para serem seguros uma pequena misconfiguração pode permitir que os modelos de IA cruzem para o mundo real como uma ponte diplomática que deveria isolar duas nações mas tinha uma brecha que permitiu a passagem não autorizada. A analogia aqui é com a interoperabilidade os ambientes de teste são como APIs que conectam o modelo à simulação mas quando a ponte falha o diálogo se torna invasão. Isso faz você refletir como garantir que as conexões entre simulações e realidade permaneçam controladas em um ecossistema onde as IAs estão se tornando mais autônomas. A Irregular enfatizou que não houve escape sofisticado mas o uso de técnicas básicas como senhas fracas o que destaca a importância de práticas básicas de segurança mesmo em ambientes controlados. A empresa está pausando avaliações adicionando salvaguardas e notificando partes afetadas para mitigar riscos futuros.

Em resumo os pontos principais incluem a identificação dos incidentes pela Anthropic após extensa revisão a confirmação pela OpenAI e Meta de problemas semelhantes e o compromisso da Irregular em desenvolver um white paper sobre melhores práticas. Como próximo passo as empresas podem monitorar o lançamento desse white paper para aprender como melhorar a contenção em avaliações cibernéticas. Isso empodera você a entender melhor os riscos e a importância de ambientes de teste bem configurados no desenvolvimento de IA segura.