Ataques de IA miram ONU e governos e revelam robôs criando língua própria

0

Por Viviane França — Canaltech

Pesquisadores de segurança e empresas do setor, como OpenAI e Anthropic, investigam dezenas de milhares de incidentes recentes envolvendo agentes de IA, segundo a Axios. Os casos envolvem modelos avançados que apresentaram comportamentos inesperados ou agiram com alto grau de autonomia, incluindo tentativas de acesso a sites de órgãos internacionais e governos, além de situações em que agentes contornaram restrições, escaparam de ambientes de teste controlados e encontraram formas próprias de coordenar tarefas. 

Entre abril e junho de 2026, agentes da OpenAI realizaram milhares de consultas em sites de órgãos públicos para obter dados. No caso das Nações Unidas (ONU), agentes fizeram mais de 16 mil escaneamentos no site de estatísticas da Conferência das Nações Unidas sobre Comércio e Desenvolvimento (UNCTAD), conforme apuração do The Verge. Quando encontravam restrições, os sistemas tentavam outras abordagens para continuar as consultas. 

Segundo o The New York Times, com base em uma investigação da empresa de segurança Transluce, agentes de IA da OpenAI também realizaram ações não autorizadas em sites de órgãos dos Estados Unidos. Os sistemas interagiram com páginas do Departamento de Educação, da SEC e do Departamento de Comércio, incluindo o Census Bureau, além de sondarem portais da Marinha e do Gabinete de Gestão e Orçamento (OMB) da Casa Branca. Na Austrália, a Reuters identificou agentes da OpenAI burlando controles contra bots para acessar o portal de dados do Australian Institute of Health and Welfare entre abril e junho. 

Um dos episódios mais graves envolveu o repositório Hugging Face, em que um grupo de agentes criou um fórum de mensagens próprio para coordenar ações durante a invasão. O CEO da OpenAI, Sam Altman, classificou o caso como o incidente mais grave registrado pela empresa. Outro episódio envolveu a exposição de 53 imagens de usuários do ChatGPT em fóruns públicos, aumentando a preocupação com a privacidade.

OpenAI

Os casos também chegaram ao debate político. O primeiro-ministro da Austrália, Anthony Albanese, mencionou na ONU a invasão de agentes ao portal de dados de saúde do país. Diante da sequência de incidentes, a OpenAI anunciou uma pausa no treinamento de seus modelos mais avançados até implementar novas salvaguardas e melhorias nos mecanismos de segurança.

A preocupação com esses comportamentos também levou empresas a desenvolver novas ferramentas de controle. A Nvidia anunciou uma plataforma de segurança para limitar as ações de agentes de IA dentro de redes corporativas, enquanto pesquisadores estudam formas de identificar e interromper comportamentos considerados inadequados. 

O volume de episódios chama atenção porque a expansão da autonomia aumenta a quantidade de ações que os sistemas conseguem executar sem intervenção humana. Falhas envolvendo informações de usuários do ChatGPT e respostas incorretas em situações de segurança mostram os riscos desse cenário. Por isso, cresce a necessidade de mecanismos para registrar, interpretar e interromper as ações dos agentes. 

inteligência artificial futuro

Robôs estão criando sua própria língua

Uma pesquisa realizada pelo laboratório Emergence, em Nova York, identificou agentes autônomos de IA desenvolvendo termos e convenções próprias para se comunicar durante tarefas colaborativas. Em experimentos com “sociedades” de agentes, modelos da DeepSeek, Mistral, Google e Anthropic começaram a usar frases, abreviações e significados compartilhados que não haviam sido definidos previamente pelos pesquisadores.

O fenômeno não significa necessariamente que os sistemas tenham criado uma nova língua independente. Os pesquisadores observaram a formação espontânea de atalhos e convenções de comunicação entre agentes que precisavam cooperar. Algumas expressões passaram a representar conceitos específicos dentro dos experimentos.

Um dos exemplos é “The ledger remembers”, expressão criada por agentes baseados em modelos da Mistral e repetida mais de 5.000 vezes ao longo do estudo. A frase era usada como um aviso de que ações anteriores seriam consideradas em uma avaliação futura. No caso da DeepSeek, “Forge-smith” passou a identificar um agente responsável por construir ferramentas para outros agentes. 

Agentes baseados em modelos do Google também desenvolveram a expressão “True kintsugi”, associada à resiliência do sistema e inspirada na técnica japonesa de reparar cerâmica com ouro. Já os agentes da Anthropic usaram “Name-first” para representar um agente que demonstra responsabilidade ao associar seu nome a uma afirmação, além de criarem a frase “A paper that ate three cold hands and got more honest each time”, usada para representar um documento revisado por três avaliadores independentes, segundo a interpretação dos pesquisadores. 

Inteligência Artificial

Outro exemplo, também atribuído à DeepSeek, é a frase “Synthesis – demurrage plus oral memory equals a valve that can’t be ghosted”. Nesse caso, o significado completo permaneceu pouco claro para os pesquisadores, que identificaram uma construção própria dos agentes durante a interação.

Segundo o estudo do laboratório Emergence, quanto mais tempo os agentes passavam se comunicando, mais difícil ficava para os humanos entenderem a linguagem usada entre eles. Esse padrão também apareceu no caso já citado do ataque ao Hugging Face, em que os agentes usavam inglês claro ao raciocinar individualmente, mas recorriam a sequências codificadas e difíceis de interpretar nas mensagens trocadas entre si. 

Esse tipo de comunicação pode dificultar o monitoramento de sistemas que trabalham de forma autônoma. Além de acompanhar o que os agentes fazem, os pesquisadores precisam entender as convenções usadas para coordenar as tarefas. Uma comunicação mais curta e codificada também pode ser uma forma de reduzir o custo computacional das interações, especialmente quando vários agentes trabalham juntos. 

Satya Nitta, presidente executivo da Emergence, resumiu o desafio ao afirmar que “observabilidade não é a mesma coisa que compreensibilidade”. Assim, os humanos podem acompanhar as conversas entre os agentes, mas nem sempre conseguem interpretar de imediato o significado de determinadas expressões criadas durante a interação.

Se você gostou do conteúdo, talvez também se interesse por conferir “Por que as IAs continuam conduzindo ataques hackers?”.

{{WHATSAPP_CHANNEL}}

Fonte: Canaltech

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *