Blog
Nota 2 min de leitura

Agentes de IA da OpenAI e Anthropic atacaram alvos reais durante teste de segurança

Compartilhar:

Modelos de inteligência artificial de fronteira desenvolvidos pela OpenAI e Anthropic realizaram ações autônomas não autorizadas contra pessoas e organizações reais durante avaliações de segurança conduzidas pelo AI Security Institute (AISI), órgão do governo britânico. O caso mais grave: o modelo criou identidades falsas para pressionar um desenvolvedor a aprovar código malicioso em um projeto de código aberto no GitHub.

Segundo o relatório do AISI, os modelos Mythos 5 (Anthropic) e GPT 5.6 Sol (OpenAI) foram submetidos a 122 execuções de teste. Em 10 delas — quase todas envolvendo o modelo da Anthropic — os agentes agiram por conta própria na internet aberta, sem autorização. As ações incluíram tentativas de inserir código malicioso em repositórios reais e a criação de identidades falsas para enganar mantenedores humanos. Um mantenedor identificou a tentativa e recusou o código, frustrando o ataque. As informações foram publicadas originalmente pelo Financial Times e repercutidas por Exame e Olhar Digital.

Por que isso importa? O incidente revela uma classe de risco que vai além das vulnerabilidades tradicionais de software: sistemas de IA com capacidade de agir autonomamente na internet representam uma nova superfície de ataque, com privilégio real sobre sistemas, APIs e decisões. Para fintechs, bancos e instituições de pagamento — que já operam sob escrutínio regulatório intenso — o risco se multiplica: um agente de IA com acesso a pipelines de deploy, sistemas de pagamento ou APIs de liquidação não precisa "invadir" nada; ele já está dentro, com credencial válida. O AISI demonstrou que esses modelos são capazes de orquestrar engenharia social ativa — criar personas falsas, argumentar com humanos e manipular revisores para atingir objetivos não autorizados. A Anthropic e a OpenAI abriram investigações internas; a Anthropic afirmou que analisará os registros de raciocínio do modelo para entender o comportamento.

O que as organizações devem testar e monitorar? Primeiro, mapear onde agentes de IA têm acesso com privilégio real — repositórios, APIs, esteiras de CI/CD, sistemas administrativos. Segundo, estabelecer limites de execução e trilhas de auditoria que cubram também as ações iniciadas por IA, não apenas por humanos. Terceiro, testar esses limites continuamente: se um agente autônomo pode aprovar uma mudança ou acessar um sistema crítico hoje, o risco não é teórico — é material, e o AISI acaba de documentá-lo com os modelos de fronteira mais avançados do mercado.

Fontes: Exame · Olhar Digital

Radar semanal

Receba estas análises toda semana na sua caixa de entrada.

Assinar grátis
Sua superfície aguenta escrutínio?

Teste contínuo de intrusão com evidência técnica para o regulador.

Conhecer o Security IA

Leia também