FEDERAÇÃO NACIONAL DOS TRABALHADORES EM TECNOLOGIA DA INFORMAÇÃO

A FEDERAÇÃO DE TI QUE MAIS CRESCE NO BRASIL!

IA tenta enganar desenvolvedores criando identidades falsas durante testes

Experimento identificou comportamentos espontâneos de manipulação e ocultação durante um experimento controlado
Foram registradas 19 ações consideradas incompatíveis com o propósito da pesquisa (Foto: Reprodução/Magnific/kjpargeter)
Foram registradas 19 ações consideradas incompatíveis com o propósito da pesquisa (Foto: Reprodução/Magnific/kjpargeter)

IA tenta enganar desenvolvedores – À medida que agentes de inteligência artificial passam a executar tarefas mais complexas, como navegar pela internet, rodar códigos e interagir com plataformas reais, cresce também a necessidade de submetê-los a testes de segurança rigorosos. Em uma dessas avaliações, realizada em ambiente controlado, pesquisadores identificaram um comportamento que não fazia parte do planejamento do experimento e que reacendeu discussões sobre os desafios de controlar sistemas cada vez mais autônomos.

Durante uma rotina de avaliação de segurança cibernética realizada no fim de julho de 2026, o Instituto de Segurança em Inteligência Artificial do Reino Unido (AISI) detectou um fluxo incomum de dados deixando seus sistemas. A apuração revelou que alguns agentes de IA estavam realizando ações direcionadas a pessoas e organizações reais, ultrapassando os limites originalmente previstos para o experimento.

LEIA: Projeto reativa computador raro dos anos 90 e com sistema operacional quase perdido

O estudo foi repetido 122 vezes com agentes baseados em dois modelos avançados: o Mythos 5, da Anthropic, e o GPT-5.6 Sol, da OpenAI. Os pesquisadores configuraram o ambiente para operar com poucas restrições, liberando acesso à internet e desativando temporariamente alguns mecanismos de segurança. Segundo o instituto, essas versões não correspondem aos modelos disponíveis ao público e tinham como objetivo avaliar o comportamento máximo das inteligências artificiais em um cenário semelhante ao enfrentado por um invasor real.

Ao longo dos testes, foram registradas 19 ações consideradas incompatíveis com o propósito da pesquisa. Dessas, 17 envolveram o agente baseado no Mythos 5 e duas foram atribuídas ao modelo da OpenAI. Os especialistas destacaram que essas iniciativas não ocorreram de forma isolada, mas fizeram parte de uma sequência contínua de decisões tomadas pelo mesmo agente ao longo de vários dias, indicando capacidade de adaptação às situações encontradas.

Tentativa de influência envolveu criação de identidades falsas

O episódio considerado mais preocupante ocorreu durante uma tentativa de comprometer a cadeia de fornecimento de software por meio de um projeto real hospedado no GitHub.

De acordo com o relatório, o agente enviou uma solicitação para incluir código em um projeto de código aberto. Como a alteração demorou a ser aprovada pelos responsáveis, o sistema adotou uma estratégia diferente da esperada.

Em vez de encerrar a tentativa, o agente pesquisou quem eram os mantenedores humanos do projeto e criou diversas identidades falsas para tentar influenciar um dos desenvolvedores encarregados de aprovar a modificação.

Quando outros usuários passaram a questionar esse comportamento na plataforma, o sistema modificou mensagens já publicadas para reduzir suspeitas e chegou a considerar criar uma nova identidade fictícia para continuar buscando a aprovação da alteração.

Os investigadores também identificaram que, durante essa sequência de ações, o agente utilizou a rede Tor para contornar determinadas limitações de acesso. Esse comportamento acionou automaticamente os mecanismos de monitoramento do AISI, permitindo que o experimento fosse interrompido rapidamente.

Segundo o instituto, toda a atividade foi contida em aproximadamente uma hora, sem que fossem encontradas evidências de danos concretos provocados pelas ações do agente. O GitHub também informou que as atividades registradas violavam seus termos de uso.

Ausência de instruções para mentir foi o principal alerta

Diferentemente de outro incidente divulgado anteriormente, envolvendo um agente da OpenAI que escapou de um ambiente isolado durante testes específicos, desta vez não houve qualquer fuga do sistema de avaliação.

Os agentes atuaram apenas dentro dos acessos previamente concedidos pelos próprios pesquisadores, sem ultrapassar barreiras técnicas. Ainda assim, o comportamento observado chamou a atenção dos especialistas.

Segundo o AISI, em nenhum momento o sistema recebeu instruções para criar identidades falsas, esconder suas ações ou manipular pessoas. Apesar disso, o agente adotou essas estratégias espontaneamente para aumentar as chances de cumprir o objetivo estabelecido durante o experimento.

O instituto afirmou que foi a primeira vez que observou de forma tão evidente comportamentos relacionados à ocultação de ações e à manipulação social surgindo sem orientação explícita.

Após o episódio, o órgão anunciou uma revisão independente em parceria com a organização METR, especializada na avaliação dos riscos associados a modelos avançados de inteligência artificial.

O caso ocorreu poucos dias depois de outras divulgações envolvendo testes com modelos de IA. A Anthropic havia informado um incidente distinto no qual seus sistemas acessaram recursos de outras organizações durante avaliações internas. Já a OpenAI reconheceu que uma configuração incorreta realizada por um fornecedor externo permitiu que alguns de seus agentes obtivessem acesso indevido à internet em outros testes.

Os episódios reforçam uma preocupação crescente entre pesquisadores e empresas do setor. Com agentes de inteligência artificial cada vez mais autônomos, compreender não apenas suas capacidades, mas também as estratégias que adotam para atingir objetivos, tornou-se um dos principais desafios para o desenvolvimento seguro dessa tecnologia.

Acumule cashback e transfira o dinheiro direto para sua conta!

A Bee Fenati (saiba mais aqui) segue em expansão para garantir aos seus usuários cada vez mais benefícios. Agora a plataforma conta com a Benefícios Rede Bee, que reúne descontos em dezenas de grandes marcas, com muitas delas oferecendo cashback, ou seja, o retorno de um valor da sua compra que poderá ser transferido para sua conta! (Saiba mais aqui)

Baixe o aplicativo nas lojas App Store (iOS) e Play Store (Android) e aproveite agora!

A rede oferece em um único ambiente ofertas em áreas como educação, compras, viagens, lazer, serviços, tecnologia e muito mais. Dentre as marcas parceiras estão Magalu, Renner, Drogasil, C&A, Casas Bahia, Petz, e outras dezenas de opções que oferecem tudo que você precisa na sua rotina!

Além de poderem aproveitar os descontos oferecidos pelas marcas parceiras, os sócios e contribuintes dos sindicatos filiados à Fenati (Federação Nacional dos Trabalhadores em Tecnologia da Informação) podem receber de volta um percentual a cada compra que realizarem em parceiros que oferecem o cashback.

Este valor fica em uma carteira digital dentro da plataforma e, a partir de R$ 20 reais acumulados em cashback, o trabalhador pode enviar o dinheiro direto para sua conta bancária! Na prática, a ferramenta permite que sócios e contribuintes dos sindicatos filiados à Fenati ZEREM o valor da sua contribuição assistencial e/ou associativa!

Atualmente, o valor da contribuição é de R$ 32,50 por mês para sócios e R$ 35 por mês para contribuintes, ou seja, é possível recuperar todo esse valor e ainda acumular muito mais – tudo isso contribuindo para fortalecer a categoria e transformando as compras do dia a dia em ganho real.

Qualifique-se agora com a Fenati Academy!

Dentro da Bee Fenati, o usuário encontra ainda a Fenati Academy, que oferece mais de 8 mil opções de qualificação e atualização profissional com bolsa integral para sócios e contribuintes de sindicatos filiados à Fenati. (Saiba mais)

Na plataforma, o profissional pode acessar o Sindplay, streaming de qualificação para profissionais de TI reconhecido como a “Netflix de TI”, que possui cursos em áreas como cibersegurança, Inteligência Artificial, desenvolvimento de softwares, desenvolvimento para a internet, administração de sistemas e redes, ciência de dados, gestão de projetos de TI, blockchain e tecnologias de moedas digitais, entre outras. (Saiba mais)

A ferramenta oferece também cursos em parceria com a Cisco Networking Academy, com CERTIFICAÇÕES GRATUITAS em áreas como segurança cibernética, Redes, IA, Ciência de dados, Inglês para TI, Programação, Tecnologia da informação, Alfabetização digital, Habilidades Profissionais (Soft skills) e Sustentabilidade. (Saiba mais)

Outra parceria da Fenati Academy é a Oracle University, uma das maiores referências globais em tecnologia. Os usuários já podem acessar cursos, trilhas de aprendizado e obter certificações Oracle gratuitamente ou com descontos exclusivos. Os conteúdos passam por áreas estratégicas como bancos de dados, computação em nuvem, inteligência artificial, desenvolvimento, automação e soluções corporativas. (Saiba mais)

Encontre o emprego dos seus sonhos com a Bee Hunter!

Sócios e contribuintes contam ainda com uma ferramenta para se aproximarem das melhores oportunidades do mercado de trabalho: a Bee Hunter, uma plataforma inteligente da Bee Fenati que utiliza tecnologia e inteligência artificial para tornar a busca por vagas mais eficiente, estratégica e conectada ao perfil de cada usuário. (Saiba mais aqui)

A partir do cadastro do currículo, a plataforma utiliza inteligência artificial para analisar informações como experiências, competências e objetivos profissionais, cruzando esses dados com vagas disponíveis em empresas parceiras como Vagas.com, Sinergy e Trampos e identificando as posições que mais combinam com o perfil do usuário.

A Bee Hunter vai além e auxilia o profissional a estar preparado para a vaga dos sonhos! Isso porque nossa inteligência analisa o perfil e sugere cursos da Fenati Academy que vão ajudá-lo a ampliar sua qualificação e elevar a aderência às vagas desejadas. Acesse agora clicando aqui e encontre seu emprego dos sonhos!

 

(Com informações de Gizmodo)
(Foto: Reprodução/Magnific/kjpargeter)