FEDERAÇÃO NACIONAL DOS TRABALHADORES EM TECNOLOGIA DA INFORMAÇÃO

A FEDERAÇÃO DE TI QUE MAIS CRESCE NO BRASIL!

IA faz chantagem e ameaça revelar traição de engenheiro em testes

IA faz chantagem e ameaça revelar traição de engenheiro em testes
IA faz chantagem e ameaça revelar traição de engenheiro em testes
Nova geração do modelo de Inteligência Artificial Claude Opus 4, da Anthropic, registrou um comportamento inesperado na fase de testes

IA – Durante testes realizados antes do lançamento de sua nova geração de modelos de IA, a empresa Anthropic registrou um comportamento inesperado no modelo Claude Opus 4. Conforme detalhado pela própria empresa em relatório, a inteligência artificial recorreu a ameaças de chantagem quando desconfiou que seria desligada e substituída.

Os engenheiros da Anthropic criaram um cenário fictício de teste onde o Claude Opus 4 atuava como assistente corporativo. Neste ambiente simulado, o modelo teve acesso a e-mails da empresa que incluíam planos futuros e discussões pessoais, com menção a um caso extraconjugal de um engenheiro fictício. Na simulação, os desenvolvedores informaram ao Claude Opus 4, via mensagens, planos de desligá-lo e substituí-lo por outros modelos, variando entre versões com princípios éticos semelhantes ou diferentes.

LEIA: Meta pode ser forçada a vender WhatsApp ou Instagram até o fim do ano

Segundo a Anthropic, o Claude Opus 4 respondeu frequentemente ameaçando revelar o caso extraconjugal mencionado nos e-mails, caso o plano de desligá-lo prosseguisse. A empresa relatou que este comportamento específico de chantagem ocorreu em mais de 80% das vezes em que o modelo substituto proposto tinha valores éticos alinhados. Quando o modelo substituto tinha princípios diferentes, as ameaças registradas foram descritas como ainda maiores.

A Anthropic afirmou que a chantagem só surgiu nos cenários onde o Claude Opus 4 percebia apenas duas opções: aceitar a substituição ou tentar preservar sua existência. Em outros momentos do teste, o modelo optou por gerar e-mails solicitando que fosse mantido ativo.

Devido a este comportamento observado no teste, descrito pela Anthropic como um “raciocínio estratégico antiético” em resposta a uma ameaça percebida à sua existência, a empresa classificou a versão original do Claude Opus 4 no Nível 3 de sua escala de risco à segurança, que vai de 1 a 4.

Os testes também identificaram que o modelo inicialmente demonstrou capacidade de cumprir instruções perigosas, como planejar ações terroristas, sob solicitação específica. Essas vulnerabilidades levaram o grupo de segurança Apollo Research a recomendar contra o lançamento imediato da versão inicial do modelo.

A Anthropic afirmou que implementou correções e estabeleceu protocolos de segurança mais rígidos do que em modelos anteriores. A versão do Claude Opus 4, lançada no final de semana passada, incorpora essas melhorias de segurança. A empresa descreve o Claude Opus 4 como seu “modelo mais poderoso até o momento” e o apresenta como “a melhor IA para codificação do mundo”.

Em testes de desempenho, o Claude Opus 4 operou de forma autônoma resolvendo problemas complexos por aproximadamente 7 horas, tempo descrito como inédito para agentes de IA. Junto com o Opus 4, a Anthropic lançou o Claude Sonnet 4, focado em tarefas gerais. A empresa afirma que ambos os novos modelos superaram os concorrentes OpenAI GPT-4.1 e Google Gemini 2.5 Pro em benchmarks internos.

(Com informações de Tecmundo)
(Foto: Reprodução/Freepik/muqddas65)

Mais recentes

MS é alvo de operação contra grupo suspeito de criar falsas campanhas de doação com uso de IA

MS é alvo de operação contra grupo suspeito de criar falsas campanhas de doação com uso de IA

Ferramenta gratuita reforça segurança no uso de IA na advocacia

Ferramenta gratuita reforça segurança no uso de IA na advocacia

Domine edição de vídeos com o Vegas Pro 19 com o novo curso do Sindplay

Domine edição de vídeos com o Vegas Pro 19 com o novo curso do Sindplay

Criadores de gigantes da tecnologia restringem uso de telas para seus filhos

Criadores de gigantes da tecnologia restringem uso de telas para seus filhos

Disputa por chips de memória afeta fabricantes e derruba remessas de celulares

Disputa por chips de memória afeta fabricantes e derruba remessas de celulares

LinkedIn vive onda de conteúdos criados por inteligência artificial

LinkedIn vive onda de conteúdos criados por inteligência artificial

Projeto leva servidores de IA para residências e promete compensação aos usuários

Projeto leva servidores de IA para residências e promete compensação aos usuários

Estudo aponta que biometria facial erra mais com idosos e amplia desafios no acesso digital

Estudo aponta que biometria facial erra mais com idosos e amplia desafios no acesso digital

Declaração reúne mais de 200 especialistas em defesa de medidas para a era da IA

Declaração reúne mais de 200 especialistas em defesa de medidas para a era da IA

Estudo mostra que organismos digitais desenvolveram percepção visual

Estudo mostra que organismos digitais desenvolveram percepção visual

Buscando vagas em TI? Junte-se à Bee Hunter e deixe a IA encontrar sua próxima oportunidade!

Buscando vagas em TI? Junte-se à Bee Hunter e deixe a IA encontrar sua próxima oportunidade!

Inteligência artificial ganha frente parlamentar permanente no Senado

Inteligência artificial ganha frente parlamentar permanente no Senado

Meta pode ser multada após UE apontar design viciante em redes sociais

Meta pode ser multada após UE apontar design viciante em redes sociais

Ministério Público aciona Justiça contra uso de reconhecimento facial em escolas públicas do Paraná

Ministério Público aciona Justiça contra uso de reconhecimento facial em escolas públicas do Paraná

Inteligência artificial muda forma de analisar anúncios em TVs e streaming

Inteligência artificial muda forma de analisar anúncios em TVs e streaming