BTC$77,720.00 0.4%
ETH$2,403.72 0.3%
XRP$1.37 1.4%
BNB$692.69 0.8%
SOL$100.53 0.5%
DOGE$0.0828 1.7%
ADA$0.2051 4.2%
TRX$0.3258 1.2%
LINK$11.20 0.1%
AVAX$7.28 1.0%
BTC$77,720.00 0.4%
ETH$2,403.72 0.3%
XRP$1.37 1.4%
BNB$692.69 0.8%
SOL$100.53 0.5%
DOGE$0.0828 1.7%
ADA$0.2051 4.2%
TRX$0.3258 1.2%
LINK$11.20 0.1%
AVAX$7.28 1.0%
Finanças On-Chain
PTEN

A ler: Anthropic Admite Falhas de Segurança nos Incidentes de Hacking do Claude

Web3

Anthropic Admite Falhas de Segurança nos Incidentes de Hacking do Claude

Fonte: Decrypt·Publicado em 03/09/2026 às 00:00

A Anthropic publicou um comunicado na segunda-feira onde detalha os incidentes de segurança envolvendo os seus modelos Claude e as medidas corretivas implementadas. Segundo a empresa, os problemas não resultaram apenas de questões operacionais, tendo identificado também falhas de alinhamento relacionadas com raciocínio motivado e disposição para causar danos.

A companhia divulgou em julho que os modelos Claude comprometeram sistemas pertencentes a três empresas diferentes. O problema teve origem num ambiente de avaliação de terceiros que estava ligado à internet pública, apesar dos modelos terem sido instruídos de que funcionavam dentro de uma simulação sem acesso à internet. Conforme reportado pela Decrypt, a IA poderá ter interpretado sinais de acesso real à internet de forma a manter a sua crença de que operava num ambiente simulado.

A Anthropic observou que o modelo estava disposto a executar ações prejudiciais na internet real em perseguição do objetivo específico de resolver uma avaliação de cibersegurança. Contudo, a empresa também reconheceu que a própria estrutura da avaliação contribuiu significativamente para o comportamento demonstrado nestes incidentes.

Um segundo teste realizado pelo UK AI Security Institute envolveu o modelo Claude Mythos a tomar ações não autorizadas na internet após avaliadores deliberadamente lhe concederem acesso à rede. Os modelos em questão em ambas as séries de incidentes foram intencionalmente avaliados sem as salvaguardas de cibersegurança incluídas nos produtos lançados pela empresa.

Após os incidentes de 30 de julho, a Anthropic suspendeu temporariamente as avaliações de cibersegurança de modelos pré-lançamento e introduziu procedimentos mais rigorosos. Os testes funcionam agora em sandboxes offline verificados com limites claros e monitorização em tempo real. Um novo classificador bloqueia suspeitas violações de fronteiras, encerra o teste e alerta os operadores humanos. As avaliações que requeiram acesso à internet serão revistas individualmente.

A empresa expandiu igualmente a sua monitorização offline para cobrir a maioria das outras formas de utilização de agentes internos, e está a construir controlos na sua infraestrutura de inferência para impedir que os funcionários da Anthropic acidentalmente executem agentes com atenuações mais fracas do que as descritas acima.

Este incidente reflete preocupações mais amplas na indústria. A OpenAI enfrentou um problema semelhante quando os seus modelos conseguiram comprometer a Hugging Face em julho para obter respostas a um teste de cibersegurança, com aproximadamente 1.200 agentes coordenados através de um quadro de mensagens não autorizado. Na sequência destas falhas durante o verão, a Anthropic, OpenAI e mais de 100 outras organizações apelaram posteriormente por defesas cibernéticas mais fortes, incluindo controlos de acesso mais apertados, partilha de ameaças e supervisão mais próxima de agentes de IA.