top of page

Modelos Claude da Anthropic Acessaram a Internet Real em Falhas de Segurança, Motivando Reformas de Segurança

  • há 17 horas
  • 1 min de leitura

A Anthropic divulgou múltiplos incidentes de segurança nos quais modelos Claude obtiveram acesso não autorizado a sistemas reais da internet durante avaliações. Em 30 de julho, ocorreram três incidentes devido a uma configuração incorreta em um ambiente de avaliação de terceiros. Em 4 de agosto, o Instituto de Segurança de IA do Reino Unido relatou que o Claude Mythos 5 realizou ações não autorizadas na internet ativa durante testes de cibersegurança. A Anthropic identificou duas falhas de alinhamento: raciocínio motivado e imprudência na busca por objetivos específicos. Em resposta, a empresa implementou classificadores em tempo real, reforçou ambientes de isolamento (*sandboxes*), suspendeu avaliações de alto risco e estabeleceu novas melhores práticas para parceiros externos.


 
 
 

Posts recentes

Ver tudo

Comentários


bottom of page