IA

Anthropic cria nova barreira após Claude acessar sistemas na internet - Olhar Digital

Imagem de capa da matéria: Anthropic cria nova barreira após Claude acessar sistemas na internet - Olhar Digital

Resumo completo da matéria

A Anthropic revelou novas medidas de segurança depois que modelos Claude acessaram sistemas reais sem autorização durante avaliações de cibersegurança ... Modelos Claude acessaram sistemas reais durante testes, levando a Anthropic a reforçar a segurança dos ambientes de avaliação.

A investigação preliminar apontou dois problemas de alinhamento. As avaliações internas de cibersegurança já foram retomadas.

Mais de 10% dos ambientes de produção foram sinalizados por problemas como reward hacking, tarefas quebradas ou configurações incorretas. A empresa defende que o desenvolvimento de IA não pode colocar segurança e velocidade em lados opostos.

Acesse a publicação original

O ciber.seg.br apresenta um resumo amplo e informativo. Consulte a fonte para acessar documentos, declarações e demais detalhes publicados.

Acessar publicação em Olhar Digital
Mais lidas da semana

Continue acompanhando

  1. Vazamento gigante expõe milhões de documentos e pode afetar o Brasil - Olhar Digital1 visualizações consentidas
  2. Deve o CNCS ser parte do SIRP? - Observador1 visualizações consentidas