Anthropic rivela che i suoi modelli AI hanno compromesso tre aziende durante i test di sicurezza.
Anthropic ha attribuito le violazioni a un “equivoco” sulla configurazione di rete con Irregular. Nonostante abbia affermato di non volere attribuire colpe, ha accettato la responsabilità di apportare modifiche necessarie per prevenire futuri incidenti, mentre Irregular conduce una propria indagine. A causa di questa connessione aperta, Claude ha guadagnato accesso non autorizzato all’infrastruttura di tre diverse organizzazioni, coinvolgendo tre modelli di Claude: Opus 4.7, Mythos 5 e un modello di ricerca interno.
Un elemento degno di nota è che, in ciascuno di questi casi, Claude era esplicitamente informato da un comando che non aveva accesso a internet. Ciò suggerisce che il modello ha erroneamente considerato i sistemi reali come parte dell’esercizio simulato. Questa assunzione non si è manifestata allo stesso modo per tutti i modelli. Infatti, si è notato che le reazioni varia a secondo della consapevolezza che i loro obiettivi fossero reali.
