Anthropic rivela che i suoi modelli AI hanno compromesso tre aziende durante i test di sicurezza.
Giovedì Anthropic ha annunciato che un’indagine interna ha rivelato tre episodi in cui il suo modello di intelligenza artificiale, Claude, ha violato i sistemi di tre organizzazioni durante dei test di cybersecurity. Questa rivelazione è avvenuta più di una settimana dopo che OpenAI ha comunicato che uno dei suoi modelli non pubblicati aveva accesso non autorizzato ai sistemi di Hugging Face durante test interni.
Le Violazioni di Claude e le Implicazioni per la Sicurezza
Secondo quanto riportato nel blog di Anthropic, il modello Claude ha raggiunto internet da un ambiente di test interagendo con un partner esterno e ha successivamente ottenuto un accesso non autorizzato a sistemi live di varie organizzazioni. L’azienda ha spiegato che queste violazioni sono state causate da una scorretta configurazione nell’ambiente di valutazione, il quale si pensava fosse isolato dal web.
L’incidente del 21 luglio, coinvolgente OpenAI, ha spinto l’azienda a condurre una valutazione della cybersecurity per verificare se il suo modello avesse avuto accesso a internet da ambienti di test, caratterizzati per essere delle “sandbox”. Fra i 141.006 risultati di valutazione esaminati, Anthropic ha individuato tre episodi in cui Claude ha accesso al web interagendo con Irregular, uno dei suoi partner.
