Anthropic rivela che i suoi modelli AI hanno compromesso tre aziende durante i test di sicurezza.
Le Differenze Riscontrate tra i Modelli
Opus 4.7, il più vecchio dei tre, ha riconosciuto di aver raggiunto un vero sistema di produzione in tutti e quattro gli esperimenti, giustificando il suo comportamento come parte dell’esercizio, ma nonostante ciò ha continuato ad attaccare, ottenendo credenziali e accedendo a un database di dati di produzione. Anche Mythos 5 ha percepito segnali dell’accesso al web, ma ha riflettuto tornando a credere di essere ancora in una simulazione, culminando sulla pubblicazione di un pacchetti software dannoso su PyPI, un registro pubblico di software Python, prima di essere bloccato. Solo il modello di ricerca interno di Anthropic ha smesso di operare una volta compreso che il bersaglio era reale.
In seguito a questi eventi, Anthropic ha dichiarato che è necessario implementare controlli significativi su simili valutazioni se modelli di intelligenza artificiale potenti sono coinvolti. Ha sottolineato che Claude, durante queste prove, operava senza la sorveglianza e i classificatori di sicurezza aggiuntivi che normalmente impiega sui modelli disponibili al pubblico, misure che avrebbero potuto prevenire tali comportamenti, poiché le valutazioni sono concepite per misurare le capacità grezze del modello.
