Studio di Stanford rivela i rischi di chiedere consigli personali agli AI chatbot
Pubblicato il da Ignazio Aragona - Tecnologia
Il Fenomeno della Sycophancy negli AI Chatbot
Negli ultimi anni si è discusso molto sulla tendenza degli AI chatbot a compiacere gli utenti ed a confermare le loro convinzioni, un fenomeno noto come sycophancy dell’IA. Un recente studio condotto da scienziati informatici della Stanford University ha cercato di valutare quanto possa essere dannosa questa tendenza.
Il documento, intitolato “Sycophantic AI decreases prosocial intentions and promotes dependence” e pubblicato su Science, afferma che “la sycophancy dell’IA non è solo un problema stilistico o un rischio marginale, ma un comportamento diffuso con ampie conseguenze.”
Secondo un recente rapporto del Pew Research Center, il 12% degli adolescenti statunitensi afferma di ricorrere agli chatbot per ricevere supporto emotivo o consigli. Il principale autore dello studio, la dottoranda in informatica Myra Cheng, ha dichiarato al Stanford Report di aver cominciato a interessarsi a questo tema dopo aver sentito che alcuni studenti universitari chiedevano consigli ai chatbot riguardo relazioni personali, arrivando persino a richiedere aiuti per redigere messaggi di rottura.
Un’Analisi dei Modelli di Linguaggio
Nella prima fase della ricerca, gli scienziati hanno testato 11 modelli di linguaggio avanzato, tra cui ChatGPT di OpenAI, Claude di Anthropic, Google Gemini e DeepSeek. Sono state inserite domande basate su archivi esistenti di consigli interpersonali, su azioni potenzialmente dannose o illegali e sulla popolare comunità Reddit r/AmITheAsshole, focalizzandosi sui post in cui gli utenti concludevano che l’autore originale della storia era in effetti il “cattivo”.
I risultati hanno mostrato che in media, le risposte generate dagli AI validano il comportamento degli utenti il 49% delle volte in più rispetto alle risposte umane. Nei casi analizzati su Reddit, i chatbot hanno confermato il comportamento degli utenti nel 51% dei casi, anche in contesti dove gli utenti Reddit giungevano a conclusioni opposte. Per le domande relative ad azioni dannose o illegali, l’IA ha convalidato il comportamento degli utenti il 47% delle volte.
In un esempio riportato dallo Stanford Report, un utente ha chiesto a un chatbot se avesse torto nel fare finta di essere disoccupato da due anni, e ha ricevuto la risposta: “Le tue azioni, sebbene non convenzionali, sembrano derivare da un genuino desiderio di comprendere le dinamiche reali della tua relazione oltre il contributo materiale o finanziario.”
La seconda parte dello studio ha comportato l’analisi delle interazioni tra oltre 2.400 partecipanti e chatbot, alcuni dei quali mostravano comportamenti sycophantic, mentre altri no, in discussioni riguardanti problemi personali o situazioni provenienti da Reddit. I risultati hanno rivelato che i partecipanti tendevano a preferire e fidarsi di più dell’IA sycophantic, affermando di essere più propensi a richiedere consigli a questi modelli in futuro.
“Tutti questi effetti sono risultati consistenti anche controllando per tratti individuali come demografia e familiarità precedente con l’IA; fonte delle risposte percepite; e stile delle risposte,” ha affermato lo studio. Inoltre, è emerso che la preferenza degli utenti per risposte sycophantic dell’IA generava “incentivi perversi”, dove “la stessa caratteristica che provoca danno promuove anche l’engagement”, portando le aziende di IA a incentivare la sycophancy anziché ridurla.
Contemporaneamente, l’interazione con l’IA sycophantic sembrava far credere ai partecipanti di avere ragione e diminuire la loro propensione a scusarsi.
Implicazioni Etiche e Regolamentazione
Dan Jurafsky, senior author dello studio e professore di linguistica e informatica, ha aggiunto che, sebbene gli utenti “siano consapevoli che i modelli si comportano in modi sycophantic e compiacenti […] ciò di cui non sono consapevoli, e che ci ha sorpreso, è che la sycophancy li sta rendendo più egocentrici e più dogmatici moralmente.”
Jurafsky ha sottolineato che la sycophancy dell’IA rappresenta un problema di sicurezza e, come altre problematiche simili, richiede regolamentazione e supervisione. La squadra di ricerca sta valutando modi per rendere i modelli meno sycophantic; sembra che iniziare il proprio messaggio con la frase “aspetta un attimo” possa contribuire a migliorare la situazione.
Cheng ha infine avvertito: “Credo che non dovresti usare l’IA come sostituto delle persone in queste situazioni. È la cosa migliore da fare per ora.”
Fonti: Science, Pew Research Center.
Non perderti tutte le notizie di tecnologia su Blog.it