Come può un giornale online impedire a Google di utilizzare i propri contenuti nelle AI overview?
Pubblicato il da Redazione - aggiornato il - Tecnologia
Abbiamo chiesto a Gemini di darci qualche informazione in piu sul come gli ediori dei giornali online possano limitare o totalmente escludere i proprio contenuti dalle AI Overview di Google e ci ha risposto così:
Questa è una questione complessa e molto dibattuta tra editori e Google. L’introduzione delle “AI Overviews” (o “Riepiloghi AI”) ha sollevato preoccupazioni significative sul fatto che i contenuti dei siti web, in particolare quelli giornalistici, vengano utilizzati per generare risposte dirette agli utenti, riducendo di conseguenza il traffico verso le fonti originali.
Ecco una panoramica delle strategie che un editore può adottare per cercare di impedire a Google di utilizzare i propri contenuti per le AI Overview, con le relative limitazioni.
1. Utilizzo di direttive per i crawler
Questo è il metodo tecnico principale per controllare come i motori di ricerca indicizzano e visualizzano i contenuti:
- Meta tag noindex: Se un editore desidera che una pagina specifica non venga indicizzata da Google e quindi non compaia nei risultati di ricerca né nelle AI Overview, può aggiungere il meta tag <meta name="robots" content="noindex"> nella sezione <head> della pagina. Questo è un metodo radicale che impedisce completamente l’indicizzazione della pagina.
- Meta tag nosnippet: Questo tag impedisce a Google di creare uno snippet (l’estratto di testo) o un video/immagine di anteprima della pagina nei risultati di ricerca. Può essere usato anche per impedire che il contenuto venga utilizzato nelle AI Overview. Il tag è <meta name="robots" content="nosnippet">.
- Attributo data-nosnippet: Questo è un approccio più granulare. L’editore può usare l’attributo data-nosnippet per contrassegnare sezioni specifiche di una pagina (ad esempio, un paragrafo o una tabella) che non devono essere usate per la creazione di snippet o riepiloghi. Ad esempio: <p><span data-nosnippet>Questo testo non deve essere utilizzato per gli snippet.</span> La parte restante del paragrafo è libera.</p>.
- File robots.txt: Questo file, posizionato nella directory principale del sito, fornisce istruzioni ai crawler su quali parti del sito possono o non possono scansionare. Tuttavia, è importante notare che il robots.txt impedisce la scansione, ma non necessariamente l’indicizzazione. Se una pagina bloccata nel robots.txt viene comunque linkata da altri siti, Google potrebbe comunque indicizzarla (senza poterne leggere il contenuto).
2. Differenziare i crawler
Google utilizza diversi “crawler” (o “bot”) per scopi diversi.
- Googlebot: Il crawler principale di Google per la ricerca web.
- Googlebot-News: Il crawler specifico per Google News.
- Google-Extended: Un crawler separato che può essere bloccato tramite il robots.txt per impedire a Google di utilizzare i contenuti per l’addestramento dei modelli di intelligenza artificiale di Google (come Gemini), senza però impedire l’indicizzazione per la ricerca tradizionale.
Un editore può utilizzare il robots.txt per bloccare selettivamente Google-Extended, ad esempio:
User-agent: Google-Extended Disallow: /Questa direttiva impedisce a Google di usare il contenuto del sito per addestrare i suoi modelli IA, ma non garantisce che i contenuti non vengano comunque utilizzati per le AI Overview, poiché Google potrebbe attingere le informazioni tramite Googlebot, che rimane autorizzato.
3. Soluzioni legali e dibattito
La questione è tutt’altro che risolta e si sta spostando sempre più sul piano legale. Numerosi editori, tra cui The New York Times e, più recentemente, Penske Media, hanno intrapreso azioni legali contro Google e OpenAI. Le principali argomentazioni sono:
- Violazione del copyright: L’uso dei contenuti per addestrare modelli IA o generare risposte dirette viene visto come una violazione del diritto d’autore, poiché il contenuto viene riprodotto e distribuito senza il consenso o un’adeguata compensazione.
- Danno economico: Gli editori sostengono che le AI Overview cannibalizzano il traffico che altrimenti andrebbe ai loro siti, riducendo drasticamente le entrate pubblicitarie e gli abbonamenti.
Il problema principale per gli editori è che, per rimanere visibili su Google (che rimane la fonte di traffico più importante), non possono semplicemente bloccare tutti i crawler di Google. La dipendenza dal motore di ricerca crea una posizione di svantaggio negoziale.
L’amara cnclusione è che in definitiva, al momento, un editore non ha un metodo semplice e univoco per impedire a Google di usare i propri contenuti specificamente per le AI Overview, mantenendo al contempo la piena visibilità nei risultati di ricerca. Le opzioni tecniche disponibili sono limitate e spesso comportano un compromesso tra controllo dei contenuti e visibilità. La soluzione definitiva potrebbe arrivare solo attraverso accordi di licenza tra Google e i grandi gruppi editoriali o, come sperano molti, tramite interventi normativi e sentenze giudiziarie che ridefiniscano i confini del “fair use” e del diritto d’autore nell’era dell’intelligenza artificiale generativa.
Non perderti tutte le notizie di tecnologia su Blog.it