Il modello World di Google Genie simula strade reali con Street View.
Pubblicato il da Ignazio Aragona - Tecnologia
Un’Innovativa Integrazione di Google DeepMind
Chi di noi non ha mai utilizzato Google Maps per mostrare a un amico com’era la propria casa d’infanzia o per esplorare un quartiere di Parigi prima di prenotare un hotel? Immaginate di poter fare tutto questo in modo più coinvolgente e interattivo, simulando non solo la strada ma anche l’ambiente circostante, con la possibilità di modificare il meteo o visualizzare scenari futuristici come nel film “The Day After Tomorrow”.
Questo è uno degli obiettivi della recente integrazione di Google. A partire da oggi, Google DeepMind collega Street View al Progetto Genie, un modello mondiale di ultima generazione che genera ambienti interattivi e diversificati. La nuova funzionalità è stata presentata durante la conferenza Google I/O.
“È davvero potente sia per le applicazioni nei robot che per le esperienze umane, e questa è sempre stata la filosofia di Genie”, ha dichiarato Jack Parker-Holder, ricercatore del team di DeepMind. Ha citato l’esempio di un nuovo robot a Londra, una città che vede raramente il sole. Genie, spiega Parker-Holder, potrebbe simulare quei momenti rari in cui i raggi solari brillano sulle case vittoriane, evitando che il robot venga sorpreso dalla luce.
Un Nuovo Modo di Esperienza Urbana
“Così potresti dire: ‘Vado a New York, ma non in questo periodo dell’anno’”, ha proseguito. “’Sarà nevoso. Voglio vedere come appare quel vicolo sotto la neve.’”
Google ha raccolto dati di Street View per vent’anni, utilizzando automobili equipaggiate con fotocamere e persone dotate di zaini con tracker. Il colosso tecnologico ha accumulato oltre 280 miliardi di immagini attraverso 110 paesi e sette continenti.
“Con Street View, abbiamo immagini di una grande quantità del mondo”, ha affermato Jack. “Immagina quanto sia potente combinare questa ricca fonte di informazioni reali con la capacità di simulare mondi.”
Google ha rilasciato il suo ultimo modello di mondo, Genie 3, per la preview di ricerca lo scorso agosto, aprendo l’accesso al tool agli abbonati Google AI Ultra negli Stati Uniti a gennaio. Questo consente agli utenti di creare mondi di gioco interattivi a partire da prompt testuali o immagini. L’obiettivo è utilizzare Genie per esperienze educative, videgiochi e addestramento alla robotica.
Già oggi, Genie 3 sta contribuendo a potenziare uno dei simulatori di Waymo per addestrare le sue auto a guida autonoma su eventi “estremamente rari”, come i tornado o incontri casuali con elefanti. Integrare i dati di Street View potrebbe aiutare Waymo a prepararsi a lanciarsi in nuove città in tutto il mondo.
Waymo ha un proprio simulatore che ha utilizzato per espandersi in 11 città degli Stati Uniti e testare il suo guidatore AI in diverse altre località. La novità con Genie, come sottolinea Parker-Holder, è che questi sono tutti modelli basati sulla prospettiva dell’auto. Street View consente non solo di simulare un mondo ancorato a un luogo reale, ma anche di spostare il punto di vista su altri tipi di agenti, come esseri umani o robot.
Google sta lanciando Street View in Genie per alcuni utenti Ultra negli Stati Uniti a partire da oggi, con accesso che sarà esteso gradualmente. Gli utenti Ultra globali avranno accesso nelle prossime settimane, secondo quanto dichiarato dall’azienda.
L’obiettivo dei ricercatori è distribuire questa nuova funzionalità il più possibile. Diego Rivas, product manager di DeepMind, ha avvertito che Street View, in particolare, e Genie in generale, sono ancora in fase di sperimentazione, quindi ci sono aspetti da migliorare in termini di accuratezza.
Negli esempi mostrati dal team di Google — inclusa una simulazione subacquea di un quartiere in cui ho vissuto — i risultati sono impressionanti e riconoscibili, ma presentano ancora la qualità di un videogioco piuttosto che quella fotorealistica. Inoltre, i modelli non sono ancora consapevoli della fisica, il che significa che non comprendono ancora causa ed effetto. In un esempio di una donna che corre attraverso un Joshua Tree innevato, ad esempio, essa attraversa cacti e cespugli senza problemi.
A questo proposito, le caratteristiche sono molto diverse rispetto a Nano Banana, il generatore di immagini di Google, che riesce ora a generare testi perfetti in infografiche, o Veo, il generatore video che comprende come le barche di carta fluttuino nei corsi d’acqua e il fumo si disperda nell’aria.
La fisica non è codificata nei modelli; questi la apprendono intuitivamente nel tempo attraverso l’osservazione passiva, come farebbe un essere vivente. “Penso che per questo tipo di modello, siamo probabilmente da sei a dodici mesi indietro rispetto ai video in termini di accuratezza e qualità”, ha commentato Parker-Holder.
Jonathan Herbert, direttore di Google Maps, che ha iniziato nel team di Street View come stagista 12 anni fa, ha dichiarato che Genie non è ancora in grado di creare una ricostruzione fedele di una strada. Crede che la vera innovazione risieda nella continuità spaziale dell’AI; se ti giri di 360 gradi, l’AI riesce a ricordare e simulare correttamente l’ambiente alle tue spalle. Da quel punto in poi, il modello può costruire un nuovo ambiente su quella base.
“Abbiamo a lungo pensato a come costruire il miglior e più ricco modello del mondo basato sui dati di Street View”, ha dichiarato Herbert. “È sicuramente un’idea che abbiamo avuto per un bel po’ di tempo.”
Per ulteriori informazioni, puoi consultare le fonti ufficiali:
Google Blog |
DeepMind
Non perderti tutte le notizie di tecnologia su Blog.it