Silicon Valley investe massicciamente negli “ambienti” per formare agenti di intelligenza artificiale.

Pubblicato il da Redazione - Tecnologia

Silicon Valley investe massicciamente negli “ambienti” per formare agenti di intelligenza artificiale.

Negli ultimi anni, i CEO delle grandi aziende tecnologiche hanno presentato visioni di agenti AI in grado di utilizzare autonomamente applicazioni software per svolgere compiti per conto delle persone. Tuttavia, testando oggi gli agenti AI disponibili, come ChatGPT di OpenAI o Comet di Perplexity, ci si rende conto di quanto la tecnologia sia ancora limitata. Rendere gli agenti AI più robusti può richiedere nuove tecniche che l’industria sta ancora scoprendo.

Il Ruolo degli Ambienti di Reinforcement Learning

Una di queste tecniche consiste nel simulare con attenzione spazi di lavoro in cui gli agenti possono essere addestrati su compiti multi-step, noti come ambienti di reinforcement learning (RL). Così come i dataset etichettati hanno alimentato l’ultima ondata di IA, gli ambienti RL stanno emergendo come un elemento critico nello sviluppo degli agenti.

Esperti di intelligenza artificiale, fondatori e investitori fanno sapere a TechCrunch che i laboratori di intelligenza artificiale di spicco stanno attualmente richiedendo maggiori ambienti RL, e non mancano le startup pronte a soddisfare questa crescente domanda.

“Tutti i principali laboratori di IA stanno costruendo ambienti RL internamente,” ha dichiarato Jennifer Li, partner generale di Andreessen Horowitz, in un’intervista con TechCrunch. “Ma, come puoi immaginare, creare questi dataset è molto complesso, quindi i laboratori di IA stanno anche esplorando fornitori esterni che possono sviluppare ambienti e valutazioni di alta qualità. Tutti stanno guardando a questo settore.”

La spinta verso gli ambienti RL ha dato origine a una nuova classe di startup ben finanziate, come Mechanize e Prime Intellect, che aspirano a diventare leader nel settore. Nel frattempo, grandi aziende che si occupano di etichettatura dei dati, come Mercor e Surge, stanno investendo di più negli ambienti RL per tenere il passo con i cambiamenti dell’industria, che si sposta da dataset statici a simulazioni interattive. Anche i principali laboratori stanno considerando investimenti significativi: secondo quanto riportato da The Information, i dirigenti di Anthropic hanno discusso la possibilità di spendere oltre un miliardo di dollari per gli ambienti RL nell’anno prossimo.

La speranza per investitori e fondatori è che una di queste startup emerga come il “Scale AI degli ambienti”, riferendosi al potente laboratorio di etichettatura dei dati da 29 miliardi di dollari che ha alimentato l’era dei chatbot.

Che Cosa Sono gli Ambienti di Reinforcement Learning?

Essenzialmente, gli ambienti RL sono spazi di addestramento che simulano le azioni che un agente AI dovrebbe svolgere in una vera applicazione software. Un fondatore ha descritto la creazione di questi ambienti come “la costruzione di un videogioco molto noioso.”

Per esempio, un ambiente potrebbe simulare un browser Chrome e incaricare un agente AI di acquistare un paio di calzini su Amazon. L’agente viene valutato in base alle sue prestazioni e riceve un segnale di ricompensa quando ha successo (in questo caso, acquistando un paio di calzini validi).

Anche se un compito del genere sembra relativamente semplice, ci sono molte insidie in cui un agente AI potrebbe cadere. Potrebbe perdersi nella navigazione dei menu a discesa della pagina web o acquistare troppi calzini. E poiché gli sviluppatori non possono prevedere esattamente quale errore potrebbe commettere un agente, l’ambiente stesso deve essere abbastanza robusto da catturare qualsiasi comportamento inaspettato, continuando a fornire feedback utili. Questo rende la costruzione degli ambienti molto più complessa rispetto a un dataset statico.

Alcuni ambienti sono abbastanza elaborati, consentendo agli agenti AI di utilizzare strumenti, accedere a internet o impiegare varie applicazioni software per completare un compito specifico. Altri sono più ristretti, mirati ad aiutare un agente ad apprendere compiti specifici in applicazioni software aziendali.

Mentre gli ambienti RL attualmente rappresentano una novità a Silicon Valley, esiste già una certa esperienza nell’utilizzo di questa tecnica. Uno dei primi progetti di OpenAI nel 2016 fu la costruzione di “RL Gym”, che era molto simile alla concezione moderna di ambienti. Nello stesso anno, il sistema AI AlphaGo di Google DeepMind ha battuto un campione del mondo nel gioco da tavolo Go, utilizzando anch’esso tecniche di RL in un ambiente simulato.

Ciò che rende unici gli ambienti di oggi è che i ricercatori stanno cercando di costruire agenti AI che utilizzano modelli di trasformatori di grandi dimensioni. A differenza di AlphaGo, che era un sistema AI specializzato che operava in ambienti chiusi, gli agenti AI odierni sono addestrati per avere capacità più generali. I ricercatori di IA hanno oggi un punto di partenza più forte, ma anche un obiettivo complicato in cui potrebbero sorgere più problemi.

Le aziende di etichettatura dei dati come Scale AI, Surge e Mercor stanno cercando di rispondere a questa nuova esigenza e ampliare gli ambienti RL. Queste aziende dispongono di più risorse rispetto a molte startup nel settore e di rapporti consolidati con i laboratori di IA. Edwin Chen, CEO di Surge, ha dichiarato a TechCrunch di aver recentemente notato un “aumento significativo” nella domanda di ambienti RL all’interno dei laboratori di IA. Surge, che ha generato 1,2 miliardi di dollari di fatturato lo scorso anno collaborando con laboratori di IA come OpenAI e Google, ha recentemente creato un’organizzazione interna specificamente incaricata di costruire ambienti RL.

In corsa con Surge c’è Mercor, una startup valutata 10 miliardi di dollari che ha lavorato anch’essa con OpenAI e Meta. Mercor sta cercando investitori per il proprio business di costruzione di ambienti RL per compiti specifici come programmazione, sanità e diritto. Brendan Foody, CEO di Mercor, ha affermato che “pochi comprendono quanto sia grande l’opportunità intorno agli ambienti RL.”

Scale AI ha dominato in passato il settore dell’etichettatura dei dati, ma ha perso terreno da quando Meta ha investito 14 miliardi e ha assunto il suo CEO. Dall’epoca, Google e OpenAI hanno escluso Scale AI come fornitore di dati, e la startup affronta anche una concorrenza per il lavoro di etichettatura all’interno di Meta. Tuttavia, Scale sta tentando di adattarsi e costruire ambienti.

“Questa è solo la natura del business in cui ci troviamo,” ha affermato Chetan Rane, responsabile prodotto di Scale AI per agenti e ambienti RL. “Scale ha dimostrato la propria capacità di adattarsi rapidamente. Lo abbiamo fatto nei primi giorni dei veicoli autonomi, il nostro primo business. Quando è uscita ChatGPT, Scale AI si è adeguata a quell’evoluzione. E ora, ancora una volta, ci stiamo adattando a nuove frontiere come agenti e ambienti.”

Alcuni nuovi giocatori si concentrano esclusivamente sugli ambienti fin dall’inizio. Tra questi c’è Mechanize, una startup fondata circa sei mesi fa con l’ambizioso obiettivo di “automatizzare tutti i lavori.” Tuttavia, il cofondatore Matthew Barnett ha dichiarato che la loro azienda inizia ora con ambienti RL per agenti di programmazione AI.

Mechanize mira a fornire ai laboratori di IA un numero limitato di ambienti RL robusti, anziché a grandi aziende che creano una vasta gamma di ambienti RL semplici. A questo proposito, la startup offre agli ingegneri del software stipendi da 500.000 dollari, decisamente superiori rispetto a quelli che un collaboratore esterno potrebbe guadagnare lavorando per Scale AI o Surge.

Mechanize ha già collaborato con Anthropic per lo sviluppo di ambienti RL. Anche se non hanno rilasciato dichiarazioni commentando la partnership, è chiaro che ci sono grandi aspettative in questo campo.

Altre startup sperano che gli ambienti RL avranno un impatto significativo al di fuori dei laboratori di IA. Prime Intellect, supportata dal ricercatore di intelligenza artificiale Andrej Karpathy, Founders Fund e Menlo Ventures, sta puntando a sviluppatori più piccoli con i propri ambienti RL. Recentemente, Prime Intellect ha lanciato un hub per ambienti RL, concepito per diventare una “Hugging Face per ambienti RL”. Lo scopo è fornire agli sviluppatori open-source accesso alle stesse risorse dei grandi laboratori di IA, vendendo loro l’accesso a risorse computazionali nel processo.

Addestrare agenti generali in ambienti RL può essere più costoso dal punto di vista computazionale rispetto alle tecniche di addestramento AI precedenti, secondo il ricercatore di Prime Intellect, Will Brown. Affianco alle startup che costruiscono ambienti RL, esiste anche un’opportunità per fornitori di GPU che possono potenziare il processo.

La questione aperta riguardo agli ambienti RL è se la tecnica possa scalare come i metodi di addestramento IA precedenti. Il reinforcement learning ha alimentato alcuni dei maggiori progressi in IA nell’ultimo anno, inclusi modelli come o1 di OpenAI e Claude Opus 4 di Anthropic. Queste sono conquiste importanti poiché i metodi precedentemente usati per migliorare i modelli AI stanno mostrando ritorni decrescenti.

Gli ambienti sono parte della scommessa più ampia dei laboratori AI sull’RL, che molti credono continuerà a guidare i progressi mentre aggiungono più dati e risorse computazionali al processo. Alcuni ricercatori di OpenAI dietro o1 hanno precedentemente dichiarato a TechCrunch che l’azienda ha investito in modelli di ragionamento AI proprio perché pensavano che scalassero bene.

La migliore strategia per scalare il reinforcement learning rimane poco chiara, ma gli ambienti sembrano rappresentare un contendente promettente. Invece di limitarsi a premiare i chatbot per le risposte testuali, questi ambienti consentono agli agenti di operare in simulazioni con strumenti e computer a loro disposizione. Ciò richiede più risorse, ma potrebbe essere molto più redditizio.

Non mancano però le opinioni scettiche riguardo all’evoluzione degli ambienti RL. Ross Taylor, ex responsabile della ricerca IA presso Meta e cofondatore di General Reasoning, ha dichiarato di essere preoccupato che gli ambienti siano suscettibili di “reward hacking,” quel processo in cui i modelli AI barano per ottenere una ricompensa senza portare a termine il compito reale.

“Credo che la gente stia sottovalutando quanto sia difficile scalare gli ambienti,” ha detto Taylor. “Anche i migliori ambienti RL disponibili pubblicamente tipicamente non funzionano senza gravi modifiche.”

Sherwin Wu, Responsabile Ingegneria per il business API di OpenAI, ha dichiarato in un podcast recente di essere “scettico” riguardo alle startup focalizzate sugli ambienti RL. Ha sottolineato che è un campo altamente competitivo e che la ricerca IA sta evolvendo così rapidamente che è difficile soddisfare adeguatamente le esigenze dei laboratori.

Anche Karpathy, investitore in Prime Intellect, ha espresso cautela riguardo al settore degli ambienti RL. In un post su X, ha sollevato interrogativi su quanto altro progresso in IA possa derivare dal reinforcement learning.

“Sono ottimista riguardo agli ambienti e alle interazioni agenziali, ma sono pessimista riguardo al reinforcement learning specificamente,” ha affermato Karpathy.

Non perderti tutte le notizie di tecnologia su Blog.it

Silicon Valley investe massicciamente negli “ambienti” per formare agenti di intelligenza artificiale. - Blog.it - Notizie, Lifestyle, Gossip, Viaggi, Tech e molto altro