Tour esclusivo del laboratorio Trainium di Amazon: il chip che conquista Anthropic, OpenAI e Apple.
Pubblicato il da Ignazio Aragona - Tecnologia
Un Visita Esclusiva al Laboratorio di Sviluppo Chip di Amazon
Subito dopo l’annuncio di Andy Jassy, CEO di Amazon, riguardo all’incredibile investimento da 50 miliardi di dollari di AWS in OpenAI, ho avuto l’opportunità di partecipare a un tour privato del laboratorio di sviluppo chip, centro nevralgico di questo accordo, a spese per lo più di Amazon stesso.
Gli esperti del settore seguono con interesse il chip Trainium di Amazon, creato in questo stabilimento, per le sue potenzialità nel ridurre i costi dell’inferenza AI e, possibilmente, per intaccare il quasi monopolio di Nvidia.
Curioso di scoprire di più, ho accettato di partecipare. I miei accompagnatori per la giornata sono stati il direttore del laboratorio, Kristopher King, e il direttore ingegneria, Mark Carroll, insieme al responsabile PR del team, Doron Aronson.
Amazon Web Services (AWS) ha rappresentato la principale piattaforma cloud per Anthropic fin dai primi giorni del laboratorio di intelligenza artificiale, un rapporto che ha resistito all’aggiunta di Microsoft come partner in cloud e alla crescente collaborazione tra Amazon e OpenAI.
L’accordo con OpenAI ha reso AWS il fornitore esclusivo per la nuova piattaforma di costruzione di agenti AI, Frontier, che potrebbe diventare una parte fondamentale del business di OpenAI se questi agenti si diffondono come previsto nella Silicon Valley. Tuttavia, ci sono voci che suggeriscono che Microsoft potrebbe ritenere che l’intesa di OpenAI con Amazon violi il loro accordo, datosi che Redmond ha accesso a tutti i modelli e tecnologie di OpenAI.
Ma cosa rende AWS così interessante per OpenAI? Nell’ambito di questo accordo, il colosso del cloud ha accettato di fornire a OpenAI una capacità di calcolo di 2 gigawatt tramite chip Trainium. Questo è un impegno enorme, considerando che Anthropic e il servizio Bedrock di Amazon stanno già utilizzando i chip Trainium più rapidamente di quanto Amazon possa produrli.
Attualmente ci sono 1,4 milioni di chip Trainium distribuiti tra tutte e tre le generazioni, e Anthropic ha dichiarato che il suo modello Claude gira su oltre 1 milione di chip Trainium2.
È interessante notare che, mentre Trainium era inizialmente progettato per una formazione più veloce ed economica dei modelli, è ora anche ottimizzato per l’inferenza. L’inferenza, infatti, è il processo di esecuzione di un modello AI per generare risposte ed è attualmente il più grande collo di bottiglia in termini di prestazioni del settore.
Un esempio chiave: il chip Trainium2 gestisce la maggior parte del traffico d’inferenza sul servizio Bedrock di Amazon, che supporta la creazione di applicazioni AI per i numerosi clienti aziendali di Amazon, consentendo loro di utilizzare più modelli contemporaneamente.
Trainium vs Nvidia: Una Nuova Era per l’Inferenza AI
Oltre a offrire un’alternativa alle GPU di Nvidia, spesso difficili da ottenere, Amazon afferma che i suoi nuovi chip in esecuzione su Trn3 UltraServers costano fino al 50% in meno rispetto ai classici server cloud per prestazioni comparabili.
Oltre al chip Trainium3, rilasciato a dicembre, il team di AWS ha anche sviluppato nuovi switch Neuron, un accoppiamento che Carroll descrive come trasformativo. Secondo lui, questo permette a ogni chip Trainium3 di comunicare con ogni altro chip in una configurazione a rete, riducendo la latenza. “Ecco perché il Trainium3 sta battendo ogni record,” ha affermato, aggiungendo che ciò è particolarmente rilevante in termini di “costo per potenza”.
Considerando che si trattano di trilioni di token al giorno, tali miglioramenti possono avere un impatto significativo. Nel 2024, il team chip di Amazon è stato lodato pubblicamente da Apple, che ha sfruttato i chip Graviton e Inferentia, dimostrando così il valore e la competenza del team.
Il laboratorio chip di Amazon è situato in un moderno edificio nel prestigioso distretto “The Domain” di Austin. Qui, i team hanno accesso a strumenti commerciali e su misura per testare e risolvere problemi con i chip. La maestria degli ingegneri è evidente, poiché essi si dedicano non solo alla progettazione, ma anche all’innovazione. Quando il chip Trainium3 è stato messo in funzione per la prima volta, i membri del team hanno dovuto affrontare sfide ingegneristiche notevoli, tra cui un passaggio dall’aria al raffreddamento a liquido.
Il team di AWS lavora incessantemente per dimostrare che il nuovo chip funzionerà come previsto, scrivendo una nuova pagina nella storia dell’AI. King ha condiviso che l’atmosfera durante le prove è carica di tensione e determinazione, facendo sentire ogni membro parte di un progetto rivoluzionario.
Come ha recentemente dichiarato Andy Jassy, il chip Trainium ha già contribuito a rendere AWS un business da miliardi di dollari e rappresenta uno dei risultati più significativi per il settore cloud.
La crescente attenzione verso il laboratorio di Amazon dimostra l’enorme fiducia riposta nei suoi prodotti. Con impegni così ambiziosi come quelli presi nell’accordo con OpenAI, e la continua innovazione nel campo dei chip, il team di AWS sta plasmando il futuro del calcolo AI.
In un momento in cui la domanda di capacità di calcolo continua ad aumentare, Amazon sta predisponendo misure per soddisfare questa esigenza attraverso lo sviluppo e l’implementazione dei propri chip, sempre in prima linea per la trasformazione dell’industria tech.
Fonti: Amazon AWS, OpenAI
Non perderti tutte le notizie di tecnologia su Blog.it