Amazon distribuisce tecnologia Cerebras 25 volte più veloce delle GPU Nvidia
Di Wendy Frey
Andrew Feldman ha firmato il contratto della sua vita il 13 marzo. Amazon Web Services, re delle nuvole, ha accettato di distribuire i chip Cerebras CS-3 direttamente all'interno dei suoi data center. Prima partnership con un hyperscaler. Mai. Gli insorti a wafer scale hanno finalmente penetrato la fortezza.
I numeri esplodono. Cerebras sostiene che i suoi chip delle dimensioni di un piatto da cena decodificano le risposte AI 25 volte più velocemente delle GPU Nvidia. Trainium gestisce il prompt. CS-3 schiaccia l'output. David Brown, VP Compute di AWS, lo definisce un salto di "ordine di grandezza". OpenAI ha già scommesso $10 miliardi su Feldman a gennaio. Ora Amazon raddoppia. Bedrock diventa la porta d'ingresso a un'inferenza fulminante.
Architettura disaggregata erode la corona di Nvidia
Le viscere tecniche rivelano una brutalità ingegnosa. AWS divide l'inferenza in due. Trainium3 gestisce la fase di pre-scarico. Cerebras WSE-3 decodifica l'output. Elastic Fabric Adapter li mette insieme. Risultato? Cinque volte più capacità di token ad alta velocità nella stessa impronta.
Nvidia ha dominato entrambe le fasi per anni. Non più. Startup come Cognition e Mistral sono già fuggite verso Cerebras per la codifica agentica. Ora AWS lo offre al grande pubblico. La startup da $23 miliardi (fresca di un round da $1 miliardo di Tiger Global a febbraio) sfida finalmente la supremazia delle GPU su scala. Non più acquisto di box Cerebras. Solo noleggio tramite Bedrock.
Tempistica della Coppa del Mondo 2026. La guerra dell'inferenza aziendale esplode
La velocità uccide. Cerebras consegna migliaia di token al secondo mentre le GPU si bloccano su centinaia. Assistenza alla codifica in tempo reale. Agenti interattivi. Modelli di ragionamento che "pensano" attraverso i problemi, generando 15 volte più token. Feldman ha costruito il suo impero su questi carichi di lavoro.
AWS lo distribuisce "nei prossimi mesi". La seconda metà del 2026 prevede il dispiegamento completo. Amazon Nova e LLM open-source girano su silicio a wafer scale. L'affare da $10 miliardi con OpenAI (750 megawatt fino al 2028) improvvisamente ha senso. Feldman ha dimostrato la sua tecnologia su scala. Ora AWS la porta a milioni di aziende. Il collo di bottiglia dell'inferenza muore. I cartellini dei prezzi rimangono premium. Ma per i carichi di lavoro dove "il tempo è denaro", Nvidia affronta finalmente un vero calore nel cloud.




