Amazon implementează tehnologia Cerebras de 25 de ori mai rapid decât GPU-urile Nvidia
De Wendy Frey
Andrew Feldman a semnat înțelegerea vieții sale pe 13 martie. Amazon Web Services, regele norilor, a acceptat să implementeze cipuri Cerebras CS-3 direct în centrele sale de date. Prima parteneriat hyperscaler. Vreo dată. Insurgenții pe câmpul de siliciu au pătruns în fortăreață.
Numerele explodează. Cerebras susține că cipurile sale de dimensiunea unui far în decodifică răspunsurile AI de 25 de ori mai repede decât GPU-urile Nvidia. Trainium se ocupă de prompt. CS-3 zdrobește output-ul. David Brown, VP AWS Compute, numește această evoluție un salt de „ordine de magnitudine”. OpenAI a pariat deja 10 miliarde de dolari pe Feldman în ianuarie. Acum Amazon își întărește miza. Bedrock devine poarta spre inferențe fulgerătoare.
Arhitectura dezagregată inundă coroana Nvidia
Interiorul tehnic descoperă o ingeniozitate brutală. AWS împarte inferența în două. Trainium3 gestionează etapa de prefill. Cerebras WSE-3 decodifică output-ul. Elastic Fabric Adapter le unește. Rezultatul? Capacitate de procesare de cinci ori mai mare în aceeași amprentă.
Nvidia a dominat ambele etape timp de ani de zile. Nu mai este cazul. Startup-uri precum Cognition și Mistral au fugit deja la Cerebras pentru codificarea agentică. Acum AWS le oferă și acestora acces. Startup-ul de 23 de miliarde de dolari (recent ieșit dintr-o rundă de 1 miliard de dolari cu Tiger Global în februarie) contestă în sfârșit supremația GPU-urilor la scară. Nu mai este nevoie să cumpărați cutii Cerebras. Doar închiriați prin Bedrock.
Timpul pentru Cupa Mondială 2026. Războiul inferenței în enterprise explodează
Viteza ucide. Cerebras livrează mii de tokenuri pe secundă în timp ce GPU-urile se chinuie cu sute. Asistență la codificare în timp real. Agenți interactivi. Modele de raționare care „gândesc” prin probleme, generând de 15 ori mai multe tokenuri. Feldman și-a construit imperiul pe aceste sarcini de lucru.
AWS le va rula „în lunile următoare”. A doua jumătate a anului 2026 vede implementarea completă. Amazon Nova și LLM-urile open-source funcționează pe siliciu de dimensiune de wafer. Acordul de 10 miliarde de dolari cu OpenAI (750 megawați până în 2028) devine brusc logic. Feldman și-a dovedit tehnologia la scară. Acum AWS o aduce la milioane de întreprinderi. Bottleneck-ul inferenței moare. Prețurile rămân premium. Dar pentru sarcinile de „timpul este bani”, Nvidia se confruntă în sfârșit cu o provocare reală în cloud.




