Amazon déploie la technologie Cerebras 25 fois plus rapidement que les GPU Nvidia

News

Par Wendy Frey

Andrew Feldman a signé le contrat de sa vie le 13 mars. Amazon Web Services, roi des nuages, a accepté de déployer les puces Cerebras CS-3 directement dans ses centres de données. Première partenariat hyperscale. Jamais. Les insurgés à échelle du wafer viennent enfin de pénétrer la forteresse.

Les chiffres explosent. Cerebras affirme que ses puces de la taille d'une assiette décodent les réponses de l'IA 25 fois plus rapidement que les GPU Nvidia. Trainium gère le prompt. CS-3 écrase la sortie. David Brown, VP Cloud Computing d'AWS, parle d'un saut "d'un ordre de grandeur". OpenAI a déjà parié 10 milliards de dollars sur Feldman en janvier. Maintenant, Amazon double la mise. Bedrock devient la porte d'entrée vers une inférence fulgurante.

L'architecture désagrégée fait saigner la couronne de Nvidia

Les entrailles techniques révèlent une intelligence brutale. AWS divise l'inférence en deux. Trainium3 gère l'étape de préremplissage. Cerebras WSE-3 décode la sortie. Elastic Fabric Adapter les assemble. Résultat? Cinq fois plus de capacité de tokens haute vitesse dans le même espace.

Nvidia a dominé les deux phases pendant des années. Plus maintenant. Des startups comme Cognition et Mistral se sont déjà tournées vers Cerebras pour un codage agentique. Maintenant, AWS l’offre au grand public. La startup de 23 milliards de dollars (tout juste sortie d’un tour de 1 milliard de dollars de Tiger Global en février) défie enfin la suprématie des GPU à grande échelle. Plus besoin d’acheter des boîtes Cerebras. Louez simplement via Bedrock.

Timing de la Coupe du Monde 2026. La guerre de l'inférence d'entreprise explose

La vitesse tue. Cerebras délivre des milliers de tokens par seconde tandis que les GPU étouffent avec des centaines. Assistance à la codification en temps réel. Agents interactifs. Modèles de raisonnement qui "pensent" à travers les problèmes, générant 15 fois plus de tokens. Feldman a construit son empire sur ces charges de travail.

AWS le déploie "dans les mois à venir". La seconde moitié de 2026 verra le déploiement complet. Amazon Nova et les LLM open source fonctionnent sur du silicium à échelle de wafer. Le contrat de 10 milliards de dollars avec OpenAI (750 mégawatts jusqu'en 2028) a soudainement du sens. Feldman a prouvé sa technologie à grande échelle. Maintenant, AWS l'apporte à des millions d'entreprises. Le goulot d'étranglement de l'inférence s'éteint. Les étiquettes de prix restent premium. Mais pour les charges de travail "le temps c'est de l'argent", Nvidia fait enfin face à une véritable pression dans le cloud.

Source: https://www.reuters.com/business/retail-consumer/cerebras-systems-amazon-strike-deal-offer-cerebras-ai-chips-amazons-cloud-2026-03-13/

Modèles viraux

Découvrez nos modèles viraux IA et appliquez-les à vos photos.

Découvrir les modèles