Amazon Implanta Tecnologia Cerebras 25 Vezes Mais Rápido Que GPUs Nvidia

News

Por Wendy Frey

medium-vecteezy_elevating-businesses-with-cloud-computing-innovations-ai_33100055_medium.jpg Andrew Feldman fechou o negócio da sua vida em 13 de março. A Amazon Web Services, rei das nuvens, concordou em implantar chips Cerebras CS-3 diretamente em seus data centers. Primeira parceria com um hyperscaler. Até hoje. Os insurgentes de wafer-scale finalmente invadiram a fortaleza.

Os números explodem. A Cerebras afirma que seus chips do tamanho de um prato de jantar decodificam respostas de IA 25 vezes mais rápido que GPUs Nvidia. Trainium gerencia o prompt. CS-3 esmaga a saída. David Brown, VP de Computação da AWS, chama isso de um salto de "ordem de magnitude". A OpenAI já apostou $10 bilhões em Feldman em janeiro. Agora a Amazon reforça. Bedrock se torna o portal para uma inferência avassaladora.

Arquitetura Desagregada Substitui a Coroa da Nvidia

As entranhas técnicas revelam uma astúcia brutal. A AWS divide a inferência em duas. Trainium3 gerencia a fase de pré-preenchimento. Cerebras WSE-3 decodifica a saída. Elastic Fabric Adapter as conecta. Resultado? Cinco vezes mais capacidade de token em alta velocidade no mesmo espaço.

A Nvidia dominou ambas as fases por anos. Não mais. Startups como Cognition e Mistral já fugiram para a Cerebras para codificação agêntica. Agora a AWS oferece isso ao público em geral. A startup de $23 bilhões (recém vinda de uma rodada de $1 bilhão da Tiger Global em fevereiro) finalmente desafia a supremacia das GPUs em escala. Não há mais necessidade de comprar caixas da Cerebras. Basta alugar através do Bedrock.

O Cronograma da Copa do Mundo de 2026. Guerra de Inferência Empresarial Explode

Velocidade mata. A Cerebras entrega milhares de tokens por segundo enquanto as GPUs se afogam em centenas. Assistência de codificação em tempo real. Agentes interativos. Modelos de raciocínio que "pensam" por meio de problemas, gerando 15 vezes mais tokens. Feldman construiu seu império sobre essas cargas de trabalho.

A AWS lançará isso "nos próximos meses". A segunda metade de 2026 verá a implantação completa. Amazon Nova e LLMs de código aberto rodam em silício de wafer-scale. O negócio de $10 bilhões da OpenAI (750 megawatts até 2028) de repente faz sentido. Feldman provou sua tecnologia em escala. Agora a AWS a traz para milhões de empresas. O gargalo de inferência morre. Os preços permanecem premium. Mas para cargas de trabalho de "tempo é dinheiro", a Nvidia finalmente enfrenta pressão real na nuvem.

Modelos virais

Explore nossos modelos virais com IA e aplique-os às suas fotos.

Explorar modelos