아마존, Nvidia GPU보다 25배 빠른 Cerebras 기술 배치

News

작성자: Wendy Frey

medium-vecteezy_elevating-businesses-with-cloud-computing-innovations-ai_33100055_medium.jpg 앤드류 펠드먼은 3월 13일에 그의 인생을 바꾸는 거래를 체결했다. 아마존 웹 서비스, 클라우드의 제왕,는 Cerebras CS-3 칩을 데이터 센터 내부에 직접 배치하기로 합의했다. 첫 번째 하이퍼스케일러 파트너십. 역사상 처음이다. 웨이퍼 스케일의 인서전트들은 마침내 요새에 진입했다.

숫자가 폭발한다. Cerebras는 저녁접시 크기의 칩이 AI 응답을 Nvidia GPU보다 25배 빠르게 디코딩한다고 주장한다. Trainium이 프롬프트를 처리하고, CS-3가 출력을 압도한다. AWS Compute 부사장 데이비드 브라운은 이를 "주문 한 단계의" 도약이라고 한다. OpenAI는 이미 1월에 펠드먼에게 100억 달러를 베팅했다. 이제 아마존도 다시 베팅한다. Bedrock은 빠른 추론의 관문이 된다.

분산 아키텍처, Nvidia의 왕관를 빼앗다

기술의 본질은 잔인한 영리함을 드러낸다. AWS는 추론을 두 개로 나눈다. Trainium3이 프리필 단계 관리하고, Cerebras WSE-3이 출력을 디코딩한다. Elastic Fabric Adapter가 이를 연결한다. 결과? 같은 공간에서 다섯 배 더 많은 고속 토큰 용량이 생겨난다.

Nvidia는 수년간 두 단계 모두를 지배했다. 더 이상 아니다. Cognition과 Mistral과 같은 스타트업들은 이미 에이전틱 코딩을 위해 Cerebras로 떠났다. 이제 AWS가 이를 주류에 제공한다. 230억 달러 규모의 스타트업(2월에 10억 달러 Tiger Global 라운드 이후)은 마침내 스케일에서 GPU 우위를 도전한다. 더 이상 Cerebras 박스를 구매할 필요가 없다. 직접 Bedrock을 통해 임대하면 된다.

2026년 월드컵 일정. 엔터프라이즈 추론 전쟁 확산

속도가 치명적이다. Cerebras는 초당 수천 개의 토큰을 전달하는 반면, GPU는 수백 개에 허덕인다. 실시간 코딩 지원. 인터랙티브 에이전트. "문제를 생각하는" 추론 모델이 15배 더 많은 토큰을 생성한다. 펠드먼은 이러한 작업 부하를 통해 자신의 제국을 구축했다.

AWS는 "오는 몇 달 안에" 이를 출시할 예정이다. 2026년 하반기에 전체 배치가 이루어질 것이다. 아마존 노바와 오픈 소스 LLM이 웨이퍼 스케일 실리콘에서 실행된다. 100억 달러 규모의 OpenAI 거래(2028년까지 750메가와트)는 갑자기 이해가 간다. 펠드먼은 그의 기술을 대규모로 입증했다. 이제 AWS가 이를 수백만 개의 기업에 제공한다. 추론 병목 현상이 사라진다. 가격은 여전히 고급이다. 그러나 "시간은 돈이다"라는 작업 부하를 위해, Nvidia는 마침내 클라우드에서 진정한 열기를 맞게 된다.

바이럴 템플릿

바이럴 AI 템플릿을 둘러보고 내 사진에 적용해보세요.

템플릿 둘러보기
아마존, Cerebras 기술을 Nvidia보다 25배 빠르게 배치