세레브라스가 웨이퍼 세 장을 한 랙에 묶었습니다 — CS-4와 초당 4400토큰

반도체는 보통 커다란 원형 웨이퍼를 잘라 작은 칩 수백 개를 만듭니다. 그런데 자르지 않고 웨이퍼 한 장을 통째로 칩 하나로 쓰는 회사가 있습니다. 세레브라스입니다. 이번에는 그 웨이퍼를 세 장 묶었습니다.
8월 18일, 세레브라스가 꺼낸 물건
2026년 8월 18일, 세레브라스 시스템즈가 CS-4를 공개했습니다. 회사는 이 제품을 업계에서 가장 빠른 AI 가속기라고 소개했습니다.
핵심 주장은 하나입니다. 대규모 언어 모델을 돌릴 때 사용자 한 명이 받는 초당 토큰 수가 GPU 기반 시스템보다 최대 30배 많다는 것입니다.
웨이퍼 스케일이라는 발상
일반적인 칩 제조에서 웨이퍼는 재료입니다. 원형 실리콘 판에 회로를 새기고, 잘라서 낱개 칩으로 포장합니다. 세레브라스는 이 마지막 단계를 건너뜁니다.
자르지 않으면 칩과 칩 사이를 잇는 배선이 필요 없어집니다. 데이터가 칩 밖으로 나갔다 들어오는 왕복이 사라집니다. 대신 수율이라는 난제를 떠안습니다. 웨이퍼 한 장에 결함이 하나라도 있으면 전체가 위험해지기 때문입니다.

WSE-3 터보 — 4조 개의 트랜지스터
CS-4 안에 들어가는 프로세서는 WSE-3 터보입니다. 트랜지스터 수는 4조 개입니다. 회사는 이것을 지금까지 만들어진 가장 큰 AI 프로세서라고 설명합니다.
비교 대상이 없는 숫자입니다. 일반적인 고성능 GPU의 트랜지스터 수는 수백억 개 단위입니다. 자릿수가 다릅니다.
90만 개의 코어와 46225제곱밀리미터
코어 수는 90만 개입니다. 전부 AI 연산에 맞춰 설계된 코어입니다. 이 코어들이 자리 잡은 실리콘 면적은 46,225제곱밀리미터입니다.
가늠이 잘 안 되는 숫자인데, 한 변이 21센티미터가 넘는 정사각형이라고 보시면 됩니다. 손바닥보다 훨씬 큰 실리콘 한 장이 통째로 칩 하나입니다.

44기가바이트 메모리가 웨이퍼 위에 붙어 있다
또 하나의 특징은 메모리 위치입니다. 44기가바이트의 고속 메모리가 별도 부품이 아니라 웨이퍼 위에 직접 올라가 있습니다.
메모리가 연산 장치 바로 옆에 있으면 데이터를 가지러 멀리 갈 필요가 없습니다. AI 추론에서 속도를 가르는 것이 대개 연산이 아니라 메모리 접근이라는 점을 생각하면, 이 배치가 성능 주장의 근거입니다.
CS-4는 웨이퍼 세 장을 한 랙에 묶었다
이번 제품에서 새로운 것은 개수입니다. CS-4는 WSE-3 터보를 세 장 담았습니다. 세레브라스의 첫 멀티 웨이퍼 시스템입니다.
이전 세대는 한 시스템에 웨이퍼 한 장이었습니다. 세 장을 한 랙에 묶어 하나처럼 동작시키는 것이 이번 설계의 골자입니다.

750 페타플롭스와 129.6 페타바이트
웨이퍼 한 장의 연산 성능은 250 페타플롭스, 메모리 대역폭은 초당 43.2 페타바이트입니다. 세 장이면 각각 750 페타플롭스와 초당 129.6 페타바이트가 됩니다.
메모리 대역폭 숫자가 특히 눈에 띕니다. 초당 페타바이트 단위는 일반적인 시스템에서 보기 어려운 규모입니다. 웨이퍼 위에 메모리를 올린 구조가 만든 숫자입니다.
다이렉트 웨이퍼 링크 — 2마이크로초
웨이퍼 세 장을 묶으면 그 사이를 잇는 통로가 필요합니다. 세레브라스는 이 연결을 다이렉트 웨이퍼 링크라고 부르고, 웨이퍼 간 지연을 2마이크로초 수준까지 낮췄다고 밝혔습니다.
지연이 크면 웨이퍼를 여러 장 붙여도 하나처럼 쓰기 어렵습니다. 이 숫자가 유지돼야 세 장이 실제로 한 덩어리로 동작합니다.

초당 4400토큰이라는 숫자
성능 주장에서 가장 구체적인 수치는 이것입니다. GPT-OSS-120B 모델에서 사용자 한 명 기준 초당 4,400토큰 이상을 처리한다는 것입니다.
토큰은 모델이 글을 다루는 최소 단위입니다. 초당 4,400토큰이면 사람이 읽는 속도를 아득히 넘어섭니다. 사람이 읽으려고 만든 속도가 아니라, 기계가 여러 단계를 스스로 밟는 작업을 염두에 둔 속도입니다.
같은 조건에서 GPU는 350토큰이었다
비교 대상으로 제시된 숫자는 초당 약 350토큰입니다. 가장 빠른 GPU 기반 추론 서비스 기준이라고 회사는 설명합니다.
4,400 대 350이면 약 12.6배입니다. 회사가 내세우는 최대 30배와는 차이가 있는데, 이는 모델과 조건에 따라 배수가 달라진다는 뜻으로 읽는 것이 정확합니다.

30배라는 주장을 뜯어보면
30배라는 표현에는 조건이 붙어 있습니다. 사용자 한 명이 받는 초당 토큰 수 기준입니다. 시스템 전체가 처리하는 총량이 아닙니다.
이 구분은 중요합니다. GPU 클러스터는 여러 요청을 묶어 한꺼번에 처리해 총 처리량을 끌어올리는 데 강합니다. 세레브라스가 강조하는 것은 총량이 아니라 한 사람이 체감하는 응답 속도입니다. 서로 다른 축을 재고 있는 셈입니다.
새 실리콘이 아니다 — 시계를 올린 것이다
여기서 짚어야 할 점이 있습니다. WSE-3 터보는 완전히 새로운 칩이 아닙니다. 기존 WSE-3 설계를 그대로 두고 동작 속도를 끌어올린 버전입니다.
클럭을 거의 모든 구간에서 두 배로 올려 연산 성능과 메모리 대역폭을 각각 두 배로 만들었습니다. 새 세대를 기다리는 대신 있는 설계에서 짜낼 수 있는 만큼 짜낸 접근입니다.

44기가바이트 천장은 2021년부터 그대로다
같은 설계를 재사용한 대가도 있습니다. 웨이퍼 위 메모리 용량이 44기가바이트에서 멈춰 있습니다. 2021년의 WSE-2, 2024년의 WSE-3, 그리고 2026년의 WSE-3 터보가 모두 같은 숫자입니다.
모델 크기가 계속 커지는 흐름에서 이 천장은 제약이 됩니다. 속도는 두 배가 됐지만 한 장에 올릴 수 있는 양은 5년째 그대로입니다.
전력 소비는 공개되지 않았다
아직 나오지 않은 숫자도 있습니다. 회사는 WSE-3 터보의 전력 소비를 밝히지 않았습니다.
클럭을 두 배로 올리면 전력은 대체로 그보다 가파르게 늘어납니다. 데이터센터에서 전력은 곧 운영비이자 설치 가능 여부를 가르는 조건입니다. 이 숫자가 나와야 실제 비용을 따질 수 있습니다.

넥서스 — 랙 스케일 플랫폼의 첫 식구
CS-4는 단품 제품이 아니라 넥서스라는 새 플랫폼의 첫 번째 구성원입니다. 넥서스는 랙 단위로 설계된 아키텍처입니다.
구조는 세 덩어리로 나뉩니다. 연산, 전원, 입출력입니다. 각 덩어리를 모듈로 분리하면 한 부분만 교체하거나 늘리는 것이 쉬워집니다.
부품 수를 절반으로 줄인 설계
넥서스의 설계 목표 중 하나는 부품 수 감소입니다. 회사는 이전 세대 대비 부품이 50퍼센트 적다고 밝혔습니다.
부품이 줄면 고장 지점이 줄고 조립과 유지보수가 단순해집니다. 대규모로 깔아야 하는 장비에서는 이 단순함이 곧 운영 비용입니다.

와트당 처리량 10배의 의미
절대 전력이 공개되지 않은 대신, 회사는 와트당 처리량이 10배라고 밝혔습니다. 같은 전기를 써서 열 배를 처리한다는 주장입니다.
이 지표는 데이터센터 입장에서 매우 실용적입니다. 건물에 들어오는 전력 총량은 정해져 있기 때문에, 와트당 성능이 곧 그 건물에서 뽑을 수 있는 최대 서비스 규모가 됩니다.
50조 파라미터를 지원한다는 말
CS-4는 50조 파라미터가 넘는 모델을 지원한다고 소개됐습니다. 현재 공개된 대형 모델들이 대체로 수천억에서 수조 파라미터 규모임을 감안하면 여유를 크게 잡은 숫자입니다.
다만 이는 웨이퍼 한 장의 44기가바이트로 감당한다는 뜻이 아니라, 여러 장을 묶어 모델을 나눠 올리는 방식을 전제한 수치로 읽어야 합니다.

추론이라는 전장
세레브라스가 이번에 겨눈 시장은 학습이 아니라 추론입니다. 모델을 만드는 단계가 아니라 서비스로 굴리는 단계입니다.
이 선택은 합리적입니다. 학습은 몇 달에 한 번 몰아서 하지만 추론은 사용자가 있는 한 매일 돕니다. 시장 규모가 시간이 갈수록 추론 쪽으로 기웁니다.
엔비디아와 정면으로 부딪히는 지점
추론 시장의 현재 주인은 엔비디아 GPU 클러스터입니다. 세레브라스는 여기에 응답 속도라는 한 축으로 파고듭니다.
다만 성능만으로 결정되지 않는 요소가 많습니다. 소프트웨어 생태계, 개발자가 이미 익힌 도구, 공급 안정성, 그리고 가격입니다. 웨이퍼 스케일은 성능이 아니라 이 나머지에서 오래 고전해 왔습니다.

가격도 고객사도 공개되지 않았다
이번 발표에서 빠진 것이 둘 있습니다. 가격과 고객사입니다. 세레브라스는 CS-4의 가격을 공개하지 않았고, 확정된 고객 계약도 밝히지 않았습니다.
성능 수치가 아무리 좋아도 이 둘이 나와야 실제 채택을 가늠할 수 있습니다. 특히 웨이퍼 스케일은 제조 난도가 높아 단가가 비싸다는 지적을 오래 받아 왔습니다.
출하는 이번 분기에 시작된다
일정은 비교적 가깝습니다. 첫 출하가 이번 분기 안에 시작된다고 밝혔습니다. 발표와 출하 사이 간격이 짧다는 것은 제품이 이미 상당히 진행됐다는 뜻입니다.
실제 물건이 나가면 독립적인 성능 측정도 뒤따르게 됩니다. 회사 발표 수치가 검증되는 시점입니다.

남은 질문들
정리하면 확인이 필요한 지점은 셋입니다. 첫째, 전력 소비입니다. 와트당 10배라는 상대 수치만으로는 설치 조건을 계산할 수 없습니다.
둘째, 가격입니다. 셋째, 44기가바이트 천장을 실제 대형 모델 운용에서 어떻게 넘기느냐입니다. 세 질문 모두 출하가 시작되면 답이 나옵니다.
실제 사례 — 속도가 곧 돈이 되는 자리
초당 4,400토큰이 필요한 곳은 어디일까요. 사람이 화면에서 글을 읽는 서비스라면 그 속도는 과합니다.
필요한 곳은 AI가 스스로 여러 단계를 밟는 작업입니다. 코드를 짜고 실행해 보고 고치는 과정, 긴 문서를 여러 번 되짚으며 답을 다듬는 과정, 여러 후보를 만들어 비교하고 고르는 과정입니다. 이런 작업은 한 번의 응답이 아니라 수십 번의 왕복으로 이뤄집니다. 한 번이 0.1초냐 1초냐가 전체 작업 시간을 열 배로 벌립니다. 사용자 한 명 기준 속도를 강조하는 이유가 여기 있습니다.

핵심 정리
이번 발표에서 기억할 것은 다섯 가지입니다.
- CS-4는 세레브라스의 첫 멀티 웨이퍼 시스템으로 WSE-3 터보를 세 장 담았습니다.
- 웨이퍼 한 장은 트랜지스터 4조 개·코어 90만 개·46,225제곱밀리미터·메모리 44기가바이트입니다.
- 시스템 전체로 750 페타플롭스, 메모리 대역폭 초당 129.6 페타바이트, 웨이퍼 간 지연 2마이크로초입니다.
- 성능 주장은 사용자 1인 기준 초당 4,400토큰이며 비교 대상 GPU는 약 350토큰입니다. 30배는 조건부 최대치입니다.
- WSE-3 터보는 새 실리콘이 아니라 클럭을 두 배로 올린 것이고, 44기가바이트 한계는 2021년부터 그대로입니다. 전력·가격·고객사는 미공개입니다.
참고하실 만한 것
AI 하드웨어 발표를 보실 때는 어떤 축으로 잰 숫자인지를 먼저 확인해 보시면 좋습니다. 같은 30배라도 사용자 한 명이 체감하는 속도인지, 시스템 전체 처리량인지에 따라 뜻이 완전히 달라집니다. 이번 발표는 앞쪽 축을 강조한 경우입니다.
공개되지 않은 항목도 함께 보시길 권합니다. 전력·가격·고객사는 성능만큼이나 채택을 좌우하는데, 발표 자료에서는 대체로 조용히 빠져 있습니다. 없는 숫자를 찾아보는 것이 있는 숫자를 읽는 것만큼 도움이 될 때가 많습니다.
출처
- Cerebras — Cerebras Unveils CS-4: Up to 30 Times Faster than GPU-based Solutions
- ServeTheHome — Cerebras Intros Faster WSE-3 Turbo Processor and First Rack-Scale CS-4 System
- The Register — Cerebras CS-4 rack systems juice chips for every last drop of AI performance
- DCD — Cerebras unveils CS-4 rack scale solution powered by four-trillion transistor WSE-3T chip
- TNW — Cerebras launches the CS-4, its first multi-wafer system, though the chip inside is not new
- Techzine — Cerebras launches CS-4 for faster AI inference
- Dataconomy — Cerebras Launches CS-4 AI Accelerator, Boasting 30x Speed Over GPUs
- Converge Digest — Cerebras CS-4 Pushes Wafer-Scale AI Inference to 4,400 Tokens per Second
협업문의 : kuroicode@gmail.com
블로그 : https://ghost-production-0ec2.up.railway.app/
홈페이지 : https://kuroicode-beep.github.io/svil-homepage/