Cerebras CS-4 공개, 초당 4400토큰은 어떤 GPU와 비교한 숫자인가
Cerebras가 8월 18일 웨이퍼 3장을 한 랙에 넣은 CS-4를 공개했습니다. gpt-oss-120B에서 사용자당 초당 4400토큰, GPU보다 최대 30배를 내걸었지만 비교한 GPU 제품은 밝히지 않았습니다.
- Cerebras가 웨이퍼 3장을 한 랙에 넣은 CS-4를 8월 18일 공개했습니다.
- GPU보다 30배 빠르다는 근거는 자사 측정 한 건입니다.
- 오늘 API 실측은 Azure보다 4.6배 빠르고 10배 비쌉니다.
Cerebras가 8월 18일 AI 추론 가속기 CS-4를 공개했습니다. 보도자료 제목이 그대로 주장입니다. GPU 기반 솔루션보다 최대 30배 빠르다는 것입니다.
웨이퍼 스케일이라는 방식부터 풀어야 이 주장이 읽힙니다. 보통 반도체는 지름 300밀리미터짜리 실리콘 원판 한 장에서 칩 수십 개를 잘라냅니다. Cerebras는 자르지 않고 원판 한 장을 통째로 칩 하나로 씁니다. 이번에 들어간 프로세서 WSE-3 Turbo는 실리콘 면적 46,225제곱밀리미터에 트랜지스터 4조 개와 AI 코어 90만 개가 올라가 있습니다. 메모리도 별도 칩이 아니라 이 판 위에 SRAM 44GB로 얹혀 있습니다. 추론에서 초당 토큰 수를 결정하는 것이 메모리 대역폭이라, Cerebras가 속도를 파는 근거가 여기 있습니다.
CS-4는 이 웨이퍼를 세 장 묶어 랙 하나로 만든 첫 제품입니다. 첫 출하는 2026년 3분기입니다. 가격은 공개하지 않았습니다.
성능 2배의 정체는 클럭 상향
WSE-3 Turbo는 이전 세대 WSE-3와 코어 수도 SRAM 용량도 똑같습니다. 90만 개와 44GB 그대로입니다. 공정도 같은 TSMC 5nm입니다. 그런데 연산 성능은 웨이퍼당 125 PFLOPS에서 250 PFLOPS로, 메모리 대역폭은 21.6 PB/s에서 43.2 PB/s로 각각 두 배가 됐습니다.
바뀐 것은 동작 속도입니다. The Next Platform은 클럭이 1.4GHz에서 2.8GHz로 올랐다고 분석했습니다. 같은 회로를 두 배 빨리 돌리려면 전력을 두 배 넣고 열은 두 배 넘게 빼야 합니다. Cerebras가 프로세서만이 아니라 랙 설계를 함께 내놓은 이유가 그것입니다.
전력 공급 위치가 핵심 변경점입니다. 일반적인 GPU 보드는 전력 변환 회로가 프로세서에서 약 50밀리미터 떨어져 있는데, CS-4는 이 거리를 약 0.5밀리미터까지 당겼습니다. 보드 위에서 새는 전력을 거의 없애 같은 조건에서 웨이퍼에 두 배 전력을 넣을 수 있게 됐다는 설명입니다.
컴퓨트 부분은 배낭처럼 뒤에 끼우는 모듈로 떼어냈습니다. Cerebras가 Wafer-Scale Backpack이라고 부르는 이 조립체는 전력 변환, 액체 냉각, 고속 입출력, 제어 회로를 웨이퍼 둘레에 3차원으로 접어 넣은 자립형 덩어리입니다. 이전 세대보다 부품 수가 절반이고 자동 제조 비중이 60% 높아져, 설치가 며칠에서 몇 시간으로 줄었다고 밝혔습니다.

랙 단위 사양은 웨이퍼 한 장짜리였던 CS-3와 이렇게 갈립니다.
| 항목 | CS-3 (웨이퍼 1장) | CS-4 (웨이퍼 3장) |
|---|---|---|
| AI 컴퓨트 | 125 PFLOPS | 750 PFLOPS |
| 메모리 대역폭 | 21.6 PB/s | 129.6 PB/s |
| 시스템 I/O 대역폭 | 1.2 Tbit/s | 7.2 Tbit/s |
| I/O 지연 | 5마이크로초 | 2마이크로초 |
웨이퍼끼리는 Direct Wafer Links라는 방식으로 잇습니다. 랙 안에서든 랙 사이에서든 스위치를 거치지 않고 직접 연결하는 것으로, 웨이퍼 간 지연은 최저 2마이크로초입니다. Cerebras는 이렇게 묶으면 50조 파라미터가 넘는 모델까지 받을 수 있다고 주장합니다. 네트워크가 표준 RoCE v2라 프롬프트 처리는 다른 회사 장비가 맡고 토큰 생성만 Cerebras가 맡는 구성도 됩니다. 보도자료는 그 상대로 AMD Helios와 AWS Trainium을 지목했습니다.
30배는 무엇과 비교한 숫자인가
보도자료가 내놓은 근거는 한 줄입니다. gpt-oss-120B에 같은 프롬프트를 넣었을 때 CS-4가 사용자당 초당 4,400토큰 이상을 냈습니다. 이 값이 GPU 솔루션보다 최대 30배라고 했습니다. 여기서 빠진 것이 비교 대상입니다. 어느 회사의 어떤 GPU를 어떤 서빙 설정으로 돌렸는지가 보도자료에 없습니다. 각주에는 실제 처리량이 모델 구조, 컨텍스트 길이, 정밀도, 서빙 구성에 따라 달라진다고만 적혀 있습니다.
250 PFLOPS라는 숫자에도 조건이 붙습니다. ServeTheHome은 이 값이 희소 연산(sparse) FP16 기준이라고 정리했습니다. implicator.ai가 인용한 독립 분석은 조밀 연산(dense) FP16으로는 약 25 PFLOPS, 홍보 수치의 10분의 1 수준으로 추정했습니다. 희소 연산 최적화는 LLM 추론에서 대체로 효과가 크지 않습니다.
측정 주체도 봐야 합니다. implicator.ai는 CS-4 쪽 수치를 Cerebras가 직접 쟀고 GPU 쪽 기준선만 제3자 측정 서비스 Artificial Analysis에서 가져왔다고 보도했습니다. CS-4는 아직 출하 전이라 외부에서 손대본 기록이 없습니다.
그러면 오늘 확인할 수 있는 격차는 얼마인가. Artificial Analysis가 같은 모델을 여러 제공자에서 잰 값은 이렇습니다.
| 제공자 | 하드웨어 | 출력 속도 | 100만 토큰 혼합 단가 |
|---|---|---|---|
| Cerebras | 웨이퍼 스케일 | 1,551 tok/s | 0.39달러 |
| SambaNova | 자체 실리콘 | 702 tok/s | 미기재 |
| Groq | 자체 실리콘 | 474 tok/s | 미기재 |
| Azure | GPU | 334 tok/s | 0.07달러 |
| CoreWeave | GPU | 미기재 | 0.04달러 |
GPU로 서빙하는 제공자 중 가장 빠른 Azure가 초당 334토큰입니다. 현행 CS-3 세대로 도는 Cerebras가 1,551토큰입니다. Cerebras가 Azure보다 4.6배 빠릅니다. CS-4가 CS-3보다 두 배 빠르다는 주장을 그대로 받아들여도 9배 남짓입니다. 30배가 나오려면 GPU 쪽 기준선이 초당 150토큰 언저리여야 하는데, 그런 속도를 내는 제공자가 어디인지는 밝히지 않았습니다.
속도의 대가는 단가입니다. 같은 표에서 Cerebras의 100만 토큰 혼합 단가는 0.39달러입니다. 가장 싼 CoreWeave는 0.04달러입니다. Cerebras가 약 10배 비쌉니다. 응답이 4.6배 빨리 나오는 대신 토큰값을 10배 내는 교환이라, 초당 토큰 수가 제품 경험을 직접 좌우하는 워크로드가 아니면 계산이 맞지 않습니다.
용량 제약도 그대로 남았습니다. 웨이퍼 한 장의 SRAM 44GB는 WSE-3와 같은 값입니다. 가중치가 수백 GB를 넘는 대형 모델은 웨이퍼 여러 장에 나눠 담아야 합니다. The Next Platform은 이 때문에 프론티어 모델 추론에 CS 시스템 수십 대가 필요할 수 있고 언젠가 SRAM을 3차원으로 쌓는 단계가 와야 한다고 봤습니다. Cerebras가 이번에 웨이퍼 간 직결 통신을 넣고 지연을 절반 이하로 줄인 이유도 여기에 있습니다. 여러 장을 묶어 쓰는 것이 전제이기 때문입니다.
지금 API로 쓸 수 있는 것과 없는 것
CS-4 하드웨어는 3분기에 첫 출하가 시작됩니다. 가격은 공개하지 않았고 구매 경로는 영업 문의뿐입니다. 반면 Cerebras 추론 API는 지금 열려 있습니다. 여기서 도는 것은 CS-4가 아니라 현행 CS-3 세대입니다.
| 항목 | 내용 |
|---|---|
| 대상 | 계정을 만든 개발자. API 키 발급이 필요합니다 |
| 요금제 | Free Trial은 계정 생성 시 5달러 크레딧, Developer는 10달러부터 자가 결제에 요청 한도가 무료의 10배, Enterprise는 영업 문의 |
| 한국 사용 가능 | 가격 페이지와 보도자료 어디에도 국가 제한 안내가 없습니다. 직접 가입 외에 AWS Marketplace, OpenRouter, Hugging Face Hub, Vercel을 거치는 경로도 함께 안내합니다. 다만 한국을 따로 언급한 문구도 없습니다 |
| 제공 모델 | gpt-oss-120b, Gemma 4 31B 계열, GLM-4.7. 컨텍스트 최대 131k, function calling과 JSON 모드 지원 |
| CS-4 하드웨어 | 2026년 3분기 첫 출하, 가격 미공개, 영업 문의 |
Cerebras의 매출 구성도 장비에서 클라우드로 옮겨가는 중입니다. 8월 12일 발표한 2분기 실적에서 추론 클라우드 매출은 전년 동기 대비 네 배 가까이 늘었습니다. 하드웨어 매출은 오히려 줄었습니다. OpenAI와 맺은 200억 달러 규모 다년 계약과 750MW 배치 계획, AWS와의 Amazon Bedrock 연동 계획이 모두 클라우드 쪽에 있습니다. CS-4를 직접 살 독자보다 API로 만날 독자가 훨씬 많다는 뜻입니다.
에이전트 루프에서 모델이 답을 뱉는 시간이 병목인 팀이라면, 5달러 크레딧으로 gpt-oss-120b에 자기 프롬프트와 컨텍스트 길이를 그대로 넣어 초당 토큰 수를 직접 재보는 것이 30배 주장을 확인하는 가장 빠른 방법입니다. 그 숫자를 지금 쓰는 모델의 토큰 단가와 나란히 놓으면, 속도 4.6배에 단가 10배라는 교환이 자기 워크로드에 맞는지 계산이 나옵니다. CS-4 자체는 3분기 출하 뒤 Artificial Analysis 같은 제3자 측정 페이지에 CS-4 기반 엔드포인트가 올라오는 시점에 다시 보면 됩니다.