오픈AI가 초당 750토큰을 뽑기 시작했습니다 — 세레브라스가 만든 GPT-5.6 솔 '울트라패스트' 모드

오픈AI가 초당 750토큰을 뽑기 시작했습니다 — 세레브라스가 만든 GPT-5.6 솔 '울트라패스트' 모드

같은 모델인데 답이 나오는 속도만 14배가 됐습니다. 오픈AI가 8월 13일 공개한 GPT-5.6 솔의 '울트라패스트' 모드 이야기예요. 그리고 그 속도를 만든 건 엔비디아 GPU가 아니라, 접시만 한 칩 한 장을 통째로 쓰는 세레브라스(Cerebras)의 하드웨어였습니다.

초당 750개, 사람이 읽는 속도를 한참 넘어섰습니다

울트라패스트 모드의 최대 출력 속도는 초당 750토큰입니다. 한국어로 치면 대략 초당 300~500자쯤 되는 분량이 쏟아져 나오는 셈이에요. 사람이 소리 내어 읽는 속도가 분당 300~400자 정도이니, 1초에 사람의 1분치가 나온다고 보면 감이 옵니다.

이 속도는 화면을 보고 있을 수 없는 수준입니다. 글자가 한 줄씩 타이핑되듯 흐르는 게 아니라, 문단이 통째로 나타났다가 다음 문단으로 넘어가요.

칠흑 같은 어둠 속에서 왼쪽 한 점으로부터 오른쪽으로 뻗어 나가며 가속하는 청록빛 광선 다발 — 추론 속도가 급격히 빨라지는 상황을 표현한 개념 이미지

무슨 일이 있었나 — 8월 13일, 오픈AI와 세레브라스의 공동 발표

발표는 양쪽에서 동시에 나왔습니다. 오픈AI는 자사 블로그에 '울트라패스트 모드 프리뷰'를 올렸고, 세레브라스는 같은 날 보도자료와 기술 블로그로 자기들이 그 인프라를 맡았다고 밝혔습니다. 국내외 매체가 이를 받아 쓴 건 8월 14일이에요.

중요한 건 이게 '발표만 하고 나중에 낸다'가 아니라는 점입니다. 이미 일부 고객사가 쓰고 있는 상태에서의 공개였습니다.

'울트라패스트'는 새 모델이 아니라 새 '속도 등급'입니다

여기서 헷갈리기 쉬운 지점을 먼저 정리할게요. 울트라패스트는 새로운 모델이 아닙니다. 기존 GPT-5.6 솔을 그대로 두고, 그것을 훨씬 빠른 하드웨어 위에서 돌리는 서비스 티어(등급)예요.

즉 "더 똑똑해진 모델"이 아니라 "같은 모델을 더 빨리 돌리는 방법"이라는 뜻입니다. 이 구분이 뒤에 나올 '품질 저하 없음'이라는 주장과 직접 연결됩니다.

칠흑 속에 떠 있는 거대한 정사각형 판, 표면 전체에 청록빛 격자 이음매가 촘촘히 빛나는 모습 — 웨이퍼 한 장을 통째로 쓰는 칩 구조를 표현한 개념 이미지

기존 속도는 초당 53개였습니다

비교 기준이 되는 표준(Standard) 모드의 추론 속도는 대략 초당 53토큰 수준입니다. 이게 그동안 우리가 챗봇 화면에서 보던 속도예요. 답이 또박또박 타이핑되듯 나오는, 익숙한 그 속도입니다.

53에서 750으로 갔으니 산술적으로 약 14배입니다. 오픈AI가 '최대 14배'라고 표현한 근거가 여기 있어요.

14배라는 숫자를 체감으로 바꾸면

긴 답변 하나를 받는 데 40초 걸리던 것이 3초가 됩니다. 코드 파일 하나를 통째로 다시 써 달라고 했을 때 커피 한 잔 가지러 갔다 오던 시간이, 의자에서 일어나기 전에 끝나요.

단순히 '빠르다'가 아니라 기다림이라는 행동 자체가 사라지는 구간에 진입한 겁니다. 이건 사용 방식을 바꿉니다.

칠흑 속에 나란히 떠 있는 굵고 밝은 청록 막대와 그 아래의 훨씬 가늘고 어두운 막대 — 표준 모드와 울트라패스트 모드의 처리량 차이를 표현한 개념 이미지

품질은 그대로라는 주장, 근거는 GDP-Val

속도를 올리면 보통 품질이 깎입니다. 양자화를 하거나, 추론 단계를 줄이거나, 더 작은 모델로 갈아타는 식이죠. 오픈AI는 이번엔 그런 트레이드오프가 없다고 주장합니다.

근거로 제시한 게 GDP-Val 벤치마크 결과입니다. 이 평가에서 울트라패스트는 전 과정 기준 5.6배 빨라졌고 품질 저하는 없었다고 밝혔어요.

GDP-Val이 뭔가요

GDP-Val은 '경제적으로 가치 있는 지식 노동 과제'를 모아 놓은 평가입니다. 시험문제 풀이 같은 인위적 과제가 아니라, 실제 직무에서 나오는 작업을 얼마나 제대로 해내는지를 봅니다.

속도 자랑에 이 벤치마크를 꺼냈다는 건, "빨라졌지만 실무에서 쓸 만한가"라는 질문을 미리 방어하겠다는 뜻이에요.

매끈한 사각 개구부에서 위로 빠르게 솟아오르는, 청록빛 테두리를 두른 작은 정육면체들의 조밀한 기둥 — 초당 수백 개씩 쏟아지는 토큰 생성을 표현한 개념 이미지

왜 GPU로는 이 속도가 안 나왔나 — 메모리 대역폭 병목

여기서부터가 이번 뉴스의 핵심입니다. GPU 기반 추론이 느린 진짜 이유는 연산이 부족해서가 아니라 메모리가 못 따라와서예요.

모델 가중치는 수십~수백 GB입니다. GPU의 초고속 메모리에는 다 못 들어가서, 계산할 때마다 칩 밖 메모리에서 가중치를 실어 와야 합니다. 이 왕복이 병목이에요.

디코딩 단계가 유독 느린 이유

대형 언어 모델의 추론은 크게 두 단계입니다. 입력을 한꺼번에 읽어 들이는 프리필, 그리고 답을 한 글자씩 만들어 내는 디코딩이에요.

프리필은 병렬 처리가 잘 됩니다. 문제는 디코딩입니다. 토큰 하나를 만들 때마다 모델 가중치를 전부 한 번씩 훑어야 하는데, 그때마다 메모리를 왕복하니 연산 장치는 놀고 메모리만 헐떡여요.

어두운 두 직육면체가 하나의 곧은 청록빛 막대로 연결되어 있고 한쪽이 훨씬 밝게 빛나는 모습 — 칩과 외부 메모리 사이를 오가는 데이터 왕복을 표현한 개념 이미지

세레브라스의 답 — 웨이퍼 한 장을 통째로 칩으로

보통 반도체는 둥근 웨이퍼 한 장에서 칩 수백 개를 잘라 냅니다. 세레브라스는 자르지 않습니다. 웨이퍼 한 장을 통째로 하나의 칩으로 씁니다. 그래서 이름이 웨이퍼 스케일 엔진(WSE)이에요.

결과적으로 칩 크기가 접시만 합니다. 3세대인 WSE-3 기준으로 트랜지스터 4조 개, AI 코어 90만 개가 한 장에 들어가 있어요.

44GB 온칩 SRAM이 바꾸는 것

세레브라스 접근법의 핵심은 크기가 아니라 메모리 위치입니다. WSE-3는 칩 안에 44GB의 SRAM을 품고 있어요. 모델 가중치를 칩 밖으로 내보내지 않고 칩 위에 그대로 올려 두겠다는 설계입니다.

가중치가 칩 안에 있으면 왕복이 사라집니다. 앞에서 말한 디코딩 병목이 구조적으로 없어져요. 이게 750토큰의 정체입니다.

여러 갈래의 청록빛 광선이 두 개의 매끈한 어두운 덩어리 사이 좁고 밝은 틈으로 모여드는 모습 — 메모리 대역폭 병목을 표현한 개념 이미지

21PB/s라는 숫자

세레브라스가 공개한 온칩 메모리 대역폭은 초당 21페타바이트입니다. 회사 설명에 따르면 엔비디아 H100 대비 약 7000배 수준이에요.

물론 이건 칩 위에 올라간 데이터에 한한 수치입니다. 하지만 디코딩처럼 "가중치를 계속 훑는" 작업에서는 바로 그 수치가 속도를 결정합니다.

세레브라스가 이전에 세운 기록들

이번이 갑자기 나온 성과는 아닙니다. 세레브라스는 그동안 공개 모델로 여러 차례 추론 속도 기록을 발표해 왔어요. 라마 3.1 405B에서 초당 969토큰, 70B급 모델에서 초당 2100토큰 같은 수치들이 있었습니다.

다만 그건 공개 가중치 모델이었습니다. 이번엔 프런티어 상용 모델 제공사가 직접 자기 대표 모델을 얹었다는 점이 다릅니다.

매끈한 벽으로 둘러싸인 커다란 어두운 직육면체 공간 깊숙이 놓인 청록빛 정육면체 하나 — 칩 안에 모델 가중치를 통째로 담아 두는 구조를 표현한 개념 이미지

오픈AI가 자체 칩이 아니라 남의 칩을 택한 이유

오픈AI는 자체 가속기를 개발 중인 것으로 알려져 있고, 엔비디아·AMD·브로드컴과 여러 갈래로 얽혀 있습니다. 그런데도 이번 속도 티어에는 세레브라스를 붙였어요.

이유는 단순합니다. 지금 당장 이 속도를 낼 수 있는 하드웨어가 그것뿐이기 때문입니다. 온칩 메모리에 모델을 통째로 올리는 방식은 GPU 아키텍처로는 흉내 내기 어려워요.

지금은 '리미티드 프리뷰'입니다

기대를 조금 눌러 둘 필요는 있습니다. 울트라패스트는 일부 고객사 대상 제한 프리뷰로 시작합니다. 아무나 지금 바로 쓸 수 있는 상태가 아니에요.

제공 경로도 API가 먼저입니다. 챗GPT 앱에서 스위치 하나로 켜는 기능이 아니라, 개발자용 인터페이스에서 먼저 열린다는 뜻입니다. 오픈AI는 용량이 늘어나는 대로 확대하겠다고 밝혔습니다.

칠흑 속에서 안쪽 고리가 바깥 고리에 흡수되듯 겹쳐 빛나는 청록빛 동심원 — 오픈AI와 세레브라스의 결합을 표현한 개념 이미지

어떤 회사들이 먼저 쓰고 있나

오픈AI는 초기 테스트 파트너의 분야를 코딩, 커머스, 금융 리서치, 고객 지원 등으로 밝혔습니다. 공통점이 보입니다. 전부 사람이 화면 앞에서 답을 기다리는 대화형 업무예요.

배치로 밤새 돌려도 되는 작업이 아니라, 응답 지연이 곧 사용성인 영역부터 붙였다는 뜻입니다.

경쟁 모델과 비교하면

세레브라스가 제시한 비교에 따르면 가속된 GPT-5.6 솔은 페이블 5보다 약 11배, 오퍼스 4.8의 패스트 모드보다 약 5배 빠릅니다. 물론 제조사 측 수치이므로 독립 검증은 따로 봐야 합니다.

다만 방향은 분명합니다. 모델 지능 경쟁과 별개로 같은 지능을 얼마나 빨리 내놓느냐가 새 전선이 됐어요.

완전한 어둠을 사선으로 가로지르며 오른쪽 위로 갈수록 굵고 밝아지는 청록빛 광선 — 속도 경쟁의 가속을 표현한 개념 이미지

가격은 어떻게 되나 — 아직 확인되지 않았습니다

솔직하게 적겠습니다. 울트라패스트 티어의 가격은 이번 발표에서 명확히 공개되지 않았습니다. 현재 확인되는 건 GPT-5.6 계열의 표준 요금 구조뿐이에요(솔 기준 100만 토큰당 입력 5달러 / 출력 30달러 수준).

속도 티어에 얼마의 웃돈이 붙는지는 확인되지 않았습니다. 이 부분을 단정하는 기사가 있다면 근거를 확인해 보시는 편이 좋습니다.

속도가 바뀌면 제품이 바뀝니다 — 대화형 UX

응답이 40초 걸리는 서비스와 3초 걸리는 서비스는 같은 기능이어도 다른 제품입니다. 느린 쪽에서는 사용자가 질문을 신중하게 한 번에 몰아서 던지고, 빠른 쪽에서는 짧게 여러 번 주고받아요.

후자가 훨씬 좋은 답에 도달합니다. 사람이 중간에 방향을 고칠 수 있으니까요.

모든 모서리가 청록빛으로 빛나는, 서로 맞물린 각진 덩어리들의 기하학적 구조물 — 하드웨어와 모델이 맞물린 구조를 표현한 개념 이미지

코딩 에이전트에서 특히 크게 체감됩니다

에이전트는 한 번 답하고 끝나지 않습니다. 파일을 읽고, 고치고, 테스트를 돌리고, 실패하면 다시 고쳐요. 한 작업에 모델 호출이 수십 번씩 들어갑니다.

호출 하나가 30초면 전체가 30분이 되고, 3초면 3분이 됩니다. 에이전트 시대에 추론 속도는 곱셈으로 누적돼요. 울트라패스트의 초기 파트너에 코딩이 들어간 이유입니다.

실제 사례 — 2500개 질문을 11시간에

발표와 함께 공개된 사례 중 눈에 띈 건 2500개 질문을 11시간에 처리했다는 수치입니다. 질문 하나당 평균 16초 꼴이에요.

이건 사람이 한 명 붙어 대화하는 속도가 아닙니다. 대량 리서치를 자동으로 돌리는 사용 방식이고, 원래는 며칠짜리 일이었습니다. 속도가 임계점을 넘으면 '더 빠른 챗봇'이 아니라 새로운 작업 방식이 열립니다.

어두운 직선 위에 놓인 흐릿한 청록빛 점들 사이에서 한 점만 훨씬 크고 밝게 빛나는 모습 — 여러 시도 가운데 임계점을 넘은 하나를 표현한 개념 이미지

저시력 사용자에게 속도는 접근성 문제입니다

여기서 SVIL이 늘 보는 각도를 하나 얹을게요. 응답 속도는 편의 문제로만 다뤄지지만, 저시력·시각장애 사용자에게는 접근성 문제입니다.

화면 낭독기는 텍스트가 생성되는 도중에 읽기 시작하면 중간에 끊기거나 같은 문장을 반복해 읽습니다. 그래서 생성이 다 끝날 때까지 기다렸다가 읽는 경우가 많아요. 생성이 40초면 40초 동안 아무 정보도 못 받습니다. 눈으로 보는 사용자는 그사이 앞부분이라도 읽지만, 낭독기 사용자에게는 그 시간이 통째로 공백이에요.

남은 물음 — 용량, 비용, 그리고 지속성

정리하면서 남겨 둘 질문 세 가지입니다. 첫째, 용량. 웨이퍼 스케일 칩은 생산량 자체가 제한적입니다. 프리뷰를 넘어 일반 공개까지 갈 물량이 나오느냐가 관건이에요.

둘째, 비용. 앞서 적었듯 가격이 공개되지 않았습니다. 셋째, 지속성. GPU 진영도 가만있지 않을 테니, 이 격차가 얼마나 유지될지는 지켜봐야 합니다.

매끈한 어두운 판이 한 줄로 갈라지며 그 틈을 강렬한 청록빛이 가득 메운 모습 — 하드웨어 구조가 만든 성능의 분기점을 표현한 개념 이미지

핵심 정리

  • 무엇: 오픈AI가 GPT-5.6 솔에 '울트라패스트' 속도 티어를 프리뷰 공개(8월 13일)
  • 얼마나: 최대 초당 750토큰, 표준(약 53토큰) 대비 최대 14배
  • 품질: GDP-Val 기준 전 과정 5.6배 가속, 품질 저하 없음(오픈AI 발표)
  • 어떻게: 세레브라스 웨이퍼 스케일 엔진의 44GB 온칩 SRAM으로 메모리 왕복 제거
  • 지금은: 일부 고객사 대상 제한 프리뷰, API 우선 제공
  • 확인 안 된 것: 울트라패스트 티어의 가격

속도는 이제 성능의 일부입니다

그동안 AI 뉴스는 "얼마나 똑똑해졌나"에 쏠려 있었습니다. 이번 발표는 다른 축을 하나 세웁니다. 같은 지능을 얼마나 빨리 내놓느냐도 제품의 질이라는 축이에요.

그리고 그 축에서는 모델을 만드는 회사가 아니라 칩을 만드는 회사가 승부를 가릅니다. 앞으로 모델 발표를 볼 때 벤치마크 점수 옆에 초당 토큰 수를 같이 보시면, 그 제품이 실제로 어떤 느낌일지 훨씬 정확하게 짐작하실 수 있을 거예요.

칠흑 속에 떠 있는 매끈한 어두운 정육면체의 한 면만 강렬한 청록빛으로 환하게 빛나는 모습 — 같은 모델이 속도라는 한 면에서만 달라진 상황을 표현한 개념 이미지

참고하실 만한 것

이 글이 도움이 되셨다면 SVIL 블로그를 구독해 주세요. AI 뉴스를 큰 글씨와 쉬운 설명으로 매일 정리해 올리고 있습니다. 저시력 사용자도 부담 없이 읽을 수 있게 만드는 것이 이 블로그의 목표예요.

혹시 API로 GPT-5.6 계열을 쓰고 계시다면, 지금 쓰는 작업이 속도에 민감한지 아닌지부터 나눠 보시길 권합니다. 밤새 돌려도 되는 배치 작업이라면 울트라패스트는 급하지 않고, 사용자가 화면 앞에서 기다리는 작업이라면 프리뷰 신청 대상을 확인해 볼 만합니다.

출처

  1. Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed — OpenAI
  2. Accelerating GPT-5.6 Sol Ultrafast with OpenAI — Cerebras
  3. Cerebras Powers Ultrafast Mode for OpenAI's GPT-5.6 Sol — GlobeNewswire
  4. Cerebras-Powered GPT-5.6 Sol Answers 2,500 Questions in 11 Hours — StockTitan
  5. Cerebras powers OpenAI's GPT-5.6 Sol ultrafast mode at 750 tokens/sec — Investing.com
  6. Cerebras Powers OpenAI's GPT-5.6 Sol Ultrafast Mode at Up to 750 Tokens Per Second — Quiver Quantitative
  7. Cerebras Announces Third-Generation Wafer Scale Engine (WSE-3) — Cerebras
  8. OpenAI and Cerebras Launch Ultrafast Mode for GPT-5.6 Sol, 14x Faster Than Standard — KuCoin

협업문의 : kuroicode@gmail.com
블로그 : https://blog.svil.dev/
홈페이지 : https://kuroicode-beep.github.io/svil-homepage/