TL;DR
OpenAI는 Cerebras에서 실행하는 GPT‑5.6 Sol Ultrafast를 최대 초당 750개 출력 토큰 속도로 제공하고 있습니다. 모델을 축소하거나 증류하거나 낮은 정밀도로 양자화하지 않고, 표준 OpenAI 엔드포인트와 동일한 구조·가중치·정밀도·컨텍스트 설정·추론 설정을 유지한 채 GPU 대신 Cerebras WSE‑3에서 실행하는 방식입니다. WSE‑3는 44GB SRAM을 900,000개 코어 가까이에 배치하고 총 21PB/s 대역폭을 제공해 가중치를 연산 근처에 둡니다. GPT‑5.6 Sol을 여러 CS‑3 시스템에 층 단위로 나누되 시스템 사이에는 활성값만 전달하며, GDP‑Val 작업에서는 표준 엔드포인트보다 5.6배, Humanity’s Last Exam의 일치 질문에서는 6.9배 빠르게 성공 작업을 완료했습니다.
빠른 이해
새로운 점
모델 구조와 정밀도를 유지한 채 WSE‑3의 wafer 단위 SRAM 구조로 GPT‑5.6 Sol의 토큰 생성 속도를 최대 750 tok/s까지 끌어올립니다.
핵심 메커니즘
WSE‑3는 44GB SRAM을 900,000개 코어 가까이에 배치해 모델 가중치를 연산 위치 주변에 유지하고, 총 21PB/s 대역폭으로 각 코어가 필요한 가중치에 접근하게 합니다. GPT‑5.6 Sol을 여러 CS‑3 시스템의 층 경계에서 분할한 뒤 각 wafer에 담당 층의 가중치를 저장하고, 토큰별 중간 결과인 활성값만 다음 wafer로 전달합니다. 입력 토큰은 첫 번째 층 그룹에서 처리되고 활성값이 순차적으로 다음 층 그룹을 통과한 뒤 마지막 단계에서 출력 토큰으로 변환됩니다. 이 구조는 GPU 클러스터에서 반복되는 가중치 이동과 층별 동기화를 줄여 최대 초당 750개 토큰의 출력을 목표로 하며, 여러 추론·도구 호출이 이어지는 에이전트 작업에서 누적 지연을 낮춥니다.
핵심 수치
- GPT‑5.6 Sol Ultrafast 출력 속도: 최대 750 output tokens per second- Cerebras WSE‑3 실행 기준
- WSE‑3 SRAM: 44 GB- 900,000개 코어 옆에 wafer 전체로 분산
- WSE‑3 aggregate bandwidth: 21 petabytes per second- SRAM이 제공하는 총 대역폭
- GDP‑Val 작업 완료 속도: 표준 엔드포인트 대비 5.6× 빠름- 품질을 맞춘 법률·금융·엔지니어링 산출물 샘플
- Humanity’s Last Exam 성공 작업 속도: 표준 엔드포인트 대비 6.9× 빠름- 추론이 작업 흐름을 지배하는 일치 질문 기준
- 공개 엔드포인트 모델 속도: OpenAI GPT OSS 120B 3,000 tok/s; Gemma 4 31B 1,850 tok/s; Z.ai GLM 4.7 1,000 tok/s- Cerebras 공개 엔드포인트 기준
섹션별 상세
GPT‑5.6 Sol의 Ultrafast 실행
GPU 메모리 이동 병목
WSE‑3의 wafer 단위 처리
반복 작업에서 누적되는 속도 효과
개발·자동화·지식 작업 적용
용어 해설
- GPU 메모리 장벽(GPU Memory Wall)
- — GPU에서 모델 가중치는 HBM에 저장되고 연산 코어와 분리되어 있습니다. 추론할 때마다 가중치를 코어로 옮겨야 하므로 모델이 커질수록 산술 연산보다 데이터 이동과 칩 간 통신이 병목이 되는 현상입니다.
- SRAM
- — SRAM은 프로세서 가까이에 배치되는 고속 메모리입니다. Cerebras WSE‑3는 wafer 전체에 44GB의 SRAM을 분산하고 900,000개 코어 옆에 가중치를 유지해 토큰 생성 때 반복적인 외부 메모리 접근을 줄입니다.
- 활성값(Activation)
- — 활성값은 신경망의 한 층에서 계산된 중간 출력으로 다음 층의 입력이 됩니다. GPT‑5.6 Sol을 여러 CS‑3 시스템에 나눌 때 각 wafer에 배정된 층 사이를 이동하며 추론 파이프라인을 진행합니다.
- 모델 분할(Model Sharding)
- — 하나의 모델을 여러 가속기나 시스템에 나누어 배치하는 방식입니다. 이 글에서는 GPT‑5.6 Sol의 층 경계에서 모델을 분할하고 각 wafer의 SRAM에 담당 가중치를 보관해 칩 간 이동을 활성값 중심으로 단순화합니다.
- 토큰당 지연 시간(Per-token Latency)
- — 토큰 하나를 생성하는 데 걸리는 시간입니다. 에이전트가 추론과 도구 호출을 여러 단계 반복하면 같은 지연이 단계마다 누적되므로, 토큰 생성 속도는 전체 작업 완료 시간에 반복적으로 영향을 줍니다.
기술
- Cerebras
- GPT‑5.6 Sol
- WSE‑3
- CS‑3
- GPU
- HBM
- SRAM
- OpenAI GPT OSS 120B
- Gemma 4 31B
- Z.ai GLM 4.7
- Kimi K2.6
- GLM 5.1
- MiniMax M2.5
- Qwen3 Coder 480B
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.