본문으로 건너뛰기
Cerebras조회 4

Cerebras에서 초당 750토큰으로 GPT‑5.6 Sol 제공

Cerebras WSE‑3가 동일한 GPT‑5.6 Sol을 최대 초당 750토큰으로 처리해 에이전트 작업의 반복 지연을 줄입니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

OpenAI는 Cerebras에서 실행하는 GPT‑5.6 Sol Ultrafast를 최대 초당 750개 출력 토큰 속도로 제공하고 있습니다. 모델을 축소하거나 증류하거나 낮은 정밀도로 양자화하지 않고, 표준 OpenAI 엔드포인트와 동일한 구조·가중치·정밀도·컨텍스트 설정·추론 설정을 유지한 채 GPU 대신 Cerebras WSE‑3에서 실행하는 방식입니다. WSE‑3는 44GB SRAM을 900,000개 코어 가까이에 배치하고 총 21PB/s 대역폭을 제공해 가중치를 연산 근처에 둡니다. GPT‑5.6 Sol을 여러 CS‑3 시스템에 층 단위로 나누되 시스템 사이에는 활성값만 전달하며, GDP‑Val 작업에서는 표준 엔드포인트보다 5.6배, Humanity’s Last Exam의 일치 질문에서는 6.9배 빠르게 성공 작업을 완료했습니다.

빠른 이해

새로운 점

모델 구조와 정밀도를 유지한 채 WSE‑3의 wafer 단위 SRAM 구조로 GPT‑5.6 Sol의 토큰 생성 속도를 최대 750 tok/s까지 끌어올립니다.

핵심 메커니즘

WSE‑3는 44GB SRAM을 900,000개 코어 가까이에 배치해 모델 가중치를 연산 위치 주변에 유지하고, 총 21PB/s 대역폭으로 각 코어가 필요한 가중치에 접근하게 합니다. GPT‑5.6 Sol을 여러 CS‑3 시스템의 층 경계에서 분할한 뒤 각 wafer에 담당 층의 가중치를 저장하고, 토큰별 중간 결과인 활성값만 다음 wafer로 전달합니다. 입력 토큰은 첫 번째 층 그룹에서 처리되고 활성값이 순차적으로 다음 층 그룹을 통과한 뒤 마지막 단계에서 출력 토큰으로 변환됩니다. 이 구조는 GPU 클러스터에서 반복되는 가중치 이동과 층별 동기화를 줄여 최대 초당 750개 토큰의 출력을 목표로 하며, 여러 추론·도구 호출이 이어지는 에이전트 작업에서 누적 지연을 낮춥니다.

핵심 수치

  • GPT‑5.6 Sol Ultrafast 출력 속도: 최대 750 output tokens per second- Cerebras WSE‑3 실행 기준
  • WSE‑3 SRAM: 44 GB- 900,000개 코어 옆에 wafer 전체로 분산
  • WSE‑3 aggregate bandwidth: 21 petabytes per second- SRAM이 제공하는 총 대역폭
  • GDP‑Val 작업 완료 속도: 표준 엔드포인트 대비 5.6× 빠름- 품질을 맞춘 법률·금융·엔지니어링 산출물 샘플
  • Humanity’s Last Exam 성공 작업 속도: 표준 엔드포인트 대비 6.9× 빠름- 추론이 작업 흐름을 지배하는 일치 질문 기준
  • 공개 엔드포인트 모델 속도: OpenAI GPT OSS 120B 3,000 tok/s; Gemma 4 31B 1,850 tok/s; Z.ai GLM 4.7 1,000 tok/s- Cerebras 공개 엔드포인트 기준

섹션별 상세

01

GPT‑5.6 Sol의 Ultrafast 실행

OpenAI는 Cerebras에서 GPT‑5.6 Sol을 최대 초당 750개 출력 토큰으로 실행하는 Ultrafast 모드를 미리 제공하고 있습니다. 표준 OpenAI 엔드포인트와 비교해 모델 아키텍처, 가중치, 정밀도, 컨텍스트 설정, 추론 설정을 바꾸지 않았으며 browser-use, computer-use, coding 기능도 유지합니다. 차이는 모델을 GPU가 아니라 Cerebras WSE‑3에서 실행한다는 점입니다. 따라서 속도 향상은 모델 능력을 낮춰 얻은 결과가 아니라 추론 하드웨어와 데이터 이동 구조를 바꾼 결과로 제시됩니다.
02

GPU 메모리 이동 병목

일반적인 GPU 시스템에서는 모델 가중치를 저장하는 고대역폭 메모리와 연산 코어가 서로 다른 칩에 있어 토큰을 계산할 때 가중치가 반복해서 경계를 넘어야 합니다. 모델을 여러 GPU에 나누면 각 층이 끝날 때 동기화가 필요하고, GPU를 추가할수록 통신 비용이 커져 단일 응답 지연이 오히려 늘어날 수 있습니다. Cerebras는 이 병목을 가중치를 사용하는 연산기 가까이에 계속 보관하는 구조로 바꿉니다. 핵심은 계산량 자체보다 가중치와 활성값을 얼마나 적게 이동시키느냐에 있습니다.
03

WSE‑3의 wafer 단위 처리

일반 칩이 silicon wafer에서 잘려 나오는 것과 달리 Cerebras는 wafer 자체를 하나의 칩으로 사용합니다. WSE‑3는 wafer 전체에 44GB SRAM을 분산하고 900,000개 코어 옆에 배치하며, 이 메모리가 총 21PB/s의 aggregate bandwidth를 냅니다. GPT‑5.6 Sol은 단일 가속기보다 크기 때문에 여러 CS‑3 시스템에 층 경계 기준으로 분할하고 각 wafer가 담당 층의 가중치를 로컬 SRAM에 보관합니다. 매 토큰마다 활성값이 한 wafer에서 다음 wafer로 이동해 마지막 단계가 결과를 내므로, GPU 클러스터의 세밀한 분할·동기화 대신 가중치는 가까운 곳에 남고 활성값만 파이프라인을 통과합니다.
04

반복 작업에서 누적되는 속도 효과

에이전트는 입력을 한 번 처리하고 끝나는 대신 결과를 읽고 추론하며 코드를 작성하고 테스트한 뒤 다음 행동을 결정하는 루프를 반복합니다. 각 단계에서 모델 요청과 도구 호출이 이어지므로 토큰당 지연은 한 번의 비용이 아니라 전체 단계 수만큼 누적되는 비용입니다. 품질을 맞춘 GDP‑Val 작업에서 GPT‑5.6 Sol Ultrafast는 표준 엔드포인트의 동일 모델보다 같은 작업을 5.6배 빠르게 완료했고, Humanity’s Last Exam의 일치 질문에서는 성공 작업을 6.9배 빠르게 마쳤습니다. 한 시간 걸리는 작업이 9분이 채 되지 않는 시간으로 줄어드는 사례처럼, 속도는 장시간 코딩 에이전트와 반복적인 지식 작업의 대기 시간을 직접 줄입니다.
05

개발·자동화·지식 작업 적용

개발자는 코딩 에이전트를 수시간 또는 수일 동안 실행하며 코드 작성, 테스트, 반복 수정 루프를 이어갈 수 있고, WSE‑3의 빠른 추론은 각 루프 사이의 대기를 줄입니다. 지식 작업에서는 사람이 결과를 읽고 판단하고 산출물을 만드는 과정이 남지만, 이메일 작성·세금 처리·영상 편집처럼 모델과 사람의 반복 교환이 필요한 작업에서 더 빠른 토큰 생성이 다음 판단까지의 간격을 단축합니다. computer-use와 브라우저 자동화에서는 인터페이스를 관찰하고 다음 행동을 결정한 뒤 명령을 실행하는 사이의 지연이 줄어듭니다. Cerebras는 별도 공개 엔드포인트에서 OpenAI GPT OSS 120B를 3,000 tok/s, Gemma 4 31B를 1,850 tok/s, Z.ai GLM 4.7을 1,000 tok/s로 제공하며, 전용 enterprise endpoint에서는 Kimi K2.6·GLM 5.1·MiniMax M2.5·Qwen3 Coder 480B 등도 지원합니다.

용어 해설

GPU 메모리 장벽(GPU Memory Wall)
GPU에서 모델 가중치는 HBM에 저장되고 연산 코어와 분리되어 있습니다. 추론할 때마다 가중치를 코어로 옮겨야 하므로 모델이 커질수록 산술 연산보다 데이터 이동과 칩 간 통신이 병목이 되는 현상입니다.
SRAM
SRAM은 프로세서 가까이에 배치되는 고속 메모리입니다. Cerebras WSE‑3는 wafer 전체에 44GB의 SRAM을 분산하고 900,000개 코어 옆에 가중치를 유지해 토큰 생성 때 반복적인 외부 메모리 접근을 줄입니다.
활성값(Activation)
활성값은 신경망의 한 층에서 계산된 중간 출력으로 다음 층의 입력이 됩니다. GPT‑5.6 Sol을 여러 CS‑3 시스템에 나눌 때 각 wafer에 배정된 층 사이를 이동하며 추론 파이프라인을 진행합니다.
모델 분할(Model Sharding)
하나의 모델을 여러 가속기나 시스템에 나누어 배치하는 방식입니다. 이 글에서는 GPT‑5.6 Sol의 층 경계에서 모델을 분할하고 각 wafer의 SRAM에 담당 가중치를 보관해 칩 간 이동을 활성값 중심으로 단순화합니다.
토큰당 지연 시간(Per-token Latency)
토큰 하나를 생성하는 데 걸리는 시간입니다. 에이전트가 추론과 도구 호출을 여러 단계 반복하면 같은 지연이 단계마다 누적되므로, 토큰 생성 속도는 전체 작업 완료 시간에 반복적으로 영향을 줍니다.

기술

  • Cerebras
  • GPT‑5.6 Sol
  • WSE‑3
  • CS‑3
  • GPU
  • HBM
  • SRAM
  • OpenAI GPT OSS 120B
  • Gemma 4 31B
  • Z.ai GLM 4.7
  • Kimi K2.6
  • GLM 5.1
  • MiniMax M2.5
  • Qwen3 Coder 480B

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 09. 01.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.