본문으로 건너뛰기

OpenAI가 Cerebras 웨이퍼칩에서 동작하는 GPT-5.3-Codex-Spark 코딩 모델을 공개했다

OpenAI가 Cerebras 하드웨어에서 동작하는 GPT-5.3-Codex-Spark를 ChatGPT Pro 연구 프리뷰로 공개하면서 코드 생성 처리량이 초당 1,000토큰을 넘는 성능을 보고했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

OpenAI는 Cerebras의 웨이퍼 스케일 칩에서 동작하는 GPT-5.3-Codex-Spark를 연구 프리뷰로 공개하며 비엔비디아 하드웨어 기반의 고속 코드 생성 가능성을 제시했다. 해당 모델은 코드 생성에서 초당 1,000토큰 이상의 처리량을 보고했고 기사에서는 이를 이전 모델 대비 약 15배 향상된 성능으로 언급하면서 Anthropic의 Claude Opus 4.6의 빠른 모드(표준 대비 약 2.5배, 표준 속도 68.2토큰/초)와 비교했다. 배포는 ChatGPT Pro(월 200달러) 구독자를 대상으로 Codex 앱·CLI·VS Code 확장으로 제공되며 API는 선별된 설계 파트너에 단계적으로 개방되고, 모델은 텍스트 전용이며 128,000토큰의 대용량 컨텍스트 윈도우를 지원한다. 이 조합은 긴 코드 컨텍스트와 높은 처리량을 요구하는 워크로드에서 응답성과 비용 구조에 실질적 변화를 줄 수 있지만 초기에는 멀티모달 입력을 지원하지 않아 적용 범위에 제약이 존재한다.

섹션별 상세

01
OpenAI는 비엔비디아 하드웨어에서 작동하는 첫 상용 모델로 GPT-5.3-Codex-Spark를 Cerebras의 칩에서 배포했고, 이 결정은 대규모 모델의 추론 플랫폼 다변화를 의미한다. Cerebras의 웨이퍼 스케일 칩은 보드 단위로 대량의 연산과 온칩 메모리를 제공해 모델의 토큰 처리량을 끌어올리는 하드웨어 특성을 지닌다. OpenAI는 Cerebras와의 협업을 통해 빠른 추론을 새로운 플랫폼 기능으로 추가할 수 있었다고 밝혔다. 이 변화는 특정 워크로드에서 엔진 선택지가 확장되었음을 시사한다.
02
GPT-5.3-Codex-Spark는 코드 생성 성능에서 초당 1,000토큰 이상의 처리량을 보고했으며, 이는 같은 계열의 이전 모델 대비 약 15배 빠른 수준으로 기술되었다. 기사에서는 성능 비교를 위해 Anthropic의 Claude Opus 4.6의 빠른 모드가 표준 대비 약 2.5배의 속도를 내며 표준 속도는 68.2토큰/초라고 명시해 상대적 위치를 제시했다. 토큰 처리량 수치는 하드웨어 아키텍처와 소프트웨어 최적화의 결합으로 달성된 성능 지표로 해석된다. 이 수준의 처리량 증가는 대규모 코드 생성이나 낮은 지연을 요구하는 실시간 서비스에서 비용·처리량 트레이드오프를 바꿀 가능성이 있다.
03
배포 방식과 제약이 명확히 공개되어 있어 사용 접근성과 한계가 동시에 존재한다. 모델은 연구 프리뷰로 ChatGPT Pro 구독자(월 200달러)를 통해 Codex 앱, 명령줄 인터페이스, VS Code 확장으로 이용 가능하며 API 접근은 선별된 설계 파트너로 단계적 제공이 진행 중이다. 출시 시점에는 텍스트 전용 처리만 지원하고 128,000토큰의 대용량 컨텍스트 윈도우를 제공한다는 점이 명시되어 있다. 대규모 컨텍스트 지원은 긴 코드베이스와 복잡한 세션 유지에 유리하지만 멀티모달 입력은 초기에는 제공되지 않아 활용 범위에 제약이 있다.

용어 해설

웨이퍼 스케일 엔진(Wafer-Scale Engine)
웨이퍼 전체를 하나의 칩처럼 설계한 초대형 반도체 아키텍처로, 칩 면적을 크게 늘려 대규모 메모리와 높은 메모리 대역폭, 병렬 연산을 제공한다. Cerebras의 웨이퍼 스케일 칩은 대용량 모델 추론에서 높은 처리량을 확보하기 위해 연산 유닛과 온칩 메모리를 넉넉히 배치하는 설계를 사용한다. 이 설계는 단일 보드에서 대규모 모델의 병렬 추론을 가속하고 비엔비디아 하드웨어 기반의 고속 추론을 가능하게 한다.
컨텍스트 윈도우(Context Window)
모델이 한 번에 입력으로 받아 처리할 수 있는 토큰의 최대 길이로, 입력 텍스트나 코드의 문맥을 유지하는 범위를 결정한다. 컨텍스트 윈도우가 크면 긴 코드 파일이나 전체 세션을 한 번에 전달해 모델이 전후 관계를 유지한 상태로 추론할 수 있다. GPT-5.3-Codex-Spark는 128,000토큰의 대용량 컨텍스트 윈도우를 제공해 긴 코드 컨텍스트 처리에 유리하다.
토큰 처리량(Token Throughput)
단위 시간당 모델이 출력하거나 처리할 수 있는 토큰 수로, 추론 지연(latency)과 처리량(throughput)을 평가하는 핵심 지표이다. 하드웨어 구조와 모델 최적화 수준에 따라 토큰 처리량이 달라지며, 높은 처리량은 대량의 코드 생성이나 실시간 응답성 개선으로 이어진다. 기사에서는 GPT-5.3-Codex-Spark가 1,000토큰/초 이상의 처리를 보고해 기존 대비 처리량 향상이 핵심 성능 지표로 제시되었다.

기술

  • Cerebras chips
  • ChatGPT Pro
  • Codex app
  • VS Code extension

활용 사례

  • 대규모 코드베이스를 한 번에 처리해야 하는 자동 코드 생성 파이프라인
  • 지연에 민감한 실시간 코드 보조 서비스
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 13.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.