TL;DR
지난 수년간 o1과 DeepSeek-R1 등에서 발전한 추론형 LLM 계열이 표준화되었고, OpenAI의 GPT-5.6 계열은 세 가지 크기와 각기 여러 단계의 reasoning-effort 설정을 통해 내부 추론 깊이와 병렬화를 조정하며 비용과 성능 사이의 트레이드오프를 제공한다. effort 수준이 높을수록 인덱스 점수가 상승하는 경향이 도표로 확인되며 Ultra 설정은 네 개의 서브에이전트를 활용해 작업을 가속하되 벤치마크 수치는 아직 명확히 공개되지 않았다. 이러한 구성은 추론 정합성 확보를 위한 강화학습 기반 레시피와 병행되어 모델 배포 시 비용·성능 의사결정을 중심 이슈로 부각시킨다.
섹션별 상세
이미지 분석

차트는 effort 수준을 높일수록 인덱스 점수가 전반적으로 상승하는 경향과 함께 API 비용도 증가하는 트레이드오프 구조를 보여준다. 도표의 캡션은 Ultra 설정의 벤치마크 수치가 아직 공개되지 않았음을 명시하고 Ultra가 네 개의 서브에이전트를 이용해 작업을 가속한다고 덧붙여, Max 수준과 유사한 성능을 예상할 근거를 제공한다. 이 시각화는 동일 모델 내에서 effort 조정이 비용·성능 균형을 어떻게 이동시키는지를 직관적으로 전달한다.
인덱스 점수와 API 비용 축으로 GPT-5.6 Sol의 서로 다른 reasoning-effort 설정별 성능과 비용 분포를 시각화한 차트이다.
용어 해설
- Reasoning Model
- — 입력된 문제를 여러 단계의 추론 과정으로 풀어내도록 설계된 대형 언어 모델 계열로, 내부적으로 중간 추론 단계 또는 서브루틴을 활용해 복잡한 논리·코딩 작업의 해법을 생성하고 성능 향상을 목표로 한다. 이런 모델은 단계별 검증이나 보상 신호를 통해 추론 품질을 관리하며 코딩 에이전트 벤치마크에서 비용·성능 트레이드오프를 중심 지표로 삼는다.
- Reinforcement Learning with Verifiable Rewards
- — 모델의 중간 산출물을 외부 규칙이나 검사기로 검증하여 보상 신호를 생성하는 강화학습 기법으로, 추론 단계의 정합성을 자동 판정 가능한 기준으로 평가해 학습 신호로 환원함으로써 복잡한 추론 루틴의 안정적 학습을 돕는다.
- Subagent
- — 상위 모델이 더 큰 작업을 분할해 할당하는 소규모 보조 작업자 역할의 하위 프로세스로, 병렬화 또는 특화된 처리를 통해 전체 추론을 가속하거나 특정 하위 책임을 분리해 처리 비용과 지연을 조절한다.
- Reasoning Effort
- — 모델이 문제 해결에 투입하는 계산·추론 단계의 강도를 조정하는 파라미터 집합으로, 낮은 노력은 빠른 응답·낮은 비용을 유도하고 높은 노력은 단계별 계산을 늘려 정확도나 문제 해결 능력을 개선하는 대가로 비용이 증가한다.
근거 모음
- o1은 LLM 기반의 추론 모델 개념을 대중화한 모델이었다. — 문서 첫 문단에서 o1의 공개와 그 영향에 대해 언급된 부분
- GPT-5.6 계열은 세 가지 크기로 제공되며 각 모델에 대략 다섯 또는 여섯 개의 reasoning-effort 설정이 포함된다. — 중간 문단의 발표 요지 및 Figure 1 캡션
- Ultra 설정은 현재 벤치마크 수치가 공개되지 않았지만 Max와 유사한 성능을 목표로 하고 네 개의 서브에이전트를 이용해 작업을 가속한다. — Figure 1 캡션의 Ultra 관련 설명
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

