TL;DR
OpenAI가 GPT-5.6을 Luna·Terra·Sol의 세 가지 크기로 일반 공개했고 각 모델의 입력/출력 토큰 가격이 공개되어 비용-성능 평가의 기초가 제공되었다. 발표는 Agents’ Last Exam에서 Sol이 53.6점을 기록해 Claude Fable 5를 상회했다고 보고하며 소형 모델들도 비용 효율성 측면에서 유의미한 이점을 갖는다고 주장했고 SWE-Bench Pro에서는 반대로 Fable 5가 우수한 결과가 있었으나 OpenAI는 해당 벤치마크의 약 30% 태스크에 문제가 있다고 지적해 벤치마크 해석의 주의를 환기했다. API 수준에서는 모델이 JavaScript로 도구 호출을 조합해 실행하는 Programmatic Tool Calling, 병렬 서브에이전트를 띄우는 Multi-agent, 개발자가 프롬프트 캐시 중단점을 명시하는 Prompt Cache Breakpoints, 이미지 원본 디테일 처리 옵션 등 실무적 통제와 오케스트레이션을 강화하는 기능들이 추가되어 복잡한 워크플로 구현과 비용 최적화 가능성이 확대되었다.
섹션별 상세
- GPT-5.6은 Luna, Terra, Sol 세 가지 크기로 일반 제공되며 토큰당 가격은 Luna $1/$6, Terra $2.50/$15, Sol $5/$30로 공개되었다. — 첫 단락 및 모델 출시 링크 출처
- Agents’ Last Exam에서 GPT-5.6 Sol이 53.6점을 기록해 Claude Fable 5보다 13.1포인트 높았고 중간(reasoning medium) 설정에서도 Fable 5를 11.4포인트 앞섰다. — 블록인용문(Agents’ Last Exam 결과 인용) 출처
- OpenAI는 SWE-Bench Pro에 대해 자체 감사 결과 약 30%의 태스크에 문제가 있다고 추정하며 벤치마크 결과를 주의해서 해석할 것을 권고했다. — 인용된 OpenAI 기사(벤치마크 감사) 링크와 본문 인용문 출처
용어 해설
- Agentic Performance
- — 장기간에 걸친 작업 흐름에서 모델이 도구 호출·기억·계획을 연속적으로 수행하여 목표를 달성하는 능력을 평가하는 개념으로, 입력을 받아 내부 상태와 도구를 조합해 여러 단계의 작업을 처리하는 방식과 그 효율성을 측정한다.
- Prompt Caching
- — 반복되는 프롬프트 전처리(토큰화·임베딩·컨텍스트 구성) 결과를 저장하여 이후 동일하거나 유사한 요청에서 재계산을 건너뛰는 최적화 기법으로, 지연과 비용을 줄이는 대신 캐시 관리와 일관성 유지 로직이 필요하다.
- Programmatic Tool Calling
- — 모델이 JavaScript 같은 스크립트를 생성해 외부 도구나 API를 조합·실행하도록 하여 한 번의 모델 턴에서 복수의 시스템 호출을 오케스트레이션하는 방식으로, 도구 사용과 결과 통합을 자동화해 복잡한 워크플로를 수행한다.
- SWE-Bench Pro
- — 소프트웨어 엔지니어링 관련 모델 성능을 평가하는 벤치마크로, 개별 태스크의 정확성·정답성에 따라 점수가 산출되며 벤치마크 설계 결함이 성능 비교 결과에 큰 영향을 미칠 수 있다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
