본문으로 건너뛰기
Simon Willison조회 3

OpenAI의 GPT-5.6 일반 제공 시작: Luna, Terra, Sol과 새로운 API 기능

OpenAI가 GPT-5.6을 Luna·Terra·Sol 세 가지로 일반 공개했고, Sol이 Agents’ Last Exam에서 53.6점을 기록하며 Claude Fable 5를 앞섰고 새 API는 도구 실행·다중 에이전트·프롬프트 캐시 제어 등 기능을 추가했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

OpenAI가 GPT-5.6을 Luna·Terra·Sol의 세 가지 크기로 일반 공개했고 각 모델의 입력/출력 토큰 가격이 공개되어 비용-성능 평가의 기초가 제공되었다. 발표는 Agents’ Last Exam에서 Sol이 53.6점을 기록해 Claude Fable 5를 상회했다고 보고하며 소형 모델들도 비용 효율성 측면에서 유의미한 이점을 갖는다고 주장했고 SWE-Bench Pro에서는 반대로 Fable 5가 우수한 결과가 있었으나 OpenAI는 해당 벤치마크의 약 30% 태스크에 문제가 있다고 지적해 벤치마크 해석의 주의를 환기했다. API 수준에서는 모델이 JavaScript로 도구 호출을 조합해 실행하는 Programmatic Tool Calling, 병렬 서브에이전트를 띄우는 Multi-agent, 개발자가 프롬프트 캐시 중단점을 명시하는 Prompt Cache Breakpoints, 이미지 원본 디테일 처리 옵션 등 실무적 통제와 오케스트레이션을 강화하는 기능들이 추가되어 복잡한 워크플로 구현과 비용 최적화 가능성이 확대되었다.

섹션별 상세

01
OpenAI가 GPT-5.6을 일반 제공 상태로 내놓았고 모델은 크기순으로 Luna, Terra, Sol 세 가지로 분류되며 각 모델의 토큰당 가격이 공개되었다. 공개된 가격은 입력/출력 토큰 단위로 Luna가 $1/$6, Terra가 $2.50/$15, Sol이 $5/$30으로 명시되어 있어 비용 산정의 기초 수치가 제시되었다. 다만 글은 토큰당 가격만으로 비교하기에는 동일 작업에서 모델별로 요구되는 추론 토큰 수가 달라 실사용 비용 비교에는 주의가 필요하다고 지적했다. 이 정보는 모델 선택 시 비용-성능 트레이드오프를 정량적으로 평가할 근거를 제공한다.
02
OpenAI는 장기 에이전트 워크플로 평가인 Agents’ Last Exam에서 GPT-5.6 Sol이 53.6점을 기록해 Claude Fable 5보다 13.1포인트 우수하다고 보고하며 중간 수준 추론 설정에서도 비용 효율성을 강조했다. 발표문은 Sol이 adaptive reasoning 설정에서 Fable 5를 13.1포인트, medium reasoning에서는 11.4포인트 앞섰고 소형 모델군인 Terra와 Luna도 더 낮은 추정 비용으로 Fable 5를 능가한다고 주장했다. 이러한 벤치마크 근거는 장기간의 에이전트형 작업에서 토큰 효율성과 일관된 작업 수행 능력이 모델 성능 판단의 핵심 기준이 되었음을 보여준다.
03
SWE-Bench Pro에서는 Claude Fable 5가 80%로 GUT-5.6 Sol의 64.6%를 크게 상회한 사례가 보고되었고 OpenAI는 해당 벤치마크를 감사한 결과 약 30%의 태스크가 문제라고 추정한다는 자체 분석을 공개했다. OpenAI의 감사 결과는 벤치마크 설계·태스크 품질이 모델 간 비교에 미치는 영향을 강조하며, 특정 벤치마크에서의 우수성이 일반적 우위로 곧바로 연결되지 않을 수 있음을 시사한다. 이 점은 모델 평가에서 벤치마크 검증과 태스크 자체의 건전성 확인이 필수임을 환기한다.
04
새 API 기능들은 모델 활용 방식에 실용적 변화를 유도할 가능성이 있고 예시로 Programmatic Tool Calling, Multi-agent 패턴, Prompt Cache Breakpoints, 이미지 요청의 detail: original 옵션 등이 포함되었다. Programmatic Tool Calling은 모델이 JavaScript를 만들어 도구 호출을 오케스트레이션하도록 해 복수 도구 조합과 결과 통합을 한 턴에서 처리할 수 있게 하고, Multi-agent는 병렬화된 세부 작업을 수행하도록 서브에이전트를 생성해 분할 및 병렬 처리를 지원한다. Prompt Cache Breakpoints는 반복되는 프롬프트의 중간 지점을 명시해 캐시를 제어함으로써 최적화 작업을 개발자가 직접 설계할 수 있게 하고, 이미지의 원본 디테일 옵션은 전처리 없이 원본 해상도로 이미지를 처리하도록 한다는 점에서 응용 개발의 유연성을 높인다.

용어 해설

에이전트형 성능(Agentic Performance)
장기간에 걸친 작업 흐름에서 모델이 도구 호출·기억·계획을 연속적으로 수행하여 목표를 달성하는 능력을 평가하는 개념으로, 입력을 받아 내부 상태와 도구를 조합해 여러 단계의 작업을 처리하는 방식과 그 효율성을 측정한다.
프롬프트 캐싱(Prompt Caching)
반복되는 프롬프트 전처리(토큰화·임베딩·컨텍스트 구성) 결과를 저장하여 이후 동일하거나 유사한 요청에서 재계산을 건너뛰는 최적화 기법으로, 지연과 비용을 줄이는 대신 캐시 관리와 일관성 유지 로직이 필요하다.
프로그래매틱 도구 호출(Programmatic Tool Calling)
모델이 JavaScript 같은 스크립트를 생성해 외부 도구나 API를 조합·실행하도록 하여 한 번의 모델 턴에서 복수의 시스템 호출을 오케스트레이션하는 방식으로, 도구 사용과 결과 통합을 자동화해 복잡한 워크플로를 수행한다.
SWE-Bench Pro
소프트웨어 엔지니어링 관련 모델 성능을 평가하는 벤치마크로, 개별 태스크의 정확성·정답성에 따라 점수가 산출되며 벤치마크 설계 결함이 성능 비교 결과에 큰 영향을 미칠 수 있다.

기술

  • OpenAI API
  • JavaScript
  • Agents’ Last Exam
  • SWE-Bench Pro

활용 사례

  • 장기 에이전트 워크플로 자동화
  • 복수 도구 조합을 통한 단일 턴 오케스트레이션
  • 토큰 비용 최적화가 중요한 대화형 서비스 운영
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 10.수집 2026. 07. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.