본문으로 건너뛰기

두 가지 설정으로 ARC-AGI-3 벤치마크 점수를 세 배 높인 방법

Responses API의 추론 유지·컨텍스트 압축으로 GPT‑5.6 Sol의 ARC-AGI-3 점수가 약 3배로 상승하고 토큰 사용이 대폭 줄었습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

OpenAI는 ARC-AGI-3 벤치마크에서 GPT‑5.6 Sol의 낮은 점수 원인을 하네스 설정에서 발견했고, Responses API의 추론 유지와 컨텍스트 압축을 적용해 성능을 크게 개선했습니다. 공식 하네스 기준 13.3%였던 RHAE가 두 기능 적용 시 38.3%로 상승했고 출력 토큰은 약 6분의 1로 줄었습니다. 이 결과는 벤치마크 해석 시 모델 자체뿐 아니라 하네스와 API 설정이 판단 기준에 큰 영향을 준다는 점을 시사합니다.

빠른 이해

새로운 점

벤치마크 점수가 모델 자체 성능뿐 아니라 하네스와 API 설정에 크게 의존한다는 실험적 증거를 제시하며, 동일 모델을 다른 하네스에서 비교할 때 설정을 표준화해야 한다는 실용적 신호를 제공합니다.

핵심 메커니즘

핵심은 모델의 내부 추론(private reasoning)을 다음 턴까지 유지하고 긴 기록은 요약해 컨텍스트에 남기는 처리 파이프라인으로, 입력으로 현재 프레임과 레벨 정보를 받고 모델이 생성한 비공개 추론을 응답 ID 단위로 연결해 전달하는 방식입니다. 이 흐름은 입력(현재 관찰)→모델의 비공개 추론 생성→이전 응답 ID를 통해 추론을 이어받음→콘텍스트 압축으로 오래된 기록을 요약해 보존하는 과정으로 구성되어, 매 턴 재해석 비용을 줄이고 장기 전략 형성을 돕습니다. 기사에서는 이 메커니즘이 실제로 점수와 토큰 효율에 유의미한 변화를 야기했다고 보고합니다.

핵심 수치

  • ARC-AGI-3 (공식 하네스): 13.3% RHAE- OpenAI가 공식 하네스로 측정한 결과
  • ARC-AGI-3 (추론 유지 + 컨텍스트 압축): 38.3% RHAE- Responses API 설정 적용 시 결과
  • 인간 테스터 평균: 약 48% RHAE- OpenAI가 게임 플레이 로그로 추정한 인간 기준선
  • 출력 토큰 사용량: 약 1/6- 추론 유지와 컨텍스트 압축 병행 시 출력 토큰이 대략 6분의 1로 감소
  • 컨텍스트 윈도우: 175,000 tokens- 기사에서 사용한 컨텍스트 길이 한도

섹션별 상세

요지

OpenAI는 ARC-AGI-3 평가에서 GPT‑5.6 Sol의 낮은 점수 원인을 하네스 설정에서 찾았으며, Responses API의 추론 유지와 컨텍스트 압축을 사용해 점수를 크게 끌어올린 사례를 보고했습니다. 구체적으로 공식 하네스에서 기록된 13.3% RHAE가 두 기능을 적용하면 38.3%로 상승했고 출력 토큰은 약 6분의 1 수준으로 줄었습니다. 이 결과는 벤치마크 결과가 모델 자체 성능뿐 아니라 하네스·API 설정에 민감하다는 점을 보여 주며, 평가를 설계하거나 결과를 해석할 때 하네스 구성요소를 함께 고려해야 한다는 근거를 제공합니다.

문제 발견

ARC-AGI-3 공개 세트에서 GPT 계열 모델의 성능이 기대보다 낮았을 때 OpenAI는 모델이 아닌 하네스 동작을 점검했습니다. 조사 결과 기본 하네스가 각 행동 후 모든 비공개 추론을 삭제하고 롤링 트렁케이션으로 긴 기록을 자르는 구조였기 때문에 모델이 매 턴마다 이전 추론을 잃고 게임을 재해석해야 했습니다. 이 때문에 모델은 행동 결정을 내리는 데 오랜 시간이 걸리고 장기적으로 전략을 축적할 수 없었으며, 이러한 운영 조건이 낮은 점수와 높은 출력 토큰 사용을 유발했다는 근거를 확보했습니다.

추론 유지 작동 원리

추론 유지는 모델이 행동을 생성하기 전 비공개 추론 메시지(private reasoning)를 만들어 두고, 이후 턴에서도 이 비공개 메시지를 보존해 다음 추론의 입력으로 삼는 방식입니다. 구현 측면에서는 이전 응답의 ID를 Responses API에 전달하면 그 응답에서 형성된 내부 추론이 자동으로 이어지므로 모델이 이전 사고 과정을 재구성할 필요가 줄어듭니다. 결과적으로 각 행동을 결정하기 전 소요되는 추론 시간이 감소하고, 누적된 통찰을 기반으로 더 일관된 전략을 형성할 수 있게 됩니다.

컨텍스트 압축 작동 원리

컨텍스트 압축은 긴 대화·행동 기록을 단순 삭제 대신 요약·압축해 컨텍스트 윈도우에 남기는 방식으로, 굵직한 정보는 유지하면서 토큰 사용량을 낮추는 처리입니다. ARC-AGI-3 하네스는 원래 175,000자(기사에서는 175,000토큰 한도로 표기)를 초과하면 오래된 메시지를 삭제했는데, 컨텍스트 압축을 쓰면 중요한 관찰과 행동 결과를 압축해 남겨 장기 기억을 유지하도록 설계합니다. 이 접근은 롤링 트렁케이션으로 인한 정보 손실을 줄이고, 특히 장시간 실행되는 게임에서 모델의 학습 효과와 일관성을 개선합니다.

결과와 권장 설정

실험 결과 공식 하네스에서 GPT‑5.6 Sol은 공개 ARC-AGI-3 세트에서 13.3% RHAE를 기록했으나 추론 유지와 컨텍스트 압축을 적용하면 38.3%까지 상승했고 출력 토큰 수는 약 6배 줄어든 것으로 보고되었습니다. 인간 테스터 평균은 약 48% RHAE로 추정되어, 개선된 설정이 인간 수준에 근접하도록 모델 행동 데이터를 더 효율적으로 활용했다는 근거가 됩니다. OpenAI는 개발자에게 Responses API 사용과 함께 추론 유지·컨텍스트 압축을 권장하며, 모델 비교나 평가를 할 때 이와 같은 설정을 참고하라고 권장합니다.
트윗과 게임 스크린샷을 합성한 이미지로, Codex를 통해 GPT 모델이 Slay the Spire 2 등 게임을 플레이한 사례를 보여 줌
Screenshot이미지는 GPT 기반 모델이 Codex 제어로 실제 게임 도전을 성공시킨 사례를 증거로 제시하며, 기사 본문에서 '모델은 게임을 클리어할 수 있었음'이라는 기술적 문맥을 보강합니다. 트윗 화면과 게임 장면이 함께 찍혀 있어 모델의 행동 로그·결과 화면을 동시에 확인할 수 있으므로 기사 결론(하네스 설정이 성능에 미치는 영향)을 뒷받침하는 시각 증거로 활용됩니다.
근거
  • 추론 유지와 컨텍스트 압축을 적용하면 GPT‑5.6 Sol의 ARC-AGI-3 공개 세트 점수가 약 3배로 증가하고 출력 토큰은 약 6분의 1로 줄었다 기사 본문에서 공식 하네스(13.3% RHAE)와 추론 유지·컨텍스트 압축 적용 시 점수(38.3% RHAE)와 출력 토큰 감소(≈6x 적음)를 직접 비교한 부분

용어 해설

추론 유지(Inference retention)
모델이 이전 응답에서 생성한 비공개 추론 메시지를 다음 턴에도 그대로 참조하도록 하는 방식으로, 이전에 형성한 계획·통찰·중간 계산을 보존해 후속 행동 결정에 활용하게 하는 기능입니다. 이 방식은 매 턴마다 모델이 처음부터 문제를 재해석하는 비용을 줄이며 장기 전략을 유지하는 데 유리합니다.
컨텍스트 압축(Context compression)
긴 대화 기록이나 행동 로그를 요약해 토큰 사용량을 줄이면서 핵심 정보는 유지하는 처리 기법으로, 롤링 트렁케이션 대신 오래된 메시지를 압축해 컨텍스트 윈도우 안에서 의미를 보존합니다. 요약 결과는 이후 추론의 입력으로 남아 장시간 실행 작업에서 기억 손실을 완화합니다.
롤링 트렁케이션(Rolling truncation)
컨텍스트가 길어지면 가장 오래된 메시지부터 삭제해 윈도우 크기를 유지하는 방식으로, 삭제된 정보는 회복되지 않습니다. 이 때문에 장기 작업에서는 과거 행동이나 추론이 유실되어 학습과 전략 일관성이 떨어질 위험이 있습니다.
상대 인간 행동 효율(Relative Human Action Efficiency)
모델의 점수를 인간 기준선과 비교해 산정한 지표로, ARC-AGI-3에서 모델 성능을 인간 평균 대비 비율로 표현합니다. OpenAI 기사에서는 이 지표를 통해 GPT‑5.6 Sol의 상대적 성취를 보고했습니다.

기술

  • Responses API
  • GPT‑5.6 Sol
  • ARC-AGI-3
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 05.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.