TL;DR
이번 글은 OpenAI가 발표한 GPT-5.6의 공개와 그에 대한 성능 및 안전성 평가를 중심으로 전개되었다. 발표는 제한적 접근으로 이루어졌으며 모델은 특정 코딩 에이전트 과제에서 높은 성과를 보였고 벤치마크에서 상위권 점수를 기록했다. 발표 배경에는 Anthropic-Fable 협상과 Mythos 통제 완화가 얽혀 있어 배포 결정이 안전성 검증과 연동되었음이 확인된다.
사이버 안전성 관점에서는 Preparedness Framework를 사용한 평가가 이루어져 GPT-5.6 Sol이 익스플로잇 프리미티브를 식별하는 능력을 보였으나 완전한 체인형 익스플로잇을 자율 생성하지 못해 Cyber Critical 임계값을 넘지 못했다. Chromium과 Firefox를 대상으로 한 실제 테스트에서의 관찰이 이러한 결론의 근거가 되었으며 이는 모델이 탐지·보조 역할에서 유용하지만 독립적 악용 능력으로 직결되지는 않는다는 점을 드러낸다. 이 결과는 모델 거버넌스와 액세스 통제의 필요성을 뒷받침한다.
제시된 벤치마크 자료는 성능 수치뿐 아니라 출력 토큰 대비 효율성 차이를 보여주어 실무적 트레이드오프를 드러냈다. TerminalBench에서는 최고 점수가 91.9% 수준으로 보고되었고 ExploitBench 산점도는 GPT-5.6 Sol이 Mythos Preview와 유사한 성능을 더 적은 토큰으로 달성한 사례를 보였다. 따라서 실제 배포·운영 환경에서는 단순한 점수뿐 아니라 출력 토큰 비용, 안전 임계값, 모델의 프리미티브 식별 성향을 함께 고려해야 한다.
섹션별 상세

- GPT‑5.6 Sol does not cross the Cyber Critical threshold under our Preparedness Framework. — 본문의 사이버 능력 평가 단락(Chromium 및 Firefox 테스트 결과 설명 부분)

- On ExploitBench, GPT-5.6 Sol is competitive with Mythos Preview using only ~1/3 of the output tokens. — ExploitBench 산점도와 해당 문단(ExploitBench 성능 비교 및 토큰 사용량 언급)
용어 해설
- 준비태세 프레임워크(Preparedness Framework)
- — 보안 위험 수준을 정량화하기 위해 설계된 평가 체계로, 모델 출력이 자율적 악용을 촉발할 수 있는지를 판정하기 위해 일련의 기준과 임계값을 사용한다. 입력·처리·출력 단계에서 모델이 생성한 행위 가능성(예: 취약점 악용 능력)을 기준으로 다단계 위험 등급을 부여한다. 이 글에서는 해당 프레임워크를 사용해 GPT-5.6 Sol의 'Cyber Critical' 도달 여부를 판정했다.
- 익스플로잇 프리미티브(Exploit Primitive)
- — 완전한 익스플로잇을 구성하는 하위 단위로서, 취약점 식별·메모리 조작 패턴·페이로드 구성 같은 재사용 가능한 기술적 요소를 의미한다. 개별 프리미티브는 자동화된 체인으로 결합되어 실제 공격으로 이어질 수 있기 때문에 위험 평가에서 별도로 검증된다. 본문은 GPT-5.6이 프리미티브를 식별했으나 완전 체인을 자율 생성하지는 못했다고 기록했다.
- TerminalBench
- — 대화형/터미널형 작업에서 모델의 문제 해결 능력을 정량화하는 벤치마크로서 여러 모델에 대해 성공률(%)을 산출한다. 입력으로 주어진 터미널 시나리오를 모델이 어떻게 해석하고 명령을 생성해 목표를 달성하는지를 평가해 점수를 매긴다. 제공된 차트에서는 TerminalBench 2.1 결과로 여러 모델의 점수 분포를 비교했다.
- ExploitBench
- — 취약점 발굴과 익스플로잇 생성 능력을 토큰 사용량 관점에서 평가하는 벤치마크로서, 출력 토큰 수와 성공 지표(cap percent)를 함께 시각화한다. 동일 작업에서 더 적은 출력 토큰으로 높은 성능을 내는 모델의 효율성을 측정할 수 있어 안전성·위험평가에 활용된다. 본문에서는 이 벤치마크로 GPT-5.6 Sol과 Mythos Preview의 토큰 대비 성능을 비교했다.
기술
- Chromium
- Firefox
활용 사례
- 코딩 에이전트 성능 평가
- 취약점 탐지 및 익스플로잇 프리미티브 식별 실험
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.