본문으로 건너뛰기

OpenAI 차세대 모델 GPT-6 Astra 공개 및 벤치마크 분석

GPT-6 Astra는 주요 지능 지표에서 신기록을 경신하며 정교한 3D 월드 생성과 브라우저 자동화 능력을 증명했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

OpenAI의 차세대 모델 GPT-6 Astra는 ARC-AGI-3 98.6%, FrontierMath 97.6% 등 주요 벤치마크에서 기존 모델들을 압도하는 성능을 기록했다. 특히 3D 게임 환경을 단일 프롬프트로 생성하고 복잡한 브라우저 제어 업무를 1분 내외로 완수하는 등 실무 에이전트로서의 능력이 비약적으로 발전했다. 수학적 난제 해결에 기여하는 과학적 발견 능력과 강화된 안전 정렬 성능을 보여주었으나, 짧은 컨텍스트 유지 시간과 특유의 디자인 편향성은 향후 개선이 필요한 한계로 지적된다.

챕터별 상세

00:30

주요 벤치마크 성능 분석

GPT-6 Astra는 ARC-AGI-3에서 98.6%라는 압도적인 점수를 기록하며 기존 모델들의 한계를 넘어섰다. FrontierMath Tier 4에서도 97.6%를 달성하여 Claude Fable 5.1의 87.8%를 크게 앞지르는 수학적 추론 능력을 입증했다. 특히 3D 객체 생성 능력을 평가하는 BenchCAD에서 95.9%를 기록했는데, 이는 모델의 공간 인지 능력이 비약적으로 향상되었음을 의미한다. 코딩 성능 지표인 DeepSWE v1.1에서도 73.0%를 기록하며 Gemini 3.8 Flash를 제외한 대부분의 경쟁 모델을 압도했다.

ARC-AGI는 AI의 일반적인 지능을 측정하는 가장 어려운 테스트 중 하나로 꼽힌다.

02:45

기술적 특징 및 안전성 정렬

OpenAI 블로그에 따르면 Astra는 컴퓨터 및 브라우저 사용 능력에서 새로운 지평을 열었다. OSWorld 2.0 벤치마크 결과 기존 모델 대비 정확도는 7% 향상되었고 처리 속도는 50% 빨라졌다. 특히 안전성 측면에서 비인가 작업 수행률 0%를 기록했는데, 이는 이전 모델인 GPT-5.6 Sol이 48.2%의 실패율을 보였던 것과 대조적이다. 이러한 정렬 성능 향상은 허깅페이스 해킹 사건 이후 강화된 보안 가이드라인이 모델 학습에 성공적으로 반영되었음을 시사한다.

OSWorld는 실제 운영체제 환경에서 AI 에이전트의 수행 능력을 평가하는 벤치마크이다.

04:46

과학적 발견과 API 가격 정책

Astra는 소수 연구 분야에서 80년 동안 변하지 않았던 수학적 알고리즘의 하한선을 개선하는 성과를 냈다. 무한 반복 소수 간격의 하한선을 240에서 186으로 낮추며 AI가 단순한 정보 처리를 넘어 실제 과학적 발견에 기여할 수 있음을 보여주었다. 상용화를 위한 API 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러로 책정되었다. 또한 표준 가격의 2배를 지불하면 처리 속도를 2.5배 높여주는 패스트 모드를 제공하여 엔터프라이즈 환경의 요구에 대응했다.
06:01

3D 게임 및 복합 에셋 생성

단 두 문장의 프롬프트만으로 'Little Planet'이라는 정교한 3D 월드를 생성하는 데모가 진행됐다. 캐릭터가 물에 들어가면 자동으로 걸음걸이가 바뀌는 물리적 상호작용이 구현되었으며, 나비나 구름 같은 동적 요소들이 자연스럽게 배치되었다. 또한 ASCII 캐릭터만을 사용하여 렌더링된 3D 도시와 7가지 서로 다른 기후(바이옴)를 가진 섬 환경을 단일 프롬프트로 생성해냈다. 이는 모델이 텍스트를 시각적 공간 구조로 변환하는 능력이 매우 정밀해졌음을 입증하는 결과이다.

ASCII 아트는 문자로 이미지를 만드는 기법이며, 여기서는 이를 3D 공간 렌더링에 응용했다.

09:59

Sim City 재현 및 실무 자동화

`/goal` 명령어를 활용하여 5일간의 지속적인 생성 과정을 거쳐 Sim City의 UI와 시스템을 완벽하게 복제했다. 교통 흐름, 구역 설정, 원자력 발전소와 같은 유틸리티 관리 기능이 실제로 작동하는 수준으로 구현되었다. 브라우저 제어 시연에서는 30초 만에 연구 워크플로우 다이어그램을 완성하고, 1분 내외로 복잡한 상품 비교 및 여행 경로 계획을 수행했다. 모델이 스스로 화면을 녹화하고 정보를 정리하여 웹사이트 형태로 즉시 호스팅하는 통합적인 에이전트 능력을 보여주었다.

에이전트가 브라우저를 직접 제어하여 인간의 복잡한 업무를 대신 수행하는 시나리오이다.

text
publish this to here.now

생성된 에이전트 결과물을 웹에 즉시 호스팅하기 위한 프롬프트 명령어

text
/goal

장기적인 프로젝트 생성을 위해 모델에게 지속적인 목표를 부여하는 명령어

12:55

한계점 및 최종 비평

성능 향상에도 불구하고 몇 가지 한계점이 지적되었다. 모델의 작업 지속 시간이 약 30분 내외로 제한적이며, 생성된 웹사이트들이 특정 녹색 계열과 파스텔 톤의 디자인에 편향되는 경향이 있다. 텍스트 생성 결과물에서는 여전히 인공지능 특유의 문체인 'AI smell'이 느껴져 인간적인 감성이 부족하다는 평가를 받았다. 하지만 프롬프트 조정을 통해 이러한 단점들을 어느 정도 극복할 수 있으며, 전반적인 성능은 현존하는 모델 중 최상위 수준임이 확인됐다.

AI smell은 AI가 생성한 텍스트에서 나타나는 특유의 반복적이고 기계적인 패턴을 의미한다.

용어 해설

추상 및 추론 벤치마크(ARC-AGI)
인간의 지능과 유사한 추상적 추론 능력을 측정하기 위해 설계된 벤치마크이다. 훈련 데이터에 없는 새로운 규칙을 얼마나 빨리 학습하고 적용하는지를 평가하며, 범용 인공지능(AGI)의 진척도를 가늠하는 핵심 지표로 활용된다.
정렬(Alignment)
AI 모델의 목표와 행동을 인간의 의도 및 윤리적 가치에 일치시키는 기술적 과정이다. 모델이 유해한 명령을 거부하거나 허용된 작업 범위 내에서만 작동하도록 보장하여 안전성을 높이는 것이 핵심 목적이다.
토큰(Token)
LLM이 텍스트를 처리하는 최소 단위로, 단어의 일부나 문장 부호 등을 포함한다. 모델의 입력 및 출력 비용을 산정하는 기준이 되며, 모델이 한 번에 처리할 수 있는 정보의 양(컨텍스트 창)을 결정하는 요소이다.
아스키(ASCII)
문자, 숫자, 기호 등을 7비트 이진수로 표현하는 표준 코드 체계이다. AI 분야에서는 텍스트 문자만을 사용하여 이미지나 3D 공간을 시각적으로 표현하는 예술적 또는 기술적 시연 용도로 사용되기도 한다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 04.수집 2026. 09. 04.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.