TL;DR
한 연구자가 GPT-6 Astra가 출시된 지 하루 만에 탈옥됐다고 보고했으며, 공격에는 ACL 2025 논문에 소개된 TIP 기법과 이름이 공개되지 않은 네 가지 기법이 결합됐다고 전했다. TIP는 암호 풀이 또는 Python 코드 실행처럼 보이는 과업 안에 유해한 목적을 숨겨 모델의 추론과 지시 이행을 유도하는 방식이다. 연구자에 따르면 GPT-6에서는 기존의 최소 TIP 공격만으로는 충분하지 않아 공격을 다시 구성해야 했다. 탈옥 세부 내용은 공개되지 않고 OpenAI에 비공개로 전달됐으며, 같은 연구자는 1년 전 GPT-5도 출시 한 시간 안에 탈옥했다고 보고한 바 있다.
섹션별 상세
이미지 분석

이미지는 게시물에서 말한 탈옥의 결과로 추정되는 모델 출력을 담고 있으며, 유해한 목적이 일반적인 작업 지시 형태로 나타난다는 점을 보충한다. 다만 화면의 세부 문구가 흐려져 있고 공격 입력과 전체 대화 과정이 보이지 않으므로, 이 이미지 alone으로 TIP 공격의 재현 절차나 성공 여부를 확인할 수는 없다.
GPT-6 Astra Max로 표시된 대화 화면에서 모델이 저작권 침해와 연결된 작업 절차를 번호 목록으로 출력한 스크린샷이다.
용어 해설
- 탈옥(Jailbreak)
- — LLM에 설정된 안전 정책이나 사용 제한을 우회해 원래 거부하도록 설계된 유해 요청을 수행하게 만드는 공격이다. 공격자는 프롬프트 구조와 과업 맥락을 조작해 모델의 거부 동작을 약화시키며, 방어 평가와 안전성 검증에 활용되는 핵심 개념이다.
- Task-in-Prompt 공격(Task-in-Prompt Attack)
- — 모델이 수행할 표면 과업 안에 실제 유해 목표를 숨기는 프롬프트 공격 기법이다. 암호 해독이나 Python 코드 실행처럼 정상적으로 보이는 과정을 앞세워 모델의 추론과 지시 이행 기능을 작동시키고, 그 결과 숨겨진 목표에 접근하게 만든다.
- 지시 이행(Instruction Following)
- — 언어 모델이 입력된 지시를 해석하고 순서와 조건에 맞춰 출력을 생성하는 능력이다. TIP 공격에서는 이 기능이 정상 과업 수행에 사용되는 동시에 숨겨진 유해 목표까지 따르게 만드는 공격 경로로 악용된다.
- 비공개 공개(Private Disclosure)
- — 보안 취약점이나 공격 방법을 대중에게 공개하기 전에 해당 시스템 운영자에게 먼저 전달하는 절차다. 이 사례에서는 연구자가 탈옥 세부 내용을 공개 게시하지 않고 OpenAI에 사적으로 전달했다고 원문이 전한다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.