본문으로 건너뛰기
r/artificial조회 2

조건 위반을 멈추는 GPT-5.4 게이트

GPT-5.4와 GPT-5.6에서 조건 위반 시 문장 대신 0바이트 출력을 만드는 게이트를 공개 평가로 검증했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 글은 위험값 조건을 만족하지 못할 때 모델이 DENY 같은 문장을 생성하는 대신 후속 출력을 완전히 멈추는지 검증한 공개 평가를 다룬다. 0.0100 조건을 0으로 바꾼 실행에서는 8회 모두 가시적 UTF-8 출력이 0이었고, 0.0099 조건의 대조 실행에서는 8회 모두 RELEASE가 반환됐다. GPT-5.4, GPT-5.6, Sol과 두 API 형식, 300토큰 및 1000토큰 설정에서 결과가 유지됐으며, 시스템 프롬프트를 제거하면 조건 위반 사례에서 DENY와 NO ACTION이 다시 나타났다. 공개 저장소의 실행기와 검증기를 통해 같은 결과를 재현할 수 있다.

실용적 조언

  • GitHub 저장소를 복제하고 OPENAI_API_KEY를 설정한 뒤 canonical 평가와 verifier를 순서대로 실행하면 조건 위반 실행과 대조 실행의 출력 차이를 직접 확인할 수 있다.
  • 조건을 충족하지 못한 호출에서 DENY 같은 거부 문구가 나오는지, 아니면 화면에 표시되는 UTF-8 바이트가 0인지 분리해 측정해야 한다.

섹션별 상세

01
평가의 핵심 규칙은 위험값이 0.0100보다 낮아야 한다는 조건이며, 작성자는 숫자 하나를 0.0100에서 0으로 바꿨다. 조건이 충족되지 않는 실행에서는 화면에 표시되는 UTF-8 바이트가 0이었고, 0.0099를 사용한 대조 실행에서는 출력이 RELEASE로 고정됐다. 따라서 이 테스트는 모델이 거부 문구를 생성하는 대신 조건 판정 지점에서 연속 생성을 끊는지를 측정하도록 구성됐다.
02
작성자는 GPT-5.4, GPT-5.6, Sol과 Chat Completions, Responses API, 300토큰 및 1000토큰 설정에서 같은 결과가 유지됐다고 밝혔다. 조건 위반 실행은 8회 중 8회가 가시적 출력을 남기지 않았고, 조건을 만족한 대조 실행은 8회 중 8회가 정확히 RELEASE를 반환했다. 여러 모델과 API 형식, 출력 길이에서 동일한 결과를 얻었다는 점이 저장소 기반 재현성 주장의 근거로 사용됐다.
03
시스템 프롬프트를 제거하면 조건 위반 사례에서 DENY와 NO ACTION 같은 문장이 다시 출력됐다. 이는 모델이 거부 의사를 표현하는 것과 후속 토큰 자체를 생성하지 않는 것이 서로 다른 동작임을 구분한다. 작성자는 안전 조건을 말로 판정하는 모델보다 조건 위반 시 연속 생성을 차단하는 시스템 동작이 중요한 이유로 이 차이를 들었다.
04
검증은 공개 GitHub 저장소를 복제하고 OPENAI_API_KEY를 설정한 뒤 canonical 평가 스위트와 verifier를 실행하는 절차로 재현할 수 있다. 작성자는 사용자가 24번의 호출을 실행해 결과를 직접 확인할 수 있다고 안내했다. 이 구조는 주장만 전달하는 대신 동일한 입력과 검증기를 사용해 결과를 다시 확인하도록 만든다.

용어 해설

적법한 연속 생성 게이트(lawful-continuation gate)
모델이 특정 조건을 충족하지 못하면 후속 토큰을 생성하지 않도록 막는 시스템 수준의 제어 장치다. 이 글에서는 조건 위반 시 화면에 표시되는 UTF-8 바이트가 0이 되는지 측정한다.
시스템 프롬프트(system prompt)
모델의 대화 전반에 적용되는 상위 지시문으로, 사용자 입력보다 우선해 생성 행동의 제약과 출력 형식을 정한다. 글에서는 이 지시문을 제거했을 때 조건 위반 사례의 출력이 달라진다.
UTF-8 바이트(UTF-8 bytes)
문자열을 UTF-8 인코딩으로 변환했을 때의 데이터 단위다. 이 실험은 조건을 만족하지 못한 호출에서 화면에 드러난 UTF-8 바이트 수를 세어 모델이 실제 출력을 남겼는지 판별한다.
조건 위반 실행(failed-condition run)
모델에 부여된 위험 기준을 충족하지 못하도록 입력값을 설정한 평가 실행이다. 원문에서는 0.0100 조건에서 위험값을 0으로 바꾼 사례를 이 범주로 묶고, 출력이 없는지 대조한다.
Chat Completions API(Chat Completions)
대화형 입력을 받아 모델의 생성 결과를 반환하는 API 방식이다. 글에서는 동일한 중단 조건을 Chat Completions와 Responses API에서 각각 실행해 인터페이스에 따른 차이가 있는지 확인한다.

코드 예제

bash
git clone https://github.com/theonlypal/lawful-continuation-gate-final
cd lawful-continuation-gate-final
export OPENAI_API_KEY='...'
python3 -m runner.run_eval --suite canonical
python3 -m verifier.verify --run "$(tr -d '
' < LATEST_RUN)"

공개 저장소를 복제한 뒤 API 키를 설정하고 평가 실행과 결과 검증을 차례로 수행하는 명령이다.

언급된 도구

Chat Completions중립

대화형 API 형식에서 lawful-continuation gate의 동작을 평가하는 데 사용됐다.

Responses API중립

Chat Completions와 비교해 동일한 조건 중단 결과가 유지되는지 평가하는 API 형식이다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 28.수집 2026. 08. 28.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.