TL;DR
이 글은 위험값 조건을 만족하지 못할 때 모델이 DENY 같은 문장을 생성하는 대신 후속 출력을 완전히 멈추는지 검증한 공개 평가를 다룬다. 0.0100 조건을 0으로 바꾼 실행에서는 8회 모두 가시적 UTF-8 출력이 0이었고, 0.0099 조건의 대조 실행에서는 8회 모두 RELEASE가 반환됐다. GPT-5.4, GPT-5.6, Sol과 두 API 형식, 300토큰 및 1000토큰 설정에서 결과가 유지됐으며, 시스템 프롬프트를 제거하면 조건 위반 사례에서 DENY와 NO ACTION이 다시 나타났다. 공개 저장소의 실행기와 검증기를 통해 같은 결과를 재현할 수 있다.
실용적 조언
- GitHub 저장소를 복제하고 OPENAI_API_KEY를 설정한 뒤 canonical 평가와 verifier를 순서대로 실행하면 조건 위반 실행과 대조 실행의 출력 차이를 직접 확인할 수 있다.
- 조건을 충족하지 못한 호출에서 DENY 같은 거부 문구가 나오는지, 아니면 화면에 표시되는 UTF-8 바이트가 0인지 분리해 측정해야 한다.
섹션별 상세
용어 해설
- 적법한 연속 생성 게이트(lawful-continuation gate)
- — 모델이 특정 조건을 충족하지 못하면 후속 토큰을 생성하지 않도록 막는 시스템 수준의 제어 장치다. 이 글에서는 조건 위반 시 화면에 표시되는 UTF-8 바이트가 0이 되는지 측정한다.
- 시스템 프롬프트(system prompt)
- — 모델의 대화 전반에 적용되는 상위 지시문으로, 사용자 입력보다 우선해 생성 행동의 제약과 출력 형식을 정한다. 글에서는 이 지시문을 제거했을 때 조건 위반 사례의 출력이 달라진다.
- UTF-8 바이트(UTF-8 bytes)
- — 문자열을 UTF-8 인코딩으로 변환했을 때의 데이터 단위다. 이 실험은 조건을 만족하지 못한 호출에서 화면에 드러난 UTF-8 바이트 수를 세어 모델이 실제 출력을 남겼는지 판별한다.
- 조건 위반 실행(failed-condition run)
- — 모델에 부여된 위험 기준을 충족하지 못하도록 입력값을 설정한 평가 실행이다. 원문에서는 0.0100 조건에서 위험값을 0으로 바꾼 사례를 이 범주로 묶고, 출력이 없는지 대조한다.
- Chat Completions API(Chat Completions)
- — 대화형 입력을 받아 모델의 생성 결과를 반환하는 API 방식이다. 글에서는 동일한 중단 조건을 Chat Completions와 Responses API에서 각각 실행해 인터페이스에 따른 차이가 있는지 확인한다.
코드 예제
git clone https://github.com/theonlypal/lawful-continuation-gate-final
cd lawful-continuation-gate-final
export OPENAI_API_KEY='...'
python3 -m runner.run_eval --suite canonical
python3 -m verifier.verify --run "$(tr -d '
' < LATEST_RUN)"공개 저장소를 복제한 뒤 API 키를 설정하고 평가 실행과 결과 검증을 차례로 수행하는 명령이다.
언급된 도구
대화형 API 형식에서 lawful-continuation gate의 동작을 평가하는 데 사용됐다.
Chat Completions와 비교해 동일한 조건 중단 결과가 유지되는지 평가하는 API 형식이다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.