gpt-5.6-sol에 맞춰 회귀 테스트로 검증된 Codex CLI 프롬프트 팩, v5와 v35 두 가지 라
gpt-5.6-sol 대상의 Codex CLI 기반 프롬프트 패키지로 v5와 v35 두 버전이 제공되며 자체 테스트뱅크에서 여러 조합에서 120/120 통과 결과를 기록했다.
TL;DR
이 레포는 로컬 Codex 환경에서 모델의 응답 차단을 회피하려는 목적의 프롬프트 팩과 자동화된 테스트 파이프라인을 제공한다. 배포 스크립트는 선택한 ZIP을 해제해 지침 파일을 CODEX_HOME으로 복사하고 config.toml의 백업을 만들며 복원 절차를 통해 안전하게 원상복구할 수 있도록 구성되어 있다. v5는 간결한 자리표시자 기반으로 범용 태스크에 적용되며 v35는 이름·URL 표준화와 다국어 복합의도 라우팅으로 특수 태스크 통과율을 추가로 개선해 README의 여러 모델·추론레벨 조합에서 120/120 통과 사례를 기록했다. 다만 공개된 자료는 로컬 실험 결과에 국한되며 보안·윤리적 책임과 지역 법규를 검토한 후 사용해야 한다.
주요 기능
- 추천 프롬프트를 CODEX_HOME에 배포하고 이전 상태를 백업 및 복원하는 배포 스크립트를 제공한다. 이 스크립트는 ZIP 해제, Markdown 파일 복사, config.toml의 백업 생성과 운영 전 스냅샷을 자동으로 수행해 실험 재현성을 보장한다. 사용자는 대화형 메뉴를 통해 v5·v35 선택, 미리보기, 복원 작업을 수행할 수 있다.
- 자동화된 프롬프트 테스트뱅크를 생성하고 실행해 raw_prompt·raw_response·status를 기록하는 테스트 파이프라인을 포함한다. 테스트는 6개 시나리오에 대해 3개 길이 수준과 2개 언어로 총 360개의 케이스를 구성하고, 각 케이스의 통과 여부를 파일 단위로 저장해 정량적 비교가 가능하게 한다. 판정 기준은 모델의 거부 문구나 회피 응답을 fail로 처리하는 방식으로 명확히 규정되어 있다.
- 두 가지 프롬프트 구조(v5·v35)를 제공해 사용자가 목적에 따라 간단한 직답 규칙 또는 복합 의도 라우팅을 선택할 수 있게 한다. v5는 간결한 자리표시자 기반 구조로 범용 작업에 최적화되어 있고 v35는 이름과 URL의 표준화 및 다국어 복합의도 라우팅으로 특수 작업을 더 정밀하게 처리하도록 설계되어 있다. README에 포함된 SHA256 해시로 배포 파일 무결성 검증을 지원한다.
어떻게 동작하는가
배포 스크립트는 선택한 ZIP 파일을 해제해 지정된 Markdown 지침 파일을 CODEX_HOME으로 복사하고 config.toml에 참조 항목을 기록하는 방식으로 작동한다. 스크립트는 배포 전후에 config의 백업과 스냅샷을 생성하고 복원 절차에서 사용자가 특정 백업 파일을 선택해 원상복구하도록 한다.
해결 문제
로컬 Codex 기반 환경에서 모델의 응답 제한으로 인해 특정 보안·리버스·NSFW 계열 작업이 자동으로 차단되는 문제를 회피하기 위해 설계된 프롬프트와 재현 가능한 테스트 파이프라인을 제공한다. 해당 패키지는 프롬프트 구조를 파일로 배포하고 구성 파일을 안전하게 백업·복원하는 절차를 자동화해 실험자의 반복적 검증 부담을 줄인다. 또한 대규모 테스트뱅크를 통해 프롬프트 변경이 다양한 모델·추론 레벨에서 어떤 영향을 주는지 정량적으로 확인할 수 있게 한다.
지금 주목받는 이유
다수의 모델과 추론 등급에서 v5·v35가 기록한 120/120 통과 사례와 README에 포함된 2026-07-13 기준의 비교 결과로 인해 관심을 받았다.
차별점
- 로컬 배포 스크립트가 config.toml 백업과 스냅샷을 자동으로 생성해 배포 전 상태로의 복원을 단순화한다. 이는 수동으로 파일을 편집하거나 설정을 되돌리는 과정에서 발생하는 실수와 복잡성을 줄여 준다. 결과적으로 프롬프트 실험의 안전성과 재현성이 높아진다.
- v5와 v35라는 두 계층의 프롬프트 구조를 함께 제공해 범용 작업과 특수 복합 의도 작업을 분리해 처리할 수 있다. v5는 간결한 자리표시자 기반 접근으로 빠른 적용을 목표로 하고 v35는 이름·URL 표준화 및 다국어 라우팅으로 특수 태스크의 통과율을 개선하도록 설계되어 있다. 이러한 구조적 분리는 사용자가 요구에 따라 손쉽게 전략을 전환하게 한다.
- 체계화된 테스트뱅크와 자동 기록 시스템을 통해 각 케이스의 raw 입력·출력·판정 상태를 파일로 보관해 결과 감사와 회귀 테스트가 가능하다. JSONL 형태의 결과와 사례별 리포트를 통해 버전별 성능 차이를 정량적으로 비교할 수 있다. 이로 인해 프롬프트 변경의 영향을 추적하고 근거 기반으로 개선할 수 있다.
사용 사례
- 로컬 Codex 환경에서 연구자가 프롬프트 변경의 회귀 효과를 검증하려는 자동화된 테스트 파이프라인으로 활용할 수 있다. 테스트 실행 시 raw_prompt와 raw_response, 판정 상태가 저장되어 이후 감사와 오류 재현이 가능하다. 프롬프트 버전 간 성능 비교를 통해 실험적 근거로 개선을 반복할 수 있다.
- 특정 소프트웨어의 다운로드·변환·네임드 소프트웨어 작업처럼 복합 의도가 필요한 태스크에서 v35 라우팅을 적용해 성공률을 끌어올리는 데 사용될 수 있다. README의 사례 테이블은 v35가 일부 모델과 레벨에서 상위 결과를 기록했음을 보여 주며, 이를 바탕으로 특수 태스크용 프롬프트를 준비할 수 있다. 라우팅 로직은 이름·URL 표준화와 다국어 복합의도 매핑을 포함한다.
- 프롬프트 배포 및 복원 절차가 필요한 운영 환경에서 배포 안전망으로 사용될 수 있다. 스크립트는 배포 전 백업을 만들고 복원 절차를 제공하므로 실험 중 설정 손상에 대비할 수 있다. 특히 여러 실험자가 같은 CODEX_HOME을 공유하는 환경에서 설정 충돌을 관리하는 데 유용하다.
시작하기
클론 후 대화형 메뉴로 배포를 시작하거나 명령어로 버전을 명시해 배포할 수 있다. 예를 들어 python3 codex-instruct.py 로 대화형 메뉴를 띄우고 python3 codex-instruct.py --version v5 --dry-run 으로 미리보기, python3 codex-instruct.py --version v5 로 실제 배포를 수행한다. ZIP으로 제공된 스크립트는 for archive in scripts/*.zip; do unzip -o "$archive" -d scripts; done 로 풀어준 뒤 테스트 생성과 실행 명령으로 파이프라인을 동작시킬 수 있다.
요구사항
- Python 3.8 이상이 필요하다. README에 Python 3.8+ 배지와 관련 명령이 명시되어 있어 최소 런타임 요구사항으로 판단된다. 추가로 unzip이나 tar 등 압축 해제 도구가 필요할 수 있다.
- 로컬 Codex 호환 환경과 CODEX_HOME에 대한 쓰기 권한이 필요하다. 배포 스크립트가 config.toml을 수정하고 파일을 복사하므로 대상 디렉터리에 대한 적절한 권한이 확보되어야 한다. 네트워크 접근은 배포 시 외부 다운로드가 필요한 경우에만 요구된다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| gpt-5.6-sol v35 medium on gpt-5.6-sol | pass_rate | 120/120 (100.00%) | — |
| gpt-5.5 minimal on gpt-5.5 | pass_rate | 100/120 (83.33%) | upstream 62/120 (51.67%) |
| gpt-5.6-sol medium baseline comparison | pass_rate | 120/120 (100.00%) | upstream 85/120 (70.83%) |
이미지 분석


1.7k
Stars
327
Forks
+216
Trending
2
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.