본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

MDX-Tom/gpt-5.6-instruct

Python4 / 0

gpt-5.6-sol 대상의 Codex CLI 기반 프롬프트 패키지로 v5와 v35 두 버전이 제공되며 자체 테스트뱅크에서 여러 조합에서 120/120 통과 결과를 기록했다.

TL;DR

이 레포는 로컬 Codex 환경에서 모델의 응답 차단을 회피하려는 목적의 프롬프트 팩과 자동화된 테스트 파이프라인을 제공한다. 배포 스크립트는 선택한 ZIP을 해제해 지침 파일을 CODEX_HOME으로 복사하고 config.toml의 백업을 만들며 복원 절차를 통해 안전하게 원상복구할 수 있도록 구성되어 있다. v5는 간결한 자리표시자 기반으로 범용 태스크에 적용되며 v35는 이름·URL 표준화와 다국어 복합의도 라우팅으로 특수 태스크 통과율을 추가로 개선해 README의 여러 모델·추론레벨 조합에서 120/120 통과 사례를 기록했다. 다만 공개된 자료는 로컬 실험 결과에 국한되며 보안·윤리적 책임과 지역 법규를 검토한 후 사용해야 한다.

핵심 포인트

  • 로컬 배포 스크립트가 config.toml 백업과 스냅샷을 자동으로 생성해 배포 전 상태로의 복원을 단순화한다. 이는 수동으로 파일을 편집하거나 설정을 되돌리는 과정에서 발생하는 실수와 복잡성을 줄여 준다. 결과적으로 프롬프트 실험의 안전성과 재현성이 높아진다.
  • v5와 v35라는 두 계층의 프롬프트 구조를 함께 제공해 범용 작업과 특수 복합 의도 작업을 분리해 처리할 수 있다. v5는 간결한 자리표시자 기반 접근으로 빠른 적용을 목표로 하고 v35는 이름·URL 표준화 및 다국어 라우팅으로 특수 태스크의 통과율을 개선하도록 설계되어 있다. 이러한 구조적 분리는 사용자가 요구에 따라 손쉽게 전략을 전환하게 한다.
  • 체계화된 테스트뱅크와 자동 기록 시스템을 통해 각 케이스의 raw 입력·출력·판정 상태를 파일로 보관해 결과 감사와 회귀 테스트가 가능하다. JSONL 형태의 결과와 사례별 리포트를 통해 버전별 성능 차이를 정량적으로 비교할 수 있다. 이로 인해 프롬프트 변경의 영향을 추적하고 근거 기반으로 개선할 수 있다.
  • 추천 프롬프트를 CODEX_HOME에 배포하고 이전 상태를 백업 및 복원하는 배포 스크립트를 제공한다. 이 스크립트는 ZIP 해제, Markdown 파일 복사, config.toml의 백업 생성과 운영 전 스냅샷을 자동으로 수행해 실험 재현성을 보장한다. 사용자는 대화형 메뉴를 통해 v5·v35 선택, 미리보기, 복원 작업을 수행할 수 있다.

벤치마크

벤치마크지표비교
gpt-5.6-sol v35 medium on gpt-5.6-solpass_rate120/120 (100.00%)
gpt-5.5 minimal on gpt-5.5pass_rate100/120 (83.33%)upstream 62/120 (51.67%)
gpt-5.6-sol medium baseline comparisonpass_rate120/120 (100.00%)upstream 85/120 (70.83%)

이미지 분석

터미널 캡처로서 공식 사이트 다운로드 및 역공학 작업을 수행하는 테스트 로그와 명령 실행 흔적을 보여 준다.
이미지는 codex-instruct 배포 및 테스트 과정에서 실행된 curl, python3, mkdir 등 실제 쉘 명령과 로그가 캡처된 스크린샷으로, 배포 스크립트가 외부 리소스 접근과 파일 조작을 수행했음을 확인할 수 있다. 파일 다운로드와 스크립트 실행 흔적이 명확히 보이므로 README가 주장하는 자동화된 배포·실행 절차의 존재를 직접적으로 뒷받침한다. 이 캡처는 배포 과정에서 네트워크 접근과 로컬 파일 작업이 수행되는 점을 시각적으로 증명한다.
비교 스크린샷으로 gpt-5.5와 gpt-5.6-sol의 xhigh 설정에서의 응답 차이를 나란히 보여 준다.
이미지는 동일 입력에 대해 gpt-5.5와 gpt-5.6-sol에서의 응답 차이를 시각적으로 비교해 v5·v35 프롬프트의 효과 차이를 보여 주는 증거로 사용된다. 스크린샷 상단의 텍스트와 로그 라인은 특정 프롬프트 버전 전환 후 모델의 행동 변화가 나타났음을 시사하므로 README 표의 정량적 결과와 함께 사용하면 정성적 보강 자료가 된다. 해당 이미지로부터는 v35 적용 시 특정 xhigh 설정에서 성공적으로 작업을 수행한 사례가 존재함이 확인된다.

6.6k

STARS

882

FORKS

+207

TRENDING

4

조회수

watchers 6.6kopen issues 22MIT License

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.