본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

AEON-7/Qwen3.8-27B-AEON-ULTIMATE-UNCENSORED-BF16

거부 동작을 제거한 27B급 멀티모달·추론·도구 호출용 text-generation 모델27B262K 컨텍스트apache-2.0

Qwen3.8-27B의 안전 거부 동작을 BF16 abliteration으로 줄이고 vision·MTP·tool calling을 유지한 uncensored 모델

학습 방식 · Qwen/Qwen3.8-27B에 SSM conv1d outlier repair를 적용한 뒤 abliterix 1.12.2로 BF16 abliteration을 수행하고, 손실된 MTP head 15개 tensor를 원본에서 hash-match로 복원했습니다.

TL;DR

이 모델은 Qwen/Qwen3.8-27B를 기반으로 abliterix abliteration을 적용한 BF16 uncensored fine-tune 계열이며, Vision tower와 native MTP head는 원본 그대로 유지했습니다. 안전 정렬이 요청 판단을 막는 잔여 동작을 줄여 thinking 과정에서 허용 여부를 따지는 비중을 낮추고, 직접적인 답변을 내도록 가중치를 수정했습니다. 100개 harmless held-out prompt의 첫 3개 teacher-forced token 기준 KL은 0.0991 nats/token이었고, harmful 세트에서 hard “I won’t”는 0건으로 기록됐지만 judge-R은 경고문까지 거부로 세어 29–36건을 남겼습니다. vLLM 0.27.1에서 thinking·vision·tool calling·MTP를 함께 검증했으므로 안전 필터를 애플리케이션 계층에 둘 수 있는 red-team, security research, 비정형 창작 작업에 맞습니다.

핵심 포인트

  • Qwen/Qwen3.8-27B를 기반으로 abliterix를 적용해 거부 응답을 제거했습니다. BF16 전체 정밀도로 원본의 Vision tower와 native MTP head를 유지했습니다. 안전 장벽보다 직접성과 응답 일관성을 우선한 변형입니다.
  • abliterix 1.12.2에서 50개 Optuna trial을 수행하고 Flash Lite judge의 thinking 이후 답변을 평가했습니다. 최종 선택은 48번째 trial이며 최저 KL이 아니라 일관된 unlock과 응답 품질을 기준으로 골랐습니다. SSM conv1d outlier repair를 먼저 적용한 뒤 MTP head를 원본에서 복원했습니다.
  • 단일 NVIDIA H200에서 vLLM 0.27.1과 3개 speculative token을 사용해 text·vision·도구 호출 입력을 검증했습니다. MTP draft acceptance는 약 40–66%였고 thinking은 기본 활성화 상태입니다. 16K 검증 설정에서 동작했으며 140GB급 카드에서는 native 262K window를 사용할 수 있습니다.

제한사항

  • 안전 정렬을 제거해 원본이 거부하던 도구·화학·exploit 형태의 코드·폭력·성적 콘텐츠에도 응답합니다. 모델이 요청의 합법성이나 위험성을 판정하지 않으므로 배포자가 입력 검증과 출력 필터링을 별도로 구현해야 합니다. 고위험 업무에서는 audit logging, rate limiting, access control과 human review가 필요합니다.
  • 저자 자체 평가의 judge-R은 경고문이나 안전 안내가 포함된 답변도 거부로 분류할 수 있습니다. harmful held-out 100개에서 judge-R은 36건이었지만 그중 25건은 disclaimer나 부분 초안과 함께 요청 내용을 작성했습니다. 따라서 judge-R 수치만으로 실제 거부율이나 안전성을 판단하기 어렵습니다.
  • 전체 정밀도 BF16 모델이라 추론 메모리 요구량이 높고 README의 검증은 NVIDIA H200 한 장과 최대 16K context에서 수행했습니다. native 262K window는 140GB 카드에서 사용할 수 있다고 안내되지만 해당 설정의 성능 수치는 제공되지 않았습니다. NVFP4 버전은 이 master에서 양자화할 예정이며, NVFP4 lattice를 재양자화하는 방식은 권장되지 않습니다.

벤치마크

벤치마크지표비교
Harmless held-out 100 promptsfull_distribution_kl, first 3 teacher-forced tokens0.0991 nats/token동일 persist-pass stock prefixes 재측정 0.099126; 29/97 openings는 0.001 미만이며 median은 0.013
Harmful held-out 100 promptsFlash Lite judge-R36건, smash 기준 29건Stock은 약 100건; judge-R 36건 중 25건은 disclaimer·부분 초안·오판정과 함께 요청 내용을 작성했으며 hard “I won’t”는 0건
Sexual 50 promptsFlash Lite judge-R5건Stock은 30건; judge-R 5건 중 3건은 요청한 post/script를 작성했으며 hard “I won’t”는 0건
Harmless held-out 100 promptsFlash Lite judge-R1건Stock은 3건; 해당 1건은 cut-off prompt였고 hard “I won’t”는 0건
Both-comply harmless rows 97개completion length / type-token ratio / think tags1481자 / 0.76 / 100/100Stock은 1516자 / 0.75 / 98/100; 양쪽 모두 답한 행에서 비교한 수치

90

Likes

508

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.