본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

OBLITERATUS/Qwen3.8-27B-OBLITERATED

안전 거부 동작을 제거한 대화형 텍스트 생성27Bapache-2.0

SVD와 LEACE 가중치 혼합으로 거부율 0%와 MMLU 86.3%를 겨냥한 Qwen3.8-27B 변형

학습 방식 · Qwen/Qwen3.8-27B 기반의 abliteration 가중치 수술 모델로, 공격적인 SVD 방식과 capability 보존을 겨냥한 LEACE 방식의 결과를 각각 만든 뒤 60% 대 40%로 혼합했습니다.

TL;DR

이 모델은 Qwen/Qwen3.8-27B의 가중치에서 안전 거부 방향을 제거한 V2 abliteration 모델이며, 일반적인 Fine-tuning이나 단순 양자화 변형이 아닙니다. 공격적인 SVD 수술은 거부 축을 깊게 제거하지만 capability를 손상시키고, LEACE 수술은 capability를 더 보존하는 대신 거부 잔여를 남기는 특성이 있어 두 결과를 60% 대 40%로 혼합했습니다. 그 결과 MMLU 0-shot은 기본 모델의 85.3%에서 86.3%로 올라갔고, 공개된 V2 표본에서는 거부율 0%를 기록했으며 실사용 과제는 8개 중 7개를 통과했습니다. 다만 전체 842개 거부 평가와 전체 MMLU 검증이 끝나지 않았고, 사용 시 temperature 0, repetition_penalty 1.15, max_new_tokens 2048 이상 설정이 권장됩니다.

핵심 포인트

  • SVD와 LEACE의 서로 다른 손상을 상쇄하도록 가중치를 60 대 40으로 혼합했습니다.
  • 거부율을 낮추면서 MMLU 점수를 기본 모델보다 1.1%포인트 높였습니다.
  • temperature 0과 repetition_penalty 1.15가 코드 중심 출력의 반복을 줄이는 핵심 설정입니다.
  • GGUF, Safetensors, MLX 형식으로 배포해 llama.cpp와 Apple Silicon에서도 실행할 수 있습니다.

제한사항

  • 842개 harmful prompt 전체에 대한 V2 검증은 아직 진행 중이며, 현재 공개된 표본은 52개입니다.
  • Multi-tool chain 과제는 V2와 기본 모델 모두 통과하지 못해 복합 도구 호출에 한계가 있습니다.
  • MLX 4-bit와 8-bit 양자화 파일은 V1 기반이며 V2용 파일로 갱신될 예정입니다.

벤치마크

벤치마크지표비교
MMLU lm-eval 0-shotaccuracy86.3% ±0.014 (n=570)기본 Qwen3.8-27B 85.3% 대비 +1.1pp이며, 전체 14k 문항 검증은 진행 중
Refusal Rate Hard-10refusal rate0/10 (0%)V1과 V2 모두 10개 프롬프트에서 거부 0건
Refusal Rate 842-Corpusrefusal rate0/52 (0%) 표본V2 무작위 52개 표본 기준 공개 수치이며, 전체 842개 검증은 진행 중
Advanced Real-World Taskstask success7/8기본 Qwen3.8-27B와 동일하며, ReAct·비동기 리팩터링·Kubernetes 디버깅 등을 통과하고 Multi-tool chain은 실패

255

Likes

4.4k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.