본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

audnai/penclaw-Kimi-K3.0-abliterated-GGUF

레드팀 평가용 거부 행동 조정 — 회색지대 프롬프트 과잉거부 완화, 유해 프롬프트 거부 유지

GGUF 양자화된 Kimi 변형에 독점 후처리를 적용해 회색지대 프롬프트 과잉거부를 낮추면서 유해 프롬프트 거부는 유지하려는 모델(공개 예정).

학습 방식 · GGUF로 양자화된 Kimi 가중치에 상업적 NDA로 보호된 독점 후처리(abliteration) 파이프라인을 적용해 거부 행동을 조정한다. 구체 알고리즘은 비공개.

TL;DR

이 저장소는 GGUF로 양자화된 Kimi 계열 변형에 독점 후처리 파이프라인(abliteration)을 적용해, 레드팀 평가에서 회색지대 프롬프트에 대한 과잉 거부를 줄이면서도 명백히 유해한 프롬프트에는 거부를 유지하는 것을 목표로 한다. 효과는 Heretic 프레임워크로 측정하며 유해 프롬프트 거부 횟수와 무해 프롬프트에 대한 KL 발산을 함께 살펴 거부 완화와 성격 유지 사이의 트레이드오프를 수치화한다. 앞서 적용한 Kimi K2.6 F 변형에서는 거부 횟수 3/100이 보고됐지만, 이 저장소의 대상인 Kimi K3.0 가중치와 상세 논문·평가는 아직 공개되지 않았고 접근도 게이트로 제한돼 있다. 구체적인 abliteration 알고리즘은 상업적 NDA로 보호돼 공개 시점까지 기술적 재현이나 일반화 가능성을 판단하기 어렵다.

핵심 포인트

  • 회색지대 프롬프트의 과잉 거부는 낮추고 유해 프롬프트의 거부는 유지하는 이중 목표를 Heretic 평가(거부 횟수 + 무해 KL 발산)로 수치화한다.
  • GGUF로 양자화된 가중치 위에서 재학습 없이 후처리만으로 거부 행동을 조정한다는 점이 일반적인 그래디언트 기반 재튜닝과 다르다.
  • 구체적인 abliteration 알고리즘은 상업적 NDA로 보호돼 있어, 공개 논문과 전체 평가가 나올 때까지 기법의 세부는 비공개다.
  • 본 대상인 Kimi K3.0 가중치는 아직 공개되지 않았고, 확인 가능한 수치는 Kimi K2.6 F 변형의 거부 3/100뿐이다.

제한사항

  • abliteration의 구체적 알고리즘이 상업적 NDA로 보호돼 있어 외부에서 기술적 재현이나 검증이 불가능하다.
  • 이 저장소가 대상으로 하는 Kimi K3.0 가중치와 전체 평가 데이터가 아직 공개되지 않아, 현재 확인 가능한 성과는 별도 변형(Kimi K2.6 F)의 예비 결과 하나뿐이다.
  • 과거 유사 시도들에서 과잉 거부(benign KL 급증)나 코드 생성 손상 같은 부작용이 보고된 바 있어, 이 방법도 검증 전까지는 같은 위험을 배제할 수 없다.

벤치마크

벤치마크지표비교
Kimi K2.6 — F VariantRefusal Count3/100

122

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.