p-e-w/heretic
Python15 / 0
Optuna 기반의 자동화된 directional ablation으로 LLM의 검열을 제거하고 모델 지능을 보존하는 CLI 도구.
TL;DR
Heretic은 LLM의 검열(safety alignment)을 제거하는 완전 자동화 도구이다. directional ablation 기법을 기반으로, Optuna를 활용해 거부 응답 감소와 모델 지능 유지(KL divergence 최소화) 사이의 최적 파라미터를 자동으로 탐색한다. 기존 수동 방식과 달리 레이어별 가중치 커널과 보간된 residual direction을 사용하여 성능 저하를 최소화하며, 복잡한 내부 구조 이해 없이 CLI 명령 한 줄로 모델을 decensor할 수 있다.
핵심 포인트
- Optuna를 활용한 자동화된 directional ablation으로 LLM의 검열을 제거하며, 수동 튜닝 없이 최적의 파라미터를 탐색한다.
- 레이어별로 유연한 ablation 가중치 커널을 적용하고 residual direction을 보간하여, 모델의 지능 손실을 최소화하면서 거부 응답을 억제한다.
- 복잡한 내부 구조 이해 없이 CLI 명령 한 줄로 실행 가능하며, 다양한 dense 및 MoE 아키텍처를 지원한다.
- residual vector 시각화 및 기하학적 분석 기능을 제공하여 모델 내부 해석 가능성 연구를 지원한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Gemma-3-12b-it Refusal Suppression | Refusals (out of 100) | 3 | 원본 모델 97/100 대비 획기적 감소, 타 abliteration 방식 대비 최저 KL divergence(0.16) 달성 |
이미지 분석
29.6k
STARS
3.2k
FORKS
+219
TRENDING
15
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.