본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

p-e-w/heretic

Python15 / 0

Optuna 기반의 자동화된 directional ablation으로 LLM의 검열을 제거하고 모델 지능을 보존하는 CLI 도구.

TL;DR

Heretic은 LLM의 검열(safety alignment)을 제거하는 완전 자동화 도구이다. directional ablation 기법을 기반으로, Optuna를 활용해 거부 응답 감소와 모델 지능 유지(KL divergence 최소화) 사이의 최적 파라미터를 자동으로 탐색한다. 기존 수동 방식과 달리 레이어별 가중치 커널과 보간된 residual direction을 사용하여 성능 저하를 최소화하며, 복잡한 내부 구조 이해 없이 CLI 명령 한 줄로 모델을 decensor할 수 있다.

핵심 포인트

  • Optuna를 활용한 자동화된 directional ablation으로 LLM의 검열을 제거하며, 수동 튜닝 없이 최적의 파라미터를 탐색한다.
  • 레이어별로 유연한 ablation 가중치 커널을 적용하고 residual direction을 보간하여, 모델의 지능 손실을 최소화하면서 거부 응답을 억제한다.
  • 복잡한 내부 구조 이해 없이 CLI 명령 한 줄로 실행 가능하며, 다양한 dense 및 MoE 아키텍처를 지원한다.
  • residual vector 시각화 및 기하학적 분석 기능을 제공하여 모델 내부 해석 가능성 연구를 지원한다.

벤치마크

벤치마크지표비교
Gemma-3-12b-it Refusal SuppressionRefusals (out of 100)3원본 모델 97/100 대비 획기적 감소, 타 abliteration 방식 대비 최저 KL divergence(0.16) 달성

이미지 분석

Heretic 실행 시의 CLI 출력 화면
모델 로딩, 프롬프트 로드, 배치 사이즈 최적화 및 평가 과정을 나타낸다. 자동화된 파이프라인의 실행 단계를 실시간으로 확인 가능하다.
Harmful/Harmless 프롬프트에 대한 residual vector의 PaCMAP 투영
레이어별 residual vector의 분포를 시각화하여 모델 내부의 의미론적 변화를 분석한다. 연구용 기능으로 모델 내부 해석 가능성을 지원한다.
Ablation weight kernel 구조도
MLP 및 Attention 레이어에 적용되는 ablation 가중치 커널의 파라미터(max_weight, position 등)를 도식화한다. 유연한 가중치 조절 방식을 이해하는 데 도움을 준다.

29.6k

STARS

3.2k

FORKS

+219

TRENDING

15

조회수

watchers 29.6kopen issues 81GNU Affero General Public License v3.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.