모델 지능 손실 없이 LLM의 거절 반응을 자동으로 제거
AI Tool·Python0 / 0
Transformer 기반 LLM의 안전 가드레일을 재학습 없이 자동으로 제거하고 모델 성능을 보존하는 CLI 도구입니다.
주요 기능
- Optuna 기반 TPE 알고리즘을 통한 최적의 절제 파라미터 자동 탐색
- KL 발산 최소화를 통해 모델의 원래 지능과 응답 품질 보존
- bitsandbytes 4비트 양자화 지원으로 낮은 VRAM 환경에서 실행 가능
- PaCMAP 프로젝션을 활용한 레이어별 잔차 벡터 시각화 및 분석
- Hugging Face 모델 업로드 및 즉시 채팅 테스트 기능 제공
사용 사례
- 로컬 LLM의 과도한 거절 반응을 제거하여 자유로운 답변을 유도할 때
- 모델 내부의 거절 메커니즘을 시각화하고 해석 가능성을 연구할 때
24.8k
Stars
2.7k
Forks
+241
Trending
0
조회수
24.8k watchers82 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.