본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

elder-plinius/OBLITERATUS

Python0 / 0

Hugging Face 모델의 거부 표현을 찾아 가중치 projection이나 추론 steering으로 제거하는 Python 연구 도구입니다.

TL;DR

OBLITERATUS는 Hugging Face Transformers 모델에서 거부 응답을 유발하는 내부 방향을 activation probing과 SVD로 추출한 뒤 가중치 projection 또는 추론 시 steering으로 제거하는 Python 연구 도구입니다. Gradio 기반 Hugging Face Spaces와 Colab에서는 설치 없이 사용할 수 있고, 로컬 CLI·Python API·YAML 설정·SSH 원격 실행으로 반복 실험을 자동화할 수 있습니다. refusal rate, perplexity, coherence, KL divergence를 이용해 거부 제거와 일반 능력 보존의 trade-off를 측정하며 15개 분석 모듈과 1,500개 초과 테스트를 포함합니다. 다만 영구적으로 safety guardrail을 제거한 모델을 만드는 도구이므로 일반 서비스 배포보다 alignment 연구, red-teaming, 안전성 평가에 적합하고 GPU 메모리와 모델 저장 공간 요구량이 큽니다.

핵심 포인트

  • OBLITERATUS는 Hugging Face Transformers 모델의 거부 응답 관련 표현을 찾아 가중치에서 제거하는 Python 기반 독립형 연구 도구입니다. CLI, Gradio 웹 UI, Google Colab, Python API를 제공해 코드 없이 실행하거나 실험 파이프라인에 통합할 수 있습니다. Hugging Face Spaces와 Colab에서 바로 실행할 수 있고, 로컬에서는 CUDA GPU와 모델 저장 공간을 직접 확보해야 합니다.
  • 파이프라인은 제한·비제한 프롬프트의 activation을 수집하고 PCA, mean-difference, SVD, Whitened SVD로 거부 방향을 추출한 뒤 해당 방향을 가중치와 bias에서 projection하는 방식입니다. `basic`부터 `nuclear`까지 여러 preset을 제공하며, `advanced`는 SVD와 norm preservation, bias projection, 2회 반복을 사용하고 `informed`는 분석 결과에 따라 방향 수와 수정 레이어를 자동 조정합니다. 수정 전후 refusal rate, perplexity, coherence, KL divergence를 측정하므로 모델 능력 손상을 확인하면서 실험할 수 있지만, 결과 모델의 안전 장치가 제거되는 목적 자체는 운영 서비스와 맞지 않습니다.
  • 일반적인 abliteration 외에도 Cross-Layer Alignment, Concept Cone Geometry, Alignment Imprint Detection, Defense Robustness 등 15개 분석 모듈을 제공해 거부 표현의 위치와 구조를 연구할 수 있습니다. `steering vectors`는 모델 가중치를 바꾸지 않고 추론 중 특정 레이어에 방향을 더하거나 빼는 방식이라 `manager.remove()`로 원상 복구할 수 있습니다. 반면 weight projection은 영구 수정이므로 재현 가능한 실험에는 YAML 설정과 결과 metadata를 함께 보존하는 편이 적합합니다.
  • 대규모 모델 실행은 `accelerate`의 `device_map="auto"`를 이용한 pipeline parallelism으로 여러 GPU에 레이어를 나누며, GPU 수를 늘려도 계산이 빨라지는 구조가 아니라 메모리 부족을 해결하는 방식입니다. README의 GPT-OSS-120B 실험에서는 A100-80GB 4장이 615초로 8장의 633초보다 빨랐고, DeepSeek-R1-Distill-Llama-70B는 3장이 536초로 가장 빨랐습니다. Hugging Face Spaces, Colab의 T4, 원격 SSH 실행, bitsandbytes 양자화를 지원하지만 대형 모델은 activation과 저장 과정까지 고려한 VRAM 여유가 필요합니다.

벤치마크

벤치마크지표비교
GPT-OSS-120B 파이프라인 실행총 소요 시간615초 (A100-80GB 4장)A100-80GB 8장은 633초였으며, 4장이 3% 더 빠름
DeepSeek-R1-Distill-Llama-70B 파이프라인 실행총 소요 시간536초 (A100-80GB 3장)A100-80GB 4장과 8장은 각각 626초와 627초로 17% 느림
Tagged-release CPU 테스트 스위트테스트 수1,500개 초과README의 최신 테스트 설명 기준 수치이며 모델 다운로드·CUDA 등 환경 의존 테스트는 별도 워크플로에서 실행
지원 모델 사전큐레이션 모델 수116개, 5개 compute tier

8k

STARS

1.5k

FORKS

+204

TRENDING

0

조회수

watchers 8kopen issues 8GNU Affero General Public License v3.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.