본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8

이미지와 텍스트를 함께 입력받는 multimodal 텍스트 생성 및 reasoning552B backbone, 토큰당 8B/16B 활성화1K 컨텍스트MIT

DeepSeek-V4.1-Flash의 안전 거부 회로를 weight-level abliteration으로 제거한 1M-token multimodal FP8 MoE 모델

학습 방식 · DeepSeek-V4.1-Flash 기반 weight-level abliteration으로 안전 거부 회로를 제거했으며, routed experts·Engram memory·CSA2 sparse attention·DSpark draft head·vision tower 등 핵심 구성요소는 base와 byte-identical하게 유지했습니다.

TL;DR

이 모델은 DeepSeek-V4.1-Flash를 기반으로 안전 거부 회로를 weight-level abliteration으로 제거한 native FP8 multimodal MoE 체크포인트입니다. 별도 `model.py`, runtime hook, steering vector 없이 표준 체크포인트처럼 로드하며, routed experts·Engram memory·CSA2 sparse attention·DSpark draft head·vision tower는 base와 byte-identical하게 유지됩니다. 1M-token context, image input, tools, reasoning을 지원하고 HarmBench-320에서 100.00% ASR을 기록했지만, MMLU는 base의 86.96%에서 82.74%로 낮아졌습니다. 552B backbone과 4×H200급 실행 환경이 필요해 일반적인 단일 GPU 추론보다는 대규모 서버 배포에 맞습니다.

핵심 포인트

  • base의 핵심 가중치를 유지한 채 weight-level abliteration으로 안전 거부 회로만 제거한 drop-in 체크포인트입니다.
  • 552B backbone에서 토큰당 8B/16B만 활성화하는 MoE 구조와 native FP8·FP4 양자화를 사용합니다.
  • HarmBench-320에서 effort=off와 max 모두 CRACK ASR 100.00%를 기록했으며, MMLU는 82.74%입니다.
  • SGLang preview branch에서 TP4·EP4로 구동하며, 4×H200 기준 DSpark 사용 시 단일 스트림 113 tok/s입니다.

제한사항

  • CRACK의 MMLU 정확도는 base 86.96%에서 82.74%로 4.22%p 낮아졌으며, ethics cluster를 제외한 나머지 항목에서도 약 1.1%p 하락했습니다.
  • 실행에는 SGLang의 DSV4.1 지원 경로와 TP4·EP4 설정이 필요하며, 552B weights 약 510GB로 4×H200 또는 그 이상 규모의 NVLink 환경이 요구됩니다.
  • 1M-token context에서 안전한 최대 동시 요청 수는 12이며, 1M context와 높은 동시성 조합은 OOM을 일으킬 수 있습니다.

벤치마크

벤치마크지표비교
HarmBench-320 effort=offASR320/320 = 100.00%base 137/320 = 42.81%, CRACK 대비 +57.19%p
HarmBench-320 effort=maxASR320/320 = 100.00%base 5/320 = 1.56%, CRACK 대비 +98.44%p
MMLU-14k full test setaccuracy11,619/14,042 = 82.74%base 12,211/14,042 = 86.96%, CRACK 대비 -4.22%p
MMLU-14k ethics cluster 제외accuracy delta약 -1.1%pbase 대비 나머지 약 11k 항목에서 측정된 차이
SGLang 단일 스트림 decodethroughput113 tok/s4×H200, DSpark + cap-accept + profiled SPS table 사용 시; speculation 미사용 시 101 tok/s
SGLang 8-way concurrentaggregate throughput126 tok/s4×H200 환경 측정값

116

LIKES

2.3k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.