본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

orcarouter/Qwen3.8-Flash-Next-Uncensored-GGUF

이미지-텍스트 생성 및 멀티모달 추론MoE (512 experts)8K 컨텍스트apache-2.0

Qwen3.8-Flash-Next의 안전성 필터를 제거하고 비전 및 도구 호출 기능을 강화한 GGUF 양자화 모델.

학습 방식 · Qwen3.8-Flash-Next 기반 모델의 잔차 스트림에서 거부 방향을 직교화하여 안전성 정렬을 제거한 abliteration 기법을 적용했다.

TL;DR

Qwen3.8-Flash-Next 모델의 안전성 정렬을 제거한 abliterated 버전으로, 거부 응답 없이 멀티모달 및 추론 작업을 수행한다. Qwen4 MoE 아키텍처를 적용하여 512개 전문가 중 10개만 활성화하는 방식으로 효율적인 추론을 지원하며, 비전과 도구 호출 기능을 갖췄다. llama.cpp 환경에서 구동하기 위해 특정 아키텍처 지원 PR 빌드가 필요하며, 2비트에서 6비트까지 다양한 양자화 옵션을 제공한다. 안전성 필터가 제거된 만큼 연구 및 레드팀 평가 목적으로만 사용해야 한다.

핵심 포인트

  • Qwen3.8-Flash-Next 모델의 안전성 필터를 제거한 abliterated 버전으로, 거부 응답 없이 모든 요청에 대응한다.
  • Qwen4 MoE 아키텍처를 기반으로 하며, 512개 전문가 중 10개를 활성화하여 추론 효율성을 극대화했다.
  • 비전, 도구 호출, 추론 기능을 포함하며 llama.cpp를 통해 CPU, CUDA, Metal 등 다양한 환경에서 구동 가능하다.
  • qwen4_exp 아키텍처를 지원하기 위해 llama.cpp의 특정 PR 빌드(PR #27742)가 필수적으로 요구된다.

제한사항

  • 안전성 필터가 제거되어 유해하거나 불법적인 요청에도 응답하므로 사용 시 주의가 필요하다.
  • qwen4_exp 아키텍처를 지원하는 llama.cpp의 특정 PR 빌드(PR #27742)가 없으면 모델 로드가 불가능하다.
  • MTP(Multi-Token Prediction) 헤드를 포함하지 않아 관련 기능은 지원하지 않는다.

벤치마크

벤치마크지표비교
Harmful-prompt refusal ratePercentage0–3.3%vs Base Qwen3.8-Flash-Next (64–100%)

99

LIKES

20.3k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.