Qwen 3.5 기반 9B 장문·무검열 대화 모델
Qwen 3.5를 기반으로 Heretic으로 검열 필터를 제거한 9B 파인튜닝 모델로서 100만 토큰 이상 컨텍스트와 GGUF 양자화 옵션을 제공한다.
TL;DR
이 모델은 Qwen 3.5를 기반으로 한 9B 규모의 파인튜닝 배포본으로서 장문 컨텍스트(100만 토큰 이상)와 함수 호출·도구 사용을 염두에 둔 텍스트 생성 기능을 로컬 환경에서 제공한다. 학습에는 합성 데이터 약 5억 토큰이 사용되었고 Heretic LLM을 적용해 검열 필터를 제거한 uncensored 응답 특성을 가지며 Apache-2.0 라이선스로 배포된다. 배포 패키지에는 bf16과 여러 GGUF 양자화 버전이 포함되어 있어 게이밍 노트북 같은 저자원 환경에서도 Q8_0 또는 Q4_K_M 옵션으로 실행할 수 있도록 설계되었으나 Q2_K는 정상 작동하지 않는 것으로 표기되어 있다. 벤치마크 이미지는 성능 경향을 제시하나 본문에 수치 표가 없어 정량적 비교를 위해서는 원본 데이터 확보가 필요하다.
핵심 역량
- 이 모델은 100만 토큰을 초과하는 컨텍스트 창을 사용해 장문 문서와 긴 대화 이력을 한 세션에서 유지하며 응답을 생성할 수 있다. 긴 컨텍스트를 입력으로 받아 토큰 간 장기 의존성을 유지하는 시나리오에서 문맥 일관성을 확보할 수 있다. 대규모 문서 분석·장문 요약·연속성 있는 멀티턴 대화에 유리하다.
- 이 모델은 함수 호출과 도구 사용 태그가 포함되어 있어 외부 도구와 결합한 체인의 일부로 동작할 수 있다. 토큰화된 메시지 입력을 통해 API 방식으로 도구 호출 지시를 포함한 생성이 가능하며, 샘플링 파라미터로 출력 다양성을 조정할 수 있다. 이러한 특성은 자동화된 작업 지시나 플러그인 연동 시에 유용하다.
- 모델은 수리·물리·화학 등 전문 영역의 질의에 대해 합성 데이터로 확장된 학습으로 보다 상세한 응답을 생성할 수 있도록 설계되었다. README는 공격·바이오·사이버 보안 같은 민감 영역에서의 응답 제약을 제거해 해당 분야의 세부 질의에 직접적인 답변을 제공한다는 점을 명시하고 있다. 민감 분야 응답의 위험성은 존재하므로 운영 환경에서의 사용 정책 검토가 필요하다.
- 양자화된 GGUF 파일을 통해 로컬 게이밍 하드웨어에서도 실행이 가능하도록 설계되었으며 bf16부터 Q8_0, Q4_K_M 같은 옵션을 제공한다. Q8_0은 게이밍 시스템에 적합하다고 명시되어 있고 Q4_K_M은 품질·성능의 균형을 위한 대안으로 제시되어 있다. 가장 낮은 비트인 Q2_K는 정상 작동하지 않는 것으로 표기되어 있어 사용자 선택 시 주의가 필요하다.
강점
- 대규모 컨텍스트 처리 능력을 제품 차원에서 지원하여 한 번의 세션에서 매우 긴 문서와 대화 이력을 유지한 채로 생성할 수 있다. 100만 토큰을 초과하는 컨텍스트 창은 장문 요약과 장기 추적 대화 같은 사용 사례에서 실질적 이점을 제공한다. 로컬 환경에서 긴 컨텍스트를 처리하려면 토크나이저·메모리 관리 전략을 병행해야 한다.
- GGUF 양자화 포맷으로 bf16에서 Q8_0, Q4_K_M 등 여러 옵션을 제공하여 사용자의 하드웨어 제약에 맞춰 실행 환경을 조정할 수 있다. README에서는 Q8_0을 게이밍 시스템에 적합하다고 표기하여 실용적 실행 가능성을 근거로 제시하고 있다. 가장 낮은 비트 옵션인 Q2_K는 정상 동작하지 않는 것으로 표기되어 있어 최저 비트 추론의 실무 적용에는 제약이 있다.
- Apache-2.0 라이선스로 배포되어 상업적 이용과 재배포 측면에서 비교적 유연한 허용 범위를 갖고 있다. 라이선스 조건은 모델을 통합한 제품이나 서비스에서 법적 준수를 설계할 때 중요한 고려사항이다. 다만 민감 분야 응답의 비검열 특성은 별도의 규제·윤리 검토를 필요로 한다.
훈련 방식
기본적으로 Qwen 3.5 기반 모델을 대상으로 full-fine-tune(SFT) 방식으로 추가 학습을 수행했으며 학습 데이터로는 합성 데이터 약 5억 토큰을 사용했다고 명시되어 있다. 합성 데이터는 README에 따르면 GPT 5.5, Claude 4.8 Opus, Claude 5 Fable 등 상용 수준 모델이 생성한 샘플을 포함한다. 학습 후 Heretic LLM 라이브러리를 적용해 응답 필터를 제거한 형태로 배포되었다.
알아두면 좋은 것
- 이 모델은 Qwen/Qwen3.5-9B와 MaralGPT/MaralGPT-Mythos-9B-2606 두 가지 기반 정보를 메타데이터에 포함하고 있으며 Apache-2.0 라이선스를 적용한다. 합성 데이터 5억 토큰을 학습에 사용했다고 명시하여 학습 데이터의 규모와 출처가 README에 반영되어 있다. 라이선스와 데이터 출처 표기는 배포·상업적 사용 가능성과 재현성 측면에서 중요한 근거가 된다.
- README는 Heretic LLM 라이브러리를 이용해 '윤리적 장벽'을 제거했다고 명시하여 검열 필터가 의도적으로 비활성화되었음을 드러낸다. 이로 인해 사이버보안·바이오·화학 분야에서 모델이 제한 없이 응답하도록 동작하도록 설계되어 있음을 확인할 수 있다. 해당 특성은 민감한 도메인에서의 사용 위험과 규제 준수 문제를 수반한다.
- 모델 배포 파일로 다양한 양자화 버전을 제공하며 bf16, Q8_0, Q4_K_M, Q2_K 항목을 표로 제시하고 Q2_K는 작동하지 않는 것으로 표기했다. Ollama 실행 예시와 Transformers 기반 파이썬 예시가 함께 제공되어 로컬 환경에서의 테스트 및 배포 경로가 명확하다. 생성 파라미터 예시로 temperature=0.6, top_p=0.95, top_k=20를 제시하여 재현 가능한 생성 설정을 안내하고 있다.
- 벤치마크 이미지는 존재하나 본문 텍스트에는 구체적 수치 표기가 부족하여 시각 자료만으로는 세부 성능 비교가 불가능하다. 벤치마크 차트의 해석에는 생성 파라미터 변경에 따라 결과가 달라질 수 있다는 주석이 함께 제공되어 있다. 따라서 정량적 평가를 위해서는 원본 차트의 데이터 포인트나 표형식의 수치가 추가로 필요하다.
기술적 특징
- README는 이 모델이 Qwen 3.5 기반의 9B 파라미터 모델을 바탕으로 추가 파인튜닝을 거쳐 생성되었다고 명시한다. 파인튜닝에는 합성 데이터 약 5억 토큰이 사용되었으며 이 데이터는 다른 고성능 모델들이 생성한 샘플을 포함한다. 이러한 학습 파이프라인은 SFT 성격을 띠어 태스크 특화 성능 향상과 응답 스타일 조정에 기여한다.
- 컨텍스트 창이 100만 토큰을 초과한다고 README에 표기되어 있어 장문 처리에 초점을 둔 설계가 핵심 차별점이다. 컨텍스트 용량이 크면 장기 의존성 유지와 긴 문서의 단일-호출 처리에 적합하나 메모리·토큰화 처리 비용이 증가한다. 실제 운영에서는 컨텍스트 분할, 스트리밍 처리, KV 캐싱 등과 결합해 효율을 확보해야 한다는 점이 관련 기술적 고려사항이다.
- 배포 파일로 GGUF 양자화 버전들을 제공해 다양한 하드웨어에서 실행 가능하도록 지원한다. README는 bf16 원본과 Q8_0, Q4_K_M 변형을 명시하고 Q2_K는 작동하지 않는 것으로 표기하여 각 양자화 옵션의 실용성을 구분했다. 이 접근은 사용자가 메모리·속도·품질 사이에서 현실적인 트레이드오프를 선택할 수 있도록 설계된 배포 전략이다.
- Heretic LLM 라이브러리 사용으로 응답 필터링이 비활성화된 상태로 배포되어 민감 도메인에서의 자유로운 질의응답이 가능하다. 필터 제거는 모델이 보이는 답변의 범위를 넓히는 효과가 있으나 그에 따른 안전성과 규제 준수 리스크가 병존한다. 운영 환경에서는 별도의 안전 장치나 액세스 제어가 필요하다.
- 배포 예시에 Ollama 실행 커맨드와 Transformers 기반 파이썬 코드가 함께 포함되어 있어 로컬 게이밍 하드웨어와 GPU 환경에서의 즉시 실행을 고려한 배포 흐름을 제공한다. 파이썬 예시는 bfloat16과 device_map 설정으로 GPU 메모리 매핑을 활용하는 방식을 보여주며 생성 파라미터 샘플을 통해 재현 가능한 테스트 조건을 제시한다. 이러한 실행 가이드는 개발자가 실전 환경에서 모델을 빠르게 기동할 수 있게 한다.
차별점
- 모델은 100만 토큰을 초과하는 매우 큰 컨텍스트 창을 전면에 내세우며 장문 처리 역량을 차별점으로 제시한다. 대부분의 공개 모델이 수만 토큰 단위의 컨텍스트를 제공하는 것과 비교해 용량 측면에서 구분된다. 다만 대규모 컨텍스트를 실제로 활용하려면 토큰화·메모리·스트리밍 최적화가 병행되어야 한다.
- Heretic LLM 기반으로 필터를 제거한 uncensored 설정을 주요 특성으로 삼아 민감 분야 질의 응답을 제한 없이 수행하도록 설계되었다. 이로 인해 사이버보안·바이오·화학 분야에서 상세한 기술적 질의에 접근할 수 있으나 안전성과 규정 준수 측면에서 심층 검토가 필요하다. 운영자는 응답 제어와 접근 정책을 별도로 마련해야 한다.
- 다양한 GGUF 양자화 버전을 공식으로 제공하여 로컬 게이밍 하드웨어에서도 실행 가능하다는 점을 실용적 차별점으로 제시한다. Q8_0을 게이밍 시스템용으로 권장하고 Q4_K_M을 품질 대 자원 타협안으로 배치한 점이 특징이다. 최저 비트 옵션(Q2_K)은 정상 작동하지 않는다고 명시하여 실무 적용 가능 범위를 명확히 하고 있다.
이미지 분석


52
Likes
6.6k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.