8/4비트에서 ARC-C 700을 돌파한 Qwen3.6-27B 멀티스테이지 파인튜닝 배포
Qwen3.6-27B 기반을 멀티스테이지로 파인튜닝하고 Heretic/ARA 비검열 기법과 NEO IMATRIX·MTP GGUF 양자화를 결합해 장문맥·비전·추론 성능을 개선한 멀티모달 모델이다.
TL;DR
이 배포판은 Qwen3.6-27B를 기반으로 멀티스테이지 파인튜닝과 병합을 거쳐 Heretic(ARA) 기반의 decensoring을 적용하고 NEO IMATRIX·MTP 형태의 GGUF 양자화 아티팩트를 함께 제공하여 저비트폭 환경에서도 추론 품질을 유지하도록 설계되었다. Nightmedia 벤치와 README의 수치에서는 mxfp8 기준 arc/c 0.711 등 낮은 비트폭 모드에서도 경쟁력 있는 성능을 보였으며 에이전트형 코딩, 장문맥 처리, 멀티모달 VQA 계열에서 우수한 결과를 기록했다. 운영 측면에서는 Regular와 MTP 양자화 간 토큰 수용률과 온도·rep_penalty 설정에 따른 속도·품질 트레이드오프가 존재하며 비전 기능은 별도 mmproj 파일을 배치해야 활성화된다는 제한이 있다.
핵심 역량
- 모델은 이미지와 텍스트를 합쳐 받아 자연어 응답을 생성할 수 있으며 비전 입력 활성화를 위한 별도 mmproj 파일을 통해 VQA 및 이미지 기반 추론을 수행한다. 이 모델은 장문맥 처리를 염두에 둔 구성으로 긴 대화 히스토리와 대규모 컨텍스트 윈도우를 처리할 수 있으며 README에 256k~262k 수준의 문맥 길이가 기술되어 있다. 또한 지침 준수와 문제 해결 능력이 향상되도록 다중 스테이지 파인튜닝이 적용되어 복합 질의에 대한 추론·계획 응답이 개선되었다.
- 모델은 코딩·에이전트 작업에서 리포지토리 수준의 추론과 파일 편집 워크플로를 지원하도록 튜닝되어 SWE-bench 계열과 LiveCodeBench 등의 에이전트·코딩 벤치마크에서 성능을 보였다. README에는 에이전트형 코딩 워크로드에 적합한 설정(temperature, top_p, top_k 등)이 권장값으로 제시되어 있어 실제 서비스 통합 시 추론 하이퍼파라미터 조정이 가능하다. MTP 양자화 모드는 다중 토큰 예측 동작을 활용해 특정 상황에서 처리량을 높일 수 있도록 설계되었다.
- 양자화된 GGUF 아티팩트(Regular / MTP)와 NEO IMATRIX 변형을 함께 배포하여 낮은 비트폭 환경(4bit/8bit)에서도 정확도를 유지하면서 로컬 소비자 하드웨어에서 실행될 수 있게 구성되었다. README는 출력 텐서 일부를 16비트로 유지하는 하이브리드 정밀도 접근을 도입했고, 이로 인해 양자화 상태에서의 품질 저하를 경감했다고 보고하고 있다. 또한 MTP 설정 시 온도 및 반복 패널티에 민감하므로 운영 중 하이퍼파라미터 튜닝이 성능과 안정성에 직접적인 영향을 미친다.
강점
- README는 이 모델이 4비트와 8비트 양자화 환경 모두에서 'ARC-C' 기준 700을 초과한 첫 파인튜닝 사례라고 명시하고 있어 낮은 비트폭에서도 고성능을 달성한 점을 강점으로 제시한다. 이 수치 근거로 낮은 정밀도 모드(mxfp4/mxfp8)에서도 벤치마크 점수 유지가 확인되었다고 표기되어 있다. 소비자 하드웨어에서 실행 가능한 GGUF 아티팩트를 배포해 실사용 측면의 접근성을 높였다는 점도 실용적 강점이다.
- Nightmedia 벤치 및 README 표에서는 Qwen3.6-27B Fable Fusion이 Qwen3.6-27B 기반 대비 다수의 벤치에서 더 높은 점수를 보였다고 보고되어 있어 동일 아키텍처 기반에서의 품질 향상이 입증되었다. 특히 에이전트형 코딩 벤치와 STEM/추론 벤치에서 경쟁력 있는 수치를 보이며 멀티태스크 성능이 향상된 것으로 나타났다. 또한 출력 텐서 일부를 16비트로 유지하는 하이브리드 정밀도 설계가 양자화 시 품질 저하를 완화한 근거로 제시되어 있다.
- 배포는 Regular 및 MTP GGUF를 모두 포함하고 MTP 모드에서 특정 상황에 더 높은 토큰 처리량을 기록할 수 있다고 README에서 수치(예: Q4_K_S에서 약 75 t/s, MTP에서 90 t/s 이상 예시)를 제시하여 실무적 유연성을 확보했다. 또한 Vision 활성화를 위한 mmproj 분리 방식으로 멀티모달 기능을 모듈화한 점이 배포·운영상의 편의성을 제공한다. 라이선스가 Apache-2.0으로 명확히 표기되어 상업적 활용 및 수정·배포가 용이하다는 점도 강점에 포함된다.
훈련 방식
기반 모델은 Qwen3.6-27B이며 멀티스테이지 멀티-파인튜닝과 단계별 병합을 통해 성능을 개선했고 Heretic(ARA) 기반의 decensoring 절차가 적용되었다. 훈련과정에는 DavidAU의 Polar-STRICT 및 F451-STRICT 데이터셋과 armand0e의 Fable 흔적, Polaris 관련 자료가 사용되었으며 각 스테이지마다 자동 벤치와 휴먼 테스트를 병행하여 품질을 확인했다. 이 과정은 'CORE MISSION'으로 지침 준수와 문제 해결 능력을 훼손하지 않고 향상시키는 방향으로 설계되었다.
알아두면 좋은 것
- 이 배포판은 Heretic 프로젝트와 ARA(Arbitrary-Rank Ablation)를 이용해 'decensored' 버전을 생성했으며 README에 거부(refusal) 비율이 4/100로 표기되어 있다. 이 수치는 원저장소의 거부 비율(99/100)과 대비되는 값으로 모델 동작의 허용 범위가 크게 바뀌었음을 암시한다. Heretic와 ARA 적용은 모델의 검열/거부 동작을 변경하는 방식으로 이루어졌다고 명시되어 있다.
- Regular GGUF와 MTP GGUF 두 가지 양자화 아티팩트를 제공하며 NEO IMATRIX 양자화가 표준 GGUF 대비 2~4% 추가 정확도 향상을 가져온다고 명시되어 있다. MTP GGUF는 Q8_0 정밀도로 설정된 MTP 텐서를 포함하고 출력 텐서의 일부를 16비트로 유지하는 하이브리드 정밀도 처리를 도입하여 낮은 비트폭에서도 품질을 보존한다. README는 MTP와 Regular 양자화 간 토큰 수용률(token acceptance) 차이에 따라 속도·품질 트레이드오프가 발생한다고 권고하고 있다.
- 모델은 멀티스테이지 파인튜닝과 여러 병합 단계에서 각 단계마다 벤치마크와 휴먼 테스트를 병행해 품질을 검증했다고 기술되어 있다. 테스트는 자동 벤치마크와 함께 인간 평가를 통해 'trust, but verify' 절차로 최종 확인되었다고 명시되어 있어 수치적 검증 외에 휴먼 피드백이 반영된 점이 특징이다. 또한 Vision 기능은 별도 mmproj 파일을 동봉해 활성화해야 하며 이 점이 비전 사용 시 추가 설정 포인트로 작용한다.
- 배포판의 라이선스는 Apache-2.0으로 표기되어 있으며 배포 아티팩트는 로컬 추론 앱에서 작동하는 GGUF 파일 형식으로 제공된다. README는 Linux/Mac이 일반적으로 더 빠르다고 안내하고, LMStudio 등에서 테스트된 T/S(토큰 초당 처리량) 수치와 함께 하드웨어·OS·앱에 따라 성능 편차가 발생한다고 명시하고 있다. 또한 모델용 권장 추론 설정(temperature, top_p, top_k, 반복패널티 등)을 구체적으로 제시하고 있어 운영 환경에 맞춘 세부 튜닝이 가능하다.
기술적 특징
- 모델은 다단계(multi-stage) 파인튜닝과 다중 파인튜닝의 병합 전략을 채택하여 각 스테이지에서 성능과 손상 여부를 점검했으며 병합 단계마다 자동 벤치와 휴먼 테스트를 수행해 품질을 확보했다. 이 절차는 간단한 단일 스테이지 파인튜닝에서 발생할 수 있는 'benchmaxing'이나 의도치 않은 핵심 모델 손상을 방지하기 위해 설계되었다. 결과적으로 지침 준수와 문제 해결 능력을 상향시키는 방향으로 파라미터 조정이 이루어졌다.
- 양자화 측면에서는 NEO IMATRIX 기반의 GGUF 변형을 사용해 표준 GGUF 대비 2~4%의 추가 정확도 향상을 목표로 했고 출력 텐서의 10~20%를 16비트로 유지하는 하이브리드 정밀도 처리를 도입했다. 이 방식은 낮은 비트폭(4bit/8bit) 환경에서 발생하는 정밀도 손실을 국소적으로 보정하여 추론 품질을 개선하는 효과를 낸다. README는 이러한 구성으로 장문맥 성능과 양자화된 정확도 모두를 개선했다고 보고하고 있다.
- MTP(Multi-Token Prediction) 양자화 모드는 예측 시 두 개 이상의 토큰을 동시에 고려하는 동작을 허용하고 해당 텐서들을 Q8_0 정밀도로 설정하여 특정 토큰 수용률 조건에서 처리량을 높인다. README는 MTP가 토큰 수용률(예: 60%에서 2토큰 예측) 상황에서 Regular GGUF보다 더 높은 T/S를 달성할 수 있다고 제시하며, 반대로 수용률이 낮을 때는 Regular GGUF가 더 빠를 수 있다고 구체적 운영 지침을 제공한다. MTP 사용 시에는 온도와 반복 패널티에 민감하므로 하이퍼파라미터 튜닝이 필수적이다.
- 비전 기능은 모델 내부에서 활성화되어 있으나 사용자는 별도 mmproj 파일을 다운로드해 GGUF와 동일 폴더에 두어야 비전 파이프라인이 작동하도록 구성되어 있다. 이 분리된 아티팩트 접근법은 비전 관련 모듈을 독립적으로 배포·업데이트할 수 있게 하여 멀티모달 운영의 유연성을 제공한다. README는 비전 테스트를 거쳤다고 표기하고 관련 VQA·MMBench 계열의 수치들을 함께 공개했다.
차별점
- Heretic(ARA) 기반의 decensoring 절차를 도입해 거부 응답 비율을 README에 4/100으로 표기함으로써 원저장소와 구별되는 응답 정책·동작을 보여준다. 이는 모델의 거부·필터링 동작을 직접 변경한 사례로서 미묘한 출력 거동 차이를 만든다. 해당 절차는 모델 내부 특정 가중치 구성요소를 조정하는 방식으로 구현되었다.
- NEO IMATRIX 양자화와 출력 텐서의 부분적 16비트 유지라는 하이브리드 정밀도 설계를 통해 4비트/8비트 환경에서도 상대적으로 높은 정확도를 유지하도록 조정했다. 이 조합은 표준 GGUF 대비 2~4%의 추가 정확도 향상을 목표로 명시되어 있고, 실사용 환경에서 양자화 품질을 개선하는 실무적 장점이 있다. 사용자는 Regular와 MTP 두 아티팩트를 선택해 워크로드 특성에 맞춰 성능을 최적화할 수 있다.
- MTP 모드에서는 Q8_0 정밀도 텐서를 활용해 다중 토큰 예측 동작을 활성화하고 특정 토큰 수용률 구간에서 토큰 처리량이 증가하는 운영 이점을 노린다. README는 MTP가 상황에 따라 Regular GGUF보다 더 높은 T/S를 기록할 수 있음을 구체 수치로 제시하며 온도 및 rep-penalty 설정의 중요성을 강조한다. 이 차별화는 창작·복잡한 시퀀스 생성에 유리한 토큰 처리 메커니즘을 제공한다.
- 멀티스테이지 파인튜닝과 각 단계별 인간 평가를 결합한 'trust, but verify' 절차를 통해 자동 벤치뿐 아니라 휴먼 테스트로 최종 모델 행동을 검증했다. 이 과정은 단일 스테이지 벤치맥싱을 방지하고 지침 준수와 문제 해결 능력을 유지·향상시키는 방향으로 설계되었다. 결과적으로 동일 아키텍처 기반 대비 전반적 성능 향상을 달성했다고 보고되었다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Nightmedia bench arc/c (mxfp8) | arc/c | 0.711 | — |
| Nightmedia bench arc/c (mxfp4) | arc/c | 0.701 | — |
| QwenWebBench (Elo rating) | Elo | 1487 | — |
| MMLU-Pro | accuracy | 86.2 | — |
| RealWorldQA | accuracy | 84.1 | — |
이미지 분석

1k
Likes
955.8k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.