40B로 확장하고 NEO-CODE·Di-IMatrix 퀀트로 긴 컨텍스트와 코드·이미지 작업 성능을 끌어올린 멀티모달 모델
27B 기반을 40B로 밀집 확장하고 Deckard·Claude 4.6 Opus 데이터와 NEO-CODE-Di-IMatrix 퀀트를 적용해 긴 컨텍스트와 이미지-텍스트 생성에서 실용성과 성능을 높인 멀티모달 모델이다.
TL;DR
이 모델은 Qwen3.6-27B를 기반으로 밀집 구조를 40B로 확장하고 Deckard(PkDick 등) 내러티브 데이터와 Claude 4.6 Opus Distill 데이터를 순차 튜닝해 이미지-텍스트 생성과 장문 추론 능력을 높인 멀티모달 모델이다. 핵심 기술로는 NEO-CODE-Di-IMatrix-MAX라는 맞춤 퀀트 파이프라인과 텐서별 보정을 통해 저비트 환경에서도 BF16 대비 높은 성능 재현을 노린 점이 있으며 README에서 IQ4_XS=94%·Q8_0≈98.4% 같은 퀀트 성능 비율이 보고되었다. 모델은 256K 규모의 긴 컨텍스트를 지원하고 에이전트형 코딩·멀티모달 VQA·창작 작업에서 균형 잡힌 점수를 기록했으며, Uncensored(Heretic) 모드로 필터링을 제거한 특성 때문에 안전성·운영 정책과 관련된 사용 제한을 사전에 고려해야 한다.
핵심 역량
- 이 모델은 이미지와 텍스트를 함께 입력받아 문장형 출력과 지시 이행을 수행할 수 있다. README에서는 이미지-텍스트 투-텍스트(pipeline_tag: image-text-to-text)를 명시하고 있어 VQA·이미지 설명·멀티모달 지시 이행이 가능함이 확인되었다. 또한 창작·스토리텔링, 코드 생성, 장문 추론 등 다양한 생성 작업에 적용하도록 튜닝되었다.
- 긴 컨텍스트를 이용한 연속 대화 유지와 복합 추론을 지원한다는 사실이 README에 언급되어 있으며 컨텍스트 윈도우를 256K로 설정해 장문 문서·대화·코드 세션을 처리하는 능력이 확보되었다. 이 특성은 연속적인 플롯 전개·대규모 코드베이스 수정·문서 기반 질의응답에서 유리하다.
- 퀀트된 GGUF 배포와 다양한 Q형(quants) 조합으로 로컬 환경에서 저비용으로 추론을 실행할 수 있다. README는 Q8_0, IQ4_XS 등 여러 퀀트가 BF16 대비 일정 비율의 성능을 유지한다고 보고하였고, 이로 인해 메모리 제약 환경에서도 실용적인 멀티모달 실행이 가능하다고 기술되어 있다.
강점
- 다중 벤치마크 표에서 전반적으로 경쟁력 있는 점수가 보고되었다는 사실이 README 표에서 확인된다. 특히 QwenWebBench Elo 1487, MMLU-Pro 86.2, LiveCodeBench·Claw 관련 지표에서 높은 실수를 보이며 코드·지식·멀티모달 태스크에서 균형 잡힌 성능을 보여준다. 이러한 수치들은 모델이 에이전트형 코딩 및 장문 추론 시 실용적 성능을 발휘함을 시사한다.
훈련 방식
기반 모델은 Qwen3.6-27B이며 로컬 Unsloth 파이프라인으로 Deckard (PDK 5 datasets) 기반의 캐릭터·서사 데이터와 Claude 4.6 Opus Distill 고추론 데이터로 다단계(post-training / fine-tune) 튜닝을 수행해 성능과 추론 길이를 개선했다.
알아두면 좋은 것
- 모델은 27B 기반을 밀집(Dense) 방식으로 40B로 확장했고 96개 레이어와 1,275개의 텐서를 가지며 확장된 파라미터 공간을 통해 'room to think'를 제공한다고 명시되어 있다.
- NEO-CODE-Di-IMatrix-MAX라는 맞춤 퀀트 설계가 적용되었으며 두 imatrix 데이터셋을 통합하고 텐서별 조정을 벤치마크 기준으로 보정해 낮은 비트 퀀트에서의 안정성과 정확도를 최적화했다고 보고되었다.
- 컨텍스트 윈도우는 모델 README에서 256K로 명시되었고 Qwen3.6 사양 문서에서는 262,144 토큰 네이티브 지원이 기록되어 있어 긴 문맥 처리 능력이 강조되었다.
- 모델은 Heretic/Uncensored 모드를 통해 안전성 필터를 제거한 상태에서 추가 튜닝을 진행했으며 라이선스는 Apache-2.0으로 표기되어 있다.
기술적 특징
- 모델은 밀집(Dense) 아키텍처로 27B 기반을 40B로 확장했으며 레이어 수와 텐서 수를 늘려 내부 표현 용량을 키웠다. README에는 96 레이어와 1,275 텐서가 기록되어 있어 파라미터 공간 확장이 추론 맥락을 길게 유지하고 복합 추론 단계를 처리하도록 설계되었음이 드러난다. 이러한 확장은 특히 복잡한 플롯 유지나 긴 코드 수정을 요구하는 작업에서 사고 공간을 확장하는 의도로 사용되었다.
- NEO-CODE-Di-IMatrix-MAX 퀀트 설계는 두 가지 imatrix 데이터셋을 먼저 개별 벤치마크로 평가한 뒤 상호 보완되는 특성만을 병합해 최적의 퀀트를 만든 접근법을 채택했다. README에는 IQ4_XS가 BF16 대비 94%, Q8_0가 98.4% 수준의 성능 재현율을 보였다고 기재되어 있어 퀀트 엔지니어링이 정확도 유지에 중점적으로 적용되었음이 확인된다. 텐서별 추가 보정도 벤치 결과에 따라 반복 적용되었다고 명시되어 있다.
- 훈련 파이프라인은 다단계 튜닝을 적용해 먼저 Heretic/Uncensored 성향을 형성한 뒤 Deckard(PkDick 등) 내부 데이터로 캐릭터·서사적 능력을 강화하고 마지막에 Claude 4.6 Opus Distill 데이터로 추론 길이를 단축하고 안정성을 높이는 순서를 택했다. 이 순차적 튜닝은 모델이 창작적 표현을 유지하면서 문제 해결 능력과 추론 안정성을 동시 확보하도록 설계되었다.
- 긴 컨텍스트 처리를 위해 모델·추론 설정에서 256K 이상의 윈도우를 권장하고 있으며 README에는 토큰 수 확장 관련 실험 설정과 권장 샘플링 파라미터(temperature, top_p, top_k, repetition penalty 등)가 상세히 제시되어 있다. 이 설정은 긴 대화·대규모 코드 생성 세션에서 반복적 루핑과 답답함을 완화하기 위해 고안되었다.
차별점
- 밀집 방식으로 기준 모델(27B)에서 40B로 확장한 후 다단계 튜닝을 적용한 점이 차별화 요소이다. 이 확장은 단순 파라미터 증가뿐 아니라 레이어·텐서 구조를 변경해 긴 사고 공간을 확보하는 데 목적을 두었으며 README에 96 레이어, 1,275 텐서라는 수치가 명시되어 있다. 따라서 동일 계열의 단순 파인튜닝 모델들과 구조적 용량에서 구별된다.
- NEO-CODE-Di-IMatrix-MAX라는 자체 퀀트 설계와 텐서별 보정 과정을 통해 저비트 퀀트 환경에서도 BF16에 가까운 성능 재현을 목표로 했다는 점이 고유하다. README에서 IQ4_XS·Q8_0 등 퀀트별 성능 비율을 제시하며 각 퀀트를 벤치마크 기준으로 선택했다고 밝히고 있어 퀀트 품질 관리 측면에서 차이가 있다.
- Heretic/Uncensored 모드로 먼저 자유로운 생성 성향을 구성한 뒤 Deckard·Claude 데이터로 안정성과 추론 능력을 보정하는 순차적 튜닝 파이프라인이 적용되었다. 이 구성은 모델이 창작적·공격적 표현을 허용하면서도 이후 단계에서 문제 해결·추론 안정성을 복원하도록 설계되었다는 점에서 운영·사용 관점의 차별화를 만든다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Verified | score | 77.2 | vs Claude 4.5 Opus: 80.9 |
| Terminal-Bench 2.0 | score | 59.3 | vs Claude 4.5 Opus: 59.3 |
| QwenWebBench (Elo) | elo | 1487 | vs Claude 4.5 Opus: 1536 |
| Claw-Eval (pass^3) | pass@3 | 60.6 | vs Claude 4.5 Opus: 59.6 |
| MMLU-Pro | accuracy | 86.2 | vs Claude 4.5 Opus: 89.5 |
| RealWorldQA | accuracy | 84.1 | vs Claude 4.5 Opus: 77.0 |
이미지 분석

572
Likes
427.1k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.