64K 컨텍스트와 BenchLocal 81%를 지닌 Qwen3.6 기반 27B 추리형 멀티모달 모델
이미지와 텍스트 입력을 받아 장기 문맥 추론·코드 분석·에이전틱 도구 사용을 포함한 다단계 응답을 생성하는 image-text-to-text 태스크를 수행한다.27B64K 컨텍스트apache-2.0
Tess-4-27B는 Qwen3.6-27B를 기반으로 64K 토큰 장기 문맥과 교사 앙상블 증류로 추리 중심의 에이전틱 행동·멀티모달 능력을 강화한 27B 모델이다.
TL;DR
Tess-4-27B는 Qwen3.6-27B를 기반으로 Migel Tissera가 사후학습을 거쳐 만든 27B 멀티모달 모델로, 64K 토큰 장기 문맥과 에이전틱 작업 로그를 사용해 장문 추론과 단계적 도구 사용을 강화했다. 모델은 Opus-4.8·GPT-5.5·GLM-5.2 교사 앙상블로 생성된 추리 트레이스를 증류해 내부적으로 가설 형성·검증·대안 평가를 선행하는 prospective 추리 방식을 채택했다. 결과적으로 이미지와 텍스트를 통합해 코드 리팩터링·대규모 문서 분석·도구 기반 작업에서 집중된 추리를 수행하며, 커뮤니티 BenchLocal에서 Q8 양자화 기준 81%의 성능을 보고했다. 다만 로컬 사용을 위해서는 제공된 GGUF 양자화 및 vision projector를 함께 배치해야 멀티모달 기능을 완전하게 활용할 수 있다.
핵심 역량
- 장기 문맥을 유지하며 코드베이스·문서 등 수만 토큰 분량의 입력에서 계획과 검증을 병렬로 수행할 수 있다.
- 내부적 <think> 추리 블록을 통해 사전 가설 형성, 실행, 검증의 순환을 거쳐 더 집중된 추리 결과를 생성할 수 있다.
- 이미지 입력을 처리하는 비전 타워를 보유해 이미지-텍스트 통합 질의응답과 설명 생성이 가능하다.
- 로컬 배포를 위한 다양한 GGUF 양자화 포맷을 제공해 경량 환경에서도 품질을 유지하면서 추론할 수 있다.
강점
- BenchLocal 커뮤니티 벤치에서 Q8 양자화 기준 81%로 상위권을 기록해 동급 양자화 모델 대비 실사용 벤치 성능 우위를 보였다.
- 64K 토큰 장기 문맥에 대해 사후학습되었기 때문에 대규모 코드베이스나 문서에 대한 단계적 계획과 검증을 한 세션에서 유지할 수 있다.
- GGUF 양자화 포맷과 별도 vision projector를 함께 제공해 로컬 환경에서 멀티모달 추론을 비교적 작은 저장공간으로 운용할 수 있다.
훈련 방식
기반 모델은 Qwen3.6-27B이며 사후학습을 통해 64K 토큰 장기 에이전틱 트레이스와 Opus-4.8·GPT-5.5·GLM-5.2 교사 앙상블로부터 증류된 추리 스타일을 혼합해 학습했다.
알아두면 좋은 것
- 모델은 Qwen/Qwen3.6-27B를 기반으로 사후학습되었고 64K 토큰 장기 문맥의 에이전틱 작업 로그를 사용해 장기 추론 능력을 강화했다.
- 추리 스타일은 Opus-4.8, GPT-5.5, GLM-5.2로 구성된 교사 앙상블의 출력을 단일 음성으로 증류해 prospective(사전예측·검증) 방식의 사고 패턴을 학습했다.
- 풀-정밀도 BF16 safetensors와 다양한 GGUF 양자화(Q4_K_M, Q6_K, Q8_0) 및 vision projector(mmproj-Tess-4-27B-F16.gguf)를 제공해 멀티모달 로컬 배포를 지원한다.
- 커뮤니티 벤치마크인 BenchLocal에서 Q8 양자화 기준 81%(122/150)로 상위권 성능을 기록했다는 결과가 README에 포함되어 있다.
기술적 특징
- 가중치 기반의 추리 집중(weight-scaled reasoning) 전략을 적용해 단순 반복 작업에서는 추리 단계를 억제하고 복잡한 판단이 필요한 지점에서만 계산 자원을 집중한다. 이 접근은 내부적으로 사후학습된 추리 트레이스에서 어떤 토큰 구간에 더 많은 내부 사고를 배치할지 학습함으로써 실질적 응답 품질을 높인다.
- 에이전틱 네이티브 설계를 통해 모델이 외부 도구 호출과 병렬적 멀티스텝 행동을 자연스럽게 통합하도록 구성했다. 모델은 코드 읽기, 계획 수립, 도구 사용, 결과 검증의 순환을 이루는 행동 시퀀스를 처리할 수 있도록 트레이스 기반 학습을 적용했다.
- 장기 문맥 처리 능력은 64K 토큰 트레이스 사후학습으로 확보되었으며, 이를 위해 입력 포맷과 토크나이저 적용 방식에서 긴 창을 유지하는 프롬프트 템플릿과 캐시 전략이 병행되었을 가능성이 높다. README는 64K 학습 데이터를 명시해 긴 대화·문서·코드 맥락에서의 안정적 동작을 목표로 삼았음을 반영한다.
- 멀티모달 지원은 Qwen3.6의 비전 타워를 물려받아 이미지-텍스트 통합 처리 구조를 유지하며, 로컬 실행성을 위해 별도 'vision projector' GGUF 파일을 제공해 텍스트 모델과 시각 입력을 연결하는 전처리·프로젝션 계층을 분리했다.
차별점
- 사후학습된 64K 장기 에이전틱 트레이스를 통해 장문 컨텍스트에서의 계획·검증 집중 능력을 구현했다.
- 교사 앙상블(Opus-4.8, GPT-5.5, GLM-5.2)으로 생성된 추리 트레이스를 단일 음성으로 증류해 prospective 방식의 사전예측·검증 루틴을 학습시켰다.
- 에이전틱 설계로 도구 호출과 멀티스텝 행동을 네이티브하게 처리하도록 구성되어 코드 리팩터링 같은 작업에서 단계적 실행이 가능하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| BenchLocal | score | 81% (122/150) | vs Qwen3.6-35B-A3B: 78% (117/150) |
127
Likes
1.6k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.