peculiar-ragdoll/Tiel-Coder-35B-A3B-GGUF
이미지 입력을 활용한 agentic coding과 장문 대화35B-A3BMIT
Ornith 기반 동적 GGUF 양자화 모델로 로컬 코드 수정과 장문 대화에 강하지만 시험형 지식 점수는 낮습니다.
학습 방식 · Ornith-1.5-35B-A3B BF16 가중치를 자체 imatrix와 unsloth-style Dynamic quantization으로 GGUF 양자화하고, Sharp chat template을 내장했습니다.
TL;DR
Tiel-Coder-35B-A3B-GGUF는 Ornith-1.5-35B-A3B를 자체 imatrix로 동적 양자화한 GGUF 모델이며 Sharp chat template을 내장했습니다. 22.4GB Q4_K_XL 기준 SWE-bench-Live에서 25개 중 12개를 해결하고 시도당 평균 12.3분을 기록해 로컬 agentic coding에 초점을 맞춥니다. Claw-Eval multi-turn 점수는 67.2점으로 기반 모델과 Nail을 앞섰지만, 명확화 질문은 줄고 MMLU-Pro는 73.7점으로 Nail보다 낮습니다. 코드 수정과 장문 대화에는 유리하고 시험형 지식 평가에는 불리한 선택입니다.
핵심 포인트
- Ornith-1.5-35B-A3B를 기반으로 만든 4-bit 중심 GGUF 양자화 모델입니다. 자체 imatrix와 per-tensor Dynamic recipe를 적용하고 Sharp chat template을 GGUF에 포함했습니다. 원본 가중치를 Fine-tuning한 모델이 아니라 코딩 작업에 맞춘 양자화·템플릿 조합입니다.
- Agentic coding에서는 25개 SWE-bench-Live 문제 중 12개를 해결했습니다. 22.4GB Q4_K_XL 기준 시도당 중앙값은 8.6분, 평균은 12.3분으로 기록됐습니다. Nail보다 평균 시간이 짧고 고비용 시도의 꼬리가 작아 로컬 코드 수정 작업에 적합한 구성을 지향합니다.
- Claw-Eval multi-turn에서 전체 점수 67.2점을 기록해 Ornith-1.5의 65.3점과 Nail의 60.5점을 앞섰습니다. 기반 모델보다 답변 품질은 3.8점 높았지만 명확화 질문 점수는 5.1점 낮아 모호한 요청에도 먼저 답하는 경향이 있습니다. 답변 점수에 80% 가중치를 두는 평가 방식이 이 trade-off를 전체 점수에 유리하게 반영했습니다.
- MMLU-Pro에서는 73.7점으로 Nail의 84.0점보다 10.3점 낮았습니다. Ornith 자체 템플릿을 유지한 동일 양자화본은 Ornith 점수와 같은 결과를 내므로 양자화보다 Sharp template의 짧은 응답 방식과 기반 모델 성능이 주요 차이로 남습니다. 따라서 시험형 지식 평가보다 실제 저장소 수정과 긴 작업 대화가 우선인 환경에 맞습니다.
제한사항
- MMLU-Pro 점수가 73.7점으로 Nail보다 10.3점 낮습니다. 기반 Ornith-1.5도 stock Qwen3.6-35B-A3B보다 낮은 78.0점을 기록했습니다. 시험형 지식과 어려운 reasoning을 우선하면 다른 모델이 더 적합합니다.
- 기반 모델보다 명확화 질문 점수가 5.1점 낮습니다. 모호한 요청을 되묻기보다 짧게 답변하는 방향으로 template이 바뀌었습니다. 요구사항 확인이 중요한 작업에서는 이 동작이 오류를 키울 수 있습니다.
- SWE-bench-Live는 문제당 1회, MMLU-Pro는 3개 seed로 측정됐습니다. README는 작은 점수 차이를 noise로 취급하라고 명시합니다. 중국어와 영어만 지원하며 이 범위는 기반 모델에서 이어졌습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench-Live | 해결 문제 수 | 12 / 25 | Opus 4.6 medium과 동일하며 Ornith-1.5보다 4개, Nail보다 3개 많음 |
| SWE-bench-Live | 시도당 시간 중앙값 / 평균 | 8.6분 / 12.3분 | Nail 7.2분 / 15.7분보다 평균 시간이 짧음 |
| Claw-Eval multi-turn | overall score | 67.2 | Ornith-1.5 base 65.3, Nail 3.6 60.5 |
| Claw-Eval multi-turn | answer quality | 72.4% | Ornith-1.5 base 68.7%, Nail 3.6 67.0% |
| Claw-Eval multi-turn | clarifying questions | 46.5% | Ornith-1.5 base 51.4%, Nail 3.6 34.5% |
| MMLU-Pro | accuracy | 73.7 ±2.3 | Nail 3.6 84.0 ±0.0보다 10.3점 낮음 |
| MMLU-Pro | tokens per answer | 2183 | 동일 차트에서 Nail 3.6 2615, Ornith 1.5 2687보다 적음 |
이미지 분석




80
LIKES
16k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.