로컬 에이전트 루프용 no-thinking QLoRA 튜닝과 MTP로 응답 지연 최소화
Qwen3.6-27B 기반 4-bit QLoRA SFT로 PI-style no-thinking 에이전트 코딩과 도구 호출에 최적화하고 MTP speculative decoding으로 로컬 추론 속도를 끌어올린 GGUF 패키지.
TL;DR
Qwen3.6-27B-MTP-pi-tune는 Qwen3.6-27B를 기반으로 4-bit QLoRA SFT로 파인튜닝한 GGUF 릴리스로, PI-style의 "no-thinking" 추론 경로에 맞춰 에이전트형 코딩 및 도구 호출 워크플로우에서 응답 지연을 줄이는 데 초점을 맞췄다. 모델은 llama.cpp 호환 포맷으로 배포되며 mmproj sidecar를 결합하면 멀티모달 입력을 처리할 수 있다. 이 릴리스의 핵심은 MTP(Multi-Token Prediction) speculative decoding과 no-thinking 튜닝의 결합이다. 모델은 3 speculative step과 4 토큰 초안 구성으로 내부적으로 초안을 생성하고 주 디코더가 일치하면 초안을 수용해 실사용 에이전트 워크로드에서 약 78%의 초안 수용률을 보고했다. 추론 성능으로는 프리필 약 615 tok/s, 원시 생성 약 40 tok/s, end-to-end 요청 약 71 tok/s의 현지 측정치를 공개했다. 의미적으로 이 튜닝은 도구 호출·터미널 명령·리포지토리 편집 등 실제 에이전트 루프의 벽시간을 줄여 반복적 워크플로우 속도를 끌어올린다. 트레이드오프로는 저비트 양자화가 지시 따름이나 도구 호출 신뢰도에 영향을 줄 수 있고, 공개된 코딩 성공률은 별도 벤치마크로 후속 공개 예정이라 정확한 task-success 수치는 아직 제한된다.
핵심 역량
- 도구 호출과 함수 호출 형식의 structured output을 직접 생성
- 터미널 명령·파일 편집·검증 루프를 포함한 에이전트형 코딩 워크플로우 수행
- 로컬 llama.cpp 런타임에서 MTP speculative decoding으로 응답 벽시간 절감
- 긴 문맥 처리(128k 테스트, 256k 네이티브, RoPE 스케일링으로 최대 1M 지원)
- 멀티모달 지원(호환되는 mmproj sidecar를 결합해 이미지/비디오 입력 처리)
강점
- 로컬 추론 최적화: MTP와 Q8_0 초안 헤드 보존으로 양자화 수준과 무관하게 speculative decoding을 활용해 에이전트 루프의 벽시간을 줄였음(초안 수용률 약 78%).
- 실사용 에이전트 데이터로 튜닝: 터미널·툴 호출·리포지토리 작업 등 실제 에이전트 트레이스 기반의 SFT로 도구 호출과 구조화된 출력이 직접적으로 향상되도록 설계되었음.
- 배포 편의성: GGUF 포맷 및 llama.cpp 호환 실행 예시를 제공해 로컬 워크스테이션에서 빠르게 실험 가능하다.
훈련 방식
Qwen3.6-27B 기반에서 4-bit QLoRA SFT로 실제 에이전트 실행 로그(내부 reasoning 블록 제거)를 사용해 PI-style no-thinking 추론 경로에 맞춰 파인튜닝했다.
알아두면 좋은 것
- 모델은 4-bit QLoRA SFT로 실제 실행된 에이전트 트레이스(내부 추론 블록 제거)를 사용해 no-thinking 추론 경로에 맞춰 튜닝되었다.
- 모든 quant 형식에 대해 MTP의 nextn(초안) 헤드를 Q8_0 정밀도로 보존해 양자화 수준과 무관하게 speculative decoding이 동작한다.
- 권장 양자화는 Q4_K_M이며, 24GB GPU 환경에서 사용하기 적합하다고 명시되어 있다.
- 비전 인코더는 fine-tune되지 않았고 mmproj-F16.gguf sidecar를 통해 원래 Qwen3.6의 이미지 이해를 그대로 재사용한다.
기술적 특징
- Multi-Token Prediction(MTP) 초안-수용 구조를 사용해 미래 토큰을 미리 드래프트하고 주 디코더가 일치하면 초안을 채택한다. 이 모델은 3 speculative step과 4 토큰 초안 구성으로 약 78% 초안 수용률을 보고해 긴 코드·추론 응답의 벽시간을 줄였다.
- 4-bit QLoRA 방식의 SFT로 파인튜닝해 전체 가중치를 재학습하지 않고도 실사용 에이전트 트레이스 품질을 끌어올렸다. QLoRA 방식은 메모리·연산 비용을 낮춘 상태에서 로컬 환경에서의 실험을 용이하게 한다는 점을 목표로 삼았다.
- MTP의 nextn(초안) 헤드를 모든 quant에서 Q8_0 정밀도로 보존해, 낮은 비트 양자화(Q2/Q3/Q4 등) 환경에서도 speculative decoding 성능을 유지하도록 구현했다.
- 컨텍스트 처리 설계는 대형 문맥 워크플로우를 염두에 두어 128k를 테스트했고 base는 256k를 네이티브로 지원하며 RoPE scaling으로 최대 1M까지 확장 가능하도록 명시했다. 긴 문맥 기반의 리포지토리·에이전트 작업을 지원한다.
- GGUF 포맷과 llama.cpp 통합을 우선해 로컬 단일 워크스테이션에서 실행하는 실험·에이전트 루프 사례에 맞춘 실행·튜닝 파이프라인을 제공한다.
차별점
- no-thinking PI 스타일로 파인튜닝되어 thinking 블록 없이 즉시 도구 호출/구조화된 출력을 생성하도록 튜닝됨
- MTP 초안 헤드를 모든 양자화에서 Q8_0로 유지해 양자화 수준과 무관하게 speculative decoding을 활성화함
- GGUF 포맷으로 llama.cpp에 바로 배포 가능하고 로컬 에이전트 루프를 대상으로 한 실측 throughput 수치를 제공함
- 긴 문맥(128k 테스트, 256k 네이티브, RoPE로 최대 1M) 지원을 명시해 리포지토리·엔지니어링 워크플로우에 초점을 둠
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.0 (Pi agentic coding) | pass@1 | 28.09 | — |
111
Likes
65.8k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.