본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF

텍스트 생성(에이전트 코딩·도구 호출·터미널/쉘 작업·리포지토리 편집 및 패치), 멀티모달(vision sidecar 연결 시 이미지·비디오 이해)27B128K 컨텍스트apache-2.0

Qwen3.6-27B 기반 4-bit QLoRA SFT로 PI-style no-thinking 에이전트 코딩과 도구 호출에 최적화하고 MTP speculative decoding으로 로컬 추론 속도를 끌어올린 GGUF 패키지.

학습 방식 · Qwen3.6-27B 기반에서 4-bit QLoRA SFT로 실제 에이전트 실행 로그(내부 reasoning 블록 제거)를 사용해 PI-style no-thinking 추론 경로에 맞춰 파인튜닝했다.

TL;DR

Qwen3.6-27B-MTP-pi-tune는 Qwen3.6-27B를 기반으로 4-bit QLoRA SFT로 파인튜닝한 GGUF 릴리스로, PI-style의 "no-thinking" 추론 경로에 맞춰 에이전트형 코딩 및 도구 호출 워크플로우에서 응답 지연을 줄이는 데 초점을 맞췄다. 모델은 llama.cpp 호환 포맷으로 배포되며 mmproj sidecar를 결합하면 멀티모달 입력을 처리할 수 있다. 이 릴리스의 핵심은 MTP(Multi-Token Prediction) speculative decoding과 no-thinking 튜닝의 결합이다. 모델은 3 speculative step과 4 토큰 초안 구성으로 내부적으로 초안을 생성하고 주 디코더가 일치하면 초안을 수용해 실사용 에이전트 워크로드에서 약 78%의 초안 수용률을 보고했다. 추론 성능으로는 프리필 약 615 tok/s, 원시 생성 약 40 tok/s, end-to-end 요청 약 71 tok/s의 현지 측정치를 공개했다. 의미적으로 이 튜닝은 도구 호출·터미널 명령·리포지토리 편집 등 실제 에이전트 루프의 벽시간을 줄여 반복적 워크플로우 속도를 끌어올린다. 트레이드오프로는 저비트 양자화가 지시 따름이나 도구 호출 신뢰도에 영향을 줄 수 있고, 공개된 코딩 성공률은 별도 벤치마크로 후속 공개 예정이라 정확한 task-success 수치는 아직 제한된다.

핵심 포인트

  • no-thinking PI 스타일로 파인튜닝되어 thinking 블록 없이 즉시 도구 호출/구조화된 출력을 생성하도록 튜닝됨
  • MTP 초안 헤드를 모든 양자화에서 Q8_0로 유지해 양자화 수준과 무관하게 speculative decoding을 활성화함
  • GGUF 포맷으로 llama.cpp에 바로 배포 가능하고 로컬 에이전트 루프를 대상으로 한 실측 throughput 수치를 제공함
  • 긴 문맥(128k 테스트, 256k 네이티브, RoPE로 최대 1M) 지원을 명시해 리포지토리·엔지니어링 워크플로우에 초점을 둠

벤치마크

벤치마크지표비교
Terminal-Bench 2.0 (Pi agentic coding)pass@128.09

111

LIKES

65.8k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.