본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

badtheorylabs/BTL-3

에이전틱 코딩·리포지토리 작업·구조화된 도구 호출(function calling)을 위한 text generation27B256K 컨텍스트apache-2.0

Qwen3.6-27B에 얹는 LoRA 어댑터로 에이전틱 코딩·도구 호출 정확도를 크게 끌어올린 모델.

학습 방식 · Qwen/Qwen3.6-27B(고정 리비전)를 기반으로 rank-32, alpha 64의 LoRA PEFT 어댑터(RL-0013)를 post-training해 에이전틱 코딩과 도구 사용 행동을 튜닝했다.

TL;DR

BTL-3은 Qwen3.6-27B에 rank-32 LoRA(alpha 64)를 적용해 에이전틱 코딩, 구조화된 도구 사용, 실패 복구, 장기 멀티턴 실행에 맞춰 post-training한 PEFT 어댑터로, 262,144 토큰의 아키텍처 컨텍스트와 최대 65,536 토큰의 RL 시퀀스 길이를 갖는다. HumanEval pass@1 95.12%, BFCL v4 AST 88.5%, LiveCodeBench v6 88.1%를 기록했고, 특히 불필요한 도구 호출을 피하는 BFCL Irrelevance에서 91.2%를 보여 도구 사용 판단력이 뛰어나다. 원본 모델을 교체하지 않고 어댑터 파일만 배포하는 구조라 전체 텍스트 모델을 8.39GB 하나의 파일로 압축한 Compact 에디션도 함께 제공되며, 100턴 도구-계약 재현 테스트에서 정식 모델 대비 92.2%의 조건부 행동 재현율을 보였다. 기본 배포는 non-thinking 모드를 권장하며 리포지토리 에이전트나 자체 호스팅 코딩 에이전트에 적합하다.

핵심 포인트

  • HumanEval pass@1 95.12%, BFCL v4 AST 88.5%, BFCL Irrelevance 91.2%를 기록했다.
  • 원본 Qwen3.6-27B는 그대로 두고 rank-32 LoRA만 배포하며 8.39GB 단일 파일 Compact판도 함께 낸다.
  • 262,144 토큰 컨텍스트와 65,536 토큰 RL 시퀀스로 리포지토리 단위 장기 작업을 겨냥했다.
  • thinking 모드는 반복·미종료 위험이 있어 평가용으로만 권장하고 배포 기본값은 non-thinking이다.

제한사항

  • 'thinking' 모드는 RL-0013 추론 정책이 반복되거나 종료에 실패할 수 있어 평가용으로만 권장되고 기본 배포에서는 비활성화된다.
  • 생성된 코드와 도구 호출은 샌드박스에서 실행하고 파괴적·고위험 작업은 명시적 확인을 거치도록 운영 지침이 요구된다.
  • BFCL 카테고리 중 parallel-multiple 호출에서는 70.0%로 다른 카테고리보다 상대적으로 낮은 성능을 보인다.

벤치마크

벤치마크지표비교
HumanEvalpass@195.12% (156/164)
BFCL v4 ASTscore88.5% (1097/1240)
LiveCodeBench v6completed (193-case)88.1% (170/193)
BigCodeBench-Hard Instructpass@126.35% (39/148)
BFCL v4 Irrelevancescore91.2%

66

LIKES

177

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.