95% HumanEval과 262k 토큰 장문맥을 지원하는 27B 에이전트 어댑터
BTL-3은 Qwen3.6-27B 기반의 rank-32 LoRA PEFT 어댑터로서 에이전트형 코딩, 구조화된 도구 호출, 실패 복구와 긴 멀티턴 실행을 목표로 설계된 모델이다.
TL;DR
BTL-3은 Qwen/Qwen3.6-27B를 기반으로 post-training된 rank-32 LoRA PEFT 어댑터로서 에이전트형 코딩과 구조화된 도구 사용을 목표로 개발되었다. 핵심적으로 어댑터만으로 기능을 확장하는 배포 구조와 Qwen의 hybrid-attention을 기반으로 한 262,144 토큰의 장문맥 지원을 결합하여 리포지터리 작업과 장기 멀티턴 실행에서 문맥 유지와 검증을 가능하게 했다. 평가에서는 HumanEval 95.12%와 BFCL Irrelevance 91.2% 같은 높은 코드 정확도와 도구 호출 회피 성능을 동시에 보였고 8.39GB Compact 에디션으로 네이티브 로컬 배포가 가능하다. 다만 'thinking' 모드는 반복 또는 종료 실패 위험을 명시하고 있어 운영에서는 비활성화된 기본 모드를 권장하며 생성 코드와 도구 호출은 샌드박스에서 실행하도록 운영 지침이 병행되어야 한다.
핵심 역량
- 코드 생성, 채점 가능한 테스트 패스, 그리고 실패한 테스트에 대해 패치 제안과 수정을 수행할 수 있으며 HumanEval에서 95.12% pass@1을 기록했다.
- 구조화된 도구 사용을 통해 단일 호출, 다중 호출 및 병렬 호출을 조율할 수 있고 BFCL Irrelevance에서 91.2%를 기록하여 불필요한 도구 호출 회피 능력이 뛰어나다.
- 리포지터리 검사와 변경, 장기 멀티턴 검증 루프를 포함한 워크플로에서 검증과 복구를 반복적으로 수행할 수 있으며 LiveCodeBench v6에서 88.1% 완수율을 보였다.
강점
- 코드 생성 정확도와 에이전트형 동작 보존에서 강점을 보이며 HumanEval 95.12%와 LiveCodeBench 88.1% 같은 높은 평가 점수를 달성했다.
- 구조화된 도구 사용에서 불필요한 호출을 회피하는 능력이 높아 BFCL Irrelevance 91.2%를 기록했고 단일·다중·병렬 호출 시나리오 전반에서 신뢰할 만한 행동 보존을 보였다.
- 오픈 라이선스(Apache-2.0)와 어댑터 기반 배포 방식으로 원본 모델을 교체하지 않고도 기능을 배포할 수 있으며 8.39GB Compact 에디션으로 로컬 네이티브 추론이 가능하다.
훈련 방식
BTL-3은 Qwen/Qwen3.6-27B를 기반으로 post-training 방식으로 어댑터를 학습한 결과물이며 PEFT 프레임워크에서 LoRA rank 32, alpha 64 설정을 사용하여 adapter 파일만 생성하였다. 이 어댑터는 에이전트형 코딩과 구조화된 도구 사용 시나리오에 맞춘 행동 보존과 실패 복구 능력을 향상시키도록 튜닝되었다. 원본 베이스 체크포인트는 정확한 리비전으로 고정되어 재현 가능한 로딩을 보장한다.
알아두면 좋은 것
- BTL-3은 Qwen3.6-27B를 기반으로 post-training된 rank-32 PEFT LoRA 어댑터로 배포되어 원본 체크포인트를 그대로 두고 어댑터 파일만으로 기능을 확장한다.
- 모델 아키텍처는 Qwen3.6의 hybrid-attention 특성을 계승하며 262,144 토큰의 장문맥을 선언하고 있고 최대 RL 시퀀스 길이 65,536을 명시하여 긴 멀티턴 실행을 지원한다.
- 배포판에는 8.39GB 크기의 Compact 에디션이 포함되어 있으며 이 에디션은 파라미터당 효과적 비트 수를 2.5비트 미만으로 유지하여 네이티브 로컬 추론과 경량 배포를 용이하게 한다.
- 운영 지침으로 생성 코드와 도구 호출은 샌드박스에서 실행할 것과 파괴적 또는 권한 높은 작업에 대해서는 명시적 확인을 요구할 것을 권고하고 있다.
기술적 특징
- 어댑터 기반 PEFT 배포는 기본 Qwen 체크포인트를 유지하면서 adapter 파일만으로 에이전트 동작을 추가하는 구조이다. 이 방식은 전체 모델을 다시 배포하지 않고도 기능을 배포·교체할 수 있게 하며 저장공간과 배포 복잡성을 낮춘다. BTL-3은 RL-0013 rank-32 LoRA adapter와 토크나이저 구성만을 포함한 릴리스를 제공한다.
- Qwen3.6의 hybrid-attention 아키텍처 특성을 계승하여 262,144 토큰의 장문맥을 선언했으며 이는 긴 리포지터리 작업과 멀티턴 검증 루프에서 문맥 유지에 유리하다. 장문맥 관리는 지역적·전역적 어텐션 전략으로 계산 부담을 제어하면서도 장기 의존성을 유지하는 설계를 전제로 한다. BTL-3은 최대 RL 시퀀스 길이 65,536을 별도로 명시하여 강화학습이나 멀티턴 상호작용에서의 활용 경계를 제공한다.
- Compact 에디션은 전체 모델의 기능을 8.39GB 네이티브 파일로 패키징하여 로컬 네이티브 추론 환경에서의 배포 비용을 크게 낮췄다. README는 Compact 에디션이 파라미터당 약 2.5비트 미만의 효과적 표현을 갖는다고 명시하여 저장 효율을 강조한다. 이 접근은 사내 또는 프라이빗 환경에서 대용량 모델을 보다 적은 저장·메모리로 운용하려는 요구에 대응한다.
- 에이전트 행위 개선을 위한 정책적·실행적 트릭으로 'thinking' 모드를 제공하되, README는 해당 모드가 반복되거나 종료하지 않을 위험을 내포한다고 명시하여 평가용 활성화와 운영상 비권장 모드를 분리했다. 이로 인해 통제된 평가에서는 더 깊은 사고 루틴을 사용할 수 있으나 프로덕션에서는 비활성 상태가 기본 권장 모드로 설정된다.
- 도구 통합을 위해 모델은 구조화된 함수 호출 패턴과 Qwen용 XML 도구 파서를 지원하도록 구성되어 있다. vLLM 서빙 예시는 LoRA 모듈을 특정 타깃 모듈에 매핑하는 방식으로 어댑터를 활성화하여 실시간 추론에서 구조화된 도구 파싱과 멀티툴 워크플로를 지원하는 구현 세부를 보여준다. 이 설계는 에이전트가 도구 호출 필요성 판단과 결과 검증을 체계적으로 수행하도록 돕는다.
차별점
- BTL-3은 Qwen3.6-27B 기반의 rank-32 LoRA PEFT 어댑터로서 전체 모델을 교체하지 않고 에이전트 능력을 어댑터만으로 추가할 수 있는 배포 방식을 채택했다.
- 262,144 토큰이라는 매우 긴 컨텍스트 창을 아키텍처 특성으로 선언하여 리포지터리 작업과 장기 멀티턴 검증 루프에서 문맥 유지 능력을 강화했다.
- HumanEval 95.12%와 BFCL Irrelevance 91.2% 같은 높은 코드 생성 및 도구 호출 회피 지표를 동시에 달성하여 코드 생성과 도구 사용 두 영역에서 균형잡힌 성능을 보였다.
- 8.39GB Compact 에디션은 네이티브 파일 하나로 동작하는 경량 배포 옵션을 제공하여 로컬 추론과 프라이빗 인프라에서의 운용 비용을 크게 낮출 수 있게 설계되었다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| HumanEval | pass@1 | 95.12% (156/164) | — |
| BFCL v4 AST | score | 88.5% (1097/1240) | — |
| LiveCodeBench v6 | completed | 88.1% (170/193) | — |
| BigCodeBench-Hard Instruct | pass@1 | 26.35% (39/148) | — |
| BigCodeBench functional tests | functional score | 59.25% (506/854) | — |
66
Likes
177
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.