microsoft/FastContext-1.0-4B-SFT
FastContext-1.0-4B-SFT는 저장소 탐색을 전담하는 경량 서브에이전트로 병렬 도구 호출과 라인 범위 인용으로 메인 에이전트의 토큰 소비를 크게 줄이는 모델이다.
학습 방식 · 기반은 Qwen/Qwen3-4B-Instruct이며 탐색 트레이스 기반으로 Supervised Fine-Tuning을 수행한 뒤 실제 서브에이전트 롤아웃을 통해 GRPO 강화학습으로 보상 신호(파일·라인 F1, 병렬 탐색 보너스, 형식 패널티)를 최적화하여 탐색 행동과 인용 형식을 정교화했다.
TL;DR
FastContext-1.0-4B-SFT는 저장소 탐색을 전담하는 경량 서브에이전트로 설계되어 메인 코딩 에이전트가 불필요한 파일 읽기와 검색으로 소모되는 토큰을 대신 처리한다. 핵심 작동은 입력 쿼리를 검색 의도로 변환한 뒤 READ, GLOB, GREP를 병렬 호출하고 관찰 기반으로 탐색을 정교화하여 최종적으로 파일 경로와 라인 범위 형태의 압축된 증거를 반환하는 것이다. SFT로 초기 탐색 행동을 학습한 뒤 GRPO 기반 강화학습으로 파일·라인 F1과 병렬 탐색 보너스, 형식 준수를 보상 신호로 최적화했으며 통합 실험에서 정확도 최대 5.5% 향상과 토큰 최대 60% 수준 절감이 관찰되었다. 이 접근은 탐색과 해법 생성을 명확히 분리함으로써 메인 에이전트의 문맥 품질을 높이고 추론 비용을 줄이는 대신 탐색 전용 인터페이스와 도구 지원이 필요하다는 운영적 제약을 수반한다.
핵심 포인트
- 탐색 전용 서브에이전트로 설계되어 메인 에이전트 문맥 오염을 줄이는 아키텍처적 분리를 채택했다.
- 단순한 검색 도구가 아니라 관찰-정교화 루프와 라인 범위 인용을 통해 증거의 정밀도를 확보하는 탐색 행동을 학습했다.
- 병렬 READ/GLOB/GREP 호출을 한 턴 내에서 조합해 초기 탐색의 폭과 효율을 동시에 높이는 실행 전략을 사용한다.
- 메인 에이전트의 종단 간 정확도를 모든 주요 메인 에이전트와 벤치마크에서 개선했으며 최대 5.5%의 정확도 향상과 최대 60% 수준의 토큰 절감을 보고했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Multilingual (GPT-5.4 + FC-30B-SFT) | accuracy and tokens | 75.0 (↑3.3) / 356k tokens (↓22.1%) | vs w/o Explore 71.7 / 457k |
| SWE-QA (GPT-5.4 + FC-30B-SFT) | accuracy and tokens | 82.0 (↑0.7) / 206k tokens (↓50.7%) | vs w/o Explore 81.3 / 418k |
| SWE-bench Pro (GLM-5.1 + FC-4B-RL) | accuracy and tokens | 22.5 (↑5.0) / 2210k tokens (↓17.9%) | vs w/o Explore 17.5 / 2692k |
369
LIKES
7k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.