저장소 탐색을 분리해 메인 에이전트 토큰을 최대 60% 절감한 FastContext 4B
FastContext-1.0-4B-SFT는 저장소 탐색을 전담하는 경량 서브에이전트로 병렬 도구 호출과 라인 범위 인용으로 메인 에이전트의 토큰 소비를 크게 줄이는 모델이다.
TL;DR
FastContext-1.0-4B-SFT는 저장소 탐색을 전담하는 경량 서브에이전트로 설계되어 메인 코딩 에이전트가 불필요한 파일 읽기와 검색으로 소모되는 토큰을 대신 처리한다. 핵심 작동은 입력 쿼리를 검색 의도로 변환한 뒤 READ, GLOB, GREP를 병렬 호출하고 관찰 기반으로 탐색을 정교화하여 최종적으로 파일 경로와 라인 범위 형태의 압축된 증거를 반환하는 것이다. SFT로 초기 탐색 행동을 학습한 뒤 GRPO 기반 강화학습으로 파일·라인 F1과 병렬 탐색 보너스, 형식 준수를 보상 신호로 최적화했으며 통합 실험에서 정확도 최대 5.5% 향상과 토큰 최대 60% 수준 절감이 관찰되었다. 이 접근은 탐색과 해법 생성을 명확히 분리함으로써 메인 에이전트의 문맥 품질을 높이고 추론 비용을 줄이는 대신 탐색 전용 인터페이스와 도구 지원이 필요하다는 운영적 제약을 수반한다.
핵심 역량
- 입력 쿼리를 검색 의도로 변환하고 READ, GLOB, GREP 같은 읽기 전용 도구를 병렬로 호출할 수 있다.
- 도구 출력 관찰을 바탕으로 추가 탐색 턴을 계획하고 증거 기반으로 라인 범위 인용을 생성할 수 있다.
- 메인 코딩 에이전트에 전달할 수 있도록 압축된 파일 경로와 라인 범위 포맷의 최종 증거 블록을 반환할 수 있다.
강점
- 메인 에이전트의 종단 간 정확도를 모든 주요 메인 에이전트와 벤치마크에서 개선했으며 최대 5.5%의 정확도 향상과 최대 60% 수준의 토큰 절감을 보고했다.
- 경량 4B-RL 변종이 더 큰 30B-SFT 변종보다 일부 상황에서 높은 SWE-bench Pro 점수를 달성하며 작은 모델로도 탐색 효율과 인용 품질을 확보할 수 있음을 보여주었다.
훈련 방식
기반은 Qwen/Qwen3-4B-Instruct이며 탐색 트레이스 기반으로 Supervised Fine-Tuning을 수행한 뒤 실제 서브에이전트 롤아웃을 통해 GRPO 강화학습으로 보상 신호(파일·라인 F1, 병렬 탐색 보너스, 형식 패널티)를 최적화하여 탐색 행동과 인용 형식을 정교화했다.
알아두면 좋은 것
- FastContext는 READ, GLOB, GREP 세 가지 읽기 전용 도구만 노출하여 탐색 권한을 최소화하고 탐색 출력을 라인 단위 인용으로 압축한다.
- 컨텍스트 길이는 최대 262K 토큰을 지원하며 Quick Start 예시에서 SGLang 기반 서버로 기동하는 커맨드를 제시한다.
- 학습은 탐색 추적을 기반으로 한 Supervised Fine-Tuning과 실제 서브에이전트 롤아웃에서의 GRPO 강화학습을 결합하여 병렬 탐색과 형식 준수를 보상 설계로 다루었다.
- 모델 패밀리는 4B부터 30B까지 존재하며 README와 논문 및 깃허브 코드가 공개되어 있다.
기술적 특징
- 탐색과 해법 생성을 분리하는 아키텍처 선택을 통해 탐색 관련 토큰 오염을 제거하고 메인 에이전트의 문맥을 정제된 인용으로 유지한다. 이 구조는 탐색 작업을 독립 서브에이전트로 위임하면서 메인 모델의 추론 비용을 절감하는 효과를 만든다.
- 초기 탐색에서 여러 가설을 동시에 검증하기 위해 READ, GLOB, GREP 호출을 병렬로 발행하는 전략을 사용한다. 병렬 호출은 넓은 후보를 빠르게 확보하고 이후 관찰 기반의 정교화 단계로 전환함으로써 전체 탐색 턴 수를 줄인다.
- 출력 형식으로 파일 경로와 라인 범위를 명시하는 라인 범위 인용 형식을 채택하여 긴 파일 내용을 전달하는 대신 정확한 코드 스니펫 위치만 제공한다. 이 방식은 토큰 비용을 직접적으로 낮추고 메인 에이전트가 필요한 부분만 읽도록 유도한다.
- 학습 파이프라인은 세분화된 탐색 트레이스에 대한 SFT와 실제 롤아웃 기반의 GRPO 강화학습을 결합한다. 보상은 파일·라인 F1과 병렬 탐색 보너스 및 포맷 위반 페널티를 결합하여 탐색 정확도와 형식 준수를 동시에 향상시키도록 설계되었다.
차별점
- 탐색 전용 서브에이전트로 설계되어 메인 에이전트 문맥 오염을 줄이는 아키텍처적 분리를 채택했다.
- 단순한 검색 도구가 아니라 관찰-정교화 루프와 라인 범위 인용을 통해 증거의 정밀도를 확보하는 탐색 행동을 학습했다.
- 병렬 READ/GLOB/GREP 호출을 한 턴 내에서 조합해 초기 탐색의 폭과 효율을 동시에 높이는 실행 전략을 사용한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Multilingual (GPT-5.4 + FC-30B-SFT) | accuracy and tokens | 75.0 (↑3.3) / 356k tokens (↓22.1%) | vs w/o Explore 71.7 / 457k |
| SWE-QA (GPT-5.4 + FC-30B-SFT) | accuracy and tokens | 82.0 (↑0.7) / 206k tokens (↓50.7%) | vs w/o Explore 81.3 / 418k |
| SWE-bench Pro (GLM-5.1 + FC-4B-RL) | accuracy and tokens | 22.5 (↑5.0) / 2210k tokens (↓17.9%) | vs w/o Explore 17.5 / 2692k |
369
Likes
7k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.