128K 콘텍스트와 GRPO로 터미널 기반 취약점 국지화를 실현하는 1B 모델
Antares-1B는 IBM Granite 4.0 1B를 기반으로 SFT 후 GRPO로 미세조정된 터미널 에이전트형 취약점 국지화 모델로서 VLoc Bench에서 File F1 0.209를 기록했다.
TL;DR
Antares-1B는 IBM Granite 4.0 1B를 기반으로 SFT 이후 GRPO로 미세조정된 터미널 에이전트형 언어모델로서, 셸 명령을 생성해 리포지토리를 탐색하고 취약한 파일을 제출하는 취약점 국지화에 특화되었다. 모델은 도구 호출을 <tool_call> JSON로 출력하고 샌드박스에서 실행된 결과를 <tool_response>로 받아 반복적 탐색을 수행하며 15회 호출 예산과 128K 콘텍스트를 활용해 근거 기반 후보 파일을 도출한다. VLoc Bench 평가에서 File F1 0.209를 달성했고 단일 H100과 16 병렬 워커로 500개 과제를 약 13분에 처리해 작은 모델 규모로도 실무적 처리량을 확보했다. 다만 15회 호출 예산과 데이터 컷오프(2025-04-10)는 대형 리포지토리나 최신 취약성에 대한 성능 제약으로 작용할 수 있으며 배포 시 샌드박스 격리와 인간 검토를 권고한다.
핵심 역량
- 주어진 CWE 범주 설명을 바탕으로 리포지토리에서 grep, find, cat 등 표준 유닉스 명령을 순차적으로 호출해 관련 코드 위치를 탐색하고 후보 파일 목록을 산출할 수 있다. 탐색은 최대 15개의 터미널 호출 예산 내에서 이루어지며 각 호출의 출력은 다음 결정에 즉시 반영된다. 모델은 탐색 결과를 사람 가독성, JSON, SARIF 같은 기계 판독 형식으로 반환할 수 있도록 설계되었다.
- CI/CD 파이프라인에 통합되어 Shift-Left 보안 워크플로에서 자동화된 파일 수준 탐지를 보조할 수 있다. 온프레미스 환경과 샌드박스 격리 조건을 충족하면 네트워크 분리된 상태에서 리포지토리 스냅샷을 대상으로 반복적 분석을 수행한다. 보안 담당자는 모델이 리턴한 후보 파일을 근거로 추가 정적 분석이나 수동 검토를 진행할 수 있다.
- 도구 연동 관점에서 OpenAI 호환 추론 엔드포인트와 연결하여 에이전트 루프를 완전하게 재현할 수 있으며, 제공된 Antares CLI는 리포지토리 스냅샷에 대한 전수 분석과 CWE 기반 타겟 분석을 지원한다. CLI는 자동화된 스위프와 타겟 분석 모드를 제공하며 결과를 여러 형식으로 출력한다. 이로 인해 보안 워크플로에 신속히 편입시키기 위한 초기 통합 비용이 낮아진다.
강점
- Antares-1B는 1B 규모 모델로서 VLoc Bench에서 File F1 0.209를 기록해 문서에 제시된 비교 대상 모델들보다 높은 파일 수준 성능을 보였다. 이 성과는 SFT로 초기 추론 능력을 확보한 뒤 GRPO로 제출 행동과 탐색 전략을 직접 최적화한 훈련 파이프라인의 효과를 반영한다. 결과적으로 모델은 상대적으로 작은 파라미터 수로도 탐색·제출 정책을 효율적으로 학습해 온프레미스 배포에 적합한 성능을 달성했다.
- 운영 효율성 측면에서 문서에 제시된 실험 설정에서는 단일 H100 GPU와 16 병렬 워커로 VLoc Bench의 500개 과제 전체를 약 13분 만에 완료해 스케줄링과 처리량 측면에서 실용적이라는 점이 확인되었다. 이 수치는 동일한 에이전트 프로토콜과 15회 호출 예산을 사용하는 다른 대형 모델 대비 빠른 처리 시간을 의미한다. 따라서 자동화된 파이프라인 통합 시 실무 적용 비용과 자원 요구가 현실적인 수준으로 유지된다.
훈련 방식
기반 아키텍처는 IBM Granite 4.0 1B이며 학습은 두 단계로 이루어졌다. 첫 단계에서는 터미널 네비게이션과 사이버보안 추론, 코드 검색 궤적을 포함한 감독학습(SFT)을 적용했고 두 번째 단계에서는 GRPO를 통해 에이전트의 다중턴 궤적을 대상으로 복합 보상 신호로 정책을 강화학습했다. 학습 데이터와 평가 스냅샷은 오프라인으로 준비되었고 데이터 컷오프는 2025-04-10이다.
알아두면 좋은 것
- 모델은 공개 접근이 제한된 gated 리포지토리로 제공되며 접근 요청 시 이름, 소속, 이메일 같은 정보를 제출하고 수동 검토 절차를 거쳐야 한다. 이 접근 통제는 민감한 보안 도메인 특성을 반영해 온프레미스 배포와 규제 준수를 용이하게 하기 위한 조치이다. Antares CLI는 저장소의 Files 섹션에 ZIP으로 포함되어 있어 통합 시 업무 흐름을 빠르게 시작할 수 있다.
- 학습 파이프라인은 두 단계로 구성되어 있으며 첫 단계는 터미널 탐색 및 사이버보안 추론을 포함한 SFT였고 두 번째 단계는 GRPO 기반 강화학습으로 정책을 미세조정했다. GRPO는 파일 수준 국지화 품질과 도구 사용 규칙 준수 같은 다중 보상 요소를 통합해 에이전트 행동을 직접적으로 최적화했다. 데이터 컷오프는 2025년 4월 10일로 명시되어 있어 이후 등장한 취약성·기법은 모델이 알지 못할 수 있다.
- 평가에는 VLoc Bench라는 500개 과제로 구성된 벤치마크가 사용되었으며 각 과제는 최대 15회의 터미널 호출 예산과 동일한 생성 설정(temperature=0.3, top_p=1.0)을 적용받았다. 성능 지표는 파일 수준 F1을 포함한 정밀도·재현율·F1의 매크로 평균이며 결과는 세 번의 독립 실행 평균으로 보고되었다. Antares-1B는 이 평가 설정에서 1B 모델로서 File F1 0.209를 달성했다.
- 모델은 샌드박스화된 터미널 환경에서의 운영을 전제로 설계되며 배포 시 Docker 네트워크 비활성화, 자원 제한, 타임아웃 같은 시스템 수준의 안전 조치를 권고하고 있다. 문서에서는 모델을 최종 결정 자동화에 사용하지 말고 항상 인간의 검토를 요구할 것을 권장했다. 또한 공격적 사용과 악성 코드 생성 같은 행위는 명시적으로 사용 금지 대상으로 분류되었다.
기술적 특징
- 아키텍처는 Auto-regressive decoder-only transformer 기반의 IBM Granite 4.0 1B이며 40개 레이어와 hidden dim 2048, 16개의 attention head, 4개의 KV head를 사용해 GQA 구조를 구현했다. RoPE positional encoding과 SwiGLU 활성화, RMSNorm을 적용해 긴 문맥과 안정적 학습을 지원하며 어휘 크기는 100,352로 구성되어 있다. 128K의 긴 콘텍스트 윈도우는 리포지토리 전반의 터미널 궤적을 한 세션에서 유지할 수 있게 해 탐색 기반 작업에서 유리하게 작동한다.
- 학습 파이프라인은 두 단계로 설계되어 SFT로 초기 정책을 학습한 뒤 GRPO로 정책을 강화학습해 에이전트의 실질적 제출 행동과 도구 사용 규범을 조절했다. GRPO 단계에서는 파일 수준 국지화 품질, 제출 유효성, 도구 사용 규정 준수, 탐색 행동 균형 등 다중 구성 보상을 사용해 전체 궤적 성능을 직접적으로 개선했다. 이 접근은 단일 턴의 정답 예측이 아닌 다턴 탐색 전략을 최적화하는 데 기여했다.
- 에이전트 실행 프로토콜은 모델이 내부 추론을 <think> 블록으로 출력하고 도구 호출은 <tool_call> JSON 형식으로 생성하는 구조를 채택해 외부 인프라가 명령을 실행하고 결과를 <tool_response>로 반환하도록 설계되었다. 이 명령-응답 루프는 샌드박스된 터미널 환경에서 안정적으로 동작하도록 구성되어 있으며 인프라는 각 도구 호출을 파싱하고 안전한 실행 컨테이너에서 결과를 제공해야 한다. 이러한 구조는 모델의 행동을 외부 검증 가능한 로그로 남기고 자동화된 파이프라인에서 재현 가능성을 확보한다.
- 평가 설정과 운영 권고는 실무 적용을 고려해 설계되어 있으며 단일 GPU 환경에서 병렬 워커를 이용한 처리 방식을 문서로 제시했다. 실험 결과에서는 16 병렬 워커와 H100 한 장으로 전체 벤치마크를 목표 시간 내에 처리했고 이는 온프레미스 자동화 워크플로에 적합한 자원 프로필을 제공한다. 다만 15회 호출이라는 엄격한 예산 제한은 큰 리포지토리나 다중 파일 컨텍스트를 필요로 하는 취약성에 대해 성능 저하를 야기할 수 있다.
차별점
- Antares-1B는 터미널 명령 기반의 에이전트 루프를 기본 실행 방식으로 채택해 외부 벡터 DB나 검색 시스템 없이 로컬 리포지토리 탐색만으로 취약점 국지화를 수행한다. 이로 인해 온프레미스 배포 시 데이터 유출 위험을 낮추면서도 실제 파일 시스템 상에서 도구 호출을 통한 근거 수집이 가능하다. 다른 접근법들이 주로 임베딩 검색이나 정적분석 신호에 의존하는 반면 Antares는 실행 가능한 탐색 전략을 직접 학습했다.
- 훈련 파이프라인에서 GRPO를 적용해 다중 턴 궤적 단위의 보상을 통해 제출 행동을 직접 최적화함으로써 작은 모델 규모(1B)로도 경쟁력 있는 파일 수준 성능을 달성했다. GRPO는 파일 F1과 도구 사용 규정 준수 같은 운영 지표를 보상으로 포함해 실제 에이전트 운영에서 필요한 행동을 강화했다. 결과적으로 Antares-1B는 모델 크기 대비 탐색·제출 성능에서 차별성을 보였다.
- 제공되는 Antares CLI는 리포지토리 스냅샷을 읽기 전용으로 분석하고 결과를 사람 가독성 또는 SARIF 같은 표준형식으로 출력하므로 보안 분석 파이프라인과 직접적으로 연계할 수 있다. 이 CLI는 엔드포인트 연결과 결과 포맷 옵션을 포함해 현장 통합을 단순화하는 역할을 수행한다. 문서에 포함된 ZIP 파일 형태로 배포되어 초기 통합 비용을 낮추는 이점이 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| VLoc Bench (Phase A — File F1) | File F1 | 0.209 | 보고서에서는 Antares-1B(1B)가 GLM-5.2, Gemini 3 Pro, GPT-5 Mini, Qwen3.5-122B 등보다 우수하다고 명시했다. |
239
Likes
9.8k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.