본문으로 건너뛰기

Dockerless: 코딩 에이전트를 위한 환경 비의존 프로그램 검증기

실제 소프트웨어 저장소는 종종 재현 가능한 실행 환경이나 충분한 테스트를 갖추지 못해 실행 기반 검증이 불가능하거나 비용이 매우 높다. Dockerless는 저장소를 직접 실행하지 않고도 저장소 내부를 탐색해 증거를 수집하고 패치의 정합성을 확률적 점수로 판정함으로써 per-repository Docker 구축 비용을 제거한다. 이로 인해 SFT와 RL의 후처리 파이프라인 전체를 단일 최소 이미지에서 운용할 수 있어 확장성 있게 롤아웃을 수집하고 학습 데이터를 선별할 수 있다.

용어 해설

환경 비의존(Environment-free)
에이전트가 각 저장소별로 Docker 이미지나 종속성을 설치하지 않고 단일 최소 기반 이미지에서 코드 롤아웃을 수집하고 평가하는 설정이다. 이 설정에서는 테스트 실행 기반의 정확한 검증 신호가 없으므로 저장소 내부 문맥을 대체할 검증 방법이 필요하다. 논문 맥락에서는 확장성 확보와 사생활·레거시 코드 저장소 평가를 위한 핵심 전제로 사용된다.
에이전틱 검증기(Agentic Verifier)
검증 과정을 단순 점수화가 아니라 여러 검증 질문을 생성하고 병렬 서브에이전트를 통해 저장소를 탐색하여 증거 기반 답변을 수집한 뒤 최종 판정을 내리는 에이전트형 검증기이다. 각 서브에이전트는 읽기 전용 셸 도구(find, rg 등)를 호출해 증거를 수집하고, 수집된 (질문,답변) 쌍을 근거로 최종 확률적 판정을 출력한다. Dockerless는 이 개념을 바탕으로 실행 없이도 저장소 맥락으로 정합성 판정을 수행한다.
거부 표본추출(Rejection Sampling)
교사 모델이 생성한 질문-답변-판정 궤적이 실제 테스트 실행 결과(ground-truth)와 일치할 때만 학습 데이터로 보관하는 표본추출 절차이다. 이 방식은 검증기 학습 신호의 일관성을 유지하고, 우연히 정답과 일치하는 잘못된 추론 궤적을 제거한다. 논문에서는 실행 라벨이 있는 후보 패치 3.7K 샘플로 이 과정을 적용해 Dockerless를 학습시켰다.
GRPO
그룹 기반 정규화 보상(그룹 정규화된 확장)을 사용해 RL 업데이트를 안정화하는 알고리즘이다. 각 이슈에 대해 수집된 복수 롤아웃의 보상 분포를 이용해 그룹 정규화된 어드밴티지를 계산하고 이를 GRPO 목적함수에 적용한다. 논문에서는 Dockerless로 산정한 보상을 GRPO로 최적화해 RL 모델을 학습했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 26.수집 2026. 07. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.