용어 해설
- 환경 비의존(Environment-free)
- — 에이전트가 각 저장소별로 Docker 이미지나 종속성을 설치하지 않고 단일 최소 기반 이미지에서 코드 롤아웃을 수집하고 평가하는 설정이다. 이 설정에서는 테스트 실행 기반의 정확한 검증 신호가 없으므로 저장소 내부 문맥을 대체할 검증 방법이 필요하다. 논문 맥락에서는 확장성 확보와 사생활·레거시 코드 저장소 평가를 위한 핵심 전제로 사용된다.
- 에이전틱 검증기(Agentic Verifier)
- — 검증 과정을 단순 점수화가 아니라 여러 검증 질문을 생성하고 병렬 서브에이전트를 통해 저장소를 탐색하여 증거 기반 답변을 수집한 뒤 최종 판정을 내리는 에이전트형 검증기이다. 각 서브에이전트는 읽기 전용 셸 도구(find, rg 등)를 호출해 증거를 수집하고, 수집된 (질문,답변) 쌍을 근거로 최종 확률적 판정을 출력한다. Dockerless는 이 개념을 바탕으로 실행 없이도 저장소 맥락으로 정합성 판정을 수행한다.
- 거부 표본추출(Rejection Sampling)
- — 교사 모델이 생성한 질문-답변-판정 궤적이 실제 테스트 실행 결과(ground-truth)와 일치할 때만 학습 데이터로 보관하는 표본추출 절차이다. 이 방식은 검증기 학습 신호의 일관성을 유지하고, 우연히 정답과 일치하는 잘못된 추론 궤적을 제거한다. 논문에서는 실행 라벨이 있는 후보 패치 3.7K 샘플로 이 과정을 적용해 Dockerless를 학습시켰다.
- GRPO
- — 그룹 기반 정규화 보상(그룹 정규화된 확장)을 사용해 RL 업데이트를 안정화하는 알고리즘이다. 각 이슈에 대해 수집된 복수 롤아웃의 보상 분포를 이용해 그룹 정규화된 어드밴티지를 계산하고 이를 GRPO 목적함수에 적용한다. 논문에서는 Dockerless로 산정한 보상을 GRPO로 최적화해 RL 모델을 학습했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





