본문으로 건너뛰기

SkillCoach: 에이전트의 스킬 사용을 평가하고 향상시키기 위한 자기진화형 루브릭. 이 연구는 스킬 선택, 스킬 따르기, 스킬 구성, 스킬 기반 반성의 네 가지 메타 능력을 명확히 정의한다. 루브릭 진화는 검증기 결과와 분리된 프로세스 신호를 생성하여 평가 품질과 학습 데이터 선택을 개선한다.

대규모 기업형 스킬 라이브러리 환경에서는 금고 스킬이 존재해도 에이전트가 올바르게 선택·실행·구성·검증하지 못하면 결과가 재사용 가능하지 않다. SkillCoach는 최종 검증기 통과만으로 숨겨지는 실패 모드를 드러내는 프로세스 수준의 신호를 제공해 실무적 진단 및 학습 데이터 선별에 활용된다. 이로 인해 단순한 outcome-only 필터링보다 SFT 성능 향상에 더 강한 감독 신호가 확보된다.

용어 해설

스킬 사용 메타능력(Skill-Use)
에이전트가 주어진 스킬 라이브러리에서 적절한 스킬을 선택하고 스킬의 절차를 충실히 수행하며 여러 스킬을 올바르게 구성하고 결과를 검증하는 궤적 수준의 능력으로, 본문에서는 선택·따르기·구성·반성의 네 가지 차원으로 구체화되어 평가와 학습 신호로 활용된다.
프로세스 기반 루브릭(Process Rubric)
실행 궤적에서 관찰 가능한 증거에 기반해 스킬 선택, 단계 완수, 순서 의존성, 검증 절차 등을 항목화한 채점 규칙으로, 외부 검증기 결과와 분리된 프로세스 품질 신호를 제공하여 실패 모드를 진단하고 학습 데이터를 필터링하는 데 사용된다.
혼란 유발 스킬(Distractor Skill)
금고 스킬과 문서 구조나 트리거 문구가 유사하지만 현재 작업에는 적용되지 않는 스킬로, 대규모 공유 라이브러리에서 에이전트의 잘못된 스킬 선택을 유발해 스킬 사용 신뢰성을 저해하는 주된 원인으로 분석되었다.
검증 게이트형 진화(Validation-Gated Evolution)
루브릭 패치를 제안한 뒤 별도의 검증 세트에서 하드·소프트 기준을 적용해 개선 효과를 검증한 후에만 루브릭을 수용하는 절차로, 과도한 규칙 추가나 허위 요구를 방지하고 루브릭의 실효성을 유지하는 메커니즘이다.
궤적 수준 평가(Trajectory Evaluation)
최종 산출물의 정답 여부가 아니라 에이전트의 상호작용 기록(파일 읽기, 스킬 호출, 스크립트 실행 등)을 증거로 하여 선택·따르기·구성·반성의 각 차원을 점수화하는 평가 방식으로, 재사용 가능한 실행 패턴을 식별하는 목적을 가진다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 02.수집 2026. 07. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.