본문으로 건너뛰기

EarlyEval: 에이전트 평가를 조기에 끝내는 결과 예측

EarlyEval은 에이전트의 중간 행동에서 성공·실패를 예측해 실행 단계와 토큰 비용을 줄입니다.

용어 해설

조기 결과 예측(Early Outcome Prediction)
에이전트가 전체 실행을 끝내기 전에 중간 행동 궤적에서 최종 성공·실패 결과를 추정하는 평가 기법입니다. 예측 확률이 정해진 임계값을 넘으면 남은 단계를 실행하지 않고 결과를 기록해 태스크별 평가 비용을 줄입니다.
에이전트 1개 제외 검증(Leave-One-Agent-Out)
전체 에이전트 구성 중 하나를 테스트 대상으로 남기고 나머지 에이전트의 궤적으로 예측기를 학습하는 검증 방식입니다. 학습에 보지 못한 모델이나 scaffold에도 조기 결과 예측이 작동하는지 측정하는 데 사용됩니다.
LightGBM
Gradient-boosted decision tree 앙상블을 빠르게 학습하고 추론하는 라이브러리입니다. EarlyEval에서는 행동·텍스트·참조 해답 특징을 입력받아 성공 확률과 실패 확률을 각각 계산하며, 단일 CPU 코어에서 수백 차원 벡터를 1밀리초보다 짧게 처리합니다.
Platt 보정(Platt Scaling)
분류기의 원시 점수를 검증 데이터에 맞춘 1차원 Logistic Regression으로 확률값으로 재조정하는 방법입니다. EarlyEval은 성공·실패 예측기의 점수를 보정해 서로 다른 검증 fold에서도 임계값이 일관된 신뢰도로 작동하게 합니다.
TF-IDF
문서에서 단어의 빈도와 전체 문서에서의 희소성을 함께 사용해 텍스트를 수치 벡터로 바꾸는 표현 방식입니다. EarlyEval은 태스크 설명, 행동 기록, 환경 피드백을 별도 블록으로 벡터화한 뒤 Truncated SVD로 차원을 줄입니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 02.수집 2026. 09. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.