용어 해설
- 스코어링 토큰 로그잎스(Scoring Token Logits)
- — LLM-as-a-Verifier 맥락에서 채점 토큰의 로그확률 분포를 가리키는 용어로, 모델이 특정 점수 토큰에 할당한 로그확률을 추출하여 연속적 점수 기대값을 계산하는 데 사용된다. 이 분포를 통해 단일 토큰 출력을 넘는 세밀한 신호 확보와 불확실성 정량화가 가능하다.
- 점수 세분화(Score Granularity)
- — 채점 토큰 집합의 크기 G를 가리키며, 토큰 수가 클수록 모델의 내재적 신념이 더 세밀하게 연속 점수로 투영된다. 점수 세분화는 같은 신념이 정수로 둔갑하는 현상을 줄여 SNR과 판별력을 높인다.
- 반복 평가(Repeated Evaluation)
- — 동일한 추론·프롬프트 설정으로 K회 독립적 평가를 수행해 점수의 분산을 줄이는 절차로, 몬테카를로 평균을 통해 편향은 유지하면서 분산을 O(1/K)로 감소시킨다. 특히 프롬프트 편향이나 일시적 실패에 강한 평균적 추정치를 제공한다.
- 평가기준 분해(Criteria Decomposition)
- — 단일의 복합적 평가문항을 여러 단순 기준(C개)으로 분해하여 각 기준별 기대 점수를 계산한 뒤 평균하는 방법으로, 각각의 기준이 포착하는 질적 요소를 독립적으로 검증하여 복합적 편향을 완화한다. 예로 코드에서는 Specification, Output, Errors로 분해했다.
- 값-순서 상관도(Value-Order Correlation (VOC))
- — 시간적으로 진행되는 에이전트의 단계 인덱스와 해당 접두사에 대한 검증기 점수의 스피어만 순위상관으로, 진행 단계를 얼마나 잘 추적하는지 수치화한다. VOC가 1에 가까울수록 검증기 점수가 시간 진행과 일관된 상승을 보인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





