용어 해설
- 검증 불가능한 지시 따르기(Non-verifiable Instruction Following)
- — 환경의 정답을 자동으로 확인할 수 없거나 인간 평가가 필요한 작업에서 지시를 따르는 문제로, 보상 신호가 외부 정답에 의해 검증되지 않아 모델 행동의 질을 측정하기 위해 휴먼 저지나 LLM 저지가 필요하다는 점에서 중요하다.
- LLM 심사자(LLM Judge)
- — 모델 출력 품질을 비교·평가하는 데 LLM을 평가자 역할로 사용하는 방식으로, 비교 판정이나 점수 산정에 prompt 기반 루브릭을 사용해 인간 평가를 자동화하려는 기술적 수단이다.
- 쌍별 비교(Pairwise Comparison)
- — 두 개의 정책 롤아웃을 쌍으로 입력하여 어느 쪽이 더 우수한지를 판단하는 절차로, 비교 결과를 보상 신호로 환산해 모델 업데이트에 직접 활용할 수 있어 판별 가능한 신호를 확보하는 데 유용하다.
- 원자 제약(Atomic Constraint)
- — 기존 프롬프트에 덧붙여 난이도를 국소적으로 올리는 간단하고 독립적인 제약 조건으로, 점진적으로 난이도를 높여 정책 능력에 맞춘 도전 과제를 만드는 데 사용된다.
- 자기조정형 훈련 신호(Self-Calibrating Training Signal)
- — 정적 난이도 스케줄 없이 모델의 현재 능력에 따라 자동으로 판별력이 유지되는 보상 신호를 생성하는 메커니즘으로, 프롬프트 난이도를 정책 성능에 맞춰 점증적으로 조정하여 보상 신호의 정보량을 유지한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.