용어 해설
- 패스-앳-K(Pass@K)
- — 모델이 생성한 K개의 답변 중 적어도 하나가 정답일 확률을 의미함. 모델이 특정 문제에 대해 정답을 생성할 수 있는 잠재적 지식(Support)을 얼마나 보유하고 있는지 측정하는 지표로, 단순 정확도보다 모델의 역량 한계를 파악하는 데 유용함.
- 그룹 상대 정책 최적화(GRPO)
- — 강화학습 기법 중 하나로, 별도의 가치 모델(Critic) 없이 샘플 그룹 내의 상대적 보상을 사용하여 정책을 업데이트함. 계산 효율성이 높고 대규모 언어 모델의 정렬 학습에 주로 사용되며, 모델의 출력 분포를 정교화하는 데 효과적임.
- 선형 탐침(Linear Probing)
- — 사전 학습된 모델의 가중치를 고정하고 마지막에 층 하나만 추가하여 성능을 평가하는 기법임. 이를 통해 모델이 학습 과정에서 데이터의 유의미한 특징(Feature)을 얼마나 잘 추출하여 내부에 저장하고 있는지 직접적으로 확인할 수 있음.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.