용어 해설
- 사고의 사슬(Chain-of-Thought)
- — 모델이 최종 정답에 도달하기 전 중간 추론 단계를 명시적으로 생성하도록 유도하는 기법이다. 복잡한 논리나 수치 계산이 필요한 작업에서 모델의 추론 정확도를 높이는 핵심적인 역할을 한다.
- 지식 증류(Knowledge Distillation)
- — 거대 모델(Teacher)의 지식이나 추론 능력을 더 작은 모델(Student)에게 전달하는 학습 방식이다. 작은 모델이 거대 모델의 추론 패턴을 모방하게 함으로써 효율성을 극대화한다.
- 그룹 상대 정책 최적화(GRPO)
- — 별도의 가치 모델 없이 그룹 내 샘플들의 상대적 보상을 비교하여 정책을 업데이트하는 강화학습 알고리즘이다. 계산 효율성이 높고 추론 모델의 정렬에 효과적이다.
- 지도 미세 조정(SFT)
- — 사람이 작성하거나 고성능 모델이 생성한 정답 데이터를 사용하여 모델을 특정 작업에 맞게 학습시키는 단계이다. 모델의 기초적인 지시 이행 능력을 형성한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.