용어 해설
- 지도 미세 조정(SFT)
- — 전문가가 작성한 정답 데이터를 모델이 그대로 모방하도록 학습시키는 기법임. 정답 토큰의 발생 확률을 최대화하는 방식으로 동작하며, 특정 도메인의 지식을 주입하거나 응답 형식을 맞추는 초기 단계에서 매우 중요함.
- 강화 학습(Reinforcement Learning)
- — 모델이 생성한 결과물에 대해 보상을 주어 좋은 행동을 강화하는 방식임. 시행착오를 통한 탐색을 수행하며, 정답이 정해지지 않은 복잡한 추론이나 정렬 작업에서 모델의 잠재력을 극대화하는 데 필수적임.
- 사고의 사슬(Chain-of-Thought)
- — 복잡한 문제를 해결할 때 중간 추론 단계를 명시적으로 생성하게 하여 논리적 정확도를 높이는 기법임. 모델이 최종 답변에 도달하기 전 단계별 사고 과정을 거치게 함으로써 복합적인 추론 능력을 향상시킴.
- 분포 변화(Distribution Shift)
- — 학습 데이터의 분포와 실제 추론 시 데이터의 분포가 달라져 모델의 성능이 저하되는 현상임. SFT 모델이 학습 시 보지 못한 새로운 상황에 직면했을 때 오류가 누적되어 엉뚱한 답변을 내놓는 주요 원인이 됨.
- 보상 모델(Reward Model)
- — 모델의 답변이 얼마나 좋은지 점수를 매기는 별도의 모델로, 강화 학습의 핵심적인 가이드 역할을 수행함. 인간의 선호도를 학습하여 모델이 생성한 결과물에 대해 수치화된 피드백을 제공함.
- 근사 정책 최적화(PPO)
- — 강화 학습에서 정책 업데이트 시 변화폭을 제한하여 학습의 안정성을 보장하는 대표적인 알고리즘임. 모델이 너무 급격하게 변하지 않으면서도 보상을 최대화하는 방향으로 학습되도록 제어함.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.