용어 해설
- 자가 대전(Self-play)
- — 모델이 스스로 생성한 데이터나 자기 자신과의 상호작용을 통해 학습하는 기법이다. 외부의 정답 데이터 없이도 모델이 스스로 문제를 내고 풀며 성능을 개선할 수 있어 데이터 확장성이 매우 높다.
- 커리큘럼 학습(Curriculum Learning)
- — 쉬운 개념부터 시작하여 점진적으로 난이도를 높여가며 학습하는 전략이다. 모델의 현재 수준에 맞는 적절한 난이도의 과제를 제공함으로써 학습의 효율성과 안정성을 극대화한다.
- 그룹 상대 정책 최적화(GRPO)
- — 별도의 가치 모델 없이 그룹 내 샘플들의 상대적 보상을 비교하여 정책을 업데이트하는 강화학습 알고리즘이다. 계산 효율성이 높고 대규모 언어 모델의 정렬 및 추론 능력 향상에 효과적이다.
- 도구 호출(Tool-calling)
- — LLM이 외부 API나 함수를 실행하기 위해 필요한 인자값을 생성하는 능력이다. 모델의 정적 지식을 넘어 실시간 정보 검색이나 계산기 실행 등 외부 도구와의 상호작용을 가능하게 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.