용어 해설
- 사고의 사슬(Chain-of-Thought)
- — 모델이 복잡한 문제를 해결할 때 중간 단계의 추론 과정을 순차적으로 생성하도록 유도하는 기법이다. 이를 통해 결과 도출 과정을 투명하게 만들고 논리적 오류를 줄여 복잡한 추론 성능을 높이는 역할을 한다.
- 그룹 상대 정책 최적화(GRPO)
- — 별도의 비판(Critic) 모델 없이 동일한 질문에 대한 여러 출력값의 상대적 보상을 비교하여 정책을 업데이트하는 강화학습 알고리즘이다. 계산 효율성이 높고 학습이 안정적이며 DeepSeek-R1 등 최신 모델에서 널리 사용된다.
- 시공간 추론(Spatial-Temporal Reasoning)
- — 이미지 내 객체의 위치 관계(공간)와 비디오 내 시간에 따른 변화(시간)를 동시에 파악하여 논리적으로 분석하는 능력이다. 비디오 이해와 자율 주행 등 동적인 환경 분석에 필수적인 기술이다.
- 직접 선호도 최적화(DPO)
- — 보상 모델을 별도로 학습시키지 않고 사람이 선호하는 답변 쌍을 직접 사용하여 모델을 정렬하는 기법이다. RLHF보다 구조가 단순하여 효율적이지만, 데이터 분포 변화에 민감할 수 있다는 특징이 있다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.