용어 해설
- 그룹 상대 정책 최적화(GRPO)
- — DeepSeek-R1에서 제안된 강화학습 기법으로, 별도의 가치 모델(Critic) 없이 동일 프롬프트에서 생성된 여러 응답(그룹)의 상대적 보상을 비교하여 정책을 업데이트하는 방식이다. 계산 효율성이 높고 추론 능력 강화에 효과적이다.
- 라그랑주 쌍대 상승법(Lagrangian Dual Ascent)
- — 제약 조건이 있는 최적화 문제를 해결하기 위한 수학적 기법이다. 제약 조건을 위반할 때마다 '라그랑주 승수'라는 가중치를 높여 모델이 해당 조건을 만족하도록 강제하며, 이를 통해 여러 목표 간의 균형을 자동으로 조절한다.
- 시각적 근거 제시(Visual Grounding)
- — 멀티모달 모델이 텍스트 응답을 생성할 때, 이미지 내의 구체적인 객체나 영역(Bounding Box)과 연결 짓는 능력이다. 모델이 단순히 짐작해서 답하는 것이 아니라 실제 시각적 증거에 기반해 추론하고 있음을 보장한다.
- 사고의 사슬(Chain-of-Thought)
- — 모델이 최종 정답을 내놓기 전에 단계적인 추론 과정을 텍스트로 생성하도록 유도하는 기법이다. 복잡한 논리적 문제를 해결하는 데 도움을 주지만, 생성된 추론 과정이 정답과 모순되거나 이미지 내용과 다를 수 있는 '불성실성' 문제가 발생하기도 한다.
코드 예제
A_FGRPO(o_i_j) = A_task(o_i_j) + sum_{k in {C,S,G}} lambda_k * A_k(o_i_j)FGRPO의 최종 어드밴티지(Advantage) 계산식으로, 기본 과업 보상에 논리적 일관성(C), 시각적 근거(S, G) 제약 조건의 어드밴티지를 라그랑주 승수와 결합하는 예시
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


