용어 해설
- 멀티홉 추론(Multi-hop Reasoning)
- — 한 번의 검색으로 해결되지 않는 복잡한 쿼리에 대해 여러 단계의 검색과 분석을 반복하며 정보를 통합하는 과정이다. 각 단계의 결과가 다음 검색의 단서가 되어 최종적으로 깊이 있는 지식을 수집하는 메커니즘을 의미한다.
- 그룹 상대 정책 최적화(GRPO)
- — 별도의 가치 모델(Value Model) 없이 동일한 프롬프트에서 생성된 여러 출력값의 상대적 보상을 비교하여 모델을 학습시키는 강화학습 알고리즘이다. 계산 효율성이 높고 에이전트의 정책 최적화에 효과적이다.
- 근거 설정(Grounding)
- — 생성 모델이 내부 지식에만 의존하지 않고 외부의 실제 데이터나 시각적 참조물에 기반하여 결과를 생성하도록 연결하는 기술이다. 이미지 생성에서 특정 인물이나 사물의 정확한 외형을 재현하는 데 필수적이다.
- 지도 미세 조정(SFT)
- — 사람이 작성한 정답 데이터셋을 사용하여 모델이 특정 작업 수행 방식을 배우도록 학습시키는 과정이다. 본 논문에서는 에이전트가 검색 도구를 사용하는 기초적인 능력을 갖추게 하는 첫 번째 학습 단계로 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.