용어 해설
- 검색 증강 생성(RAG)
- — 검색 증강 생성(RAG)은 외부 지식을 검색해 생성 모델의 입력으로 넣어 응답 품질을 높이는 기법이다. 질의에 대해 관련 문서를 먼저 검색하고, 검색 결과를 컨텍스트로 제공해 생성기의 답변 정확도를 개선한다. 본문에서는 온라인(query-side)과 오프라인(index-side) 방식의 rationale 생성을 대조한다.
- 밀집 벡터 기반 검색기(Dense Retriever)
- — Dense Retriever는 문서와 질의를 임베딩 공간으로 매핑한 뒤 코사인 유사도 등으로 검색하는 방식이다. 임베딩은 문장 수준 의미를 포착하지만 문서와 질의 사이의 복잡한 논리적 관계를 항상 포착하지 못해 본 논문의 보강 대상이 된다.
- 임베딩(벡터 표현)(Embedding)
- — Embedding은 텍스트를 실수 벡터로 변환하는 방법이다. 질의 q와 문서 d가 주어지면 인코더가 각각 임베딩을 계산하고, 코사인 유사도 등의 연산으로 관련도를 평가한다. 본문에서는 임베딩 유사도(코사인)를 보상 신호로 사용한다.
- 정규화 누적 이득 nDCG@10(nDCG@10)
- — nDCG@10은 상위 10개 검색 결과의 관련도 순서를 고려한 랭킹 지표이다. 각 결과의 기여를 로그 스케일로 가중합해 계산하고 정규화해 0~1 범위로 표현한다. 본문에서는 BRIGHT 벤치마크 평가에 nDCG@10을 사용한다.
- Group Relative Policy Optimization(GRPO)
- — GRPO는 그룹 단위로 샘플된 후보들 사이에서 상대적 우위를 학습하는 정책 최적화 기법이다. 한 문서에 대해 K개의 증강본을 샘플하고 각 증강의 보상을 정규화해 상대적 advantage를 계산한 뒤, 중요도 비율과 clipping을 적용해 정책을 업데이트한다. 본 논문에서 rationale 품질 최적화에 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

