용어 해설
- 리랭킹(Reranking)
- — 검색 시스템의 2단계 과정으로, 1단계에서 임베딩 모델이 추출한 수백 개의 후보군을 더 정교한 모델로 다시 순위를 매기는 기법이다. 검색 결과의 최상단 품질을 결정짓는 핵심 단계로, AI 에이전트가 정확한 코드 정보를 참조하게 만드는 데 필수적이다.
- 정규화된 할인 누적 이득(nDCG)
- — 검색 결과의 순위 품질을 평가하는 지표로, 관련성이 높은 항목이 상단에 위치할수록 높은 점수를 부여한다. 단순한 정답 유무를 넘어 검색 엔진이 얼마나 정교하게 사용자 의도에 맞는 순서를 제안하는지 측정하는 데 사용된다.
- 데이터 오염(Data Contamination)
- — 모델의 학습 데이터에 평가용 데이터셋이 포함되어 성능이 비정상적으로 높게 측정되는 현상이다. 코드 검색 모델이 실제 문제 해결 능력이 아닌 암기된 정보를 출력하는 문제를 야기하며, 이를 방지하기 위해 시간적 필터링이나 변형 기법이 동원된다.
- 하드 네거티브(Hard Negative)
- — 정답과 겉모습은 매우 유사하지만 실제로는 오답인 데이터 샘플이다. 코드 검색에서는 문법이나 변수명은 비슷하지만 알고리즘 로직이 틀린 코드가 해당하며, 모델이 단순한 문자열 매칭을 넘어 깊은 의미론적 이해를 갖췄는지 테스트하는 데 중요하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

