본문으로 건너뛰기

CoGR: 검색 매칭을 함께 진화시키는 두 LLM

CoGR은 쿼리·아이템 LLM을 번갈아 학습해 키워드 역색인 검색의 F1을 높인다

용어 해설

역색인(Inverted Index)
문서나 아이템에 포함된 키워드를 기준으로 해당 항목의 위치를 저장하는 검색 자료구조입니다. 검색어의 키워드를 역색인에서 조회해 일치하는 아이템을 빠르게 모으므로 대규모 키워드 검색의 핵심 기반으로 쓰입니다.
희소 검색(Sparse Retrieval)
쿼리와 문서를 대부분 비어 있는 키워드·가중치 벡터로 표현하고 겹치는 항이나 학습된 용어를 기준으로 검색하는 방식입니다. BM25처럼 역색인과 결합하기 쉽지만 표현이 다른 의미 관계를 포착하는 데 한계가 있습니다.
밀집 검색(Dense Retrieval)
쿼리와 아이템을 연속적인 embedding 공간의 벡터로 바꾼 뒤 벡터 유사도로 가까운 항목을 찾는 검색 방식입니다. 단어가 정확히 겹치지 않아도 의미적 유사성을 활용하지만 별도의 벡터 검색 인프라가 필요합니다.
생성 검색(Generative Retrieval)
검색 모델이 쿼리에서 문서 식별자나 의미 표현을 직접 생성해 검색하는 방식입니다. 유사도 검색을 대체할 수 있지만 식별자 설계, decoding 확장성, 새로운 항목에 대한 일반화가 주요 과제로 남습니다.
반사실적 한계 보상(Counterfactual Marginal Reward)
특정 아이템의 키워드만 후보 세트로 교체했을 때 전체 검색 F1이 기준 상태와 비교해 얼마나 변하는지 측정하는 보상입니다. 다른 아이템을 고정한 채 해당 키워드의 순수한 기여를 계산하므로 item-side RL의 학습 신호가 됩니다.
BM25
쿼리와 문서의 단어 빈도, 문서 길이, 역문서 빈도 등을 이용해 lexical match 점수를 계산하는 검색 ranking 방식입니다. CoGR은 생성된 키워드를 역색인으로 매칭한 뒤 BM25 점수로 검색 결과의 순서를 정합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 01.수집 2026. 09. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.