본문으로 건너뛰기

재작성으로 향상된 코드 검색: NL-강화 PseudoCode 및 전체 NL을 직접 검색 표현으로 활용

임베딩 기반 코드 검색은 표면 구문에 과적합하는 경향이 있어 코드의 의미를 왜곡한다. 본 연구는 세 가지 재작성 전략과 두 가지 확장 방식(QC/온라인, C/오프라인)을 체계적으로 비교하고, 입력 토큰 엔트로피 변화(∆H)와 임베딩 코사인 변화(∆¯s)라는 두 가지 진단 지표를 제시한다. NL-강화 재작성이 코드 중심 질의에서 특히 큰 이득을 가져올 수 있음을 보이며, 언제 재작성 비용을 들일지 결정하는 실용 프레임워크를 제시한다.

용어 해설

토큰 엔트로피(Token Entropy)
텍스트 토큰의 확률 분포에서의 엔트로피를 측정한 값으로, NL이 포함될수록 토큰의 다양성이 증가하고 분포가 더 평탄해지는 경향이 있다.
임베딩 코사인 유사도(Embedding Cosine)
임베딩 벡터 간 코사인 유사도를 평균화해 표현의 분산도나 구분력을 나타내는 지표이다.
CoIR 벤치마크(CoIR Benchmarks)
코드 정보 검색에 사용되는 다수의 데이터셋을 묶은 벤치마크 모음으로, 코드-코드, 텍스트-코드, 하이브리드 태스크를 포함한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 08.수집 2026. 05. 14.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.