TL;DR
이 글은 10억개 이상의 후보 프로필을 대상으로 하는 채용 검색에서 관련성 라벨이 부족한 상황을 해결한 시스템 설계와 실험 결과를 포함한다. 핵심적으로 prompt-engineered Expert Judge로 수백만 건의 Chain-of-Thought 포함 라벨을 생성하고 그 라벨을 바탕으로 대비학습과 LoRA 또는 end-to-end 파인튜닝을 통해 임베딩을 재학습해 검색 품질을 개선했다. 오프라인 사전 랭킹의 고관련성 비율이 4%포인트 개선되었고 온라인에서는 가드 이후 HRR이 2.7%포인트 상승하고 InMail 발송이 4.1% 증가했으며 소싱 후보 수는 4% 감소하는 질적 트레이드오프가 관찰되었다. 그러나 Expert Judge의 프롬프트·가중치·코드는 공개되지 않아 외부 재현이 제한되며 쿼리 유형별 분포 불일치를 해결하기 위해 쿼리 혼합과 어댑터 적용이 병행되었다.
커뮤니티 반응
작성자는 시스템 설계 전반과 세부 트레이닝 절차를 공개했고 댓글에서 교사(teacher) 선택, Matryoshka 트레이닝, 평가 캐스케이드에 대해 추가 질의를 받는 양상이었다. 일부 참여자는 LLM 기반 라벨이 도메인 지식이 필요한 경우 인간보다 우수하다는 관찰에 공감을 표했고 다른 일부는 인간 피드백을 직접적으로 랭커에 반영하는 RL 접근을 선호한다는 반응을 보였다. 전반적으로 경험 기반 팁과 쿼리 코호트 분석의 필요성에 동의하는 분위기가 우세했다.
합의점 vs 논쟁점
합의점
- 고품질 LLM 라벨을 대규모로 생성해 대비학습에 활용하면 검색용 임베딩 재현이 개선될 수 있다는 점에 대해 여러 참여자가 동의했다.
- 쿼리 유형별 분포 불일치를 모니터링하고 학습 데이터와 어댑터를 통해 보완해야 한다는 점이 실무 합의로 보였다.
- 임베딩 목적에 맞춘 대비적 사전학습이 단순한 모델 확장보다 실제 검색 성능에 더 큰 영향을 줄 수 있다는 견해가 널리 수용되었다.
논쟁점
- LLM 판사 라벨이 모든 도메인에서 인간 라벨을 대체할 수 있는지에 대해서는 의견이 갈렸다.
- Expert Judge의 프로프라이트리성 때문에 외부 재현 가능성과 투명성 문제가 논쟁거리로 남아 있다.
실용적 조언
- 쿼리 분포 분석을 통해 짧은 질의와 긴 질의 등 코호트를 정의한 뒤 각 코호트에 맞춘 데이터 혼합과 어댑터를 적용해 파인튜닝해야 한다는 점이 경험적으로 효과적이었다.
- 고신뢰 라벨 선택을 위해 weighted Cohen's Kappa 같은 일관성 지표를 사용해 LLM 생성 라벨 중 신뢰도가 높은 사례를 선별하고 이를 교수 데이터로 사용해야 한다.
- Chain-of-Thought를 포함한 라벨 생성은 기술적 자격 판단에서 LLM의 일관성을 높여 라벨 품질을 개선하므로 판단 이전에 CoT를 유도하는 워크플로를 고려할 필요가 있다.
섹션별 상세
용어 해설
- Contrastive Pretraining
- — 대조적 사전학습은 긍정 쌍과 부정 쌍을 이용해 임베딩 공간에서 유사도 구조를 학습하는 방법이다. 입력 쌍을 샘플링하고, 양성 쌍의 임베딩을 가깝게, 음성 쌍은 멀게 만들도록 손실을 최적화하여 표현을 분리한다. 검색용 임베딩 품질을 높여 파인튜닝 시 재현성과 상관관계가 개선되는 것이 핵심적 중요성이다.
- LoRA
- — LoRA는 전체 모델 가중치를 고정한 채 저순위(low-rank) 분해 행렬만 학습하는 파라미터 효율적 파인튜닝 방식이다. 학습 시 원래 가중치에 더해지는 작은 저순위 행렬 두 개만 업데이트하므로 메모리와 계산 부담을 줄인다. 대규모 모델을 제한된 리소스에서 임베딩이나 특화 과제에 맞춰 적응시킬 때 실용적이다.
- Chain-of-Thought
- — Chain-of-Thought는 모델이 중간 추론 단계를 텍스트로 생성하게 하여 복잡한 판단 근거를 드러내는 프롬프트 기법이다. 입력에 대해 단계적 추론을 유도한 뒤 최종 판단을 얻어 라벨 품질과 일관성을 개선하는 데 사용된다. 라벨 부트스트랩이나 고품질 교사 레이블 생성에서 근거를 확보하는 수단으로 중요하다.
- Cohen's Kappa
- — Cohen's Kappa는 두 평가자 간 일치도를 기댓값 대비 조정해 측정하는 통계적 척도이다. 가중치를 둔 형태는 등급 차이에 따라 불일치의 심각도를 반영하므로 라벨 선택·정제에서 유용하다. 대규모 자동 라벨링 시스템에서 신뢰할 만한 레이블을 추출할 때 기준으로 활용된다.
언급된 도구
파라미터 효율적 임베딩/모델 파인튜닝
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
