이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
RAG assistant가 정책 예외 조항을 놓친 원인은 모델보다 검색 문맥의 중복에 있었습니다. 과도한 청크 중첩으로 기본 top k가 유사한 정책 문단을 반복 선택했고, 예외 조항은 문맥에서 빠졌습니다. Braintrust traces와 embedding similarity를 이용해 실패 질의를 추적한 뒤 중복 제거와 전체 질문 기반 reranking을 적용하자 citation precision과 groundedness가 개선됐습니다. 실패 질의를 회귀 사례로 남기고 retrieval coverage를 answer groundedness와 분리해 평가하면서 토큰 사용량도 줄었습니다.
실용적 조언
- 정책 문서를 청킹할 때 청크 중첩을 크게 설정하는 것만으로 검색 안정성을 확보하기 어렵습니다. 실패 질의의 검색 청크를 추적해 동일하거나 유사한 문단이 반복되는지 확인하고, 중복 제거와 전체 질문 기반 reranking을 차례로 비교해야 합니다. 평가에서는 필요한 조항이 검색됐는지 나타내는 retrieval coverage와 검색된 근거를 답변이 제대로 사용했는지 나타내는 answer groundedness를 분리해 기록하는 편이 적절합니다.
섹션별 상세
작성자는 RAG assistant가 정책의 예외 조항 하나를 놓친 채 확신에 찬 답변을 내놓자 몇 주 동안 모델 자체를 원인으로 의심했습니다. 실제 문제는 청크 중첩이 너무 커서 검색 결과에 거의 같은 정책 문단이 반복된 데 있었습니다. 그 결과 토큰을 더 사용하면서도 같은 잘못된 근거가 여러 번 선택되어 답변의 근거가 만장일치처럼 보이는 현상이 생겼습니다.
실패한 질의를 Braintrust traces에서 확인하고 여러 청킹 결과를 비교하자, embedding similarity와 기본 top k가 유사한 문단의 복사본을 계속 고르는 구조가 드러났습니다. 중복 제거로 반복 청크를 줄인 뒤, 전체 질문을 기준으로 후보 순서를 다시 매기는 reranking을 적용해 예외 조항을 반복된 정책 문구보다 위로 올렸습니다. 근거 집합의 반복이 사라지면서 citation precision과 groundedness가 함께 개선됐습니다.
실패한 질의를 회귀 테스트 사례로 남기고 retrieval coverage와 answer groundedness를 별도 점수로 측정하는 평가 체계를 마련했습니다. 모델은 입력 문맥에 전달되지 않은 조항을 인용할 수 없으므로, 답변이 근거에 충실한지 평가하기 전에 필요한 정보가 검색됐는지 확인해야 합니다. 중복 문단이 줄어든 문맥에서는 토큰 사용량도 감소해 검색 품질과 비용을 동시에 관리할 수 있었습니다.
용어 해설
- 검색 증강 생성(RAG)
- — RAG는 질문과 관련된 외부 문서를 먼저 검색한 뒤, 검색 결과를 모델의 입력 문맥에 넣어 답변을 생성하는 방식입니다. 검색 단계에서 필요한 근거가 빠지면 생성 모델의 답변 품질과 무관하게 정확한 인용이 어렵습니다.
- 청크 중첩(Chunk Overlap)
- — 문서를 여러 청크로 나눌 때 인접한 청크 사이에 같은 내용을 겹쳐 넣는 설정입니다. 중첩이 지나치게 크면 검색 결과에 거의 같은 문단이 반복되어 서로 다른 근거가 선택될 기회를 줄일 수 있습니다.
- 중복 제거(Deduplication)
- — 검색 결과에 포함된 유사하거나 동일한 청크를 하나로 합치거나 제외하는 처리입니다. 중복 근거가 검색 결과를 채우는 현상을 줄여 예외 조항처럼 짧고 중요한 내용이 문맥에 포함될 가능성을 높입니다.
- 재순위화(Reranking)
- — 1차 검색으로 모은 후보 문서의 순서를 질문과의 전체 의미적 관련성을 기준으로 다시 정하는 과정입니다. 단순한 embedding 유사도보다 질문의 조건과 예외를 반영해 필요한 청크를 상위로 올리는 데 쓰입니다.
- 임베딩 유사도(Embedding Similarity)
- — 질문과 문서를 벡터로 변환한 뒤 벡터 간 거리를 이용해 의미적 유사성을 계산하는 방법입니다. 표현이 비슷한 정책 문단이 반복될 때 기본 top k가 같은 종류의 청크를 여러 개 선택하는 원인을 파악하는 데 활용됩니다.
- 검색 커버리지(Retrieval Coverage)
- — 답변에 필요한 정보가 검색 결과와 모델 입력 문맥에 실제로 포함됐는지를 평가하는 지표입니다. 모델이 받지 못한 예외 조항은 아무리 잘 생성하거나 인용하려 해도 답변에 반영할 수 없으므로 groundedness와 별도로 측정해야 합니다.
언급된 도구
Braintrust추천
실패한 질의에서 검색된 청크를 traces로 확인하고 청킹 결과를 비교하는 데 사용했습니다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 08. 21.수집 2026. 08. 21.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.