TL;DR
이 게시물은 Evaluation-Driven Development를 사용해 LLM 애플리케이션을 반복적으로 개선하는 튜토리얼을 소개합니다. LangGraph와 Qdrant로 구성한 RAG 애플리케이션을 기준선으로 만들고, 비평이 포함된 binary labelled dataset을 OPIK에서 버전 관리한 뒤 LLM-as-a-Judge 평가자를 정렬합니다. 이후 각 실험을 실행해 기준선과 점수를 비교하고 tracing과 실험 비교로 개선된 부분, 퇴행한 부분, 다음에 조정할 코드를 찾습니다. 평가 항목에는 relevance, hallucination, GEval이 포함되며 Agent Skills와 소스 코드는 GitHub에 공개되어 있습니다.
실용적 조언
- RAG 애플리케이션의 코드·프롬프트·retrieval_k·model을 바꿀 때마다 같은 binary labelled dataset과 평가 항목으로 실험을 실행하고 baseline 점수와 비교하십시오.
- OPIK tracing과 experiment comparison을 사용해 relevance·hallucination·GEval 점수의 변화와 실행 세부 정보를 함께 기록한 뒤, 개선된 변경만 유지하십시오.
섹션별 상세
이미지 분석

도식은 binary labelled dataset이 RAG 앱으로 들어가고, RAG 앱의 출력이 OPIK evals에서 relevance·hallucination·GEval 기준으로 평가되는 순서를 나타냅니다. 평가 결과는 OPIK Dashboard의 experiments에 기록되며, 코드·프롬프트·retrieval_k·model을 조정한 뒤 다시 실행하는 순환 구조로 이어집니다. 마지막에는 변경을 유지하거나 거부하는 판단이 배치되어 있어 게시물의 실험 기반 개선 절차를 직접 시각화합니다.
LangGraph와 Qdrant로 실행하는 RAG 앱을 OPIK 평가와 실험 대시보드에 연결한 반복 개선 흐름도입니다.

이 이미지는 첫 번째 이미지와 같은 흐름을 다른 URL로 제공하며, 데이터셋에서 RAG 앱을 실행하고 OPIK 평가를 거쳐 실험 대시보드에 결과를 쌓는 과정을 보여줍니다. 평가 결과를 바탕으로 코드·프롬프트·검색 설정·모델을 다시 조정하고 변경을 유지하거나 거부하는 피드백 루프가 핵심입니다. 게시물의 튜토리얼이 단일 실행보다 반복 실험과 비교를 중심으로 구성된다는 점을 시각적으로 확인할 수 있습니다.
binary labelled dataset, RAG 앱, OPIK 평가와 실험 비교가 순환하는 동일한 평가 주도 개발 흐름도입니다.
용어 해설
- 평가 주도 개발(Evaluation-Driven Development)
- — LLM 애플리케이션을 감으로 수정하지 않고, 평가 데이터셋과 반복 실험을 기준으로 개선하는 개발 방식입니다. 기준선과 변경 버전의 점수를 비교하고 추적 데이터를 함께 확인해 무엇이 좋아졌거나 나빠졌는지 판단한 뒤 코드·프롬프트·설정을 조정합니다.
- LLM 심사자(LLM-as-a-Judge)
- — 하나의 LLM을 평가자로 사용해 다른 LLM 애플리케이션의 응답을 기준에 따라 채점하는 방식입니다. 평가자 자체를 사람이 만든 라벨과 비평에 맞춘 뒤 관련성·환각 같은 품질 항목의 점수를 산출하므로, 반복 실험을 자동화하는 데 활용됩니다.
- 검색 증강 생성(RAG)
- — 질문과 관련된 문서를 먼저 검색하고 그 결과를 LLM 입력 맥락에 넣어 답변을 생성하는 구조입니다. 이 게시물에서는 LangGraph와 Qdrant로 만든 RAG 애플리케이션을 실험의 기준 시스템으로 삼고, 검색 설정과 모델 변경이 평가 점수에 미치는 영향을 비교합니다.
- 실험 추적(Experiment Tracking)
- — 서로 다른 코드·프롬프트·모델·검색 설정으로 실행한 실험의 입력과 결과를 기록하고 비교하는 과정입니다. OPIK 대시보드와 tracing을 사용하면 각 실험의 점수를 기준선과 나란히 확인하면서 개선·퇴행·다음 조정 지점을 찾을 수 있습니다.
언급된 도구
RAG 애플리케이션의 실행 구조를 구성하는 데 사용됩니다.
튜토리얼의 초기 RAG 애플리케이션 구성에 사용되는 검색 저장소입니다.
라벨 데이터셋 버전 관리, LLM-as-a-Judge 평가, tracing, 실험 비교와 대시보드에 사용됩니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.