챕터별 상세
00:00
멀티모달 평가의 필요성과 LangSmith의 지원 범위
현대의 AI 에이전트 상호작용은 더 이상 텍스트에 국한되지 않고 PDF 업로드, 음성 메시지, 스크린샷 공유 등을 포함한다. 에이전트 역시 이미지나 차트 같은 멀티모달 출력을 생성하므로 텍스트만 평가해서는 전체 시스템의 품질을 파악하기 어렵다. LangSmith는 이러한 흐름에 맞춰 이미지 품질, 사용자 톤, 오디오 품질 등 멀티모달 구성 요소를 평가할 수 있는 기능을 도입했다.
01:06
Base64 멀티모달 콘텐츠를 평가기에 매핑하기
사용자가 업로드한 이미지가 제품 생태계와 관련이 있는지 확인하는 '이미지 관련성(Image Relevancy)' 평가기 설정 과정을 보여준다. 필터를 적용해 이미지 입력이 있는 트레이스(Trace)만 선택하고 멀티모달 입력을 처리할 수 있는 저비용 모델인 GPT-4o mini를 평가 모델로 지정한다. 프롬프트 내에서 input.messages를 매핑하면 내부적으로 base64 형식의 이미지가 평가기에 전달되어 분석이 수행된다.
02:39
멀티모달 첨부 파일을 평가기에 활용하는 방법
트레이스에 포함된 첨부 파일이나 오프라인 데이터셋의 파일을 평가기에 전달하는 방법을 설명한다. 영수증 이미지에서 정보를 추출하는 에이전트의 정확성을 평가하기 위해 attachments 변수를 사용한다. 특정 이름의 첨부 파일만 선택하거나 전체 첨부 파일을 일괄 매핑할 수 있는 유연한 옵션을 제공한다. 플레이그라운드에서 실행 시 평가기가 텍스트 출력뿐만 아니라 첨부된 원본 파일까지 고려하여 정확도 점수를 산출한다.
용어 해설
- 베이스64(Base64)
- — 이진 데이터를 텍스트 형식으로 인코딩하는 방식이다. AI 모델에 이미지를 전달할 때 별도의 파일 링크 대신 텍스트 문자열 형태로 직접 포함하여 전송하는 데 주로 사용된다.
- 판사로서의 LLM(LLM-as-a-Judge)
- — 사람 대신 고성능 언어 모델을 평가자로 활용하여 다른 AI 모델의 응답 품질을 측정하는 기법이다. 대규모 데이터에 대한 일관성 있고 빠른 평가가 가능하다는 장점이 있다.
- 트레이스(Trace)
- — AI 애플리케이션의 실행 과정을 기록한 상세 로그 데이터이다. 입력값, 모델 호출 결과, 도구 사용 내역 등 전체 워크플로를 추적하여 디버깅과 성능 평가에 활용한다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 10.수집 2026. 03. 10.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.