이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
Rippling AI는 인사 및 급여 데이터를 처리하는 자연어 어시스턴트를 구축하며 세 가지 핵심 아키텍처 전환을 거쳤다. 복잡한 멀티 에이전트 구조를 포기하고 선언적 스킬을 갖춘 단일 평면 에이전트로 단순화했으며, 개별 도구 대신 캐시된 스키마 위에서 LLM이 SQL을 직접 생성하는 방식으로 데이터 접근성을 높였다. 또한 확률적 모델의 불확실성을 해결하기 위해 윌슨 신뢰 구간을 활용한 평가 주도 개발(EDD) 프로세스를 도입하여 필요한 평가 반복 횟수를 통계적으로 산출했다. 이러한 접근은 시스템 복잡도를 낮추고 신뢰성을 확보하는 데 기여했다.
챕터별 상세
00:00
문제 정의: 인사 관리자의 업무 환경
인사 및 급여 데이터는 다양한 시스템에 분산되어 있어 자연어 질문에 답하기 어렵다. Rippling AI는 이러한 복잡한 데이터 구조를 이해하고 정확한 답변을 제공해야 하는 과제를 안고 시작되었다.
01:36
데모: Rippling AI와 직원 그래프
Rippling AI가 직원 그래프 데이터를 활용해 급여, HR, 복리후생 관련 질문에 답변하는 과정을 시연한다. 자연어 입력을 통해 데이터베이스에서 정확한 정보를 추출하고 요약하는 기능을 보여준다.
02:37
아키텍처 개요: LangGraph와 평면 에이전트
LangGraph를 기반으로 한 아키텍처를 채택했다. 초기에는 복잡한 계층적 구조를 고려했으나, 최종적으로는 단일 평면 에이전트 구조로 단순화하여 엔티티 해석과 데이터 접근을 처리한다.
04:54
멀티 에이전트 모델의 실패 원인
초기 도입했던 멀티 에이전트 및 서브 에이전트 구조는 복잡도가 너무 높았다. 에이전트 간의 통신 오버헤드와 디버깅의 어려움으로 인해 시스템의 안정성이 저하되어 이를 폐기했다.
05:33
평면 에이전트: 선언적 스킬과 SOP
서브 에이전트 대신 선언적 스킬과 표준 운영 절차(SOP)를 갖춘 평면 에이전트를 도입했다. 각 스킬을 명확하게 정의하여 에이전트가 수행할 작업을 예측 가능하게 만들었다.
06:12
범용 도구: SQL 기반 데이터 접근
개별적인 맞춤형 도구들을 제거하고, 캐시된 스키마 위에서 LLM이 직접 SQL을 생성하는 범용적인 데이터 접근 방식을 채택했다. 이를 통해 도구 관리의 복잡성을 획기적으로 줄였다.
07:31
환각 문제와 LLM 생성 SQL의 해결책
LLM이 생성한 SQL은 데이터베이스 스키마를 직접 참조하므로 환각(hallucination) 문제를 줄이는 데 효과적이다. 정형화된 데이터 접근 방식이 비정형 도구 호출보다 더 높은 신뢰성을 보였다.
08:14
SQL의 강력함: 실제 사례
SQL은 맞춤형 도구보다 훨씬 강력한 데이터 조작 능력을 제공한다. 복잡한 조인과 필터링이 필요한 질문에 대해 SQL 생성 방식이 훨씬 유연하게 대응함을 확인했다.
09:38
반복 쿼리를 위한 데이터 캐싱
후속 질문이나 반복적인 쿼리 처리를 위해 데이터를 캐싱한다. 이를 통해 동일한 데이터에 대한 재계산을 방지하고 응답 속도를 개선했다.
10:17
평가 주도 개발(EDD)의 의미
평가 주도 개발(Eval-Driven Development)은 모델의 성능을 정량적으로 측정하는 것을 최우선으로 한다. 개발 초기부터 평가 지표를 설정하고 이를 통과해야 배포하는 프로세스를 구축했다.
11:50
EDD의 난제: 확률적 문제
LLM은 확률적 모델이므로 동일한 입력에도 결과가 달라질 수 있다. TDD와 달리 평가 결과가 변동성을 가지기 때문에 이를 통계적으로 처리하는 것이 핵심 과제였다.
12:37
윌슨 신뢰 구간: 필요한 반복 횟수 산출
윌슨 신뢰 구간(Wilson's confidence interval)을 사용하여 모델의 성능을 통계적으로 검증한다. 이를 통해 신뢰할 수 있는 결과를 얻기 위해 최소 몇 번의 평가를 수행해야 하는지 산출한다.
13:40
비용, 불확실성, 지연 시간의 트레이드오프
비용, 불확실성, 지연 시간은 서로 상충하는 관계에 있다. 모든 것을 최적화할 수는 없으므로, 비즈니스 요구사항에 따라 두 가지를 선택하고 하나를 희생하는 전략을 취했다.
14:17
커밋 시 스모크 테스트와 사전 배포 평가
코드 커밋 시마다 스모크 테스트를 수행하여 기본적인 기능을 확인하고, 프로덕션 배포 전에는 더 정밀한 건강 평가(health evals)를 수행하여 시스템 안정성을 확보한다.
15:00
프로덕션 환경의 맞춤형 도구와 합성 테스트
실제 프로덕션 환경과 유사한 합성 테스트 환경을 구축했다. 이를 통해 실제 데이터를 사용하지 않고도 다양한 엣지 케이스에 대한 모델의 대응력을 검증한다.
16:00
세 가지 핵심 교훈
평면 에이전트 구조 채택, 구성 가능한 도구 사용, 그리고 평가 주도 개발 프로세스 정착이 Rippling AI 성공의 핵심 요인이었다. 복잡성을 줄이고 통계적 근거를 확보하는 것이 중요하다.
용어 해설
- Flat Agent
- — 복잡한 계층적 서브 에이전트 구조 대신, 단일 수준에서 선언적 스킬을 실행하는 에이전트 아키텍처이다. 시스템 복잡도를 낮추고 디버깅과 제어 가능성을 높이기 위해 도입된다.
- Eval-Driven Development
- — 테스트 주도 개발(TDD)과 유사하게, 모델의 성능과 신뢰성을 평가하는 지표를 먼저 정의하고 이를 기반으로 개발을 진행하는 방법론이다. LLM의 확률적 특성으로 인해 통계적 검증이 필수적이다.
- Wilson Score Interval
- — 베르누이 시행에서 성공 확률의 신뢰 구간을 계산하는 통계적 방법이다. LLM 평가 시 모델이 정답을 맞힐 확률을 통계적으로 신뢰할 수 있는 수준까지 검증하기 위해 필요한 반복 횟수를 산출하는 데 사용된다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 07. 13.수집 2026. 07. 13.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.