본문으로 건너뛰기
LangChain조회 1

Clay의 대규모 AI 에이전트 구축 사례와 평가 및 데이터 아키텍처 전략.

Clay가 GTM 에이전트의 성능과 신뢰성을 확보하기 위해 도입한 계층적 평가 매트릭스와 데이터 레이크 중심의 아키텍처 전환 전략을 다룬다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Clay는 GTM 리서치 에이전트 Claygent와 워크플로우 구축 에이전트 Sculptor를 통해 매월 수억 건의 작업을 처리하며 에이전트 중심의 플랫폼으로 진화하고 있다. 대규모 운영의 핵심은 로컬 개발부터 프로덕션까지 이어지는 계층적 평가 시스템과 LangSmith를 활용한 실시간 모니터링 루프를 통해 신뢰성을 확보하는 것이다. 특히 파편화된 데이터 소스를 S3 기반 데이터 레이크로 통합하고 에이전트에게 데이터 접근 권한을 부여함으로써, 에이전트가 대규모 데이터를 직접 분석하고 스스로 성능을 개선하는 아키텍처를 구축했다. Fable의 대규모 컨텍스트 기술을 활용해 수만 개의 데이터에서 패턴을 찾는 등 에이전트의 분석 역량을 극대화하며 자가 학습형 수익 엔진을 지향하고 있다.

챕터별 상세

00:00

Clay의 에이전트 스택 개요

Clay는 2023년 리서치 에이전트인 Claygent를 출시한 이후, 워크플로우 구축을 돕는 Sculptor를 선보이며 에이전트 스택을 확장했다. Claygent는 공개 웹을 검색하여 기업 정보를 조사하고 자격을 검증하는 역할을 수행하며, Sculptor는 제품 내에서 GTM 워크플로우를 직접 설계하고 오케스트레이션하는 엔지니어링 에이전트이다. 2026년까지 Sculptor와 검색 기능을 결합하여 기업 및 연락처 데이터베이스에서 잠재 고객을 발굴하는 기능을 강화할 계획이다.

GTM(Go-To-Market)은 제품을 시장에 출시하고 고객에게 도달하기 위한 전략적 프로세스를 의미한다.

00:45

리서치 에이전트 Claygent의 작동 원리

Claygent는 웹 리서치, 1차 데이터 통합, 대규모 워크로드 처리라는 세 가지 핵심 기능을 갖추고 있다. 공개 인터넷 검색뿐만 아니라 Snowflake나 Salesforce 같은 내부 데이터 세트에서도 정보를 찾아낼 수 있다. 현재 월 3억 건 이상의 실행 횟수를 기록하고 있으며, 개별 워크스페이스나 사용자 수준에서 발생하는 방대한 양의 실행 추적 데이터를 관리하고 있다.

1차 데이터(First-party data)는 기업이 고객으로부터 직접 수집한 데이터를 의미한다.

01:25

엔지니어링 에이전트 Sculptor의 성장

Sculptor는 워크플로우 구축뿐만 아니라 데이터 분석을 위한 분석가 모드(Analyst Mode)를 제공한다. 출시 1년 만에 사용자들이 Clay와 상호작용하는 주요 수단으로 자리 잡았으며, 매주 10만 개 이상의 메시지가 Sculptor를 통해 처리되고 있다. 대규모 운영 단계에 진입함에 따라 모든 실행 과정을 일일이 모니터링하는 것이 불가능해졌으며, 이에 따라 프로덕션 품질을 유지하기 위한 자동화된 평가 체계의 필요성이 대두됐다.

오케스트레이션(Orchestration)은 여러 시스템이나 서비스의 복잡한 워크플로우를 자동화하고 관리하는 것을 말한다.

02:03

계층적 평가 프레임워크 도입

에이전트의 실행 규모가 커지면서 평가(Eval)는 신뢰성 확보를 위한 필수 요소가 됐다. Clay는 로컬 개발 단계에서는 비용이 저렴하고 빠른 평가를 수행하고, CI 및 스테이징 단계에서는 프로덕션과 동일한 환경에서 고충실도 평가를 수행하는 전략을 취한다. 이를 통해 Claude나 Devin 같은 외부 에이전트 도구가 프롬프트를 변경하더라도 프로덕션 환경에 악영향을 미치지 않도록 안전장치를 마련했다.

CI(지속적 통합)는 코드 변경 사항을 정기적으로 빌드 및 테스트하여 공유 리포지토리에 통합하는 방식이다.

04:19

사분면 기반의 평가 매트릭스 전략

평가 체계는 결정론적(Deterministic) 여부와 온/오프라인 여부에 따라 네 가지 영역으로 나뉜다. 오프라인에서는 정답 셋(Goldens)과 LLM-as-a-judge를 활용해 쿼리 구조와 도구 사용 궤적을 검증한다. 온라인 프로덕션 단계에서는 지연 시간과 비용 같은 A/B 테스트 지표를 모니터링하며, LangSmith의 온라인 평가기를 통해 사용자 만족도 점수(NPS)와 에이전트 수정 여부를 실시간으로 파악한다. 특히 프로덕션에서 발견된 실패 사례를 다시 오프라인 평가 셋으로 피드백하는 루프를 구축하는 것이 가장 난이도가 높으면서도 중요한 과제이다.

결정론적(Deterministic) 평가는 동일한 입력에 대해 항상 동일한 결과가 나오는지를 검증하는 방식이다.

10:15

데이터 레이크 기반의 아키텍처 전환

파편화된 데이터 소스로 인한 확장성 문제를 해결하기 위해 S3 기반의 데이터 레이크 아키텍처로 전환하고 있다. 에이전트를 데이터 플랫폼의 '일급 사용자'로 정의하여 데이터 모델을 직접 구축하고 배포할 수 있는 권한을 부여했다. Fable의 대규모 컨텍스트 윈도우 기술 덕분에 에이전트가 1만 개의 예시 데이터를 한 번에 읽고 트렌드를 분석하는 대규모 데이터 분석이 가능해졌다. 최종적으로는 모든 데이터 소스가 통합된 기반 위에서 에이전트가 스스로 학습하고 성능을 개선하는 자가 학습 엔진(Self-learning engine) 구축을 목표로 한다.

일급 사용자(First-class user)는 시스템 내에서 제한 없이 핵심 기능을 수행할 수 있는 주체를 의미한다.

용어 해설

평가(Evals)
AI 모델이나 에이전트의 출력 품질을 측정하는 프로세스이다. Clay는 로컬 개발부터 프로덕션 단계까지 계층화된 평가 체계를 구축하여 프롬프트 변경이 시스템 전체에 미치는 영향을 사전에 검증하고 신뢰성을 확보한다.
데이터 레이크(Data Lake)
다양한 소스의 원시 데이터를 통합 저장하는 아키텍처이다. Clay는 Snowflake, Postgres 등 파편화된 소스를 S3 기반 레이크로 통합하여 에이전트가 데이터에 직접 접근하고 대규모 분석을 수행할 수 있는 기반을 마련했다.
컨텍스트 윈도우(Context Window)
모델이 한 번에 처리할 수 있는 데이터의 양을 의미한다. Fable의 기술적 돌파구를 통해 컨텍스트 윈도우가 비약적으로 확장되었으며, 이를 통해 에이전트가 수만 개의 예시 데이터를 한 번에 읽고 패턴을 분석하는 것이 가능해졌다.
랭스미스(LangSmith)
LLM 애플리케이션의 디버깅, 테스트 및 모니터링을 지원하는 플랫폼이다. Clay는 LangSmith를 활용해 에이전트의 실행 추적(Trace)을 기록하고, 온라인 평가기(Online Evaluator)를 통해 사용자 만족도와 에이전트의 성능을 실시간으로 분석한다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 29.수집 2026. 08. 29.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.