본문으로 건너뛰기

LLM 속도 제한 하에서 AI 작업 부하를 5배 확장한 분산 영속성 큐 구축 사례

Salesforce는 분산 영속성 큐와 우선순위 오케스트레이션을 통해 LLM 인프라 제한 내에서 AI 에이전트의 영업 지원 처리량을 5배 향상시켰다.

섹션별 상세

01
대규모 리드 할당 시 발생하는 LLM 게이트웨이의 과부하와 요청 실패 문제를 해결하기 위해 분산 영속성 큐를 오케스트레이션 레이어로 구축했다. 고객 워크플로와 인프라 사이에서 큐가 실행 시점을 결정함으로써 시스템의 신뢰성과 공정성을 유지한다. 이를 통해 사용자는 처리량을 직접 계산할 필요 없이 대량의 아웃리치 작업을 안정적으로 할당할 수 있다.
리드 육성 에이전트의 상위 수준 아키텍처 다이어그램
Diagram영업 케이던스 엔진, Einstein 활동 캡처, 이메일 서비스, 데이터 클라우드 및 에이전트 API가 어떻게 상호작용하는지 보여준다. 특히 플래너 모델(LLM)과 에이전트 API 사이의 연결 구조를 통해 오케스트레이션 흐름을 설명한다.
02
AI 에이전트와 인간 판매자가 공유 LLM 제한을 두고 경쟁하는 상황을 해결하기 위해 페어 쉐어(Fair-share) 할당 메커니즘을 도입했다. 실행 컨텍스트별로 작업을 그룹화하고 라운드 로빈 전략을 사용하여 각 주기마다 모든 그룹에서 균등하게 작업을 추출한다. 이 방식은 특정 에이전트나 워크플로가 가용 자원을 독점하는 것을 방지하고 전체적인 균형을 유지한다.
03
비즈니스 가치가 다른 다양한 이메일 유형을 효율적으로 처리하기 위해 동적 슬롯 할당 방식의 3단계 우선순위 큐를 구현했다. 답장 메일에 최고 우선순위를 부여하고 도입 및 넛지 메일은 하위 단계로 배치하여 중요한 대화가 지연되지 않도록 보장한다. 상위 우선순위 작업이 부족할 경우 하위 작업으로 슬롯을 채우는 적응형 백필 메커니즘을 통해 100%의 시스템 처리량을 유지한다.
Agentforce가 이메일을 통해 잠재 고객을 육성하고 자격을 검증하는 단계별 프로세스
Infographic잠재 고객 할당부터 다중 터치 넛지, 자율 답장, 최종 미팅 예약 및 리드 등급 산정까지의 전체 비즈니스 로직을 시각화한다. 각 단계에서 에이전트가 수행하는 구체적인 작업(질문 답변, 미팅 일정 조율 등)을 명시한다.
04
인간의 검토가 필요한 워크플로와 자율 에이전트 간의 자원 충돌을 방지하기 위해 이중 경로 아키텍처를 설계했다. 자율 작업은 표준 생성 및 발송 파이프라인을 따르며, 검토가 필요한 작업은 초안 작성 단계에서 이미 생성이 완료되어 발송 시 LLM 자원을 추가로 소모하지 않는다. 이러한 분리된 실행 경로는 규제 준수가 중요한 산업에서도 성능 저하 없이 에이전트를 운영할 수 있게 한다.
리드 육성 런타임의 상세 워크플로 및 오케스트레이션 규칙
Diagram아웃리치 발송, 고객 응대, 수신 거부 관리의 세 가지 주요 경로를 상세히 다룬다. 초기 발송 후 1시간 지연, 넛지 횟수 설정 등 구체적인 에이전트 행동 규칙과 활동 타임라인 캡처 방식을 설명한다.
05
LLM 속도 제한 위반으로 인한 대화 단절 리스크를 줄이기 위해 실시간 사용량 기반의 적응형 속도 변조 기술을 적용했다. 이전의 단순 재시도 방식이 유발하던 계단식 실패를 방지하기 위해 발송 전 조직의 실시간 사용량을 확인하고 발송량을 조절한다. 인프라 한계에 근접하면 발송량을 줄여 실패를 예방하고 고우선순위 작업의 실행을 우선적으로 보장한다.

용어 해설

분산 영속성 큐(Distributed Persistent Queue)
데이터를 여러 서버에 분산하여 저장하고 시스템 장애 시에도 데이터 유실을 방지하는 대기열 구조이다. 이 아티클에서는 대규모 AI 작업 부하를 관리하고 인프라 한계 내에서 실행 순서를 조정하는 핵심 오케스트레이션 레이어로 사용된다.
속도 제한(Rate Limiting)
시스템이 특정 시간 동안 처리할 수 있는 요청의 수를 제한하는 메커니즘이다. LLM API의 분당 요청 수(RPM) 제한을 준수하여 시스템 과부하와 서비스 거부 오류를 방지하는 데 필수적이다.
인간 참여형 루프(Human-in-the-Loop)
AI의 자동화 과정 중간에 인간의 검토나 개입을 포함시키는 설계 방식이다. 규제가 엄격한 산업에서 AI가 생성한 이메일을 발송 전 사람이 최종 승인함으로써 신뢰성과 준수성을 확보한다.
기아 현상 방지(Starvation Avoidance)
특정 작업이 우선순위에 밀려 영원히 실행되지 못하는 상태를 방지하는 기법이다. 자율 에이전트와 인간 검토 작업이 공존할 때 한쪽이 자원을 독점하지 않도록 공정하게 배분하는 역할을 한다.

기술

  • Agentforce
  • Salesforce Data Cloud
  • Einstein Activity Capture
  • LLM Gateway

활용 사례

  • 대규모 리드 육성(Lead Nurturing) 자동화
  • 인간 검토가 포함된 AI 이메일 발송 시스템
  • 멀티 에이전트 자원 관리 및 스케줄링

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 10.수집 2026. 04. 10.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.