왜 중요한가
실세계 자율 에이전트는 즉시 완료 판정이 가능한 단회성 과제보다 과거 결정이 미래 선택을 제약하고 피드백 지연이 존재하는 지속 운영 환경에서 성능을 유지해야 한다는 점이 중요하다. MerchantBench는 98,843개 실상품과 365일 주문 레벨 시뮬레이션으로 이러한 장기 일관성 요구를 재현하며, 지연된 주문 결과와 즉시 관찰 가능한 공급자 이벤트를 동시에 포함하는 환경을 제공한다. 따라서 도구 호출, 메모리 압축, 요인 귀인, 정책 수정 능력 같은 에이전트 설계 요소가 장기간 목표 달성에 미치는 정량적 영향을 평가할 수 있다.
관련 Figure

상단 패널은 11.11 등 피크와 춘절 트로프 같은 계절성이 실데이터에 존재함을 보여주고, 하단 박스플롯은 가격변동·상품삭제·지연과 취소·환불·후기 같은 이벤트 확률 분포의 범위를 드러낸다. 이러한 통계는 에이전트가 비정상 리스크와 계절성 모두에 적응해야 함을 시사한다.
실제 수요 시계열과 상류·하류 이벤트 확률 분포를 요약한 복합 플롯이다.
핵심 기여
장기 일관성 평가를 위한 전자상거래 벤치마크
MerchantBench는 판매자 측 운영을 365일 주문 수준에서 재현하는 벤치마크이다. 98,843개 실상품 기록과 카탈로그·공급자·주문 툴을 통합하여 공급자 이벤트는 즉시, 주문 결과는 지연 관찰되는 혼합 지연 피드백을 생성한다. 이 구조는 에이전트가 과거 결정을 추적하고 누적된 증거에 따라 전략을 수정해야 하는 실제 운영 문제를 재현한다.
혼합 지연 증거와 부분 관찰 POMDP 구성
환경은 POMDP로 형식화되어 시간은 시간단위로 전진하고 의사결정은 12시간마다 이루어진다. 상류 이벤트(가격변동·삭제·지연)와 하류 주문 결과(취소·환불·반품·나쁜 후기 등)는 서로 다른 시점에 드러나며, 이는 도구 호출과 관찰 기록을 기반으로 한 인과 귀인과 정책 수정을 요구한다. 최종 보상은 기말 순자산으로 정의되어 중장기 재무 성과에 초점을 맞춘다.
대규모 실험: 모델·프레임워크 비교
저자들은 8개 LLM과 ReAct·Hermes 두 에이전트 프레임워크를 조합하여 총 48회(각 구성 3회 반복) 365일 시뮬레이션을 수행했다. Hermes는 평균적으로 더 높은 최종 순자산과 거래량을 기록했으며, 일부 모델은 운영 활동이 시간에 따라 급감하거나 전략적 포기 상황을 보였다. 인간 참가자 대비 성능 격차가 크며, 최고 구성도 인간 평균의 일부만 회복했다는 실측 결과를 보고한다.
핵심 아이디어 이해하기
전자상거래 판매자 운영은 과거 선정·상장·가격 결정이 이후 주문 발생과 현금흐름을 즉시 또는 지연된 형태로 결정하는 장기적 의사결정 문제이다. MerchantBench는 이 문제를 POMDP로 모델링하여 매시간 수요와 공급자 상태가 진화하고 에이전트는 12시간 간격의 의사결정 창에서 도구를 호출해 상점 포트폴리오와 자금흐름을 조정하도록 구성한다. 혼합 지연 피드백 구조 때문에 유리한 행동인지 실수인지 판별하려면 지연된 주문 결과를 초기 결정과 연결해 인과를 귀인하고 그에 따라 상장·재소싱·재가격을 수정해야 한다.
관련 Figure

패널별로 인간은 높은 수요 정렬을 유지하는 반면 대부분의 LLM 에이전트는 월별 수요 정렬이 불안정하거나 일관되게 낮음을 보인다. 이 그림은 제품 소싱에서의 포트폴리오 정렬 실패가 장기 이익 전환을 저해하는 메커니즘임을 시사한다.
월별 수요 백분위수에서 Hermes·ReAct·Human·Rule-based의 궤적을 비교한 4패널 플롯이다.
방법론
환경은 시간 해상도를 시간단위로 두고 총 제어 기간 H_{c}=8,760(365일)로 구성되며 에이전트는 12시간(12 스텝)마다 결정 창을 부여받는다. 실데이터 기반 카탈로그(98,843개 상품)와 26개 도구 인터페이스를 통해 제품 검색, 상장·가격 제어, 자금관리, 공급자·주문 조회를 수행할 수 있게 구현했다. 상류 이벤트는 상품별 확률로 샘플링된 가격변동·상품삭제·발송지연을 적용하고, 하류는 Eq.(3)로 시간단위 도착강도를 계산한 뒤 포아송 샘플링으로 주문을 생성하여 각 주문의 라이프사이클을 따르게 했다. 실험은 ReAct(간단 컨트롤러)와 Hermes(플래닝·메모리·스킬관리 내장) 두 프레임워크에 8개 LLM을 조합해 각 구성 3회 반복, 총 48회의 365일 시나리오를 실행했다.
관련 Figure

그림은 신규 주문이 현금 유동성을 즉시 잠그고 비정상 주문 결과는 시간이 지나서 평점과 지급 결과에 영향을 준다는 혼합 지연 증거 구조를 시각적으로 드러낸다. 시뮬레이션 초중반에 현금 부족으로 인한 운영 제약이 발생하고 이후 회복되는 궤적이 관찰되어 자금 관리의 중요성이 명확히 드러난다.
시간에 따른 자금 구성과 주문 발생을 결합한 시계열 플롯이다.

다이어그램은 상류 공급자 시뮬레이션, 상점 상태, 하류 주문 시뮬레이션이 어떻게 연결되는지와 26개 도구가 에이전트에 어떻게 노출되는지를 구조적으로 제시한다. 이 그림은 부분 관찰 정보 흐름과 짧은 공급자 피드백 대 지연 주문 결과라는 핵심 설계 의도를 명확히 보여준다.
MerchantBench의 시스템 구성도이자 에이전트와 환경 간 인터페이스를 정리한 다이어그램이다.
주요 결과
전체적으로 인간 참가자는 평균 최종 순자산 217.61(천 RMB)을 기록했고, 평가된 LLM 에이전트들은 인간 성과에 크게 못 미쳤다. 논문은 최고 LLM 구성도 인간 평균의 27.3% 수준에 그쳤다고 보고되며, 프레임워크별로는 Hermes가 평균 최종 순자산에서 ReAct보다 53.3% 높은 성과를 보였다. 모델별 특성으로는 GPT-5.6 Sol이 ReAct에서, Qwen3.7-Max가 Hermes에서 최상 성능을 보였고 활동성 지표인 SWR은 인간이 100%인 반면 모델들은 10.6%에서 99.4%까지 넓은 편차를 나타냈다.
관련 Figure

이 그림은 동일 모델을 ReAct과 Hermes로 실행했을 때 성과 분포와 반복 간 변동성을 비교할 수 있게 한다. Qwen3.7-Max와 GPT-5.6 Sol의 프레임워크 민감도와 일부 구성의 높은 불안정성이 시각적으로 확인된다.
각 모델·프레임워크 조합의 최종 순자산 분포를 표시한 막대·점 플롯이다.

히트맵은 시간에 따른 운영 활동성과 실질 이익의 동행성을 보여주며 인간은 높은 활동성·일관된 이익을 유지한 반면 모델별로 활동성이 감소하고 이익이 소실되는 패턴이 관찰된다. 이 시계열적 상관은 Operational Coherence의 감소가 성과 하락과 연계됨을 시사한다.
효과적 윈도우 비율·환경 호출 수·월별 순이익을 모델별·월별로 정리한 히트맵이다.
기술 상세
환경은 POMDP로 정의된 후 시뮬레이터가 시간 단위로 전진하고 에이전트는 12시간마다 의사결정 창을 얻는 구조이다. 수요 강도는 논문 Eq.(3)로 정의되며 식은 이다. 여기서 는 실데이터의 일수요, 는 범주·시간대 가중치, 는 상점 평점에 따른 수요 조정, 는 상장 노출 계수, 는 가격 비율이며 는 가격 탄력성이다. 계산 흐름은 일일 수요와 시간·노출·평점·가격 인자를 곱해 시간단위 기대 도착률 를 얻고, 그 다음 로 도착수를 샘플해 주문 후보를 생성하는 방식이다. 예를 들어 , , , , 가격비=1, 이면 이 되어 시간단위 기대 주문수가 100이 되고 포아송 샘플링은 이 값을 중심으로 도착수를 생성한다.
한계점
MerchantBench는 판매자 측 드롭쉬핑 운영에 초점을 맞추어 플랫폼·소비자 행동의 다른 형태로 일반화하기 어렵다. 시뮬레이터는 공급자 이상 이벤트의 내부 트리거와 회복 스케줄을 숨기고 회복 시간을 샘플링하는 가정을 사용하므로 실제 플랫폼의 인과 구조와 차이가 있을 수 있다. 데이터는 1688 플랫폼의 2025년 6월~2026년 5월 기록으로 구성되어 시계열적·지리적 편향이 존재할 가능성이 있다.
실무 활용
MerchantBench는 장기 운영성능과 혼합 지연 피드백 적응 능력을 측정하려는 연구자와 개발자가 에이전트 설계 결정을 평가할 때 유용하다. 실데이터 기반 카탈로그와 도구 세트를 제공하여 정책 설계, 메모리·요약 방식, 도구 사용 전략의 장기적 영향을 비교할 수 있다. 코드와 레포지토리는 공개되어 실제 에이전트 개발 파이프라인에 통합해 재현 가능한 실험을 수행할 수 있다.
- LLM 기반 상점 운영 에이전트의 장기 재무 성과와 전략적 일관성 비교
- 메모리 압축·히스토리 요약 방식이 장기간 활동성(SWR)에 미치는 영향 평가
- 도구 설계(흔적·쿼리 빈도)와 증거 귀인 알고리즘이 주문 결과 전파에 미치는 효과 실험
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 장기 일관성(Long-Term Coherence)
- — 에이전트가 누적된 증거와 지연된 피드백을 바탕으로 장기간 목표를 유지하면서 전략을 수정하고 행동을 일관성 있게 유지하는 능력을 평가하는 개념이다. 실세계 운영처럼 과거 결정이 미래 선택을 제약하는 환경에서 평가가 필요하다는 점을 강조한다.
- 부분 관찰 마르코프 결정 과정(Partially Observable Markov Decision Process)
- — 관찰가능한 정보가 상태의 일부만을 드러내는 결정 문제 형식으로, MerchantBench는 시간에 따라 숨겨진 수요, 위험 신호, 결과 시점을 포함하는 POMDP로 운영된다는 점을 전제로 한다.
- 혼합 지연 피드백(Mixed-Latency Feedback)
- — 즉시 관찰되는 공급자 이벤트와 수일에서 수주 뒤에 드러나는 주문 결과가 혼재하는 피드백 구조를 가리킨다. 이 구조는 원인 추적과 시의적절한 정책 수정을 어렵게 만든다.
- 주문 레벨 시뮬레이션(Order-level Simulation)
- — 상품별 일수요를 시간단위 주문 도착으로 변환하고 각 주문의 조달·배송·결제·사후 결과를 개별 라이프사이클로 시뮬레이션하는 구성이다. 개별 주문의 지연 결과가 누적되어 상점 평판과 유동성에 영향을 준다.
- 상류 공급자 이벤트(Upstream Supplier Events)
- — 상품 가격 변동, 상품 삭제(Product Delisting), 발송 지연 같은 공급자 쪽 이상 이벤트를 뜻한다. 이 이벤트들은 확률적으로 발생하고 회복 시간이 샘플링되어 환경 상태를 일시적으로 변형한다.
코드 예제
Math formulation: \mathcal{M}=\langle\mathcal{S},\mathcal{A},P,\mathcal{O},Z,R,\mu_{0},H_{c}\rangleMerchantBench의 전체 문제 설정을 POMDP 표기로 간단히 보여주는 수식이다.
Terminal objective: J(\pi)=\mathbb{E}_{\pi}[R(s_{T})], R(s_{T})=B_{T}+D_{T}+I_{T}+Q_{T}에피소드 최종 시점의 순자산을 보상으로 사용하는 목적함수의 원문 표기이다.
\lambda_{m,i,t}=D_{i,d(t)} w_{c(i),h(t)} r_{m,t} \ell_{m,i,t} \left(p_{m,i,t}/p_{i}^{\mathrm{ref}}\right)^{-\epsilon_{i}}상품별 시간 단위 수요 강도를 계산하는 핵심 식(논문 Eq.3) 원문 표기이다.
Arrival sampling: N_{m,i,t} \sim \mathrm{Poisson}(\lambda_{m,i,t})시간 단위 도착수를 포아송 분포로 샘플링하는 절차를 보여주는 원문 표기이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

