왜 중요한가
CoffeeBench는 LLM 에이전트의 장기적 의사결정 능력을 경제적 상호작용 맥락에서 검증할 수 있게 만든다. 이 벤치마크는 동종 에이전트가 아닌 서로 다른 역할(농부, 로스터, 소매상)을 포함하여 실제 경제에서 요구되는 협상·거래·신용 관리 역량을 시험한다. 에이전트의 통신 빈도와 현금흐름 관리가 수익성에 직접 연결되는 점이 장기적 에이전트 평가에서 중요한 판단축으로 드러난다.
핵심 기여
장기·이기종 다중 에이전트 경제 시뮬레이션 설계
CoffeeBench는 농부·로스터·소매상으로 구성된 세 단계 공급망을 90일간 시뮬레이션하는 벤치마크를 제공한다. 이 시뮬레이션은 재고, 현금, 신용(기본 Net-30), 저장 용량, 부패(일일 0.5%) 등 경제적 제약을 통합하여 단기 운영과 장기 전략 간의 상충을 유도한다. 이러한 설계는 에이전트가 메시지 교환과 거래를 통해 지속적으로 의사결정을 조정하도록 만드는 실세계 유사의 상호작용 구조를 제공한다.
도구 기반 비동기 상호작용과 시간 비용 모델링
에이전트는 ReAct 프레임워크를 사용하여 post_listing(), make_offer(), accept_offer(), pay_invoice(), send_message() 등 도구를 호출하며 각 호출은 로컬 시간 30분을 소모한다. 에이전트는 비활성 상태에서도 외부 이벤트(메시지, 배송, 거래 성사)로 재활성화될 수 있어 이벤트 기반 비동기 상호작용이 가능하다. 이러한 시간·이벤트 모델은 에이전트가 언제 수동 대기하고 언제 적극적으로 상호작용할지를 전략적으로 결정하게 만든다.
다양한 상용 및 오픈 모델에 대한 체계적 평가와 행동 분석
여러 폐쇄·오픈 가중치 LLM을 동일한 조건에서 roaster_A 역할로 평가하여 누적 순이익·거래수·도구 호출·메시지 전송 등 행동 지표를 계량적으로 보고했다. 실험 결과 대부분 모델이 수동 기준선보다 우수한 수익을 냈고 상위 모델일수록 메시지 전송 빈도가 높아 협상 중심의 상호작용을 더 많이 사용했다. 또한 일부 모델은 안정적으로 추론 로그를 출력하면서도 행동을 선택하지 않는 'idle-drift' 실패 모드를 보였다.
코드·궤적 공개로 재현성 제공
연구진은 CoffeeBench의 구현 코드와 에이전트 궤적을 공개 저장소에 배포하여 실험 재현과 추가 연구를 지원한다. 공개 자료에는 시뮬레이션 환경, 도구 카탈로그, 시스템 프롬프트 사양, 및 여러 모델의 실행 궤적이 포함되어 있다. 공개 리소스는 후속 연구자가 환경을 수정하거나 새로운 에이전트를 동일한 조건에서 평가하는 데 필요한 기초를 제공한다.
핵심 아이디어 이해하기
문제 출발점과 기존 한계에 대해 CoffeeBench는 장기 의사결정 능력이 단일 에이전트·수동 환경 평가로는 충분히 포착되지 않는다고 가정한다. 경제 시스템에서는 여러 자율 주체가 통신·협상·신용관리를 통해 상호 의존적 결과를 만들기 때문에 단일 에이전트 벤치마크는 역할 간 상호작용과 신용 리스크의 복합적 영향을 반영하지 못한다. 따라서 장기적 성과를 평가하려면 다수의 이기종 에이전트가 동일 환경에서 지속적으로 상호작용하는 설정이 필요하다.
방법론
CoffeeBench의 전체 접근 방식은 90일간의 에이전트 기반 시뮬레이션으로 구성된다. 각 에이전트는 ReAct 아키텍처를 통해 자연어 추론(trace)과 도구 호출(action)을 교대로 생성하며, 역할별 시스템 프롬프트와 도구 집합이 제공된다. 시뮬레이션은 도구 호출 시 로컬 시간 30분 소모, 일일 운영 창(09:00~19:00), 이벤트 기반 재활성화, 그리고 매일 발생하는 소비자 판매·비용·부패 업데이트로 시간 흐름을 관리한다.
관련 Figure

이 다이어그램은 환경 구성과 에이전트 간 상호작용 흐름을 명확히 보여 주며 도구 호출이 거래·메시지·결제로 어떻게 연결되는지를 한눈에 파악하게 만든다. 다이어그램에 포함된 예시(예: roast(green_bean, 20) 호출과 일일 매출 시뮬레이션)는 논문 본문에서 기술된 도구 카탈로그와 시간 비용 모델을 직관적으로 보완한다. 따라서 이 그림은 methodology 블록의 환경 설계와 도구 사양을 이해하는 데 직접적인 보조 자료로 작동한다.
CoffeeBench의 시스템 개요 다이어그램으로서 역할별 에이전트, 도구, 일일 판매 예시와 KPI(순이익)를 시각화하고 있다.
주요 결과
메인 벤치마크 결과는 Table 2에 요약되어 있으며, 평가된 모델들 가운데 GPT-5.5가 평균 +3,109 달러(±1,123)로 가장 높은 누적 순이익을 기록했다. Claude Opus 4.7과 Claude Sonnet 4.6도 양호한 성과(+2,782 ±2,263, +2,236 ±1,489)를 보였고 여러 오픈 모델과 휴리스틱/수동 기준선은 낮은 수익 또는 손실을 나타냈다. 행동 분석에서는 높은 성과를 낸 모델이 더 빈번하게 send_message() 등 대인 커뮤니케이션 도구를 호출했고, 일부 모델은 추론 로그는 유지하면서 반복적 비활동(idle-drift)을 보여 낮은 실적을 기록했다.
관련 Figure

이 차트는 서로 다른 모델 간 성능과 행동 차이를 시간축에서 비교할 수 있게 한다. 예컨대 누적 순이익 패널에서 상위 모델은 꾸준한 우상향을 보였고 메시지 전송 패널에서 성과와의 상관이 관찰되며, idle-drift 현상은 낮은 도구 호출·높은 idle days와 결합되어 시각적으로 드러난다. 결과 패널은 논문의 results 블록에서 보고된 평균·표준편차 수치와 행동적 해석을 뒷받침한다.
로스터_A의 90일 경제·행동 궤적을 보여 주는 복수 패널 차트로서 누적 순이익·누적 매출·일별 도구 호출·재고·누적 거래·일별 메시지 전송을 포함한다.
기술 상세
전체 아키텍처는 여섯 개의 에이전트(2 농부, 2 로스터, 2 소매상)가 공용 마켓플레이스를 통해 아이템을 주고받는 멀티에이전트 시뮬레이터이다. 각 에이전트는 시스템 프롬프트와 역할별 도구 세트를 받고 ReAct 루프에서 자연어 추론과 도구 호출을 반복한다. 도구는 post_listing(), make_offer(), accept_offer(), pay_invoice(), send_message(), produce_item(), roast(), set_retail_price(), view_consumer_sales() 등으로 구성되어 있으며 배송 지연·배송 손실·연체 이자 등 무작위성 요소를 포함한다.
한계점
논문은 환경 난수성과 에이전트 행동의 내재적 확률성으로 인해 실행 간 분산이 크다고 명시한다. API 비용과 실행 시간(한 실행당 평균 약 8시간, 총 API 비용 약 250달러)이 대규모 반복 실험의 현실적 제약으로 작용한다. 또한 배경 에이전트의 고정 선택(기본 Claude Sonnet 4.6)과 일부 러스트리 턴오프된 추론 옵션이 결과의 일반화에 영향을 미칠 수 있음을 논문에서 명시하고 있다.
실무 활용
CoffeeBench는 연구자와 엔지니어가 LLM 기반 에이전트의 장기 경제행동을 실험적으로 검증하는 데 활용 가능하다. 공개된 코드와 에이전트 궤적을 이용해 새로운 에이전트를 동일한 경제적 제약과 도구 사양에서 비교 평가할 수 있다. 다만 API 비용과 시뮬레이션 시간 소요가 실험 설계에 중요한 실무적 제약으로 작동한다.
- 에이전트 설계자가 메시지·거래 정책의 장기적 재무 영향을 검증하기 위해 새로운 정책을 roaster_A 역할로 배치하여 성능을 비교할 수 있다.
- 연구자가 신용 조건(net-30, 연체 이자율 등)이나 재고 부패율(0.5%/일)을 조정하여 시장 안정성·파산 민감도를 민감도 분석할 수 있다.
- 시스템 프롬프트·도구 집합·시간 비용(도구 호출당 30분) 변경이 에이전트 행동에 미치는 영향을 재현 실험으로 평가할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- ReAct 프레임워크(ReAct)
- — ReAct는 모델의 자유 텍스트 추론(trace)과 환경에 대한 도구 호출(action)을 교대로 생성하도록 구성된 에이전트 프레임워크이다. 에이전트는 내부 추론을 자연어로 기술한 뒤 도구를 호출해 외부 상태를 변경하고, 이 과정이 반복되며 복합적인 의사결정이 가능해진다. CoffeeBench에서는 각 에이전트가 ReAct를 사용하여 메시지 전송, 주문 제안, 결제 등 실거래 도구를 호출하도록 구성되어 전략적 상호작용을 유도한다.
- 이벤트 기반 시뮬레이션(Event-driven simulation)
- — 이벤트 기반 시뮬레이션은 시간 경과를 모든 에이전트의 동기적 루프가 아닌 사건(event) 발생에 따라 진행하는 방식이다. CoffeeBench는 도구 호출이 로컬 시간을 30분씩 소모하고 외부의 메시지·배송·거래 완료 등 사건으로 비활성 에이전트를 재활성화하도록 설계되어 비동기적 상호작용을 허용한다. 이 설계는 에이전트가 시장 활동에 반응하는 재활성화 루틴을 통해 연속적이면서도 비동기적인 장기 계획을 요구하도록 만든다.
- Net-30 결제 조건(Net-30 trade credit)
- — Net-30 결제 조건은 배송 후 30일 이내에 대금이 지급되는 상거래 약정으로, 지연 시 일일 이자가 부과된다. CoffeeBench는 모든 거래에 기본적으로 Net-30을 적용하고 연체 시 일일 0.1%의 벌금이 발생하도록 설정하여 채무·현금흐름 리스크를 경제적 제약으로 도입했다. 이 규칙은 단기 운영 결정과 장기 현금흐름 관리 사이의 균형을 요구하는 환경적 압력을 생성한다.
- 아이들-드리프트(Idle-drift)(Idle-drift)
- — Idle-drift는 에이전트가 합리적 추론과 계획 문서를 생성하면서도 반복적으로 행동 대신 wait_for_next_day() 등 비활동을 선택해 장기간 비활성 상태로 머무르는 실패 모드이다. CoffeeBench 실험에서 일부 모델은 일관된 계획을 출력했음에도 실제 도구 호출을 수행하지 않아 매출 기회를 상실하는 패턴이 관찰되었다. 이 현상은 장기 과제에서 '생각은 하지만 행동하지 않는' 정책적 실패를 드러내어 에이전트 설계에 중요한 진단 지표로 작동한다.
코드 예제
roast(green_bean, 20), make_offer(), send_message(), pay_invoice(), ..., wait_for_next_day()이 코드는 에이전트가 시뮬레이션에서 호출할 수 있는 도구 호출 예시를 나열한 것으로, 로스팅·거래·메시지·결제·일일 종료 동작을 포함한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.