TL;DR
다중 에이전트 LLM 워크플로 운영에서 핵심 자원인 토큰과 고비용 추론 예산을 절약하기 위해 저비용 모델로 폭넓은 증거를 수집하고 판단은 하나의 고역량 계층에서 수행하도록 계층화하는 원칙을 제시한다. 각 서브에이전트는 발견·출처·신뢰도·미해결 질문으로 구성된 구조화된 결과만 반환하고 필요 시 상위 계층으로 불확실성을 에스컬레이션하며, 검색은 최소 컨텍스트로 시작해 필요한 경우만 확장하는 점진적 검색을 권장한다. 이렇게 하면 중복 요약과 중복 판단을 제거하고 토큰 낭비를 줄이는 대신 판단의 일관성과 출처 추적을 확보할 수 있으나 모델 역량 판정과 자동 오케스트레이터와의 조화는 추가 설계가 필요하다.
실용적 조언
- 세션 스탠딩 인스트럭션이나 프롬프트 전단에 토큰 경제 원칙을 명시하여 모든 서브에이전트가 동일한 선호 의도를 따르도록 구성하라고 권고했다.
- 서브에이전트가 반환할 표준 스키마를 코드나 메시지 포맷으로 정의하여 발견, 출처, 신뢰도, 미해결 질문 필드를 자동으로 채우게 하여 다운스트림 합성을 단일 진입점에서 수행하라고 제안했다.
- 검색은 점진적으로 확장하는 방식으로 구현하고 각 소스는 한 번만 요약하도록 설계하여 중복 컨텍스트 로드를 방지하라고 제안했다.
섹션별 상세
용어 해설
- 토큰 경제(Token Economy)
- — 토큰 경제는 LLM 호출에서 비용과 컨텍스트 사용을 최소화하기 위해 토큰 소비를 설계하는 접근법으로, 어떤 작업을 어떤 모델에 위임할지 결정하고 중복 추론과 불필요한 컨텍스트 로드를 줄이는 규칙을 포함한다. 이 글 맥락에서는 비싼 추론 예산을 보존하고 기계적 작업은 저비용 모델에 맡기며 판단은 중앙화하는 전략적 목표를 가리킨다.
- 점진적 검색(Progressive Retrieval)
- — 점진적 검색은 먼저 최소한의 컨텍스트로 답을 찾고 필요할 때만 문서 범위를 확장하는 방식으로, 전체 문서를 한 번에 로드하지 않음으로써 토큰 사용을 줄이고 응답 속도와 비용을 최적화하는 검색 전략이다. 이 글에서는 5%만으로 해답이 나올 경우 전체 문서 로드를 피하라는 규칙으로 제시됐다.
- 오케스트레이션 계층(Orchestration Layer)
- — 오케스트레이션 계층은 여러 서브에이전트의 모델 선택과 작업 분배를 자동화하는 중간 구성 요소로, 모델 티어링 정책을 시행하거나 자동 할당을 허용할 때 선호 의도를 적용하는 역할을 한다. 이 글에서는 계층이 자동으로 모델을 할당하더라도 토큰 경제 원칙을 지키는 것이 강조됐다.
- 구조화된 발견(Structured Findings)
- — 구조화된 발견은 서브에이전트가 반환하는 결과 형식으로서 핵심 발견, 출처(프로비넌스), 신뢰도, 미해결 질문을 명시적으로 포함하여 다운스트림 합성 단계에서 재검증 없이 바로 소비할 수 있게 하는 데이터 포맷을 의미한다. 원문에서는 프로즈 덤프 대신 스코프된 결과만 전달할 것을 요구했다.
- 에스컬레이션 패턴(Escalation Pattern)
- — 에스컬레이션 패턴은 저비용 에이전트가 충돌하는 증거, 불충분한 정보, 또는 판단이 필요한 과제에 직면했을 때 스스로 추측하지 않고 상위 판단 계층으로 불확실성을 전달하는 규칙 집합으로, 관찰 가능한 조건에 따라 '미해결 질문'을 표면화하도록 요구한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

