섹션별 상세
LLM 에이전트의 컨텍스트 비대화는 토큰 비용을 급증시키고 모델의 유효 컨텍스트 범위를 초과하여 성능을 저하시키는 '노이즈'를 생성한다.
'관찰 마스킹(Observation Masking)'은 오래된 환경 관찰 결과(로그 등)를 플레이스홀더로 숨기고 추론과 행동 기록만 유지하는 방식으로, 구현이 간단하고 비용이 저렴하다.


'LLM 요약(LLM Summarization)'은 별도의 모델로 과거 이력을 압축하지만, 요약 과정에서 에이전트가 종료 시점을 놓치고 불필요하게 더 많은 단계를 수행하는 '궤적 연장(Trajectory Elongation)' 부작용이 발생한다.
SWE-bench Verified 벤치마크 실험 결과, 관찰 마스킹은 관리되지 않은 에이전트 대비 비용을 50% 이상 절감하면서도 Qwen3-Coder 480B 모델 기준 해결률을 2.6% 향상시켰다.
JetBrains가 제안한 '하이브리드 접근법'은 평소에는 관찰 마스킹을 사용하다가 컨텍스트가 임계치를 넘을 때만 요약을 실행하여, 순수 마스킹 대비 7%, 순수 요약 대비 11%의 추가 비용 절감을 달성했다.
용어 해설
- 컨텍스트 윈도우(Context Window)
- — LLM이 한 번에 처리할 수 있는 최대 토큰의 양을 의미한다. 에이전트가 작업을 수행하며 생성하는 데이터가 이 범위를 넘어서면 이전 정보를 망각하거나 성능이 급격히 떨어지므로, 이를 효율적으로 관리하는 것이 에이전트 설계의 핵심이다.
- 관찰 마스킹(Observation Masking)
- — 에이전트의 실행 이력 중 환경으로부터 받은 상세한 피드백(로그, 파일 내용 등)을 특정 시점 이후 생략하거나 플레이스홀더로 대체하는 기법이다. 추론 과정은 보존하면서 토큰 소모를 획기적으로 줄여 비용 효율성을 높인다.
- 궤적 연장(Trajectory Elongation)
- — 에이전트가 문제를 해결하는 과정에서 불필요하게 많은 단계를 수행하게 되는 현상이다. 요약된 정보가 에이전트의 판단력을 흐려 종료 시점을 놓치게 만들 때 발생하며, 이는 전체적인 API 비용 상승과 효율성 저하로 이어진다.
기술
- SWE-agent
- OpenHands
- Qwen3
- Gemini 2.5 Flash
- SWE-bench Verified
활용 사례
- 소프트웨어 엔지니어링 에이전트
- 장기 추론 작업
- API 비용 최적화
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 14.수집 2026. 03. 14.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
