본문으로 건너뛰기
r/LLMDevs조회 2

Caveman

Caveman이 에이전트 컨텍스트를 호출 전에 압축해 입력 토큰을 33.2% 줄였습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Caveman은 코딩 에이전트의 출력 토큰을 줄이는 방식에서 출발했지만, JetBrains의 장기 코딩 작업에서는 전체 트래픽 중 출력 비중이 작아 절감폭이 8.5%로 나타났습니다. 이에 따라 에이전트와 provider 사이에 로컬 proxy를 배치하고 대화 기록, 소스 파일, 로그, 도구 결과 같은 입력 컨텍스트를 호출 전에 압축·재구성했습니다. 54회 벤치마크에서 provider 입력 토큰은 33.2% 감소했고 18회의 exact-answer 검사를 모두 통과했으며, skills를 이미지 컨텍스트로 표현한 실험에서는 공간이 약 70% 줄고 retrieval accuracy가 약 99% 유지됐습니다. 다만 adversarial workload에서 세부 정보와 지연된 도구 사용이 보존되는지는 추가 검증이 필요합니다.

실용적 조언

  • 에이전트 최적화에서는 출력 토큰 절감률만 따로 보지 말고 매 호출에 반복되는 대화 기록, 소스 파일, 로그, 도구 결과, 브라우저 상태, MCP 응답의 입력 토큰을 분리해 측정하는 편이 적절합니다. provider 호출 직전에 컨텍스트를 압축하더라도 원본을 로컬에 보존하고 byte-for-byte 복구 경로를 마련해야 세부 정보 손실을 점검할 수 있습니다. 품질 검증은 exact-answer 검사에 그치지 말고 긴 의존성, 미묘한 소스 세부사항, 지연된 도구 사용을 포함한 adversarial workload로 확장해야 합니다.

섹션별 상세

01
Caveman은 코딩 에이전트의 출력 토큰을 줄이는 개입에서 출발했으며, 초기 서술·채팅 벤치마크에서는 출력 토큰 사용량이 약 65% 감소했습니다. JetBrains가 장기 코딩 작업으로 독립 검증했을 때 감소폭은 8.5%였지만 작업 품질의 측정 가능한 하락은 없었습니다. 두 수치의 차이는 출력 압축 효과가 없어서가 아니라 해당 작업에서 전체 트래픽 중 모델 출력이 차지하는 비중이 작았기 때문입니다.
02
최적화 위치를 에이전트 하네스 아래로 옮겨 에이전트와 provider 사이에 로컬 Caveman proxy를 배치했습니다. provider를 호출하기 전에 eligible context를 압축하거나 재구성하고, 원본 데이터는 로컬에 저장해 byte-for-byte 복구가 가능하도록 구성했습니다. 54회 고정 벤치마크에서 provider가 보고한 입력 토큰은 33.2% 감소했고, 18회의 exact-answer 검사 모두 통과했습니다.
03
현재 실험은 에이전트 skills의 표현 방식에도 확장됐습니다. 기존 skills를 multimodal image context로 표현하자 벤치마크에서 차지하는 공간이 약 70% 줄었고, retrieval accuracy는 약 99% 수준으로 유지됐습니다. 이 결과는 매 턴 provider 경계를 통과하는 누적 상태의 표현이 에이전트 효율에 큰 영향을 줄 수 있다는 가설을 뒷받침하지만, 긴 의존성이나 미묘한 소스 세부사항, 지연된 도구 사용을 포함한 adversarial workload 검증은 아직 필요합니다.

용어 해설

에이전트 하네스(Agent Harness)
코딩 에이전트의 대화 기록, 소스 파일, 로그, 도구 결과, 브라우저 상태 같은 누적 상태를 관리하고 모델 호출을 조정하는 실행 계층입니다. Caveman은 이 계층 아래에서 provider로 전달되는 컨텍스트를 가공합니다.
컨텍스트 표현(Context Representation)
에이전트가 축적한 상태를 모델 입력으로 변환하는 방식입니다. 같은 정보라도 텍스트, 구조화된 데이터, 이미지 등 표현을 바꾸면 provider 경계를 통과하는 입력 토큰과 검색 정확도가 달라질 수 있습니다.
MCP
모델과 외부 도구·데이터 소스를 연결하는 프로토콜로, 에이전트 요청에 MCP 응답이 누적되면 매 호출마다 provider로 전달되는 컨텍스트가 커질 수 있습니다. 원문에서는 반복 입력의 한 구성 요소로 언급됩니다.
입력 토큰(Input Tokens)
모델 호출 때 프롬프트와 대화 기록, 파일, 도구 결과처럼 모델에 전달되는 입력을 쪼갠 단위입니다. 입력 토큰 수는 긴 에이전트 작업에서 provider 사용량과 비용에 직접 영향을 주며, Caveman은 이를 줄이는 데 초점을 둡니다.

언급된 도구

Caveman추천링크

에이전트와 provider 사이의 로컬 proxy에서 provider 호출 전 컨텍스트를 압축·재구성하는 도구입니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 13.수집 2026. 08. 14.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.