에이전트 컨텍스트를 60–95% 줄이는 로컬 압축 계층
Headroom은 에이전트가 읽는 모든 컨텐츠를 로컬에서 가역적으로 압축해 토큰 비용을 대폭 줄이되 정확도는 유지하는 프록시·라이브러리·MCP 솔루션이다.
TL;DR
Headroom은 AI 에이전트가 읽는 모든 형태의 컨텐츠를 로컬에서 분류하고 유형별 압축기를 적용해 전송 및 출력 토큰을 줄이는 인프라 솔루션이다. 프록시·라이브러리·MCP 서버 형태로 제공되며 CacheAligner, ContentRouter, SmartCrusher, CodeCompressor, Kompress-base, CCR 같은 구성 요소로 파이프라인을 구성해 입력을 압축하고 원본을 필요 시 복원할 수 있게 한다. 문서와 데모는 코드 검색, 사고 대응, 이슈 분류 같은 실제 워크로드에서 47–92% 수준의 입력 토큰 절감 사례를 제시한다. 출력 토큰 절감 기능은 프록시 레벨에서 모델의 불필요한 서술과 코드 재출력을 줄이는 방식으로 동작하며, 추정치와 통제군을 통해 절감량을 측정하도록 설계되었다. 'headroom learn' 같은 자동 실패 마이닝 도구가 포함되어 있으므로 실사용 로그 기반으로 적정한 응답 장단을 학습해 런타임 설정을 조정할 수 있다. 또한 Kompress-base 모델은 HuggingFace에서 제공되며 로컬 실행과 원격 허브 사용을 모두 지원한다. 제약은 런타임 자산(ONNX, Kompress 모델 등)과 플랫폼 요구사항이 존재하고 기업 네트워크에서는 TLS/CA 설정 같은 설치 전 검토가 필요하다는 점이다. 로컬 실행과 가역성은 데이터 유출 위험을 낮추지만 로컬 자원과 초기 설정이 필요하며, 일부 기능은 특정 Python 버전(예: 3.10+)과 선택적 런타임 의존성을 요구한다. 문서는 설치·평가·벤치마크 재현을 위한 명령과 측정 방법을 제공하므로 도입 전 실제 워크로드로 성능을 검증할 수 있다.
주요 기능
- 프록시와 라이브러리 양쪽 모드로 동작하며 프록시는 네트워크 수준에서 기존 클라이언트의 요청을 중계해 코드 변경 없이 압축 파이프라인을 적용할 수 있다. 프록시는 런타임 설정을 핫-싱크하여 재시작 없이 환경변수 변경을 반영할 수 있으며 대시보드와 성능 측정 도구를 통해 실시간 절감 효과를 확인할 수 있다. 또한 MCP 명령어 셋을 제공해 표준화된 방식으로 압축·복원·통계 API를 노출한다.
- 컨텐츠 유형을 판별하는 ContentRouter와 데이터 유형별 압축기(SmartCrusher, CodeCompressor, Kompress-base)를 통해 JSON, AST 기반 코드, 일반 텍스트를 각각 적합한 방식으로 처리한다. CodeCompressor는 AST를 이용해 코드 구조를 보존하면서 불필요한 토큰을 줄이고 Kompress-base는 학습된 모델로 문장 단위 압축을 수행한다. 이 파이프라인은 CacheAligner와 CCR을 결합해 캐시 적중률을 높이고 원본을 필요 시 복원 가능하게 유지한다.
- 출력 토큰 절감 기능은 모델이 생성하는 불필요한 문구와 코드 재출력을 줄이는 방식으로 동작하며, 이 기능은 프록시 레벨에서 활성화할 수 있고 추정값과 대조군을 통해 실측 또는 추정치를 제공한다. CLI 명령어로 'headroom learn'를 실행하면 실패 세션을 마이닝해 수정을 자동으로 기록하는 워크플로가 포함되어 있다. 가역성(원본 캐싱)과 측정 가능한 절감치를 함께 제공하므로 비용-정확도 트레이드오프를 실험적으로 관리할 수 있다.
- 다중 에이전트 환경을 위한 SharedContext와 자동 중복 제거 기능을 제공해 Claude, Codex, Gemini 등 여러 에이전트 간에 압축된 메모리를 공유할 수 있다. 이 기능은 교차 에이전트 메모리 동기화와 에이전트별 출처 추적을 포함하며, 에이전트 래핑 명령으로 간단히 통합 가능한 것이 특징이다. 또한 로컬-first 설계로 민감 데이터가 외부로 노출되지 않도록 한다.
어떻게 동작하는가
Headroom은 입력을 유형별로 라우팅하고 각 유형에 적합한 압축기를 적용한 뒤 압축된 프롬프트와 선택적 검색 도구를 LLM에 전달하는 파이프라인으로 작동한다. 파이프라인 단계는 CacheAligner로 접두사를 안정화하고 ContentRouter가 적절한 압축기(SmartCrusher, CodeCompressor, Kompress-base)를 선택한 다음 CCR에 원본을 저장해 필요 시 복원하도록 구성되어 있다. 이 과정에서 출력 토큰에 대한 별도의 성형(output shaping)과 노력 수준(effort routing) 제어가 적용되어 모델이 쓰는 토큰까지 절감하도록 설계되었다.
해결 문제
대규모 컨텍스트를 LLM에 전달할 때 발생하는 토큰 비용과 캐시 미스, 그리고 에이전트별 중복 컨텍스트 문제를 줄이는 것이 핵심 문제이다. Headroom은 다양한 입력 유형을 분류해 언어·코드·JSON·이미지 메타데이터 등에 대해 최적의 압축기를 적용함으로써 송신 토큰과 출력 토큰을 모두 줄인다. 또한 가역성(원본 복원)과 교차 에이전트 메모리 공유로 정보 손실과 중복성 문제를 동시에 해결한다.
지금 주목받는 이유
토큰 비용이 운영 비용에 직접적인 영향을 주는 환경에서 입력과 출력 양쪽을 줄이는 접근은 당장의 비용 절감 효과를 만들어낸다. Headroom은 에이전트 중심 워크플로에서 여러 제공자와 에이전트를 아우르는 통합 솔루션을 제시해 실무 도입 사례가 빠르게 늘었다. 또한 GitHub 스타와 문서화, HuggingFace 모델 공개 등으로 주목도가 높아져 생태계 통합 수요를 촉진했다.
차별점
- 로컬 실행과 가역성 조합은 Headroom의 핵심 차별점이며 원본을 CCR로 저장하여 필요 시 LLM이 원본을 조회하도록 복원이 가능하게 만든다. 이 구성은 호스팅형 컴팩션 서비스와 달리 데이터가 외부로 나가지 않는 요구사항을 만족한다. 또한 로컬 캐시 정렬(CacheAligner)을 통해 프롬프트 캐시 적중률을 개선하는 점이 다른 도구와 구분된다.
- 입력 유형별로 특화된 압축기 세트를 제공한다는 점이 실무적 장점으로 작용한다. SmartCrusher는 복잡한 JSON 구조를, CodeCompressor는 AST를 기반으로 한 코드 압축을, Kompress-base는 학습 기반 텍스트 압축을 각각 담당하여 단일 방식보다 높은 절감 효과를 낸다. 이 모듈화는 필요에 따라 개별 압축기만 선택해 사용하거나 플러그인 방식으로 확장할 수 있게 한다.
- 프록시 래핑·CLI·라이브러리·MCP 서버 등 다양한 배포 인터페이스를 동시에 제공해 통합 난이도를 낮춘다. 기존 클라이언트는 프록시 주소만 바꾸면 되고 개발자는 compress() 함수를 호출해 인라인으로 사용 가능하다. 이로 인해 코드 변경 없이 빠르게 비용 절감 효과를 얻을 수 있다.
사용 사례
- 대규모 코드 검색과 코드베이스 탐색 시 반환되는 수천 토큰의 결과를 압축해 LLM 호출 비용을 줄이는 데 쓰인다. 예시로 100개 검색 결과를 압축해 토큰을 대폭 절감하면서 동일한 판별 결과를 유지하도록 설계되어 있다. 이 사용법은 코드 리팩터링, 검색 기반 코드 생성 등 반복적 코드 처리 워크플로에서 비용 효율을 높인다.
- SRE 사고 대응 워크플로에서 로그와 명령 출력, 디버그 산출물을 압축해 에이전트가 문제 원인을 분석하는 데 드는 토큰 비용을 낮춘다. 문서에 제시된 사례는 대량 로그를 압축해도 동일한 결론(FATAL 탐지 등)을 유지한 점을 보여준다. 이 방식은 긴 콘텍스트가 필요한 조사 시나리오에서 유용하다.
- 여러 에이전트를 사용하는 멀티에이전트 시스템에서 교차 에이전트 메모리를 공유하고 중복 항목을 자동으로 제거하는 데 사용된다. SharedContext와 자동 중복 제거는 서로 다른 에이전트가 같은 컨텍스트를 반복해서 저장하는 것을 방지하고, 전체 시스템의 컨텍스트 효율성을 개선한다. 이 기능은 에이전트 간 협업과 장기 메모리 유지가 필요한 파이프라인에서 이점을 제공한다.
시작하기
설치부터 실행까지 문서에 제시된 '60초 시작' 경로가 명확하게 나와 있다. Python 환경에서는 pip install "headroom-ai[all]"로 전체 기능을 설치하고 Node 환경에서는 npm install headroom-ai로 설치한 뒤 headroom proxy --port 8787 또는 headroom wrap <agent> 명령으로 프록시 또는 에이전트 래핑을 즉시 실행할 수 있다. 대시보드와 성능 측정 도구(headroom perf, headroom dashboard)를 통해 실시간 절감 효과를 확인하는 절차도 함께 제공된다.
요구사항
- Headroom은 Python 3.10 이상을 요구하며 여러 추가 기능은 선택적 익스트라(예: [ml], [pytorch-mps])로 제공된다. Kompress-base 모델과 ONNX 런타임 같은 런타임 자산은 다운로드가 필요하며 기업 네트워크 환경에서는 사전 준비나 인증서 설정이 요구될 수 있다. Docker 이미지와 사전 빌드된 wheel이 제공되어 Rust 빌드 툴체인이 필요하지 않은 플랫폼이 있으나 플랫폼별 제약 사항은 문서에 상세히 기재되어 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Code search (100 results) | tokens | 17,765 → 1,408 (92% savings) | — |
| SRE incident debugging | tokens | 65,694 → 5,118 (92% savings) | — |
| GitHub issue triage | tokens | 54,174 → 14,761 (73% savings) | — |
| Codebase exploration | tokens | 78,502 → 41,254 (47% savings) | — |
| GSM8K | accuracy | Baseline 0.870 → Headroom 0.870 | Δ ±0.000 |
| TruthfulQA | accuracy | Baseline 0.530 → Headroom 0.560 (N=100) | Δ +0.030 |
| SQuAD v2 | accuracy | Headroom 97% (19% compression) | — |
이미지 분석


52k
Stars
3.7k
Forks
+265
Trending
1
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.