본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

headroomlabs-ai/headroom

Python0 / 0

Headroom은 에이전트가 읽는 모든 컨텐츠를 로컬에서 가역적으로 압축해 토큰 비용을 대폭 줄이되 정확도는 유지하는 프록시·라이브러리·MCP 솔루션이다.

TL;DR

Headroom은 AI 에이전트가 읽는 모든 형태의 컨텐츠를 로컬에서 분류하고 유형별 압축기를 적용해 전송 및 출력 토큰을 줄이는 인프라 솔루션이다. 프록시·라이브러리·MCP 서버 형태로 제공되며 CacheAligner, ContentRouter, SmartCrusher, CodeCompressor, Kompress-base, CCR 같은 구성 요소로 파이프라인을 구성해 입력을 압축하고 원본을 필요 시 복원할 수 있게 한다. 문서와 데모는 코드 검색, 사고 대응, 이슈 분류 같은 실제 워크로드에서 47–92% 수준의 입력 토큰 절감 사례를 제시한다. 출력 토큰 절감 기능은 프록시 레벨에서 모델의 불필요한 서술과 코드 재출력을 줄이는 방식으로 동작하며, 추정치와 통제군을 통해 절감량을 측정하도록 설계되었다. 'headroom learn' 같은 자동 실패 마이닝 도구가 포함되어 있으므로 실사용 로그 기반으로 적정한 응답 장단을 학습해 런타임 설정을 조정할 수 있다. 또한 Kompress-base 모델은 HuggingFace에서 제공되며 로컬 실행과 원격 허브 사용을 모두 지원한다. 제약은 런타임 자산(ONNX, Kompress 모델 등)과 플랫폼 요구사항이 존재하고 기업 네트워크에서는 TLS/CA 설정 같은 설치 전 검토가 필요하다는 점이다. 로컬 실행과 가역성은 데이터 유출 위험을 낮추지만 로컬 자원과 초기 설정이 필요하며, 일부 기능은 특정 Python 버전(예: 3.10+)과 선택적 런타임 의존성을 요구한다. 문서는 설치·평가·벤치마크 재현을 위한 명령과 측정 방법을 제공하므로 도입 전 실제 워크로드로 성능을 검증할 수 있다.

핵심 포인트

  • 로컬 실행과 가역성 조합은 Headroom의 핵심 차별점이며 원본을 CCR로 저장하여 필요 시 LLM이 원본을 조회하도록 복원이 가능하게 만든다. 이 구성은 호스팅형 컴팩션 서비스와 달리 데이터가 외부로 나가지 않는 요구사항을 만족한다. 또한 로컬 캐시 정렬(CacheAligner)을 통해 프롬프트 캐시 적중률을 개선하는 점이 다른 도구와 구분된다.
  • 입력 유형별로 특화된 압축기 세트를 제공한다는 점이 실무적 장점으로 작용한다. SmartCrusher는 복잡한 JSON 구조를, CodeCompressor는 AST를 기반으로 한 코드 압축을, Kompress-base는 학습 기반 텍스트 압축을 각각 담당하여 단일 방식보다 높은 절감 효과를 낸다. 이 모듈화는 필요에 따라 개별 압축기만 선택해 사용하거나 플러그인 방식으로 확장할 수 있게 한다.
  • 프록시 래핑·CLI·라이브러리·MCP 서버 등 다양한 배포 인터페이스를 동시에 제공해 통합 난이도를 낮춘다. 기존 클라이언트는 프록시 주소만 바꾸면 되고 개발자는 compress() 함수를 호출해 인라인으로 사용 가능하다. 이로 인해 코드 변경 없이 빠르게 비용 절감 효과를 얻을 수 있다.
  • 프록시와 라이브러리 양쪽 모드로 동작하며 프록시는 네트워크 수준에서 기존 클라이언트의 요청을 중계해 코드 변경 없이 압축 파이프라인을 적용할 수 있다. 프록시는 런타임 설정을 핫-싱크하여 재시작 없이 환경변수 변경을 반영할 수 있으며 대시보드와 성능 측정 도구를 통해 실시간 절감 효과를 확인할 수 있다. 또한 MCP 명령어 셋을 제공해 표준화된 방식으로 압축·복원·통계 API를 노출한다.

벤치마크

벤치마크지표비교
Code search (100 results)tokens17,765 → 1,408 (92% savings)
SRE incident debuggingtokens65,694 → 5,118 (92% savings)
GitHub issue triagetokens54,174 → 14,761 (73% savings)
Codebase explorationtokens78,502 → 41,254 (47% savings)
GSM8KaccuracyBaseline 0.870 → Headroom 0.870Δ ±0.000
TruthfulQAaccuracyBaseline 0.530 → Headroom 0.560 (N=100)Δ +0.030
SQuAD v2accuracyHeadroom 97% (19% compression)

이미지 분석

데모 GIF는 큰 입력 토큰 수가 압축되어 크게 줄어드는 과정을 터미널 출력으로 보여주며 '10,144 → 1,260 tokens' 예시를 포함하고 있다.
화면은 프록시 또는 라이브러리 적용 전후의 토큰 카운트를 비교해 실무 워크로드에서의 절감 효과를 시각적으로 확인시킨다. GIF 속 텍스트는 동일한 오류(FATAL)를 보존하면서도 토큰 수가 크게 낮아졌음을 나타내어 압축이 정보 손실 없이 문제 재현을 유지함을 시사한다. 이 이미지는 README의 'Savings' 주장을 보강하는 근거로 사용될 수 있다.
headroom learn 기능 시연 GIF는 실패 세션을 마이닝하고 수정 사항을 자동으로 파일(CLAUDE.md 등)에 기록하는 과정을 보여준다.
화면은 CLI 명령 실행과 그 결과로 생성되는 문서 파일을 보여주어 'headroom learn'이 자동으로 실패 사례를 추출하고 수정을 문서로 남기는 워크플로를 수행함을 입증한다. 이 시연은 학습 기반 설정 조정과 자동화된 실패 피드백 루프가 실제로 동작함을 시각적으로 뒷받침하므로 문서화된 기능 설명과 일치한다.

52k

STARS

3.7k

FORKS

+265

TRENDING

0

조회수

watchers 52kopen issues 396Apache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.