본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Paritok-official/paritok-4b-v1

Python0 / 0

코딩 에이전트의 도구 schema와 누적 context를 비파괴 압축해 입력 토큰 비용과 context 소모를 줄이는 Python gateway입니다.

TL;DR

Paritok은 Claude Code·Cursor·Codex·OpenHands 앞에 배치하는 Python 기반 비파괴 LLM gateway와 CLI proxy입니다. 매 요청의 tool schema를 embedding으로 선별하고 file read·tool output·오래된 history를 Paritok-4B-v1로 압축한 뒤, [REF:id]를 통해 필요할 때 정확한 원문을 복구합니다. README 기준 SWE-bench Lite 품질 유지율은 86.5%, 압축률은 25.7%이며, 전체 stack 절약은 turn 1 약 25%에서 turn 20 약 63%로 제시됩니다. Ollama self-host는 약 2.5GB 모델로 시작할 수 있고 Apache 2.0이라 비용과 데이터 이동을 통제하기 좋지만, 압축 품질과 Python 중심 지원 범위는 실제 코드베이스에서 별도 검증이 필요합니다.

핵심 포인트

  • Paritok은 독립 실행형 Python 기반 LLM gateway이자 CLI proxy로, Claude Code·Cursor·Codex·OpenHands와 Anthropic·OpenAI 호환 에이전트 사이에서 동작합니다. 에이전트의 BASE_URL 또는 Codex 설정만 proxy로 바꾸므로 기존 에이전트 코드를 수정하지 않습니다. 다만 proxy를 세션 내내 별도 프로세스로 실행해야 합니다.
  • embedding 기반 tool-schema filter가 매 요청마다 전체 JSON schema를 보내는 대신 현재 작업과 관련된 도구만 전체 schema로 남기고 나머지는 stub으로 바꿉니다. 일반적인 Claude Code 환경에서 도구 영역을 약 29K 토큰에서 약 8K 토큰으로 줄이며, CPU에서 BAAI/bge-small-en-v1.5를 실행합니다. 필터링된 도구는 gateway_search_tools 호출로 복구되며 shell·exec·apply_patch 같은 핵심 실행 도구는 stub 처리하지 않습니다.
  • Paritok-4B-v1은 file read·tool output·오래된 history를 [REF:id]로 치환하고 필요할 때 read_original로 원본 바이트를 되가져오는 비파괴 압축 모델입니다. README 기준 각 segment를 원본의 25.7%까지 줄이고, SWE-bench Lite에서 uncompressed baseline 대비 86.5%의 solve quality를 유지했습니다. 원본 복구 경로가 있어 wire 단계에서는 손실이 있지만 중요한 세부 정보를 다시 조회할 수 있습니다.
  • Apache 2.0 self-hosting은 무료이며 Ollama의 약 2.5GB q4 모델, 또는 24GB GPU의 vLLM LoRA 구성을 사용할 수 있습니다. README의 측정과 projection은 turn 1 약 25%, turn 5 약 39%, turn 20 약 63%의 end-to-end 절약을 제시하고 context budget에 따라 85% 이상까지 올라갑니다. 긴 multi-turn·read-heavy 작업과 MCP 도구가 많은 환경에 적합하지만, v1은 Python 중심이고 압축으로 인한 품질 저하 가능성을 SWE-bench 수치로 확인해야 합니다.

벤치마크

벤치마크지표비교
SWE-bench Lite 품질 유지율quality retained86.5%uncompressed baseline 대비 solve rate 정규화 수치이며, Paritok-4B-v1 raw model의 공개 측정값
SWE-bench Lite 압축률compression rate25.7%Paritok-4B-v1의 공개 측정값이며, gpt-4.1-mini 50.2%, gpt-5 61.9%보다 낮음
Claude Code 5턴 누적 절약end-to-end saving~39%tool filter와 content compression을 모두 적용한 README 측정 및 계산 기준
Claude Code 1턴 절약end-to-end saving~25%전체 도구 schema와 raw files를 사용하는 no-Paritok baseline 대비 README 측정 및 계산 기준
동일 context budget 실행 가능 턴turn runway약 3배128K에서 약 10→30턴, 200K에서 약 15→44턴, 1M에서 약 75→220턴으로 제시된 README 수치

이미지 분석

Python 환불 코드 파일을 한 번에 읽는 3,000토큰 입력을 Paritok이 코드 구조와 오류 정보를 유지한 780토큰 표현으로 줄인 전후 비교 이미지입니다.
이미지는 동일한 refund.py 코드에 대해 기존 one-file read가 3,000토큰이던 상황과 non-destructive 처리 후 780토큰이 된 상황을 좌우로 비교합니다. 오른쪽 결과에는 import, 함수 signature, 예외명, 반환문이 남아 있고 read_original("a41")로 정확한 원본 바이트를 되찾을 수 있다는 흐름이 표시됩니다. 하단의 74% removed 표기는 README가 말하는 비파괴 file-read 압축의 작동 방식과 연결되지만, 이 한 장의 예시는 전체 session 절약률이나 SWE-bench 성능을 검증하지는 않습니다.

1.3k

Stars

130

Forks

+209

Trending

0

조회수

1.3k watchers29 open issuesApache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.