Paritok-official/paritok-4b-v1
Python0 / 0
코딩 에이전트의 도구 schema와 누적 context를 비파괴 압축해 입력 토큰 비용과 context 소모를 줄이는 Python gateway입니다.
TL;DR
Paritok은 Claude Code·Cursor·Codex·OpenHands 앞에 배치하는 Python 기반 비파괴 LLM gateway와 CLI proxy입니다. 매 요청의 tool schema를 embedding으로 선별하고 file read·tool output·오래된 history를 Paritok-4B-v1로 압축한 뒤, [REF:id]를 통해 필요할 때 정확한 원문을 복구합니다. README 기준 SWE-bench Lite 품질 유지율은 86.5%, 압축률은 25.7%이며, 전체 stack 절약은 turn 1 약 25%에서 turn 20 약 63%로 제시됩니다. Ollama self-host는 약 2.5GB 모델로 시작할 수 있고 Apache 2.0이라 비용과 데이터 이동을 통제하기 좋지만, 압축 품질과 Python 중심 지원 범위는 실제 코드베이스에서 별도 검증이 필요합니다.
핵심 포인트
- Paritok은 독립 실행형 Python 기반 LLM gateway이자 CLI proxy로, Claude Code·Cursor·Codex·OpenHands와 Anthropic·OpenAI 호환 에이전트 사이에서 동작합니다. 에이전트의 BASE_URL 또는 Codex 설정만 proxy로 바꾸므로 기존 에이전트 코드를 수정하지 않습니다. 다만 proxy를 세션 내내 별도 프로세스로 실행해야 합니다.
- embedding 기반 tool-schema filter가 매 요청마다 전체 JSON schema를 보내는 대신 현재 작업과 관련된 도구만 전체 schema로 남기고 나머지는 stub으로 바꿉니다. 일반적인 Claude Code 환경에서 도구 영역을 약 29K 토큰에서 약 8K 토큰으로 줄이며, CPU에서 BAAI/bge-small-en-v1.5를 실행합니다. 필터링된 도구는 gateway_search_tools 호출로 복구되며 shell·exec·apply_patch 같은 핵심 실행 도구는 stub 처리하지 않습니다.
- Paritok-4B-v1은 file read·tool output·오래된 history를 [REF:id]로 치환하고 필요할 때 read_original로 원본 바이트를 되가져오는 비파괴 압축 모델입니다. README 기준 각 segment를 원본의 25.7%까지 줄이고, SWE-bench Lite에서 uncompressed baseline 대비 86.5%의 solve quality를 유지했습니다. 원본 복구 경로가 있어 wire 단계에서는 손실이 있지만 중요한 세부 정보를 다시 조회할 수 있습니다.
- Apache 2.0 self-hosting은 무료이며 Ollama의 약 2.5GB q4 모델, 또는 24GB GPU의 vLLM LoRA 구성을 사용할 수 있습니다. README의 측정과 projection은 turn 1 약 25%, turn 5 약 39%, turn 20 약 63%의 end-to-end 절약을 제시하고 context budget에 따라 85% 이상까지 올라갑니다. 긴 multi-turn·read-heavy 작업과 MCP 도구가 많은 환경에 적합하지만, v1은 Python 중심이고 압축으로 인한 품질 저하 가능성을 SWE-bench 수치로 확인해야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWE-bench Lite 품질 유지율 | quality retained | 86.5% | uncompressed baseline 대비 solve rate 정규화 수치이며, Paritok-4B-v1 raw model의 공개 측정값 |
| SWE-bench Lite 압축률 | compression rate | 25.7% | Paritok-4B-v1의 공개 측정값이며, gpt-4.1-mini 50.2%, gpt-5 61.9%보다 낮음 |
| Claude Code 5턴 누적 절약 | end-to-end saving | ~39% | tool filter와 content compression을 모두 적용한 README 측정 및 계산 기준 |
| Claude Code 1턴 절약 | end-to-end saving | ~25% | 전체 도구 schema와 raw files를 사용하는 no-Paritok baseline 대비 README 측정 및 계산 기준 |
| 동일 context budget 실행 가능 턴 | turn runway | 약 3배 | 128K에서 약 10→30턴, 200K에서 약 15→44턴, 1M에서 약 75→220턴으로 제시된 README 수치 |
이미지 분석

1.3k
Stars
130
Forks
+209
Trending
0
조회수
1.3k watchers29 open issuesApache License 2.0
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.