본문으로 건너뛰기
r/LLMDevs조회 3

Vision LLM 비용을 35-53% 절감하는 오픈소스 프록시 Token0 공개

Vision LLM 요청을 가로채 이미지 리사이징, OCR 라우팅, 유사도 캐싱 등 9가지 기법으로 비용을 최대 53% 절감하는 오픈소스 API 프록시 Token0가 출시됐다.

실용적 조언

  • pip install token0 명령어로 설치 후 로컬에서 서버를 실행하여 즉시 테스트 가능하다.
  • LiteLLM 사용자는 Token0Hook을 콜백에 추가하는 것만으로 기존 파이프라인에 최적화를 적용할 수 있다.

섹션별 상세

01
텍스트 비중이 높은 이미지를 비전 토큰 대신 OCR로 처리하여 비용을 절감한다. 입력된 이미지의 텍스트 밀도를 91% 정확도의 휴리스틱으로 분석하여 기준 충족 시 텍스트로 변환해 모델에 전달한다. 영수증 이미지의 경우 약 750토큰이 소요되나 텍스트 변환 시 30-50토큰으로 줄어들어 최대 25배의 효율을 낸다. 비전 모델의 높은 단가를 텍스트 단가로 대체함으로써 전체 비용의 47-70%를 절약하는 실무적 이점이 있다.
02
지각적 해싱을 이용해 유사한 이미지에 대한 캐시 히트를 구현했다. Johnson-Lindenstrauss 정리를 활용한 압축 바이너리 시그니처와 Hamming 거리를 계산하여 촬영 각도나 압축률이 조금 다른 이미지도 동일한 것으로 인식한다. 실험 결과 이미지 변형이 있는 환경에서 추가로 62%의 비용 절감 효과가 확인됐다. 이는 단순 픽셀 매칭 캐시의 한계를 극복하여 실제 운영 환경에서의 캐시 효율을 극대화한다.
03
대용량 비디오 데이터를 핵심 프레임 단위로 압축하여 전송 효율을 높인다. 1fps 단위로 프레임을 추출한 뒤 QJL 해시로 중복을 제거하고 장면 전환을 감지하여 고유한 키프레임만 선별한다. 60초 분량의 30fps 비디오(1,800프레임)를 약 10개의 핵심 프레임으로 줄여 비전 파이프라인에 입력한다. 비디오 데이터의 중복성을 제거함으로써 API 비용과 추론 지연 시간을 동시에 단축한다.
04
OpenAI의 512px 타일 그리드 시스템에 최적화된 리사이징을 수행한다. 이미지를 모델이 처리하는 타일 경계값에 맞춰 조정함으로써 불필요한 타일 생성을 방지한다. 1280x720 이미지를 최적화하면 품질 손실 없이 타일 수를 4개에서 2개로 줄여 토큰 소모를 44% 절감한다. 모델의 내부 아키텍처 특성을 활용하여 데이터 품질은 유지하면서 비용만 선택적으로 제거하는 방식이다.

용어 해설

OCR 라우팅(OCR Routing)
이미지 내의 텍스트 비중을 분석하여 비전 토큰 대신 OCR을 통해 추출된 텍스트를 모델에 전송하는 기술이다. 이미지당 약 750토큰이 소요되는 비전 처리를 30-50토큰 수준의 텍스트 처리로 대체하여 비용을 15-25배 절감할 수 있다.
지각적 해싱(Perceptual Hashing)
이미지의 시각적 특징을 기반으로 해시값을 생성하여 픽셀이 완벽히 일치하지 않아도 유사한 이미지를 식별하는 기법이다. 촬영 각도나 압축률이 미세하게 다른 이미지를 동일한 콘텐츠로 인식하여 캐시 효율을 높이는 데 사용된다.
존슨-린덴슈트라우스 정리(Johnson-Lindenstrauss Lemma)
고차원 데이터를 저차원 공간으로 투영하면서도 데이터 포인트 간의 거리를 일정 수준으로 보존할 수 있다는 수학적 원리이다. 이 도구에서는 이미지 시그니처를 압축하여 효율적인 유사도 검색(Fuzzy Cache)을 구현하는 데 활용됐다.
타일 최적화(Tile Optimization)
OpenAI 등 비전 모델이 이미지를 처리하는 최소 단위인 타일(예: 512px) 그리드에 맞춰 이미지 해상도를 조정하는 기법이다. 이미지 크기를 타일 경계에 맞게 리사이징하여 불필요한 토큰 생성을 방지하고 비용을 절감한다.
모델 캐스케이드(Model Cascade)
입력된 쿼리의 복잡도를 분석하여 단순한 작업은 저렴한 소형 모델로, 복잡한 작업은 고성능 모델로 자동 분산시키는 전략이다. 이를 통해 전체 시스템의 성능은 유지하면서 운영 비용을 최적화할 수 있다.

코드 예제

python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="unused", # Ollama doesn't need a key
)

response = client.chat.completions.create(
    model="moondream",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "What's in this image?"},
            {"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,..."}}
        ]
    }],
    extra_headers={"X-Provider-Key": "unused"}
)

OpenAI 호환 클라이언트를 사용하여 Token0 프록시를 통해 Vision LLM 요청을 보내는 예시

python
import litellm
from token0.litellm_hook import Token0Hook

litellm.callbacks = [Token0Hook()]
# All your existing litellm.completion() calls now get image optimization

LiteLLM 사용 시 콜백 기능을 통해 기존 코드 변경 없이 최적화를 적용하는 방법

언급된 도구

Token0추천링크

Vision LLM 비용 최적화 API 프록시

Ollama중립

로컬 LLM 실행 및 서빙 엔진

LiteLLM추천

다양한 LLM API 통합 라이브러리

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 31.수집 2026. 03. 31.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.