본문으로 건너뛰기

LLM 분류 비용을 99% 절감하는 5단계 최적화 전략

대규모 상품 분류 시스템에서 컨텍스트 압축, 계층적 분류, DB 기반 유사도 캐싱 및 배치를 통해 LLM 비용을 90% 이상 절감한 실전 사례를 소개합니다.

섹션별 상세

장황한 JSON 형식을 간결한 텍스트 인코딩으로 변경하여 컨텍스트 크기를 대폭 줄였습니다. 불필요한 속성 메타데이터를 제거하고 '이름|ID' 형태의 계층 구조로 프롬프트를 재구성하여 토큰 사용량을 52% 절감했습니다. 이는 LLM이 사람이 읽기 좋은 형식보다 구조화된 텍스트를 효율적으로 처리한다는 점을 활용한 것입니다.
전체 카테고리 트리를 한 번에 보내는 대신 루트 카테고리를 먼저 정하고 해당 하위 트리만 전송하는 2단계 분류 방식을 도입했습니다. 1단계에서 약 30개의 루트 카테고리 중 하나를 선택하고, 2단계에서 관련 하위 트리만 참조함으로써 토큰 사용량을 기존 대비 95%까지 낮췄습니다. 이 방식은 지연 시간은 다소 늘어나지만 분류의 집중도와 정확도를 높이는 효과가 있습니다.
데이터베이스에 이미 저장된 동일 상품명을 정규화하여 조회함으로써 LLM 호출 자체를 생략했습니다. 공백 제거, 소문자 변환 등의 전처리를 거친 정확한 매칭을 통해 전체 요청의 20-30%를 비용 없이 처리했습니다. 이는 캐시 테이블을 별도로 운영하지 않고 기존 상품 테이블을 활용하여 구현 효율성을 높였습니다.
Postgres의 pg_trgm 확장을 사용하여 정확히 일치하지 않지만 유사한 상품명에 대해 캐시된 결과를 재사용했습니다. GIN 인덱스를 활용해 0.5~0.6 이상의 유사도를 가진 기존 분류 결과를 참조함으로써 추가로 40%의 LLM 호출을 제거했습니다. 별도의 벡터 임베딩 없이도 충분히 높은 정확도의 유사도 검색을 구현할 수 있음을 입증했습니다.
sql
CREATE EXTENSION pg_trgm;
CREATE INDEX idx_order_products_name_trgm ON order_products USING gin (name gin_trgm_ops);

SELECT category_l1_id, category_l2_id, category_l3_id, similarity(name, $1) AS sim
FROM order_products
WHERE category_l1_id IS NOT NULL AND name % $1
ORDER BY sim DESC LIMIT 1;

Postgres의 pg_trgm 확장을 사용하여 유사한 상품명을 기반으로 카테고리를 조회하는 코드

근거
  • pg_trgm 유사도 임계값 0.5에서 LLM 결과와의 일치율이 95% 이상임을 확인했다. Layer 4: Similarity Cache with pg_trgm 섹션의 검증 결과
공통된 컨텍스트를 공유하는 여러 상품을 하나의 프롬프트에 묶어 처리하는 배치 분류를 적용했습니다. 루트 카테고리 목록과 같은 고정 비용 성격의 토큰을 여러 상품이 공유하게 하여 상품당 평균 토큰 소모량을 110개까지 낮췄습니다. 이는 특히 신규 상품이 대량으로 유입될 때 비용 효율성을 극대화하는 전략입니다.

용어 해설

컨텍스트 압축(Context Compression)
LLM에 전달되는 프롬프트에서 불필요한 메타데이터나 형식을 제거하여 토큰 수를 줄이는 기법입니다. JSON 대신 구분자를 사용한 텍스트 형식을 채택함으로써 모델의 이해도는 유지하면서 비용을 절감할 수 있습니다.
트라이그램 유사도(Trigram Similarity)
문자열을 3글자 단위의 부분 문자열로 나누어 두 텍스트 간의 유사성을 측정하는 방식입니다. 오타나 미세한 표기 차이가 있는 텍스트 간의 유사도를 빠르게 계산하여 캐시 히트율을 높이는 데 사용됩니다.
pg_trgm 확장(pg_trgm)
PostgreSQL에서 트라이그램 기반의 문자열 매칭과 인덱싱을 지원하는 확장 모듈입니다. GIN 인덱스와 결합하여 대규모 텍스트 데이터셋에서 유사한 문자열을 밀리초 단위로 검색할 수 있게 해줍니다.
배치 분류(Batch Classification)
여러 개의 입력 데이터를 하나의 API 호출에 묶어서 처리하는 방식입니다. 공통된 컨텍스트(예: 카테고리 트리)를 한 번만 전송함으로써 중복되는 토큰 비용을 획기적으로 줄일 수 있습니다.

근거 모음

근거
  • 토큰 사용량을 상품당 평균 25,000개에서 100개 수준으로 줄여 약 99.5%의 누적 감소율을 달성했다. The Numbers 섹션의 표 데이터

기술

  • Postgres
  • pg_trgm
  • JSON

활용 사례

  • 대규모 상품 카테고리 자동 분류
  • 텍스트 데이터 정규화 및 매핑
  • LLM API 비용 최적화

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 25.수집 2026. 04. 25.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.