커뮤니티 반응
대체로 긍정적이며, 특히 컨텍스트 제한이 엄격한 로컬 모델 사용자들에게 실질적인 도움이 될 것이라는 평가를 받고 있다.
주요 논점
01찬성다수
JSON의 오버헤드가 LLM 비용과 성능에 악영향을 미치므로 LEAN과 같은 효율적인 포맷 도입이 필수적이다.
합의점 vs 논쟁점
합의점
- JSON은 구조화된 데이터를 전달하기에 토큰 효율성이 매우 떨어진다.
- 데이터 포맷을 변경하더라도 모델의 이해도와 데이터 복원력이 유지되어야 한다.
실용적 조언
- 컨텍스트 윈도우가 작은 로컬 모델을 사용할 때 LEAN 포맷을 적용하여 가용 공간을 확보하라.
- RAG 시스템에서 대량의 구조화된 검색 결과를 모델에 전달할 때 토큰 비용 절감을 위해 활용하라.
섹션별 상세
JSON 포맷이 가진 구조적 한계로 인해 컨텍스트 윈도우가 낭비되는 문제를 지적했다. JSON은 객체 배열에서 키 이름을 반복하고 따옴표, 중괄호, 쉼표 등의 문법 기호를 과도하게 사용하여 실제 데이터보다 구문 자체에 많은 토큰을 소모한다.
LEAN 포맷은 공유 키를 헤더로 분리하고 탭 구분 행 방식을 사용하여 토큰 효율을 극대화했다. 중첩된 스칼라 값은 점 경로(dot path)로 평탄화하고, 불필요한 따옴표를 제거하며, 불리언 값과 null을 T/F/_와 같은 단일 문자로 치환하여 인코딩한다.
12개의 데이터셋을 대상으로 벤치마크를 수행한 결과 JSON Compact 대비 평균 48.7%의 토큰 절감 효과를 확인했다. 이는 ZON(-47.8%), TOON(-40.1%), ASON(-39.3%) 등 기존의 다른 효율적 포맷들과 비교해도 가장 높은 수치이다.
모델의 데이터 이해도 측면에서도 JSON과 동일한 수준의 정확도를 유지함을 입증했다. 15개의 금융 거래 데이터에 대해 조회, 산술, 필터링 등 15개의 질문을 테스트한 결과 JSON과 LEAN 모두 93.3%의 동일한 정확도를 기록했다.
용어 해설
- 컨텍스트 윈도우(Context Window)
- — LLM이 한 번에 처리할 수 있는 최대 토큰의 양을 의미한다. 데이터의 구조적 오버헤드가 크면 실제 정보가 들어갈 공간이 줄어들기 때문에 효율적인 데이터 포맷 사용이 중요하다.
- 직렬화(Serialization)
- — 데이터 구조나 오브젝트 상태를 저장하거나 전송하기 위해 다른 포맷으로 변환하는 과정이다. LLM 통신에서는 주로 JSON이 사용되지만 토큰 효율성을 위해 새로운 포맷이 제안되기도 한다.
- 토큰 효율성(Token Efficiency)
- — 동일한 정보를 전달할 때 사용하는 토큰의 수를 최소화하는 성능 지표이다. 토큰 사용량이 줄어들면 API 비용이 절감되고 모델의 유효 컨텍스트 범위가 넓어지는 효과가 있다.
- 무손실 압축(Lossless Compression)
- — 원래의 데이터를 아무런 정보 손실 없이 완벽하게 복원할 수 있는 압축 방식이다. 데이터 직렬화 포맷에서 인코딩과 디코딩 후 데이터가 동일함을 보장하는 것이 필수적이다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 14.수집 2026. 04. 14.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.