본문으로 건너뛰기

비압축 지식 프로브: 사실적 용량을 통한 블랙박스 LLM 파라미터 수 추정

모델이 보유한 사실적 지식의 양과 파라미터 수 사이의 상관관계를 이용해 폐쇄형 LLM의 규모를 추정하는 새로운 벤치마크 방법론

섹션별 상세

기존의 추론 비용 기반 추정 방식은 하드웨어와 서빙 스택의 가변성으로 인해 2배 이상의 불확실성을 가졌으나, 지식 용량 기반 방식은 모델 고유의 특성을 이용해 더 좁은 오차 범위를 제공한다.
Incompressible Knowledge Probes(IKP)는 추론으로 도출하거나 아키텍처 개선으로 압축할 수 없는 7단계 난이도의 사실적 질문 1,400개를 통해 모델의 순수 지식 저장량을 측정한다.
135M에서 1,600B 규모의 89개 오픈 웨이트 모델을 교차 검증한 결과, 중앙값 오차 1.59배 수준으로 파라미터 수를 예측할 수 있는 로그-선형 매핑 모델을 구축했다.
근거
  • IKP 정확도와 파라미터 수 사이의 상관관계는 R² = 0.917에 달하며, 중앙값 오차는 1.59배 수준이다. Abstract 및 Calibration 결과 섹션
Mixture-of-Experts(MoE) 구조의 모델에서는 지식 용량이 활성 파라미터(R²=0.51)보다 전체 파라미터(R²=0.79)와 훨씬 더 높은 상관관계를 보임을 입증했다.
근거
  • MoE 모델에서 전체 파라미터는 지식량을 잘 예측(R²=0.79)하지만, 활성 파라미터는 예측력이 낮다(R²=0.51). Abstract의 Mixture-of-Experts 분석 부분
안전 튜닝이 강하게 적용된 모델의 경우 거부 정책이 알고 있는 지식을 숨길 수 있어, IKP를 통한 추정치는 해당 모델의 최소 파라미터 하한선으로 기능한다.
시간 경과에 따른 지식 밀도 변화를 분석한 결과, 추론 능력과 달리 사실적 지식은 시간이 지나도 압축되지 않고 파라미터 수에 비례하여 유지되는 특성을 보였다.

기술

  • LLM
  • Mixture-of-Experts
  • Incompressible Knowledge Probes

활용 사례

  • 폐쇄형 상용 모델의 파라미터 규모 추정
  • 모델의 지식 저장 효율성 평가
  • MoE 모델의 전체 용량 대비 지식 밀도 분석
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 30.수집 2026. 04. 30.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.