본문으로 건너뛰기

LLM의 메타인지: 기초·진전·기회에 대한 종합적 검토

이 논문은 LLM의 메타인지 개념을 정의하고 측정법, 구현 기법, 실험적 발견, 응용 가능성 및 남은 과제를 체계적으로 종합한 리뷰 논문이다.

용어 해설

메타-d'(meta-d′)
meta-d′는 신호탐지이론 기반의 측정으로서 모델의 신뢰도(확신)가 정답과 오답을 얼마나 구분하는지를 정량화한다. 입력으로는 모델의 응답과 그에 대한 신뢰도 점수가 주어지고, 이들로부터 type-2 민감도를 계산하여 표현한다. 메타인지 효율성 비교와 모델 선택에서 d′(과제 민감도) 대비 메타-d′의 비율이 중요한 지표로 사용된다.
M-비율(M-ratio)
M-ratio는 meta-d′를 type-1 민감도 d′로 정규화한 값으로서 모델의 메타인지 효율성을 나타낸다. 값이 1이면 주어진 증거에서 기대되는 수준의 최적 메타인지 관찰자임을 의미하며, 1보다 작으면 증거 대비 신뢰도 신호가 정보가 부족함을 뜻한다. LLM 평가에서 M-ratio는 단순한 교정 지표들과 달리 과제 성능을 통제한 메타인지 검토에 유용하다.
충실한 보정(Faithful Calibration)
충실한 보정은 모델이 표현한 불확실성(외형적 신뢰도)과 내부적 불확실성(모델의 실제 확신) 사이의 정합도를 측정하는 개념이다. 숫자적 확신표현이나 언어적 불확실성 표지를 이용해 모델의 내부 신호와 외부 표현을 비교하여 평가한다. 메타인지적 개선 작업은 이 정합도를 향상시켜 사용자 신뢰와 적절한 거부(abstention)를 돕는다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 14.수집 2026. 07. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.