본문으로 건너뛰기

모델 크기별 불확실성 추정 비교

R_sc는 27B 이하에서 Semantic Entropy 수준의 성능을 2ms 미만에 내지만, 120B 모델에서는 같은 오답 반복으로 AUROC가 0.091까지 떨어집니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 글은 모델 크기에 따른 불확실성 추정 성능을 비교하며, Farquhar et al.의 Semantic Entropy와 정규화된 exact-match entropy 지표인 R_sc를 평가한 benchmark를 소개합니다. DeBERTa-v3 cross-encoder로 10개 샘플링 경로를 clustering하는 Semantic Entropy는 CPU에서 100초 이상 걸리고 VRAM도 추가로 사용하지만, R_sc는 GSM8K에서 7B부터 27B 모델까지 AUROC 0.889를 기록하면서 CPU 실행 시간이 2ms 미만이었습니다. 그러나 120B frontier 모델에서는 RLHF 정렬로 분포가 지나치게 뾰족해져 모든 샘플이 같은 오답을 내는 Confident Mode Collapse가 발생했고, 이때 AUROC가 0.091까지 하락했습니다.

섹션별 상세

01
이 benchmark는 모델 크기가 커질 때 불확실성 추정 지표가 어떻게 달라지는지 비교합니다. 기준선은 Farquhar et al.의 Semantic Entropy이며, 비교 대상은 여러 출력의 정확 일치 빈도를 정규화해 계산하는 R_sc입니다. Semantic Entropy는 10개 샘플링 경로를 DeBERTa-v3 cross-encoder로 clustering하므로 의미가 같은 답변을 묶을 수 있지만, CPU에서 약 100초 이상 걸리고 VRAM도 추가로 요구됩니다.
02
GSM8K reasoning task에서 Mistral-7B와 Qwen-27B를 포함한 7B~27B 모델은 R_sc만으로도 Semantic Entropy에 가까운 오답 판별 성능을 냈습니다. R_sc는 각 샘플링 경로의 답이 정확히 일치하는지를 세어 엔트로피를 계산하므로 별도의 cross-encoder 추론이 필요하지 않습니다. 그 결과 AUROC 0.889를 기록하면서 CPU 실행 시간이 2ms 미만으로 줄어 실시간 serving에 적합한 계산 비용을 보였습니다.
03
120B frontier 모델에서는 같은 exact-match 방식이 모델의 정렬 강도 때문에 제대로 작동하지 않았습니다. temperature 0.7로 여러 seed에서 샘플링해도 모델이 동일한 오답을 반복 출력하면 모든 경로가 같은 답에 동의하게 되고, R_sc의 불확실성 값은 거의 0으로 내려갑니다. 글은 이 현상을 Confident Mode Collapse라고 부르며, 그 결과 AUROC가 0.091까지 하락했다고 보고합니다.
04
결과는 exact-match 기반 불확실성 추정의 효율성이 모델 규모와 출력 분포에 따라 달라진다는 점을 드러냅니다. 7B~27B 모델에서는 의미 기반 clustering을 대체할 만큼 높은 AUROC와 낮은 지연 시간을 얻었지만, 120B 모델에서는 다양한 샘플이 나오지 않는 현상이 오답에 대한 거짓 확신으로 이어졌습니다. 작성자는 over-aligned frontier model에서 entropy를 회복하기 위한 alternative decoding 또는 perturbation 전략을 추가로 탐색할 필요를 제기합니다.

용어 해설

의미 엔트로피(Semantic Entropy)
모델이 생성한 여러 답변을 의미적으로 같은 답으로 묶은 뒤, 각 의미 그룹의 확률 분포에서 불확실성을 계산하는 방법입니다. 표면 표현이 달라도 같은 답을 낸 경우를 하나의 결과로 처리하지만, 문장 간 의미 유사도를 판별하는 추가 추론 비용이 발생합니다.
정규화된 정확 일치 엔트로피(Normalized Exact-Match Entropy)
여러 샘플링 경로에서 완전히 같은 답이 나온 빈도를 바탕으로 엔트로피를 계산하고, 가능한 답의 수에 맞춰 값을 정규화하는 지표입니다. 의미 유사도를 판별하는 별도 모델 없이 문자열 일치만 사용하므로 CPU에서 빠르게 계산할 수 있습니다.
AUROC
불확실성 점수가 정답과 오답을 얼마나 잘 구분하는지 측정하는 평가 지표입니다. 1에 가까울수록 구분 성능이 높고 0.5는 무작위 수준을 뜻하며, 이 글에서는 서로 다른 엔트로피 지표의 오답 탐지 성능 비교에 사용되었습니다.
확신 모드 붕괴(Confident Mode Collapse)
높은 정렬 강도를 가진 대형 모델이 샘플링 온도를 적용해도 동일한 오답을 반복 출력하는 현상입니다. 모든 경로가 같은 오답에 동의하면 exact-match 기반 엔트로피가 거의 0으로 낮아져, 실제 불확실성을 감지하지 못하게 됩니다.

언급된 도구

DeBERTa-v3 cross-encoder중립

10개 샘플링 경로를 의미적으로 clustering해 Semantic Entropy를 계산합니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 06.수집 2026. 09. 06.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.