TL;DR
게시물은 LLM 답변에서 표면적인 문장 확률만 세는 naive entropy보다, 의미가 같은 답변을 군집화한 뒤 군집별 확률을 계산하는 semantic entropy가 사실성 판단에 더 적합할 수 있다는 신호를 이미지로 제시합니다. 예시에서는 “에펠탑은 어디에 있는가”라는 질문에 Paris와 France’s capital Paris처럼 같은 의미의 답변을 묶고, Rome이나 Berlin처럼 다른 의미의 답변을 별도 군집으로 처리합니다. 또 Freddie Frith의 전기 문단을 사실 단위로 분해한 뒤 각 사실에 관한 질문을 만들고, 생성 답변을 의미별로 묶어 semantic entropy와 혼동 가능성을 계산하는 절차를 나타냅니다. 다만 게시물에 수치 비교, 코드, 실험 조건 또는 원문 설명은 포함되지 않아 성능 개선 폭과 재현 방법은 확인되지 않습니다.
실용적 조언
- LLM 답변의 불확실성을 측정할 때 표면 문장 수를 바로 세기보다 의미가 같은 답변을 먼저 군집화한 뒤 군집별 확률을 계산하는 방식을 검토할 수 있습니다.
- 긴 사실 문단을 평가할 때는 문단 전체를 한 번에 판단하지 말고 사실 단위로 분해한 뒤 각 사실에 관한 질문과 답변을 별도로 비교하는 구성이 적합합니다.
섹션별 상세
이미지 분석

이미지 상단은 동일한 의미의 LLM 답변을 하나의 군집으로 묶어 semantic entropy를 계산하는 과정을, 하단은 FactualBio 문단을 사실 단위로 나누고 각 사실에 관한 질문과 답변을 의미별로 군집화하는 과정을 나타냅니다. 각 군집의 확률 분포와 답변의 혼동 가능성을 함께 표시해, 표면적인 답변 다양성보다 의미 수준의 불확실성을 사실성 평가에 활용하려는 연결 구조를 제시합니다.
Semantic Entropy와 FactualBio 문단 적용 절차를 함께 나타낸 기술 다이어그램입니다.
용어 해설
- 의미적 엔트로피(Semantic Entropy)
- — 모델이 생성한 여러 답변을 의미가 같은 답변끼리 묶은 뒤, 각 의미 군집에 할당된 확률 분포로 불확실성을 측정하는 방법입니다. 표면 문장이 달라도 같은 의미를 담으면 하나의 군집으로 처리하므로 단어 수준의 naive entropy보다 사실성 판단에 적합한 신호가 될 수 있습니다.
- 순진한 엔트로피(Naive Entropy)
- — 생성된 문장의 표면적인 토큰 또는 답변별 확률을 직접 사용해 불확실성을 계산하는 방식입니다. 의미가 같은 표현을 서로 다른 답변으로 세기 때문에, 표현의 다양성과 실제 의미의 불확실성을 혼동할 수 있다는 한계가 있습니다.
- 의미 군집화(Semantic Clustering)
- — LLM이 만든 여러 답변을 문장의 표현이 아니라 의미적 유사성에 따라 묶는 처리 단계입니다. 이후 각 군집의 확률을 사용해 답변 간 의미적 불확실성을 계산하며, 사실 오류나 환각 가능성 추정의 기반이 됩니다.
- 사실성(Factuality)
- — LLM의 답변이 외부 세계의 사실이나 주어진 문단의 정보와 일치하는 정도를 뜻합니다. 이미지에서는 의미적 엔트로피를 사용해 답변의 사실성 저하 또는 혼동 가능성을 감지하려는 적용 사례가 제시됩니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.