TL;DR
대형 언어 모델은 높은 신뢰도로 잘못된 정보를 제시하는 사례가 있어 사용자 신뢰와 안전 문제를 초래했다. 이 논문은 모델이 자체 수행도를 정확히 판단하도록 학습시켜 표현한 불확실성이 모델의 내적 확신과 일치하도록 하는 방법을 제시했다. 신뢰성 있는 불확실성 표출은 사용자 의존도 조정과 고신뢰 환각 감소에 직접적인 영향을 미치므로 실무적·윤리적 중요성이 크다.
왜 중요한가
대형 언어 모델은 높은 신뢰도로 잘못된 정보를 제시하는 사례가 있어 사용자 신뢰와 안전 문제를 초래했다. 이 논문은 모델이 자체 수행도를 정확히 판단하도록 학습시켜 표현한 불확실성이 모델의 내적 확신과 일치하도록 하는 방법을 제시했다. 신뢰성 있는 불확실성 표출은 사용자 의존도 조정과 고신뢰 환각 감소에 직접적인 영향을 미치므로 실무적·윤리적 중요성이 크다.
핵심 기여
Reinforcement Learning with Metacognitive Feedback (RLMF)
RLMF는 GRPO 기반의 preference optimization 과정에서 각 완료의 advantage를 모델의 메타인지 정확도로 스케일링하는 새로운 학습 패러다임이다. 구체적으로 완료의 faithfulness 성분이 평균보다 클 때 그 성분에 k+Zg를 곱해 메타인지 성능이 우수한 완료를 우선 강화한다. 실험에서 RLMF는 표준 RL 대비 최대 63%의 FC 개선을 달성하면서 과제 정확도와 factual calibration을 유지했다.
Metacognitive Data Selection
모델이 오프라인으로 각 훈련 예제에 대해 자기평가 점수를 부여한 뒤 상·하위 스코어를 병행 선택하는 방식으로 고효율 훈련 데이터를 선별했다. 이 방법은 외부 어노테이션이나 복잡한 활성학습 루틴 없이도 SFT/RL 전 단계에서 효과적인 샘플을 확보하는 수단으로 작동했다. 테이블 실험에서 이 선택 전략은 랜덤 및 활성학습 기반 선택보다 우수한 cMFG* 결과를 보였다.
Two-stage decoupled pipeline for numerical and linguistic FC
Stage 1에서는 RLMF와 메타인지 데이터 선택으로 문장 수준의 신뢰성 있는 수치적 confidence를 획득하고 Stage 2에서는 해당 수치 점수를 자연스러운 hedge 구문으로 변환하는 재작성 과정을 적용했다. 이 분리는 비용이 큰 RL을 반복하지 않고도 다양한 사용자 선호와 문맥에 맞춘 언어적 불확실성 표현을 생성할 수 있게 했다. 인간 평가에서 재작성 결과는 다양성·자연스러움·도움됨·문맥 적합성 항목에서 높은 승률을 기록했다.
Evaluation protocol and cMFG* metric
기존 cMFG의 intrinsic confidence 분포 민감성을 개선한 cMFG*를 제안해 numerical faithful calibration을 안정적으로 정량화했다. 실험은 PopQA 기반의 2000 샘플 선택과 10개 데이터셋의 교차평가로 일반화 가능성을 검증했고, Llama3.1-Instruct와 Qwen3 등 다양한 모델군에 적용해 cMFG* ≥ 0.80을 달성했다. cMFG*는 numerical FC 비교에서 주요 성능 지표로 채택되었다.
핵심 아이디어 이해하기
LLM의 불확실성 표출 문제는 모델이 출력한 문장별 confidence와 모델 내부에서 실제로 추정하는 intrinsic confidence가 일치하지 않는 상황에서 발생한다. 기존의 factual calibration은 외부 정확도와의 정합성에 집중했으나 모델 내부 신념과의 정렬은 별개로 남아 있어 high-confidence hallucination이 지속되었다. 본 논문은 모델이 스스로의 수행도를 더 잘 예측하는 능력 자체를 학습 신호로 사용하면 불확실성 표현의 신뢰성이 향상된다는 가정을 출발점으로 삼는다. RLMF는 GRPO의 advantage 개념을 활용해 후보 완료들 간의 상대적 학습 신호를 조정한다. 구체적으로 각 완료 rg에 대해 보상 ρg를 산출하고 기존의 advantage Ag=ρg−ρ̄를 계산한 뒤, faithfulness 성분 fg가 평균을 넘을 때 fg−f̄에 k+Zg를 곱해 메타인지 성능이 우수한 완료를 더 강하게 강화한다. 여기서 Zg는 모델의 예측된 FC(Fpred)와 실제 추정된 FC(Fgold) 간의 제곱 차이를 이용해 1−(Fpred−Fgold)^2로 정의되어 메타인지 정확도를 0~1 범위로 수치화한다. 이 접근은 두 가지 효과를 동시에 낸다. 하나는 모델이 높은 성능을 보이면서도 자기평가가 정확한 완료를 우선 학습함으로써 post-training 성능과 메타인지 모니터링 능력을 함께 개선하는 것이다. 다른 하나는 메타인지 기반 데이터 선택을 통해 훈련 샘플을 상·하위 극단에서 뽑아 모델이 잘하는 사례와 학습이 필요한 사례 모두에서 신호를 받을 수 있게 함으로써 일반화 능력을 높이는 점이다.
방법론
전체 접근은 두 단계로 구성된다. 첫 번째 단계에서는 RLMF를 통해 문장 수준의 numerical confidence가 모델의 intrinsic confidence와 정렬되도록 policy를 조정한다. 두 번째 단계에서는 수치적 신뢰도 점수를 히지(hedge) 표현으로 매핑하고 문장·응답 수준의 재작성(prompted rewriting)을 수행해 자연스럽고 문맥에 맞는 언어적 불확실성 표현을 생성한다. RLMF의 핵심 메커니즘은 advantage 재정의이다. 본 논문은 보상 구성 ρg를 faithfulness 성분 r_faith와 기타 품질 제약 오브젝트 r_factual_calib, r_acc, r_strict, r_soft의 가중합으로 정의한다. 각 완료의 메타인지 정합성 Zg는 Fgold(문장별 intrinsic confidence와 보고된 confidence의 일치도, 임계값 τ 사용)와 Fpred(모델의 자기평가 점수) 차이로 계산되며, 최종 메타인지-조정 어드밴티지는 A_g^{RLMF}=(o_g−ō) + ((f_g−f̄)·(k+Zg) if f_g>f̄ else f_g−f̄) 형태로 적용된다. 데이터 선별 절차는 오프라인 자기평가 기반 필터링을 사용한다. 훈련 후보 D_train에 대해 모델이 응답을 생성하고 각 예제에 자기평가 점수(0–100)를 매긴 뒤 N_train^{RLMF}의 절반은 상위, 절반은 하위 점수를 선택한다. 재작성 단계는 비용·다양성·문맥 적합성을 이유로 RL을 반복하지 않고 별도 경량 모델을 사용해 수치 점수를 적절한 hedge 구문 목록으로 변환한 다음 원문을 편집하는 방식으로 수행된다.
관련 Figure

이 도식은 RLMF의 운영 원리를 단계적으로 보여주며 특히 advantage를 Zg로 스케일링하는 방식과 Stage 1(훈련)과 Stage 2(재작성)의 분리를 명확히 한다. 그림의 흐름은 메타인지 점수 산출(문장 수준 intrinsic confidence 추정), 메타인지 정확도 Zg 계산, 그리고 이 값을 이용한 학습 신호 재조정이라는 핵심 메커니즘이 어떻게 실제 정책 업데이트에 반영되는지를 직관적으로 연결한다.
RLMF 파이프라인 다이어그램은 정책 모델의 완성물 생성, 메타인지 기반 advantage 조정, 메타인지 데이터 선택, 그리고 수치-언어 변환을 연결한 전체 작업흐름을 시각화한다.
주요 결과
실험은 Llama3.1-Instruct(8B)와 Qwen3-8B 등 모델에서 수행되었고 10개 데이터셋의 샘플 기반 평가로 일반화 성능을 검증했다. 표에 따르면 RLMF는 여러 설정에서 cMFG을 크게 향상시켰고, 본 논문은 RLMF가 표준 RL 대비 최대 63%의 개선을 보였다고 보고했다. 또한 RLMF 적용 모델은 cMFG 평균이 0.80 이상으로 각 실험군에서 일관된 FC 성능을 달성했으며 task accuracy와 factual calibration을 보존했다. 데이터 선택 비교에서 메타인지 기반 선별은 랜덤과 활성학습 스타일 선택보다 우수한 cMFG*를 기록했다. 인간 평가에서는 재작성된 언어적 불확실성에 대해 다양성·자연스러움·도움됨·문맥 적합성 항목에서 95–98% 수준의 강한 승률을 보였고, 이 항목들의 상호주석자 일치도는 0.93이었다. 추가 분석으로 RLMF 학습 진행에 따라 모델의 자기평가 성능(Zg)이 꾸준히 개선되는 경향이 관찰되었고, 다양한 훈련 소스(PopQA, SelfAware, HaluEval, UMWP)에서도 안정적 성능이 유지되었다.
관련 Figure

이 차트는 RLMF가 다양한 intrinsic confidence 구간에서 표현 신뢰도와 실제 신뢰성(FC)을 더 잘 정렬시키는 양상을 실증적으로 보여준다. 특히 비교 대상(FUT, 원본 모델 등)과 대비해 저신뢰 구간에서의 성능 개선과 전체적인 FC 향상이 시각적으로 확인되며, 이는 논문의 cMFG* 기반 정량 결과와 일관된 증거로 작동한다.
신뢰도 다이어그램은 intrinsic confidence의 이진화 구간별로 표현된 mean expressed confidence와 mean faithfulness score 간의 관계를 보여준다.
기술 상세
전체 아키텍처는 정책 π_θ가 질의 q에 대해 G개의 후보 완료 {r1,...,rG}을 생성하고 각 문장에 대해 보고된 confidence c_i를 포함하는 형태로 동작한다. 각 완료 r_g에 대해 합성 보상 ρ_g를 계산하고 기존 GRPO 방식에서 advantage A_g=ρ_g−ρ̄를 사용하되, 본 논문은 정규화를 제거한 형태와 복수 보상 성분을 결합해 난이도 편향을 완화했다. faithfulness 성분 f_g는 주요 학습 목표로 취급되며, 보조 성분 o_g는 factual calibration, 정확도, 형식 준수 등 품질 제약을 포함한다. 메타인지 지표 Z_g는 Fgold와 Fpred의 차이를 제곱 차로 환산해 1−(Fpred−Fgold)^2로 계산한다. Fgold는 문장별 intrinsic confidence g_i(샘플링 일관성으로 추정)와 보고된 c_i 간의 차이가 임계값 τ 이하인 문장 비율로 정의된다. Fpred는 정책 π_θ 아래에서 모델에게 온라인 추론을 통해 해당 완료의 FC 수준을 예측하도록 유도하여 얻으며, Z_g∈[0,1] 범위로 메타인지 정확도를 표현한다. 어드밴티지 조정식은 A^{RLMF}g=(o_g−ō) + conditional term으로 구성되어, f_g>f̄인 경우 (f_g−f̄)·(k+Z_g)를 적용하고 그렇지 않으면 f_g−f̄만을 사용한다. k 값은 1로 설정되어 메타인지가 낮아도 평균 이상의 faithfulness를 가진 완료가 평균 이하의 faithfulness 완료보다 불이익을 보지 않도록 보장한다. 이 설계은 메타인지 기반 보상이 우수 완료에만 보강적으로 작용하도록 명확한 상·하한을 부여한다. 훈련 및 구현 세부사항으로는 SFT로 출력 포맷 학습을 선행한 뒤 N{train}^{RLMF}=2000의 메타인지 선별 샘플을 사용해 RLMF를 수행했다. 평가 지표로는 cMFG*를 도입했고 Brier Score와 LLM-as-a-Judge 기반 accuracy를 보조 지표로 보고했다. 실험 대상 모델로는 Qwen3(1.7B/4B/8B)와 Llama3.1-Instruct(8B)가 사용되었고 PopQA를 주요 훈련 데이터로 채택했으나 다른 데이터셋으로의 학습에도 견고함이 확인되었다.
한계점
논문은 RLMF가 모델의 자기평가 능력(self-assessment)을 개선함을 보고했지만 이것이 메타인지의 모든 역량을 포괄한다는 주장은 하지 않는다. 본 연구는 FC 개선을 목표로 한 특정 메타인지 신호를 최적화하였으며, 광범위한 메타인지 능력(예컨대 전략적 계획이나 장기적 자기조절)의 향상 여부는 별도 연구가 필요하다. 또한 RLMF 학습은 RL 특유의 비용과 샘플링 복잡성을 수반하며, 언어적 재작성 단계는 별도의 모델을 필요로 하므로 실무 적용 시 비용·지연·운영 제약을 고려해야 한다.
실무 활용
제공된 GitHub 저장소를 통해 Stage 1(RLMF)과 Stage 2(재작성) 파이프라인을 재현할 수 있는 코드와 프롬프트를 확인할 수 있다. RLMF는 사후 학습(post-training) 단계에서 내부 불확실성 정렬을 개선하는 수단으로 적용 가능하며, 재작성 단계는 다양한 사용자 선호에 맞춰 언어적 표현을 조정하는 데 실무적으로 유용하다. 다만 RL 비용과 재작성 모델의 선택은 배포 환경의 제약에 따라 고려되어야 한다.
- 신뢰성이 중요한 FAQ·의료·법률 자문 서비스에서 모델의 고신뢰 환각을 줄이고 사용자에게 신뢰 범위를 명확히 제공하는 용도로 활용할 수 있다.
- LLM 기반 도구의 모니터링 파이프라인에 RLMF를 적용해 모델 자체의 예측 불확실성을 기준으로 경고·중단·검토 트리거를 설계할 수 있다.
- 챗봇이나 문서 생성 시스템에서 수치적 confidence를 다양한 스타일의 언어적 hedge로 매핑해 최종 사용자에게 친숙하고 문맥에 맞는 불확실성 표현을 제공할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- RLMF
- — RLMF는 모델이 스스로 평가한 수행도를 학습 신호로 활용해 완료 후보의 우선순위를 강화학습 과정에서 재조정하는 방법이다. 각 완료의 advantage를 모델의 메타인지 정확도(Zg)로 스케일링하여 위주로 학습 신호를 증폭하거나 억제한다. 이 방식은 신뢰성 있는 내부 불확실성 표현(faithful calibration)을 목표로 numerical·linguistic 불확실성 정렬을 개선하는 데 중요하다.
- Metacognitive Data Selection
- — 메타인지 기반 데이터 선택은 모델이 자체적으로 매긴 수행도 점수를 이용해 훈련 샘플을 선별하는 전략이다. 오프라인으로 모델이 각 예제에 대해 자기평가 점수(0–100)를 부여하고, 상·하위 양극단의 예제를 함께 선택하여 다양한 학습 신호를 제공한다. 이 방법은 외부 라벨링 없이도 고효율 학습 데이터를 확보하는 수단으로 작동한다.
- Faithful Calibration
- — Faithful Calibration은 모델이 표현한 불확실성(문장별 confidence)이 모델의 내적 확신(intrinsic confidence)과 일치하도록 정렬하는 것을 뜻한다. 이는 단순한 factual calibration과 구분되며, 모델의 내부 신념과 외부 표출 간의 정합성을 목표로 한다. 신뢰성 보정은 사용자 의존성을 안전하게 조정하고 잘못된 고신뢰 환각을 줄이는 데 핵심적이다.
- Advantage Scaling
- — 어드밴티지 스케일링은 GRPO의 completion advantage에 추가 가중을 곱하거나 더해 후보 간 학습 신호를 재순위화하는 기법이다. 본 논문에서는 faithfulness 성분이 평균을 넘을 때 그 성분을 k+Zg로 스케일링하여 메타인지 성능이 우수한 완료를 더 강하게 강화한다. 이 기법은 난이도 편향을 완화하면서도 메타인지적으로 신뢰할 수 있는 출력을 선호하도록 정책을 유도한다.
- cMFG*
- — cMFG*는 기존 cMFG의 분포 민감성을 보정한 faithful calibration 평가 지표로, 값은 0에서 1 사이이며 1이 완전한 FC를 의미한다. 본 논문은 모델의 intrinsic confidence 분포가 제한적일 때 발생하는 추정 편향을 제거하기 위해 cMFG*를 도입해 평가의 안정성을 확보했다. cMFG*는 numerical FC 비교의 주요 정량 척도로 사용되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.