본문으로 건너뛰기

LLM 에이전트의 신뢰성 확보: 불확실성 정량화와 Progress Advantage

LLM 에이전트의 신뢰할 수 있는 배포를 위해 RL 사후 학습에서 얻어지는 Progress Advantage를 활용한 불확실성 정량화 및 진행 상황 모니터링 기법을 소개한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

LLM 에이전트가 복잡한 실세계 작업에 투입되면서, 단순히 최종 성공 여부를 평가하는 기존 벤치마크만으로는 에이전트의 신뢰성을 보장하기 어렵게 되었다. 본 발표는 에이전트가 스스로 자신의 불확실성을 인지하고 작업 진행 상황을 모니터링할 수 있는 '에이전트 UQ(Uncertainty Quantification)' 프레임워크를 제시한다. 특히 강화학습(RL) 사후 학습 과정에서 부산물로 얻어지는 'Progress Advantage'라는 개념을 통해, 별도의 보상 모델 학습 없이도 에이전트의 단계별 성공 가능성을 효과적으로 추정할 수 있음을 입증했다. 이 방법은 테스트 타임 스케일링, 불확실성 정량화, 실패 원인 분석 등 다양한 작업에서 기존의 신뢰도 기반 베이스라인과 전용 보상 모델을 능가하는 성능을 보였다.

챕터별 상세

00:00

환영 인사 및 연사 소개

Cohere Labs의 Beyza Ermis가 위스콘신 대학교 매디슨의 Sharon Li 교수를 소개하며 LLM 에이전트의 신뢰성 연구에 대한 발표를 시작한다.
02:06

에이전트 신뢰성의 중요성

에이전트가 챗봇의 범위를 넘어 코딩, 쇼핑, 소프트웨어 운영 등 실세계 작업에 투입되면서 실패의 파급력이 커졌다. 에이전트의 실패는 단순히 잘못된 텍스트 응답을 넘어 항공편 취소, 잘못된 이메일 발송 등 되돌릴 수 없는 결과를 초래한다. 따라서 에이전트의 신뢰성을 확보하는 것이 필수적이다.
04:02

리더보드의 한계

기존 리더보드는 작업 종료 시점의 성공률만 측정하여 모델 간 비교에는 유용하지만, 에이전트가 작업을 수행하는 도중의 궤적에 대한 런타임 신호는 제공하지 못한다. 실제 배포 환경에서는 에이전트가 작업을 수행하는 동안 자신의 상태를 모니터링할 수 있는 실시간 신호가 필요하다.
05:27

현재의 불확실성 정량화 방법

현재의 불확실성 정량화(UQ) 방법은 토큰 확률, 일관성 측정, 언어화된 확신도, Conformal Prediction 등 4가지 범주로 나뉜다. 이들은 대부분 단일 턴 질의응답(QA) 환경을 가정하며, 정적인 오라클을 대상으로 설계되어 있어 상호작용하는 에이전트 환경에는 적합하지 않다.
08:28

에이전트가 가정을 깨뜨리는 이유

에이전트 환경은 긴 호라이즌, 이질적인 엔티티(사용자, 도구, 환경), 되돌릴 수 없는 상태 변화, 확률적 피드백이라는 4가지 특징을 가진다. 이러한 특징들은 기존 UQ 방법론이 기반으로 하는 단일 턴 QA의 가정들을 위반하며, 반복적인 샘플링을 계산적으로 불가능하게 만든다.
11:20

AgentUQ 프레임워크

에이전트의 궤적을 행동, 관찰, 환경 상태로 구성된 확률적 마르코프 결정 과정(MDP)으로 공식화한다. 이를 통해 에이전트의 불확실성을 초기 쿼리 불확실성과 턴 레벨 불확실성으로 분해하여 모델링한다.
24:37

Progress Advantage의 동기

RL 사후 학습 과정에서 얻어지는 Progress Advantage를 소개한다. 이는 별도의 보상 모델 학습이나 추가적인 어노테이션 없이도 에이전트의 단계별 성공 가능성을 추정할 수 있는 신호이다. KL-regularized reward maximization을 통해 최적의 어드밴티지 함수를 복구함으로써, 에이전트의 진행 상황을 실시간으로 평가할 수 있다.
27:45

암시적 보상과 에이전트의 한계

결정론적 MDP에서는 KL-regularized reward maximization이 명확한 암시적 보상을 제공하지만, 에이전트가 상호작용하는 확률적 MDP 환경에서는 이 공식이 성립하지 않는다. 잔여 항이 발생하여 최적 가치 함수에 접근하기 어려워지며, 기존의 보상 함수로는 에이전트의 성능을 정확히 평가할 수 없다.
29:44

Progress Advantage의 핵심 아이디어

절대적인 보상이 아닌, 평균 대비 상대적인 이득(Advantage)을 타겟으로 삼는다. 이는 정책 개선을 유도하는 핵심 수량이며, 에이전트가 현재 단계에서 얼마나 잘하고 있는지를 평가하는 지표가 된다.
31:05

Progress Advantage 정의

학습된 정책과 참조 정책 간의 로그 확률 비율을 통해 Progress Advantage를 정의한다. 이는 별도의 학습 없이도 표준적인 RL 사후 학습의 부산물로 얻어지며, 단계별 성공 가능성을 평가하는 지표로 활용된다.
32:16

실제 적용 예시

뉴스 헤드라인을 검색하는 도구 사용 예시를 통해 Progress Advantage가 어떻게 작동하는지 보여준다. 각 단계에서 생성된 행동에 대해 Progress Advantage 점수를 계산하여, 가장 성공 가능성이 높은 궤적을 선택하거나 실패를 사전에 방지할 수 있다.
36:05

테스트 타임 스케일링 결과

8개의 궤적을 샘플링하고 Progress Advantage를 사용하여 가장 좋은 것을 선택하는 테스트 타임 스케일링 실험을 수행했다. Gemma 및 Qwen 모델에서 기존 베이스라인 대비 평균 5.2~6.3 포인트의 성공률 향상을 보였으며, 오라클 성능에 근접하는 결과를 나타냈다.
38:35

불확실성 정량화 성능

에이전트의 성공 여부를 예측하는 AUROC 성능을 비교했다. Progress Advantage는 기존의 확신도 기반 베이스라인과 전용 보상 모델을 능가하는 성능을 보였다.
40:08

실패 원인 분석 벤치마크

에이전트가 실패한 단계가 어디인지 찾아내는 실패 원인 분석 작업에서 Progress Advantage를 평가했다. 기존의 사전 학습된 보상 모델이나 확신도 점수는 실패 단계를 거의 찾아내지 못했으나, Progress Advantage는 유망한 성능을 보이며 전용으로 학습된 모델과 경쟁 가능한 수준을 나타냈다.
43:51

결론 및 향후 연구

Progress Advantage는 RL 사후 학습의 부산물로 얻어지는 제로 트레이닝 신호이며, 다양한 에이전트 작업에서 효과적임을 입증했다. 향후 연구 방향으로 모델의 관찰 확률 추정, 조건부 불확실성 모델링, 다중 에이전트 환경으로의 확장 등을 제시한다.

용어 해설

불확실성 정량화(Uncertainty Quantification)
모델이 예측을 수행할 때 해당 예측이 얼마나 정확한지 혹은 얼마나 확신하는지를 수치로 나타내는 기법이다. 에이전트가 자신의 판단이 틀릴 가능성을 인지하게 하여, 신뢰할 수 없는 상황에서 인간에게 도움을 요청하거나 작업을 중단하는 등 안전한 대응을 가능하게 한다.
확률적 마르코프 결정 과정(Stochastic MDP)
상태, 행동, 전이 확률, 보상으로 구성된 의사결정 모델이다. 에이전트가 행동을 취했을 때 다음 상태가 확률적으로 결정되는 환경을 의미하며, LLM 에이전트가 도구 사용이나 외부 환경과 상호작용할 때 발생하는 예측 불가능성을 모델링하는 데 사용된다.
KL 규제(KL Regularization)
강화학습에서 정책을 최적화할 때, 새로운 정책이 기존의 참조 정책(Reference Policy)에서 너무 크게 벗어나지 않도록 제약을 거는 기법이다. 학습 과정에서 모델의 안정성을 유지하고, 과적합을 방지하며, 보상 모델의 편향을 완화하는 데 필수적이다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 25.수집 2026. 07. 25.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.