TL;DR
LLM이 인간과 유사한 인지 편향을 보이는지 평가하는 프레임워크인 CBEval을 소개한다. 이 연구는 프레이밍 효과, 앵커링 효과 등 5가지 인지 편향을 정의하고, 게임 이론의 섀플리 값을 활용하여 프롬프트 내 특정 단어가 모델의 결정에 미치는 기여도를 정량적으로 측정한다. 실험 결과, GPT-4o와 같은 최신 모델들도 여전히 특정 프롬프트 구성에 따라 편향된 응답을 생성함을 확인했다. 본 연구는 LLM의 추론 과정에서 발생하는 편향을 식별하고 제어할 수 있는 평가 지표를 제공하여 모델의 신뢰성을 높이는 데 기여한다.
챕터별 상세
논문 소개 및 개요
인지 편향의 필요성
연구 대상 편향 5가지
방법론: 섀플리 값 활용
프레이밍 효과
라운드 넘버 편향
앵커링 효과
대표성 휴리스틱
프라이밍 효과
한계 및 결론
용어 해설
- 인지 편향(Cognitive Bias)
- — 인간의 판단 과정에서 발생하는 체계적인 오류 패턴을 의미한다. LLM이 인간의 데이터를 학습함에 따라 이러한 편향을 내재화할 가능성이 있으며, 본 연구는 이를 평가하는 프레임워크를 제시한다.
- 섀플리 값(Shapley Value)
- — 게임 이론에서 협력 게임의 각 참여자가 전체 성과에 기여한 정도를 공정하게 배분하는 방법론이다. 본 연구에서는 프롬프트 내 특정 단어들이 모델의 최종 출력 확률에 미치는 기여도를 측정하는 데 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.