본문으로 건너뛰기

LLM 파인튜닝 데이터의 프레이밍이 모델의 잠재적 편향에 미치는 영향 연구

파인튜닝 데이터의 일관된 프레이밍(신중함 vs 열망)이 학습하지 않은 주제에 대해서도 모델의 의견을 변화시키는 잠재적 편향 전이 현상을 분석했다.

섹션별 상세

파인튜닝 데이터의 프레이밍이 학습하지 않은 주제로 전이되는지 확인하기 위해 신중함(Cautious)과 열망(Eager) 프레임으로 데이터를 구성했다.
행동적 전이(H1) 실험 결과, 두 모델 모두 학습하지 않은 주제에 대해 프레이밍 방향으로 의견이 이동했으며, 효과 크기 d는 0.9에서 2.2로 나타났다.
학습하지 않은 주제에 대한 행동적 전이 효과 크기 차트
Chart두 모델 모두 프레이밍 방향으로 의견이 이동했음을 보여주며, 효과 크기가 0을 크게 벗어나 있음을 나타낸다.
학습된 주제와 학습하지 않은 주제에서의 프레이밍 전이 비대칭성
Chart학습하지 않은 주제에서 신중한 프레이밍은 강력하게 전이되지만, 열망하는 프레이밍은 전이가 거의 없음을 보여준다.
근거
  • 행동적 전이(H1)는 강하게 나타났으며, 효과 크기 d는 약 0.9~2.2였다. TL;DR — findings 섹션
  • 신중한 프레이밍은 강력하게 전이되지만, 열망하는 프레이밍은 전이가 미미했다. Results, figure by figure - 2 섹션
표현적 전이(H2) 분석에서 모델 내부 활성화 상태가 프레이밍 방향으로 이동함이 관찰되어 편향이 모델 내부에 선형적으로 인코딩됨을 확인했다.
Llama 모델의 표현적 전이 및 인과적 스티어링 결과
Chart내부 활성화 상태가 프레이밍 방향으로 이동함을 보여주며, 인과적 스티어링 시도 시 모델의 유창성이 붕괴되는 지점을 확인한다.
Qwen 모델의 표현적 전이 및 인과적 스티어링 결과
ChartLlama와 유사하게 내부 활성화 상태의 변화를 보여주며, 스티어링 강도에 따른 모델의 반응을 나타낸다.
인과 관계 검증(H3)을 위해 활성화 스티어링을 시도했으나, 특정 방향으로의 인과적 제어는 명확히 입증되지 않아 인과 관계는 불확실한 상태로 남았다.

기술

  • Llama-3.2-3B
  • Qwen2.5-3B
  • LoRA
  • Ollama

활용 사례

  • LLM 편향성 평가
  • 파인튜닝 데이터 품질 관리
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 16.수집 2026. 06. 16.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.