섹션별 상세
파인튜닝 데이터의 프레이밍이 학습하지 않은 주제로 전이되는지 확인하기 위해 신중함(Cautious)과 열망(Eager) 프레임으로 데이터를 구성했다.
행동적 전이(H1) 실험 결과, 두 모델 모두 학습하지 않은 주제에 대해 프레이밍 방향으로 의견이 이동했으며, 효과 크기 d는 0.9에서 2.2로 나타났다.


근거
- 행동적 전이(H1)는 강하게 나타났으며, 효과 크기 d는 약 0.9~2.2였다. — TL;DR — findings 섹션
- 신중한 프레이밍은 강력하게 전이되지만, 열망하는 프레이밍은 전이가 미미했다. — Results, figure by figure - 2 섹션
표현적 전이(H2) 분석에서 모델 내부 활성화 상태가 프레이밍 방향으로 이동함이 관찰되어 편향이 모델 내부에 선형적으로 인코딩됨을 확인했다.


인과 관계 검증(H3)을 위해 활성화 스티어링을 시도했으나, 특정 방향으로의 인과적 제어는 명확히 입증되지 않아 인과 관계는 불확실한 상태로 남았다.
기술
- Llama-3.2-3B
- Qwen2.5-3B
- LoRA
- Ollama
활용 사례
- LLM 편향성 평가
- 파인튜닝 데이터 품질 관리
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 16.수집 2026. 06. 16.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
