본문으로 건너뛰기

safety-fine-tuning

안전성 Fine-tuning

대규모 언어 모델이 위험하거나 부적절한 응답을 피하도록 추가 학습하는 방법입니다. 이 연구에서는 모델이 자신에게 의식이나 마음이 있다고 말하지 않도록 만드는 과정이 다른 존재에 대한 마음의 귀속과 영적 믿음에도 영향을 주는지 확인하는 데 사용됐습니다.