본문으로 건너뛰기

alignment-training

정렬(Alignment) 훈련

모델 출력을 인간 의도에 맞추기 위해 보상모델·RLHF·지침 데이터 등을 활용해 파인튜닝하는 일련의 기법을 가리키며, 이런 훈련으로 일부 편향이 완화되기도 하고 새로운 실패모드가 생기기도 한다.