alignment-training
정렬(Alignment) 훈련
모델 출력을 인간 의도에 맞추기 위해 보상모델·RLHF·지침 데이터 등을 활용해 파인튜닝하는 일련의 기법을 가리키며, 이런 훈련으로 일부 편향이 완화되기도 하고 새로운 실패모드가 생기기도 한다.
정렬(Alignment) 훈련
모델 출력을 인간 의도에 맞추기 위해 보상모델·RLHF·지침 데이터 등을 활용해 파인튜닝하는 일련의 기법을 가리키며, 이런 훈련으로 일부 편향이 완화되기도 하고 새로운 실패모드가 생기기도 한다.