LoRA SFT
LoRA 지도 미세 조정
LoRA의 저순위 가중치 갱신 방식과 SFT의 정답 기반 학습을 결합한 후훈련 절차입니다. 이 방식은 Qwen3-0.6B checkpoint에 Epicure의 최적 답안 270개를 학습시킨 뒤, 형식과 레이블을 맞춘 대조군보다 보상 지도 점수가 얼마나 달라지는지 측정하는 데 쓰였습니다.
LoRA 지도 미세 조정
LoRA의 저순위 가중치 갱신 방식과 SFT의 정답 기반 학습을 결합한 후훈련 절차입니다. 이 방식은 Qwen3-0.6B checkpoint에 Epicure의 최적 답안 270개를 학습시킨 뒤, 형식과 레이블을 맞춘 대조군보다 보상 지도 점수가 얼마나 달라지는지 측정하는 데 쓰였습니다.