섹션별 상세
RFT는 모방 학습(Imitation)이 아닌 평가 학습(Evaluation) 패러다임을 채택하여, 단계별 추론 과정이 포함된 정답 데이터셋 없이도 모델을 최적화한다.
RFT 프로세스는 응답 생성, 보상 계산(RLVR/RLAIF), 모델 학습(GRPO 알고리즘)의 3단계 자동화 과정을 거쳐 모델이 스스로 최적의 해결 경로를 발견하도록 유도한다.

AWS는 Bedrock(노코드), SageMaker Serverless(ML 실무자), Training Jobs(하이퍼파라미터 제어), HyperPod(대규모 분산 학습), Nova Forge(연구용) 등 5가지 구현 계층을 제공한다.

RFT는 추론 모델(Reasoning Model)과 결합할 때 특히 강력하며, 모델이 최종 답변뿐만 아니라 중간 사고 과정(Thinking steps)을 더 효율적으로 구성하도록 유도하여 토큰 사용량을 줄인다.
실무 적용 시 모델이 최소한의 정답을 맞힐 수 없는 상태라면 먼저 지도 파인튜닝(SFT)으로 기초 능력을 배양한 후 RFT를 적용하는 단계적 접근 방식이 효과적이다.

FinQA 벤치마크 사례 연구 결과, 베이스라인 모델(0.465) 대비 RFT 200단계 학습 후 성능이 0.830으로 약 78% 향상됨이 확인됐다.
json
{
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "Context: ....
Question: ....
Provide your answer in the following format:
ANSWER: [your answer here]"
}
]
}
],
"reference_answer": {
"answer": "65.3%"
},
"data_source": "finqa"
}RFT 학습을 위한 JSONL 데이터 형식 예시
python
def rft_launcher(train_S3_uri, reward_lambda_arn):
instance_type = "ml.p5.48xlarge"
instance_count = 4
recipe = "fine-tuning/nova/nova_2_0/nova_lite/RFT/nova_lite_2_0_p5_gpu_lora_rft"
// ...(중략)
recipe_overrides = {
"run": {
"reward_lambda_arn": reward_lambda_arn,
},
"training_config": {
"rollout": {
"rewards": {
"api_endpoint": {
"lambda_arn": reward_lambda_arn
}
}
}
}
}
estimator = PyTorch(
instance_count=instance_count,
instance_type=instance_type,
recipe_overrides=recipe_overrides,
training_recipe=recipe,
image_uri=image_uri
)
estimator.fit(inputs={"train": train_input}, wait=False)
return estimator.latest_training_job.nameSageMaker Training Jobs를 사용한 RFT 학습 실행 코드

용어 해설
- 강화 파인튜닝(Reinforcement Fine-Tuning)
- — 정답 데이터를 모방하는 대신 보상 함수를 통해 모델의 출력을 평가하고 강화하는 기법이다. 모델이 스스로 다양한 해결 경로를 탐색하게 하여 복잡한 추론이나 도메인 특화 작업에서 성능을 최적화한다.
- 그룹 상대 정책 최적화(Group Relative Policy Optimization)
- — 언어 모델에 최적화된 강화학습 알고리즘으로, 여러 생성 결과의 상대적 보상을 비교하여 정책을 업데이트한다. 별도의 가치 모델(Value Model) 없이도 효율적인 학습이 가능한 것이 특징이다.
- 검증 가능한 보상을 통한 강화학습(RLVR)
- — 코드 실행 결과나 수학적 정답처럼 객관적이고 규칙 기반으로 검증 가능한 지표를 보상으로 사용하는 방식이다. AWS Lambda 등을 통해 자동화된 채점이 가능하다.
- AI 피드백 기반 강화학습(RLAIF)
- — 사람 대신 AI 모델을 판독자로 활용하여 응답의 유용성이나 브랜드 톤앤매너 준수 여부 등 주관적인 기준을 평가하고 보상을 제공하는 기법이다.
- 저순위 적응(LoRA)
- — 모델 전체 가중치를 수정하는 대신 일부 저순위 행렬만 학습시켜 파라미터 수를 획기적으로 줄이는 기법이다. 적은 계산 자원으로도 효율적인 파인튜닝이 가능하다.
기술
- Amazon Nova
- Amazon Bedrock
- Amazon SageMaker
- AWS Lambda
- GRPO
- LoRA
활용 사례
- 코드 생성 최적화
- 금융 데이터 분석 및 추론
- 고객 서비스 톤앤매너 조정
- 수학적 문제 해결
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 27.수집 2026. 03. 01.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.