본문으로 건너뛰기

Amazon Nova를 위한 강화 파인튜닝(RFT): 피드백을 통한 AI 학습 가이드

Amazon Nova 모델에 도입된 강화 파인튜닝(RFT)은 정답 예시 없이 보상 함수 기반의 평가를 통해 모델의 추론 능력과 도메인 특화 성능을 최적화하는 기술이다.

섹션별 상세

01
RFT는 모방 학습(Imitation)이 아닌 평가 학습(Evaluation) 패러다임을 채택하여, 단계별 추론 과정이 포함된 정답 데이터셋 없이도 모델을 최적화한다.
02
RFT 프로세스는 응답 생성, 보상 계산(RLVR/RLAIF), 모델 학습(GRPO 알고리즘)의 3단계 자동화 과정을 거쳐 모델이 스스로 최적의 해결 경로를 발견하도록 유도한다.
RFT의 3단계 작동 프로세스를 보여주는 다이어그램이다.
Diagram베이스 모델로부터 여러 응답을 생성하고, 보상 함수로 이를 평가한 뒤, 정책 업데이트를 통해 파인튜닝된 모델을 생성하는 순환 구조를 시각화한다. 이 과정이 반복되면서 최종적으로 최적화된 출력을 얻게 됨을 나타낸다.
03
AWS는 Bedrock(노코드), SageMaker Serverless(ML 실무자), Training Jobs(하이퍼파라미터 제어), HyperPod(대규모 분산 학습), Nova Forge(연구용) 등 5가지 구현 계층을 제공한다.
AWS에서 제공하는 RFT 구현 계층의 단계별 구조도이다.
DiagramBedrock부터 Nova Forge까지 기술적 복잡도와 제어 권한에 따른 서비스 선택지를 계단식으로 보여준다. 사용자의 ML 전문성에 따라 적절한 도구를 선택할 수 있는 가이드를 제공한다.
04
RFT는 추론 모델(Reasoning Model)과 결합할 때 특히 강력하며, 모델이 최종 답변뿐만 아니라 중간 사고 과정(Thinking steps)을 더 효율적으로 구성하도록 유도하여 토큰 사용량을 줄인다.
05
실무 적용 시 모델이 최소한의 정답을 맞힐 수 없는 상태라면 먼저 지도 파인튜닝(SFT)으로 기초 능력을 배양한 후 RFT를 적용하는 단계적 접근 방식이 효과적이다.
RFT 구현을 위한 체계적인 단계별 접근법 플로우차트이다.
Diagram검증 가능한 평가 구축부터 베이스라인 실행, 데이터셋 및 보상 함수 구축, 그리고 RFT 실행으로 이어지는 반복적인 개선 루프를 설명한다. 특히 성능이 낮을 경우 SFT를 먼저 수행해야 한다는 의사결정 포인트를 명시한다.
06
FinQA 벤치마크 사례 연구 결과, 베이스라인 모델(0.465) 대비 RFT 200단계 학습 후 성능이 0.830으로 약 78% 향상됨이 확인됐다.
json
{
  "messages": [
    {
      "role": "user",
      "content": [
        {
          "type": "text",
          "text": "Context: ....

Question: ....

Provide your answer in the following format:
ANSWER: [your answer here]"
        }
      ]
    }
  ],
  "reference_answer": {
    "answer": "65.3%"
  },
  "data_source": "finqa"
}

RFT 학습을 위한 JSONL 데이터 형식 예시

python
def rft_launcher(train_S3_uri, reward_lambda_arn):
    instance_type = "ml.p5.48xlarge"
    instance_count = 4
    recipe = "fine-tuning/nova/nova_2_0/nova_lite/RFT/nova_lite_2_0_p5_gpu_lora_rft"
    // ...(중략)
    recipe_overrides = {
        "run": {
            "reward_lambda_arn": reward_lambda_arn,
        },
        "training_config": {
            "rollout": {
                "rewards": {
                    "api_endpoint": {
                        "lambda_arn": reward_lambda_arn
                    }
                }
            }
        }
    }
    estimator = PyTorch(
        instance_count=instance_count,
        instance_type=instance_type,
        recipe_overrides=recipe_overrides,
        training_recipe=recipe,
        image_uri=image_uri
    )
    estimator.fit(inputs={"train": train_input}, wait=False)
    return estimator.latest_training_job.name

SageMaker Training Jobs를 사용한 RFT 학습 실행 코드

베이스 모델과 RFT 학습 단계별 성능 비교 막대 그래프이다.
Chart베이스 모델(0.465) 대비 RFT 20단계(0.540), 200단계(0.830)로 학습이 진행됨에 따라 점수가 비약적으로 상승함을 수치로 증명한다. 이는 RFT가 실제 벤치마크 성능 향상에 효과적임을 보여준다.

용어 해설

강화 파인튜닝(Reinforcement Fine-Tuning)
정답 데이터를 모방하는 대신 보상 함수를 통해 모델의 출력을 평가하고 강화하는 기법이다. 모델이 스스로 다양한 해결 경로를 탐색하게 하여 복잡한 추론이나 도메인 특화 작업에서 성능을 최적화한다.
그룹 상대 정책 최적화(Group Relative Policy Optimization)
언어 모델에 최적화된 강화학습 알고리즘으로, 여러 생성 결과의 상대적 보상을 비교하여 정책을 업데이트한다. 별도의 가치 모델(Value Model) 없이도 효율적인 학습이 가능한 것이 특징이다.
검증 가능한 보상을 통한 강화학습(RLVR)
코드 실행 결과나 수학적 정답처럼 객관적이고 규칙 기반으로 검증 가능한 지표를 보상으로 사용하는 방식이다. AWS Lambda 등을 통해 자동화된 채점이 가능하다.
AI 피드백 기반 강화학습(RLAIF)
사람 대신 AI 모델을 판독자로 활용하여 응답의 유용성이나 브랜드 톤앤매너 준수 여부 등 주관적인 기준을 평가하고 보상을 제공하는 기법이다.
저순위 적응(LoRA)
모델 전체 가중치를 수정하는 대신 일부 저순위 행렬만 학습시켜 파라미터 수를 획기적으로 줄이는 기법이다. 적은 계산 자원으로도 효율적인 파인튜닝이 가능하다.

기술

  • Amazon Nova
  • Amazon Bedrock
  • Amazon SageMaker
  • AWS Lambda
  • GRPO
  • LoRA

활용 사례

  • 코드 생성 최적화
  • 금융 데이터 분석 및 추론
  • 고객 서비스 톤앤매너 조정
  • 수학적 문제 해결
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 27.수집 2026. 03. 01.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.