본문으로 건너뛰기

Kimi K3의 LoRA 대 FullFT 비교

학습 데이터의 범위, 학습률 튜닝, 어댑터 랭크가 FullFT 우위의 핵심 레버로 작용한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Qwen3.5-9B에서 LoRA 어댑터와 FullFT를 같은 입력·타깃·평가로 비교했을 때 데이터 커버리지, 학습률, 어댑터 랭크가 각각 성능 차이를 만들 수 있음이 관찰되었다. Placement와 Nexa VM에서는 데이터 다양성과 학습률 탐색으로 초기 FullFT 우위를 대부분 회복할 수 있었고, Register allocation에서는 랭크 증대가 실질적 개선을 가져왔다. 운영 관점에서는 자동화된 검증 지표로 실패 패턴을 진단하고 데이터·레시피·랭크 순으로 개입한 뒤 서빙 비용을 포함한 총소유비용을 비교해 FullFT 전환을 결정하라는 권고가 제시되었다.

빠른 이해

새로운 점

실험 절차는 세 가지 잠재 원인(데이터·옵티마이제이션·어댑터 용량)을 개별적으로 개입해 원인을 분리하는 진단 프로토콜을 제시한 점에서 새로움이 있다.

핵심 메커니즘

같은 SFT 입력·타깃·평가 코드를 유지한 채 데이터 규모, 학습률 스윕, 어댑터 랭크를 따로 바꿔 각 개입이 검증 성능에 미치는 영향을 관찰한다.

핵심 수치

  • Fixed-budget 세과제 매크로 점수(최종): FullFT 80.89%, Tuned LoRA-r128 76.60%, Tuned LoRA-r32 75.25%- 세 과제 평균을 동일 가중치로 계산한 고정 예산 조건 결과.
  • Exposure-matched 세과제 매크로 점수: LoRA-r32 86.92%, LoRA-r128 86.11%, FullFT 84.58%- 각 과제에 원래 토큰 노출을 보존한 조건에서 LoRA가 앞섰다.
  • Placement 초기/확장 데이터 유효성: 2k rows LoRA-r32 34.33% → 20k rows LoRA-r32 68.33%- 데이터를 10배로 늘리자 LoRA 유효성이 거의 두 배로 증가.
  • Register allocation 유효성(랭크 효과): LoRA-r8 80.50% → LoRA-r128 90.50% → FullFT 93.00%- 랭크 증가는 유효성과 품질을 함께 개선했다.
  • 고정 예산 활성 학습 시간 및 하한 비용: Original LoRA-r32 2.70 h $53.97, Tuned LoRA-r128 3.23 h $64.53, FullFT 3.50 h $70.06- B200 GPU 시간당 $10 고정 전제로 계산한 활성 업데이트 시간 하한이다.
  • 서버리스 학습 비용(추정): 약 $91.79- Qwen3.5-9B 표준 가격($1.463/1M tokens)으로 전체 학습-데이터 토큰을 계산한 목록가 추정치이다.

섹션별 상세

LoRA와 FullFT 비교 실험

이 글은 Qwen3.5-9B에 Supervised Fine-Tuning을 적용해 LoRA 어댑터와 Full Parameter Fine-Tuning(FullFT)을 같은 데이터·프롬프트·평가 코드로 비교한 결과를 제시한다. 세 가지 가능한 원인인 데이터 커버리지, 옵티마이제이션(특히 학습률), 어댑터 용량(랭크)을 개별적으로 개입해 어떤 레버가 품질 차이를 만든지 확인하는 절차를 따랐다. 각 개입의 효과는 자동 채점이 가능한 세 가지 합성 과제(Placement, Register allocation, Nexa VM)에서 정량적 수치로 제시되어 실험 결과가 재현 가능하도록 구성되었다.
근거
  • FullFT가 LoRA보다 나은 결과를 냈을 때는 데이터 커버리지, 학습률, 또는 어댑터 용량 중 하나가 원인일 수 있다. 글 전반의 실험 설계와 각 과제 결과 요약(Placement, Register allocation, Nexa VM).

실험 환경과 평가 지표

실험은 Qwen3.5-9B를 대상으로 SFT를 수행했으며 동일한 프롬프트·타깃·평가 코드를 LoRA와 FullFT에 적용해 비교하였다. 세 과제는 프로그램 가능 검사기를 갖춰 유효성(validity), 솔루션 품질, 그리고 정확한 실행 추적(exact trace)을 자동으로 채점할 수 있었다. 각 비교에서 데이터 규모, 학습률 스윕, 어댑터 랭크 변경을 개별 변수로 통제해 원인-효과를 구분하려는 설계가 사용되었다.

Placement 과제 결과

Placement 과제는 선 상에 셀을 배치해 배선 길이를 최소화하면서 강한 금지 제약을 만족시키는 문제로, 한 번의 제약 위반이 출력을 무효화하는 특성이 있다. 초반에는 FullFT가 LoRA(r32 대비)보다 큰 우위를 보였으나 데이터를 10배로 늘리자 LoRA 유효성이 거의 두 배로 올라갔고 학습률을 높이자 LoRA의 검증 성능이 FullFT와 통계적으로 구별되지 않는 수준까지 개선되었다. 이 증거는 어댑터가 본질적으로 너무 작아서 실패한 것이 아니라 훈련 데이터의 다양성 부족과 부적절한 학습률이 주원인이었음을 시사한다.

Register allocation 과제 결과

Register allocation 과제에서는 동시 사용되는 값을 서로 다른 물리 레지스터에 배치해야 하며 한 충돌도 허용되지 않아 유효성 지표가 민감하게 반응한다. 이 과제에서는 어댑터 랭크가 직접적으로 효과를 냈고, 랭크를 8→32→128로 늘리자 유효성과 솔루션 품질이 함께 상승해 랭크 128은 FullFT 성능에 근접했다. 실험은 alpha/rank 비율을 유지해 명목상 업데이트 스케일을 일정하게 한 상태에서 용량만 늘렸고, 그 결과 랭크 상승이 유효성·품질·정확한 시퀀스 점수에 동반 상승을 가져왔다는 근거가 확보되었다.
근거
  • Placement 과제에서는 데이터를 10배로 늘리고 학습률을 높이자 LoRA 유효성이 크게 개선되어 FullFT와의 격차가 줄었다. Placement 표: 원래 2k rows LoRA-r32 34.33% → 20k rows 68.33% 및 학습률 상승 결과.

Nexa VM 과제 결과

Nexa VM은 프로그램을 실행해 모든 중간 상태를 보고하도록 요구하는 과제로, 작은 오차가 연쇄적으로 누적되는 특성을 지닌다. 초기 고정 레시피에서는 FullFT가 큰 우위로 보였으나 학습률 스윕을 수행하자 그 우위는 사라졌고 LoRA가 유사하거나 약간 우수한 최종 답안·정확 추적 성능을 보였다. 더 긴 길이로 일반화할 때는 훈련 시 레지스터 시작 위치를 무작위화하는 데이터 커버리지 확장이 결정적 효과를 냈고, 단순히 랭크를 올리는 것만으로는 커버리지 결핍을 보완할 수 없었다.
근거
  • Register allocation 과제에서는 랭크 증가가 유효성과 품질을 함께 끌어올려 랭크 128이 FullFT에 근접했다. 레지스터 테이블: LoRA-r8 80.50% → LoRA-r128 90.50%, FullFT 93.00%.

세 과제 혼합 실험과 비용 비교

세 과제를 태그된 혼합으로 학습할 때 노출을 보존한 조건에서는 LoRA가 FullFT보다 전체 평균에서 앞섰으나 동일한 총 예산을 각 과제에 분산시키면 FullFT가 더 관대하게 성능을 유지했다. 고정 예산 환경에서 학습률 튜닝으로 5.61포인트를 회복하고 랭크 128이 추가로 1.35포인트를 회복했으나 최종적으로는 FullFT가 약 4.29포인트 우위를 유지했다. 훈련 비용은 보고된 활성 업데이트 시간 기준으로 FullFT가 tuned r128보다 약 8.6% 더 많은 활성 학습 시간을 썼고, 서버리스 표준 계산으로는 고정 예산 혼합 실험 하나가 약 $91.79로 추정되었다.
근거
  • Nexa VM에서는 학습률 스윕으로 초기 FullFT 우위가 사라졌고, 장길이 일반화는 더 다양한 레지스터 시작 위치를 포함한 데이터 커버리지가 결정적이었다. Nexa 데이터: depth-8 소표 및 무작위 레지스터 시작이 depth-16에서 성능을 회복시킨 결과.

실무용 진단 절차

실무적으로는 먼저 LoRA로 시작해 목표 행동을 명확히 정의하고 자동화된 평가로 실패 패턴을 수집하는 것이 권장된다. 실패가 케이스 커버리지 부족에 집중되면 데이터 다양성을 늘리고, 데이터가 도움은 주되 차이가 남아 있으면 학습률과 스케줄을 먼저 탐색한 다음에 랭크를 증가시키는 순서로 개입해야 한다. 마지막으로 품질 기준이 충족되면 훈련·서빙·운영을 합한 총비용을 비교해 FullFT 전환이 비용 대비 정당화되는지를 판단해야 한다.

Fireworks 기반 재현

이 연구의 재현은 Fireworks Serverless Training과 Inference로 수행 가능하다고 안내하고 있으며 고정 예산 혼합 실험은 공개 Qwen3.5-9B 요율 기준으로 약 $91.79에 처리되었다. Fireworks는 여러 LoRA 어댑터를 같은 베이스 모델 배포에 교체·동시 서빙할 수 있어 서빙 측면에서 FullFT 전환보다 비용 우위가 있을 수 있음을 강조한다. 따라서 방법 선택을 인프라 제약으로 고정하지 말고 실험적 절차로 결정하라는 운영적 권고가 제시되었다.

용어 해설

지도형 미세조정(Supervised Fine-Tuning (SFT))
지도형 미세조정은 입력과 정답 쌍을 이용해 모델 출력을 특정 행동으로 수렴시키는 과정이다. 입력-타깃 쌍을 손실 함수로 측정하고 옵티마이저로 가중치를 갱신하여 모델이 목표 출력으로 수렴하도록 만든다. 이 문서에서는 Qwen3.5-9B에 SFT를 적용해 LoRA 어댑터와 FullFT의 성능을 비교하였다.
정확한 실행 추적(Exact Trace)
정확한 실행 추적은 프로그램 실행의 모든 중간 상태를 레퍼런스와 바이트 단위로 일치시키는 평가 기준이다. 한 단계라도 불일치하면 실패로 간주되므로 단일 실수로 전체 예제가 무효화될 수 있다. Nexa VM 과제에서 모델의 미세한 오류가 장거리 연쇄 에러로 이어지는지를 확인하는 핵심 판단 기준으로 쓰였다.
유효성(체커 통과)(Validity)
유효성은 모델 출력이 과제의 제약 조건을 모두 만족해 자동 채점기를 통과하는지를 뜻한다. 배치(Placement)와 레지스터 할당 과제에서 한 번의 제약 위반으로 유효성이 사라지기 때문에 이 지표가 중요하다. 연구는 훈련 셋에서 100% 적중하더라도 검증 셋 유효성이 낮을 수 있음을 반복해서 관찰했다.
어댑터 랭크(Adapter rank)
어댑터 랭크는 LoRA가 학습하는 저순위 행렬의 차원 수로, 어댑터의 표현 용량을 결정한다. 동일한 업데이트 스케일을 유지하면서 랭크를 올리면 어댑터가 더 복잡한 변환을 학습할 여지가 커진다. 레지스터 할당 과제에서는 랭크를 32에서 128로 늘리자 유효성과 품질이 함께 올라갔다.
학습률 탐색(Learning-rate sweep)
학습률 탐색은 여러 학습률과 스케줄을 비교해 최적의 옵티마이저 설정을 찾는 절차다. 이 연구에서는 LoRA가 FullFT보다 높은 최적 학습률을 선호하는 경향을 보였고, 미조정 레시피에서 생긴 겉보기 격차를 학습률 탐색으로 대부분 제거했다. Nexa 과제에서는 초기 FullFT 우위가 학습률 탐색으로 뒤집혔다.

기술

  • Qwen3.5-9B
  • LoRA
  • FullFT
  • Fireworks Serverless Training

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 01.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.