TL;DR
Qwen3.5-9B에서 LoRA 어댑터와 FullFT를 같은 입력·타깃·평가로 비교했을 때 데이터 커버리지, 학습률, 어댑터 랭크가 각각 성능 차이를 만들 수 있음이 관찰되었다. Placement와 Nexa VM에서는 데이터 다양성과 학습률 탐색으로 초기 FullFT 우위를 대부분 회복할 수 있었고, Register allocation에서는 랭크 증대가 실질적 개선을 가져왔다. 운영 관점에서는 자동화된 검증 지표로 실패 패턴을 진단하고 데이터·레시피·랭크 순으로 개입한 뒤 서빙 비용을 포함한 총소유비용을 비교해 FullFT 전환을 결정하라는 권고가 제시되었다.
빠른 이해
새로운 점
실험 절차는 세 가지 잠재 원인(데이터·옵티마이제이션·어댑터 용량)을 개별적으로 개입해 원인을 분리하는 진단 프로토콜을 제시한 점에서 새로움이 있다.
핵심 메커니즘
같은 SFT 입력·타깃·평가 코드를 유지한 채 데이터 규모, 학습률 스윕, 어댑터 랭크를 따로 바꿔 각 개입이 검증 성능에 미치는 영향을 관찰한다.
핵심 수치
- Fixed-budget 세과제 매크로 점수(최종): FullFT 80.89%, Tuned LoRA-r128 76.60%, Tuned LoRA-r32 75.25%- 세 과제 평균을 동일 가중치로 계산한 고정 예산 조건 결과.
- Exposure-matched 세과제 매크로 점수: LoRA-r32 86.92%, LoRA-r128 86.11%, FullFT 84.58%- 각 과제에 원래 토큰 노출을 보존한 조건에서 LoRA가 앞섰다.
- Placement 초기/확장 데이터 유효성: 2k rows LoRA-r32 34.33% → 20k rows LoRA-r32 68.33%- 데이터를 10배로 늘리자 LoRA 유효성이 거의 두 배로 증가.
- Register allocation 유효성(랭크 효과): LoRA-r8 80.50% → LoRA-r128 90.50% → FullFT 93.00%- 랭크 증가는 유효성과 품질을 함께 개선했다.
- 고정 예산 활성 학습 시간 및 하한 비용: Original LoRA-r32 2.70 h $53.97, Tuned LoRA-r128 3.23 h $64.53, FullFT 3.50 h $70.06- B200 GPU 시간당 $10 고정 전제로 계산한 활성 업데이트 시간 하한이다.
- 서버리스 학습 비용(추정): 약 $91.79- Qwen3.5-9B 표준 가격($1.463/1M tokens)으로 전체 학습-데이터 토큰을 계산한 목록가 추정치이다.
섹션별 상세
LoRA와 FullFT 비교 실험
- FullFT가 LoRA보다 나은 결과를 냈을 때는 데이터 커버리지, 학습률, 또는 어댑터 용량 중 하나가 원인일 수 있다. — 글 전반의 실험 설계와 각 과제 결과 요약(Placement, Register allocation, Nexa VM).
실험 환경과 평가 지표
Placement 과제 결과
Register allocation 과제 결과
- Placement 과제에서는 데이터를 10배로 늘리고 학습률을 높이자 LoRA 유효성이 크게 개선되어 FullFT와의 격차가 줄었다. — Placement 표: 원래 2k rows LoRA-r32 34.33% → 20k rows 68.33% 및 학습률 상승 결과.
Nexa VM 과제 결과
- Register allocation 과제에서는 랭크 증가가 유효성과 품질을 함께 끌어올려 랭크 128이 FullFT에 근접했다. — 레지스터 테이블: LoRA-r8 80.50% → LoRA-r128 90.50%, FullFT 93.00%.
세 과제 혼합 실험과 비용 비교
- Nexa VM에서는 학습률 스윕으로 초기 FullFT 우위가 사라졌고, 장길이 일반화는 더 다양한 레지스터 시작 위치를 포함한 데이터 커버리지가 결정적이었다. — Nexa 데이터: depth-8 소표 및 무작위 레지스터 시작이 depth-16에서 성능을 회복시킨 결과.
실무용 진단 절차
Fireworks 기반 재현
용어 해설
- 지도형 미세조정(Supervised Fine-Tuning (SFT))
- — 지도형 미세조정은 입력과 정답 쌍을 이용해 모델 출력을 특정 행동으로 수렴시키는 과정이다. 입력-타깃 쌍을 손실 함수로 측정하고 옵티마이저로 가중치를 갱신하여 모델이 목표 출력으로 수렴하도록 만든다. 이 문서에서는 Qwen3.5-9B에 SFT를 적용해 LoRA 어댑터와 FullFT의 성능을 비교하였다.
- 정확한 실행 추적(Exact Trace)
- — 정확한 실행 추적은 프로그램 실행의 모든 중간 상태를 레퍼런스와 바이트 단위로 일치시키는 평가 기준이다. 한 단계라도 불일치하면 실패로 간주되므로 단일 실수로 전체 예제가 무효화될 수 있다. Nexa VM 과제에서 모델의 미세한 오류가 장거리 연쇄 에러로 이어지는지를 확인하는 핵심 판단 기준으로 쓰였다.
- 유효성(체커 통과)(Validity)
- — 유효성은 모델 출력이 과제의 제약 조건을 모두 만족해 자동 채점기를 통과하는지를 뜻한다. 배치(Placement)와 레지스터 할당 과제에서 한 번의 제약 위반으로 유효성이 사라지기 때문에 이 지표가 중요하다. 연구는 훈련 셋에서 100% 적중하더라도 검증 셋 유효성이 낮을 수 있음을 반복해서 관찰했다.
- 어댑터 랭크(Adapter rank)
- — 어댑터 랭크는 LoRA가 학습하는 저순위 행렬의 차원 수로, 어댑터의 표현 용량을 결정한다. 동일한 업데이트 스케일을 유지하면서 랭크를 올리면 어댑터가 더 복잡한 변환을 학습할 여지가 커진다. 레지스터 할당 과제에서는 랭크를 32에서 128로 늘리자 유효성과 품질이 함께 올라갔다.
- 학습률 탐색(Learning-rate sweep)
- — 학습률 탐색은 여러 학습률과 스케줄을 비교해 최적의 옵티마이저 설정을 찾는 절차다. 이 연구에서는 LoRA가 FullFT보다 높은 최적 학습률을 선호하는 경향을 보였고, 미조정 레시피에서 생긴 겉보기 격차를 학습률 탐색으로 대부분 제거했다. Nexa 과제에서는 초기 FullFT 우위가 학습률 탐색으로 뒤집혔다.
기술
- Qwen3.5-9B
- LoRA
- FullFT
- Fireworks Serverless Training
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.