TL;DR
대형 언어 모델의 사후 정렬로 인한 과도한 검열이 합법적 비즈니스 워크플로를 방해하는 문제가 존재한다는 배경에서, Amazon Nova의 CCMS는 고객이 승인한 정책 영역에서만 검열 거부를 줄이기 위해 LoRA 어댑터 기반의 언러닝을 적용하는 접근을 제시한다. 구현 방식은 고객별로 훈련된 LoRA 어댑터를 임포트해 고유한 ARN으로 맞춤 모델을 생성하고 추론 시 어댑터가 핵심 모델의 거부 동작을 국소적으로 약화시키는 것이며, 플랫폼 차원에서는 필수적 안전 제약은 유지한다. rDPO는 이러한 선택적 언러닝을 수행하기 위한 역방향 선호 최적화 방법으로, 직접 파인튜닝이 초래할 수 있는 전체 모델 품질 저하를 피하면서 특정 정책 관련 거부를 줄이는 것을 목표로 한다. 이 접근은 합법적 목적의 콘텐츠 생성을 허용하면서도 비대상 영역의 정렬을 보존하려는 실용적 균형을 제공한다.
섹션별 상세
용어 해설
- 로라(LoRA)(LoRA)
- — LoRA는 전체 모델 가중치를 직접 수정하지 않고 저순위 저차원 행렬을 추가로 학습시켜 특정 동작을 빠르게 적응시키는 기법으로, 본문에서는 핵심 모델의 파라미터를 복구하지 않고도 특정 검열 정책을 역학습(unlearning)하는 어댑터로 활용된다.
- 직접적 선호 최적화(DPO)(Direct Preference Optimization)
- — DPO는 선호하는 응답을 비선호 응답보다 점수화하여 모델이 선호 응답을 높은 확률로 생성하도록 파라미터를 조정하는 방법론으로, 본문에서는 DPO의 반대 방향으로 동작하는 언러닝 계열 기법들과 비교되는 기준으로 사용된다.
- 부정적 선호 최적화(NPO)(Negative Preference Optimization)
- — NPO는 DPO에서 파생된 접근법으로서 특정 응답을 모델에서 낮게 평가하도록 학습시켜 의도된 동작을 줄이는 방향으로 작동하며, 본문에서는 NPO가 언러닝 연구의 선행 사례로 언급된다.
- 언러닝(Unlearning)
- — 언러닝은 모델이 학습한 특정 행동이나 정책을 전체 재학습 없이 선택적으로 제거하는 방법을 뜻하며, 본문에서는 검열·거부 동작을 파라미터 수준에서 줄이기 위해 LoRA 어댑터와 rDPO를 활용하는 문맥으로 사용된다.
- Amazon 리소스 이름(ARN)(Amazon Resource Name)
- — ARN은 AWS에서 리소스를 고유하게 식별하는 문자열 식별자이며, 본문에서는 고객이 임포트한 LoRA 어댑터를 통해 생성되는 맞춤 모델을 식별하는 데 쓰이는 고유 식별자로 언급된다.
기술
- Amazon Nova
- LoRA
- rDPO
- DPO
- NPO
활용 사례
- 미디어용 성숙 표현의 정당한 요약 생성
- 보안 모의훈련용 피싱 이메일 생성
- 법률적·증거 관련 민감 문서의 처리
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.