본문으로 건너뛰기

MinT: 수백만 개의 LLM 학습 및 서빙을 위한 관리형 인프라

포스트-트레이닝은 다수의 정책 변형을 단일 고가의 기지 모델 배포 위에 올려놓는 환경이다. Full checkpoint 기반 파인튜닝은 확장에 한계가 있으며, MinT는 base-model을 resident하게 유지하고 LoRA adapter revision을 통해 rollout, update, export, evaluation, serving, rollback를 연결하는 서비스형 RL 인프라를 제시한다. 이를 통해 다수의 정책 변형을 하나의 거대 모델에 흩뜨리지 않고 관리할 수 있으며, 1T-class 규모의 베이스 모델과 함께 수백만 규모의 어댑터 정책을 다룰 수 있다.

용어 해설

LoRA
LoRA는 학습 파라미터의 일부만 학습시키고, 선택된 계층에 저랭크 행렬을 곱해 전체 가중치를 변경하지 않으면서 파인튜닝 효과를 얻는 PEFT 방식이다. 본 논문에서 MinT의 핵심 정책 단위로 LoRA 어댑터를 활용한다.
PEFT
PEFT는 Parameter-Efficient Fine-Tuning의 약자로, 기반 모델의 가중치를 거의 그대로 두고 일부 매개변수만 학습시키는 방식으로 파라미터 효율적인 미세조정을 가능하게 한다.
vLLM
vLLM은 resident base를 활용한 대규모 언어 모델의 추론 엔진으로, LoRA 어댑터를 GPU 배치에 로드한 상태에서 토큰을 생성한다.
MoE
Mixtures of Experts로 분할된 가중치와 전문가 경로를 사용하여 대규모 모델의 확장을 가능하게 하는 구조적 기법.
IcePop 롤아웃 보정(IcePop rollout correction)
IcePop 스타일의 롤아웃 보정은 학습/롤아웃 확률 비율이 신뢰 구간 밖으로 벗어날 때 토큰의 중요도 가중치를 0으로 설정하는 방식으로, sparse-attention 토큰 세트 재구성을 목표로 하지 않는 보정 기법이다.
MLA 주의(MLA attention)
MLA(attention) 경로는 LoRA 타깃 모듈 매핑 및 롤아웃 보정과 함께 프런티어 대형 아키텍처에서 다양한 주의 경로를 활용하는 설계이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 13.수집 2026. 05. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.