본문으로 건너뛰기

Multimodal Fine-tuning

멀티모달 Fine-tuning

텍스트뿐 아니라 이미지와 영상 등 여러 입력 형식을 처리하는 모델을 특정 도메인 데이터에 맞게 추가 학습하는 방법입니다. MOSS-VL에서는 이미지·영상 작업에 맞춘 데이터 준비와 학습, 추론까지 하나의 workflow로 연결합니다.