baseten/GLM-5.2-Vision-NVFP4
GLM-5.2 텍스트 백본과 Kimi-K2.6의 비전 인코더를 동결한 채 49.5M 프로젝터만 학습해 시각 입력을 더한 모델.
학습 방식 · GLM-5.2(텍스트)와 Kimi-K2.6의 MoonViT(비전)를 둘 다 동결한 채, 패치 임베딩을 GLM 토큰 공간으로 투사하는 PatchMerger MLP(49.5M 파라미터)만 새로 학습했다.
TL;DR
GLM-5.2-Vision(NVFP4)은 GLM-5.2 텍스트 백본과 Kimi-K2.6의 MoonViT 비전 인코더를 업스트림 그대로 바이트 단위로 동결한 뒤, 1152차원 패치 임베딩을 GLM의 6144차원 토큰 공간으로 매핑하는 49.5M 파라미터 PatchMerger 프로젝터만 새로 학습해 시각 입력을 더한 모델이다. 텍스트 가중치는 NVFP4로 양자화돼 있고 이미지당 최대 4096토큰(16384 MoonViT 패치를 2x2 병합), 최대 1,048,576 토큰 컨텍스트를 지원하며 SGLang 전용 플러그인으로 서빙한다. 전체 크기가 약 466GB에 달해 8×B200에서 풀 1M 컨텍스트, 4×B200에서 256k 컨텍스트로 구동하도록 설계돼 Blackwell급 GPU 클러스터가 필요하다. GLM 원본의 추론(reasoning) 동작은 그대로 유지되면서 이미지 설명·멀티모달 질의응답에 chain-of-thought 출력을 분리해 제공할 수 있어, 대규모 인프라를 갖춘 팀의 장문맥 멀티모달 서비스에 적합하다.
핵심 포인트
- GLM-5.2와 MoonViT 두 백본을 동결하고 49.5M PatchMerger 프로젝터만 새로 학습해 시각 입력을 더했다.
- 이미지당 최대 4096토큰(16384 패치를 2x2 병합)과 최대 1,048,576 토큰 컨텍스트를 지원한다.
- 텍스트 가중치는 nvidia/GLM-5.2-NVFP4를 쓰고 8xB200(1M)·4xB200(256k) 구성을 함께 제공한다.
- GLM 원본의 reasoning-parser 기반 chain-of-thought 분리 출력을 그대로 유지한다.
제한사항
- 체크포인트 크기가 약 466GB에 달하고 8×B200 또는 4×B200 같은 Blackwell급 GPU 클러스터가 필요해 일반적인 단일 GPU 환경에서는 구동할 수 없다.
- GLM-5.2·Kimi-K2.6 원 개발팀은 이 체크포인트 제작에 관여하지 않았으므로, 이 모델에서 발생하는 문제는 원 팀에 문의할 수 없다.
- Glm5vForConditionalGeneration이 아직 SGLang 상류 아키텍처로 병합되지 않아 저장소에 포함된 별도 플러그인을 설치해야 구동할 수 있다.
139
LIKES
3.1k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.