GLM-5.2 기반 비전언어 모델, 1M 토큰 컨텍스트 지원
GLM-5.2에 MoonViT 비전 인코더를 결합하고 49.5M 파라미터 PatchMerger만 학습한 NVFP4 양자화 멀티모달 모델이다.
TL;DR
이 모델은 GLM-5.2 텍스트 백본과 Kimi-K2.6의 MoonViT 비전 타워를 바이트 단위로 동결한 채로 MoonViT의 1152차원 패치 임베딩을 GLM 토큰 공간으로 투사하는 49.5M 파라미터 PatchMerger만 학습해 멀티모달 능력을 추가한 구성이다. 텍스트 가중치는 NVFP4 양자화가 적용되어 있으며 최대 1,048,576 토큰 컨텍스트와 이미지당 최대 4096 토큰 처리를 지원하되 배포에는 8×B200 또는 4×B200 Blackwell 구성이 권장된다. 이러한 설계는 검증된 대규모 추론 능력을 보존하면서 시각 입력을 결합하여 긴 문맥과 이미지 기반 질의응답을 처리할 수 있게 하고, 초기 다운로드 용량 약 466GB와 하드웨어 요구사항이라는 현실적 한계를 동반한다.
핵심 역량
- 이미지와 텍스트를 결합한 질의응답을 수행할 수 있으며 이미지에서 추출한 패치 임베딩을 텍스트 토큰 공간으로 투사한 뒤 GLM-5.2의 추론 루틴을 통해 상세한 서술형 응답을 생성할 수 있다. 체인오브소트 형태의 내부 추론을 별도 스트림으로 유지할 수 있어 추론 과정과 결과를 분리해서 활용할 수 있다. OpenAI 스타일 멀티모달 메시지 형식으로 로컬 엔드포인트에 요청을 보낼 수 있다.
- 대용량 컨텍스트 환경에서 긴 문맥을 유지한 멀티턴 대화를 처리할 수 있으며 최대 1,048,576 토큰 컨텍스트를 지원하는 구성으로 운영할 경우 장문 문서와 대화 히스토리를 포괄적으로 유지하면서 시각 정보까지 결합한 응답을 생성한다. KV 캐시를 fp8_e4m3로 구성하여 메모리와 성능 균형을 맞춘다. 컨텍스트 크기 조정은 GPU 수와 메모리 분할 설정으로 제어된다.
- 하드웨어에 맞춘 양자화와 런타임 옵션을 사용해 대규모 모델을 제한된 GPU 수로도 배포할 수 있다. README에서는 NVFP4 텍스트 가중치와 modelopt_fp4 양자화 옵션을 조합하도록 권장하며 B200 Blackwell GPU 4대 또는 8대를 기준으로 서로 다른 컨텍스트 길이를 제시한다. Baseten을 통한 Truss 배포 구성이 포함되어 배포 흐름을 단축할 수 있다.
- 추론 파이프라인은 SGLang 플러그인 아키텍처를 통해 통합되며 외부 모델 패키지와 멀티모달 프로세서를 환경 변수로 등록해 사용한다. Glm5vForConditionalGeneration 아키텍처가 플러그인으로 제공되어 추가 코드 없이도 SGLang 런타임에서 모델을 실행할 수 있다. 이 구조는 로컬 서버와 Baseten 배포 양쪽을 지원한다.
강점
- 텍스트 백본과 비전 타워를 upstream과 바이트 동일하게 동결하여 원본 모델의 추론 특성과 호환성을 유지하면서 시각 입력을 통합했다. 이로 인해 검증된 GLM-5.2의 추론 동작이 보존되며 새로운 학습은 프로젝터에 집중되어 학습 비용과 위험을 절감한다.
- NVFP4로 양자화된 텍스트 가중치와 modelopt_fp4 옵션을 통해 메모리 사용을 줄이고 대규모 컨텍스트 운영을 현실화하도록 설계되었다. README에서 제시한 B200 기반 배포 구성은 실제 하드웨어 제약을 고려한 최적화된 운영 방식을 반영한다.
- PatchMerger 구조는 1152차원 패치 임베딩을 6144차원 텍스트 토큰 공간으로 정렬하는 명확한 매핑 경로를 제공하여 시각 정보를 텍스트 추론 루틴에 자연스럽게 결합한다. 이 설계는 멀티모달 정합의 복잡도를 줄이고 간단한 추가 학습으로 기능을 확장하는 데 유리하다.
훈련 방식
기본 텍스트 모델은 zai-org/GLM-5.2를 사용하고 비전 타워는 Kimi-K2.6의 MoonViT를 사용하되 두 컴포넌트는 동결 상태로 유지했다. 새로 학습한 구성요소는 패치 임베딩을 텍스트 토큰 차원으로 변환하는 PatchMerger MLP뿐이며 이 프로젝터만 49.5M 파라미터 규모로 학습되었다. 이러한 접근은 기존 강력한 추론 능력을 보전하면서 시각 입력을 추가해 멀티모달 기능을 확장하는 방식이다.
알아두면 좋은 것
- 라이선스는 MIT로 공개되어 있어 상업적 사용과 수정이 허용되며 소스 코드와 플러그인이 모델 리포지토리에 포함되어 있어 추가 클론이 필요하지 않다. 텍스트 백본과 비전 타워는 upstream과 바이트 일치하도록 동결되어 있어 원본 모델의 동작을 유지하면서 시각 입력을 통합한 방식이다. 이로 인해 모델의 업스트림 업데이트 및 재현 가능성이 보존된다.
- 텍스트 가중치는 nvidia/GLM-5.2-NVFP4 포맷을 사용하며 모델 전체 크기는 약 466GB로 초기 다운로드와 로드에 상당한 시간이 소요된다. README는 8×B200에서 1M 토큰 컨텍스트를, 4×B200에서 256k 토큰 컨텍스트를 각각 권장하며 하드웨어 요구사항이 크다는 점을 명확히 기술하고 있다. 대규모 컨텍스트와 양자화 설정 때문에 시작 시간과 메모리 튜닝이 배포의 주요 고려사항이다.
- 이미지 토큰은 이미지당 최대 4096 토큰을 지원하며 내부적으로 MoonViT 패치를 2×2 병합해 최대 16384 패치를 처리하는 옵션을 제공한다. PatchMerger 프로젝터는 1152차원 입력을 4608 차원의 중간층을 거쳐 6144 차원 토큰 공간으로 투사하도록 설계되어 시각-언어 정렬을 수행한다. 이 설계는 시각 정보의 세부를 텍스트 표현과 정합시키는 데 중점을 둔다.
- 배포 관련으로 Baseten Truss 설정을 포함해 모델을 곧바로 푸시할 수 있는 구성 파일을 제공하며 Baseten API 키로 간단히 배포를 시작할 수 있다. Truss 기반 배포는 최초 모델 다운로드와 초기화에 따른 지연을 감수해야 하며 생성된 predict_url을 통해 표준 HTTP 호출로 멀티모달 요청을 전송할 수 있다. Baseten 문서와 함께 제공되는 단계별 명령이 배포 과정을 재현 가능하게 만든다.
기술적 특징
- 프로젝터는 pre_norm, linear_1, GELU, linear_2 순의 MLP 아키텍처로 구현되어 패치 임베딩 1152차원을 중간 4608차원을 거쳐 6144차원 토큰 차원으로 투사한다. 이 구조는 입력 패치의 특성을 비율적으로 보존하면서 텍스트 토큰 공간에 매핑하는 역할을 하며 GELU 활성화가 비선형 정합을 수행한다. 프로젝터만 학습하도록 설계해 전체 백본을 동결한 상황에서도 시각 정보를 효율적으로 통합한다.
- 텍스트 백본 GLM-5.2는 MoE와 MLA 및 DSA 기반의 희소 어텐션을 사용하여 활성 파라미터를 줄이는 방식으로 동작하며 이 모델은 동결된 상태로 포함된다. 동결된 상태는 원본 GLM의 추론 특성과 성능을 유지하고 재학습 리스크를 줄이는 효과를 낳는다. 활성화된 전문가 수(A40B active) 등 내부 활성화 설정이 성능과 메모리 사용에 직접적인 영향을 준다.
- 비전 타워로 MoonViT-3d의 27 레이어, 1152차원 패치 임베딩을 사용하여 이미지 패치를 고차원 임베딩으로 변환하고 2×2 병합을 통해 최대 16384 패치를 처리할 수 있게 구성했다. 이렇게 생성된 많은 수의 이미지 토큰을 PatchMerger가 텍스트 차원으로 합류시키며 대형 이미지나 고해상도 입력에도 대응한다. 이미지 토큰 상한과 병합 전략은 입력 해상도와 처리 비용 사이의 트레이드오프를 조절한다.
- 추론 환경은 SGLang 플러그인 아키텍처와 Baseten Truss 배포를 통해 통합되며 런타임 플래그로 kv-cache 데이터 타입, 어텐션 백엔드, 전문가 퓨전 옵션 등을 세밀하게 조정할 수 있다. README는 kv-cache를 fp8_e4m3로 설정하고 어텐션 백엔드로 dsa와 sdpa 조합을 권장하여 메모리와 성능 균형을 맞추는 구체적 운영 지침을 제공한다. 이러한 런타임 제어는 대규모 컨텍스트를 다루는 실제 서비스 환경에서 필수적이다.
차별점
- 텍스트와 비전 컴포넌트를 모두 동결하고 PatchMerger 프로젝터만 학습하여 재학습 비용과 리스크를 최소화하면서 멀티모달 기능을 추가했다.
- NVFP4 양자화된 텍스트 가중치와 modelopt_fp4 설정으로 대규모 컨텍스트 운영을 가능한 범위로 끌어올리며 B200 Blackwell 기반의 구체적 하드웨어 권장을 제공한다.
- 이미지 토큰을 최대 4096토큰으로 처리하고 내부적으로 2×2 병합을 통해 최대 16384 패치까지 수용하는 설계로 고해상도 이미지 입력을 지원한다.
139
Likes
3.1k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.