Blackwell GPU 최적화의 정수, 397B 거대 모델을 FP4 양자화로 가볍고 빠르게
텍스트 생성 (멀티모달 입력 지원)397B (17B Active)262K 컨텍스트apache-2.0
NVIDIA ModelOpt를 통해 Qwen3.5 MoE 모델을 FP4 정밀도로 양자화하여 Blackwell 환경에서 초고속 추론을 구현한 모델입니다.
핵심 역량
- 397B 총 파라미터 및 17B 활성화 MoE 아키텍처
- 최대 262K 토큰의 초장거리 컨텍스트 지원
- NVFP4(FP4) 양자화를 통한 추론 속도 및 메모리 효율 극대화
- 텍스트, 이미지, 비디오를 포함한 멀티모달 입력 처리
- NVIDIA Blackwell(B200) GPU 하드웨어 가속 최적화
- SGLang 프레임워크를 활용한 고성능 서빙 지원
알아두면 좋은 것
- NVIDIA Model Optimizer v0.42.0을 사용한 가중치 및 활성함수 FP4 양자화
- GPQA(생물, 물리, 화학 전문 지식) 벤치마크를 통한 성능 검증 완료
- SGLang 최신 메인 브랜치 및 특정 PR(18937) 적용 시 실행 가능
- Blackwell 마이크로아키텍처와의 하드웨어 호환성 명시
56
Likes
68.2k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.