nvidia/Qwen3.8-27B-NVFP4
텍스트·이미지·비디오 입력을 받아 텍스트 시퀀스를 생성하며, AI Agent·chatbot·RAG 시스템에 활용할 수 있습니다.27B최대 262K 컨텍스트apache-2.0
Qwen3.8-27B를 NVFP4·FP8 혼합 정밀도로 양자화한 NVIDIA 배포용 모델
학습 방식 · Qwen3.8-27B 기반 post-training mixed NVFP4/FP8 quantization으로, Model Optimizer v0.48.0과 Nemotron-Post-Training-Dataset-v3의 2,048개 calibration 샘플을 사용했습니다.
TL;DR
Qwen3.8-27B를 기반으로 한 mixed NVFP4/FP8 양자화 모델로, MLP와 language model head에는 NVFP4를, self-attention과 linear-attention에는 FP8을 사용합니다. Model Optimizer v0.48.0의 Local-Hessian calibration algorithm으로 2,048개 샘플을 처리해 양자화했고, vLLM 또는 SGLang에서 NVIDIA Blackwell GPU와 최대 262K 컨텍스트로 구동할 수 있습니다. NVFP4 버전은 BF16 기준 GPQA Diamond 88.92에서 88.01, Terminal-Bench 75.56에서 74.02를 기록했으며, AA-LCR과 SciCode에서는 BF16 수치를 웃돌았습니다. AI Agent, chatbot, RAG 시스템처럼 긴 문맥과 도구 호출이 필요한 배포 환경을 겨냥합니다.
핵심 포인트
- MLP와 language model head에는 NVFP4, attention 계층에는 FP8을 배치해 계층별 혼합 정밀도를 구성했습니다.
- Local-Hessian calibration algorithm이 2,048개 샘플을 사용해 NVFP4 계층의 양자화 보정값을 산출합니다.
- vLLM과 SGLang에서 NVIDIA Blackwell GPU용으로 실행되며, 설정에 최대 262K 컨텍스트를 지정할 수 있습니다.
- NVFP4 버전은 GPQA Diamond 88.01, AA-LCR 73.38, SciCode 48.41의 정확도를 기록했습니다.
제한사항
- 인터넷에서 수집한 독성 언어와 사회적 편견이 포함된 데이터의 영향으로 유해한 표현이나 편향된 응답을 생성할 수 있습니다.
- 질문에 대해 부정확하거나 핵심 정보가 빠진 답변, 관련 없거나 중복된 텍스트를 생성할 수 있습니다.
- 배포 전 산업과 사용 사례에 맞춘 내부 검증 및 unit·system 수준의 반복 테스트가 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GPQA Diamond | accuracy | 88.01 | Qwen3.8-27B BF16 기준 88.92 |
| Terminal-Bench | accuracy | 74.02 | Qwen3.8-27B BF16 기준 75.56 |
| AA-LCR | accuracy | 73.38 | Qwen3.8-27B BF16 기준 72.63 |
| MMMU-Pro | accuracy | 74.86 | Qwen3.8-27B BF16 기준 75.14 |
| SciCode | accuracy | 48.41 | Qwen3.8-27B BF16 기준 47.93 |
| IFBench | accuracy | 78.93 | Qwen3.8-27B BF16 기준 80.07 |
74
LIKES
19.2k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.