본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/Qwen3.8-27B-NVFP4

텍스트·이미지·비디오 입력을 받아 텍스트 시퀀스를 생성하며, AI Agent·chatbot·RAG 시스템에 활용할 수 있습니다.27B최대 262K 컨텍스트apache-2.0

Qwen3.8-27B를 NVFP4·FP8 혼합 정밀도로 양자화한 NVIDIA 배포용 모델

학습 방식 · Qwen3.8-27B 기반 post-training mixed NVFP4/FP8 quantization으로, Model Optimizer v0.48.0과 Nemotron-Post-Training-Dataset-v3의 2,048개 calibration 샘플을 사용했습니다.

TL;DR

Qwen3.8-27B를 기반으로 한 mixed NVFP4/FP8 양자화 모델로, MLP와 language model head에는 NVFP4를, self-attention과 linear-attention에는 FP8을 사용합니다. Model Optimizer v0.48.0의 Local-Hessian calibration algorithm으로 2,048개 샘플을 처리해 양자화했고, vLLM 또는 SGLang에서 NVIDIA Blackwell GPU와 최대 262K 컨텍스트로 구동할 수 있습니다. NVFP4 버전은 BF16 기준 GPQA Diamond 88.92에서 88.01, Terminal-Bench 75.56에서 74.02를 기록했으며, AA-LCR과 SciCode에서는 BF16 수치를 웃돌았습니다. AI Agent, chatbot, RAG 시스템처럼 긴 문맥과 도구 호출이 필요한 배포 환경을 겨냥합니다.

핵심 포인트

  • MLP와 language model head에는 NVFP4, attention 계층에는 FP8을 배치해 계층별 혼합 정밀도를 구성했습니다.
  • Local-Hessian calibration algorithm이 2,048개 샘플을 사용해 NVFP4 계층의 양자화 보정값을 산출합니다.
  • vLLM과 SGLang에서 NVIDIA Blackwell GPU용으로 실행되며, 설정에 최대 262K 컨텍스트를 지정할 수 있습니다.
  • NVFP4 버전은 GPQA Diamond 88.01, AA-LCR 73.38, SciCode 48.41의 정확도를 기록했습니다.

제한사항

  • 인터넷에서 수집한 독성 언어와 사회적 편견이 포함된 데이터의 영향으로 유해한 표현이나 편향된 응답을 생성할 수 있습니다.
  • 질문에 대해 부정확하거나 핵심 정보가 빠진 답변, 관련 없거나 중복된 텍스트를 생성할 수 있습니다.
  • 배포 전 산업과 사용 사례에 맞춘 내부 검증 및 unit·system 수준의 반복 테스트가 필요합니다.

벤치마크

벤치마크지표비교
GPQA Diamondaccuracy88.01Qwen3.8-27B BF16 기준 88.92
Terminal-Benchaccuracy74.02Qwen3.8-27B BF16 기준 75.56
AA-LCRaccuracy73.38Qwen3.8-27B BF16 기준 72.63
MMMU-Proaccuracy74.86Qwen3.8-27B BF16 기준 75.14
SciCodeaccuracy48.41Qwen3.8-27B BF16 기준 47.93
IFBenchaccuracy78.93Qwen3.8-27B BF16 기준 80.07

74

LIKES

19.2k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.