본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/Qwen3.8-Flash-Next-NVFP4

텍스트·이미지·비디오를 입력받아 텍스트를 생성하는 멀티모달 대화 및 추론총 125B, 활성 6B, n-gram embedding 51B, MTP 4B기본 262K, 최대 1,000,000토큰으로 확장 가능 컨텍스트nvidia-open-model-license

MoE 전문가층을 NVFP4로 양자화한 Qwen3.8-Flash-Next 배포용 체크포인트

학습 방식 · Qwen/Qwen3.8-Flash-Next 기반 Model Optimizer v0.46.0 양자화로, routed MoE expert linear layer는 W4A4 NVFP4와 MSE 보정 weight scale을 적용하고 MTP routed expert·PLE n-gram embedding은 FP8, attention과 shared expert 등은 BF16으로 유지했으며 Fine-tuning은 수행하지 않았습니다.

TL;DR

nvidia/Qwen3.8-Flash-Next-NVFP4는 Qwen/Qwen3.8-Flash-Next를 NVIDIA Model Optimizer로 양자화한 혼합 정밀도 모델이다. 주요 언어 모델의 routed MoE expert linear layer에는 W4A4 NVFP4를 적용하고, attention·shared expert 등은 BF16으로 유지하며 MTP routed expert와 PLE n-gram embedding에는 FP8을 사용한다. 이 구성으로 BF16 원본보다 디스크 크기를 약 2.7배 줄여 약 63% 절감하고, 텍스트·이미지·비디오 입력과 최대 262K 컨텍스트를 처리한다. vLLM과 NVIDIA Blackwell B200·B300 환경에서 AI Agent, 챗봇, RAG 시스템 배포를 겨냥한다.

핵심 포인트

  • MoE 전문가층에 W4A4 NVFP4를 적용하고 핵심 attention 층은 BF16으로 남긴 혼합 정밀도 체크포인트입니다.
  • BF16 원본 대비 디스크 크기를 약 2.7배 줄여 약 63% 절감하며, 양자화 뒤에도 FP8 기준 성능을 함께 측정했습니다.
  • 텍스트·이미지·비디오 입력과 기본 262K, 확장 시 최대 1,000,000토큰 컨텍스트를 처리합니다.
  • vLLM과 Blackwell B200·B300에서 AI Agent, 챗봇, RAG 시스템 배포를 겨냥합니다.

제한사항

  • 인터넷에서 수집한 독성 언어와 사회적 편향을 포함한 데이터로 학습해 유해하거나 편향된 응답을 생성할 수 있습니다.
  • 응답에 부정확한 내용, 핵심 정보 누락, 불필요하거나 반복적인 문장이 포함될 수 있습니다.
  • 배포 전 사용 사례별 데이터로 안전성·품질·보안 검증이 필요하며, 입력 이미지와 비디오의 권리 및 개인정보 처리를 별도로 확인해야 합니다.

벤치마크

벤치마크지표비교
GPQA DiamondaccuracyFP8 92.0, NVFP4 91.5Qwen3.8-Flash-Next-FP8 기준과 동일 조건 비교
HLEaccuracyFP8 34.7, NVFP4 35.4Qwen3.8-Flash-Next-FP8 기준과 동일 조건 비교
τ²-Bench TelecomaccuracyFP8 90.8, NVFP4 90.1Qwen3.8-Flash-Next-FP8 기준과 동일 조건 비교
MMMU ProaccuracyFP8 77.1, NVFP4 78.3Qwen3.8-Flash-Next-FP8 기준과 동일 조건 비교
SciCodeaccuracyFP8 16.3, NVFP4 18.8Qwen3.8-Flash-Next-FP8 기준과 동일 조건 비교
AA-LCRaccuracyFP8 71.9, NVFP4 74.1Qwen3.8-Flash-Next-FP8 기준과 동일 조건 비교
IFBenchaccuracyFP8 80.5, NVFP4 81.0Qwen3.8-Flash-Next-FP8 기준과 동일 조건 비교
OmniscienceaccuracyFP8 28.1, NVFP4 27.6Qwen3.8-Flash-Next-FP8 기준과 동일 조건 비교
Terminal-Bench 2.1accuracyFP8 83.3, NVFP4 82.9Qwen3.8-Flash-Next-FP8 기준과 동일 조건 비교

92

LIKES

1.1k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.