본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

RadixArk/Qwen3.8-Flash-Next-NVFP4

텍스트·이미지·영상 입력 기반 멀티모달 텍스트 생성약 180B최대 262K 컨텍스트other

routed expert만 NVFP4로 양자화해 360GB 모델을 135GB로 줄인 멀티모달 MoE

학습 방식 · Qwen3.8-Flash-Next에 NVIDIA Model Optimizer v0.46.0의 NVFP4 W4A4 post-training quantization을 적용했으며, 48개 MoE 계층의 routed expert 활성값 보정에 cnn_dailymail 128개 기사를 사용했습니다.

TL;DR

이 모델은 Qwen3.8-Flash-Next를 기반으로 NVIDIA Model Optimizer의 NVFP4 W4A4 방식으로 양자화한 멀티모달 MoE 체크포인트입니다. 48개 MoE 계층의 routed expert만 4비트 가중치·4비트 활성값으로 변환하고, Attention·GDN·공유 expert·Vision 계층 등은 BF16으로 유지합니다. 그 결과 원본 360GB에서 135GB로 크기를 줄였으며, SGLang과 NVIDIA Blackwell에서 최대 262K 컨텍스트로 구동하도록 구성됐습니다. GSM8K 97.27, AIME26 pass@1 98.75를 기록했지만 긴 agentic 생성은 BF16보다 길어지는 경향이 있습니다.

핵심 포인트

  • routed expert에만 NVFP4 W4A4를 적용하고 Attention과 Vision 계층은 BF16으로 보존합니다.
  • FP4 양자화로 체크포인트 크기를 360GB에서 135GB로 줄여 Blackwell 추론 배포 부담을 낮춥니다.
  • SGLang의 qwen4_exp 지원 빌드와 NVIDIA Blackwell에서 최대 262K 컨텍스트를 처리합니다.
  • GSM8K 97.27과 AIME26 pass@1 98.75로 단일 턴 추론 정확도를 유지합니다.

제한사항

  • 긴 agentic 생성에서는 BF16보다 출력이 길어지는 경향이 있어 장시간 작업의 처리량과 메모리 사용량을 별도로 확인해야 합니다.
  • BF16 비교값은 동일 계열의 이전 revision에서 얻은 수치이고 현재 체크포인트와의 weight 차이가 확정되지 않아 정확한 동등 비교로 사용할 수 없습니다.
  • 기반 모델의 인터넷 수집 데이터에 독성 언어와 사회적 편향이 포함되어 있어 유해하거나 부정확하고 중복적인 응답이 나올 수 있습니다.

벤치마크

벤치마크지표비교
GSM8K평가 점수97.27이 체크포인트 측정값이며, 이전 revision의 BF16 참고 범위 97.12–97.50과 비교할 때 revision 차이를 고려해야 합니다.
AIME26pass@198.75이전 revision 체크포인트 측정값이며, BF16 참고값 100과의 비교는 PLE embedding tables 변경 때문에 지표상 참고용입니다.

69

LIKES

109k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.