본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

unsloth/Qwen3.6-27B-NVFP4

이미지와 텍스트를 함께 입력받아 텍스트 출력을 생성하는 image-text-to-text 멀티모달 태스크와 에이전트형 코딩 및 장문 추론을 포함한 대화형 응답 생성 작업을 수행한다. 모델은 시각 입력을 이해해 코드·문서·질문응답을 생성하거나 편집 지시를 처리하는 데 최적화되어 있다. 장문 컨텍스트를 활용한 리포지토 수준의 reasoning과 툴 호출을 포함한 에이전트 워크플로를 지원하도록 설계되었다.27B262K 컨텍스트apache-2.0

Qwen3.6-27B 기반의 Unsloth NVFP4 양자화 체크포인트로 24GB GPU에서 동작하며 NVFP4 보정과 MTP를 통해 원본 성능을 유지하면서 추론 처리량을 크게 높였다.

학습 방식 · Qwen3.6-27B를 기반으로 사전학습 후 포스트트레이닝·보정(post-training calibration)을 통해 NVFP4 양자화를 적용했으며, 보정 데이터로 Unsloth 내부 데이터와 UltraChat을 혼합해 정밀도 유지와 추론 효율을 동시에 확보했다.

TL;DR

Qwen3.6-27B NVFP4는 Qwen3.6 27B 기반의 post-trained 양자화 아티팩트로 Unsloth와 UltraChat 데이터로 보정하여 NVFP4 특유의 저비트 표현으로도 주요 벤치마크 정확도를 유지하도록 설계되었다. 이 체크포인트는 MTP 모듈을 포함해 speculative multi-token 초안 생성으로 디코딩-처리량 트레이드를 런타임에서 조정할 수 있으며, vLLM·cute-DSL·flashinfer 계열 백엔드 조합에서 최대 2.5배 수준의 처리량 향상을 보고했다. 컨텍스트 길이 262,144 토큰을 기본으로 지원하고 24GB VRAM 환경에서 동작하도록 최적화되어 있어 긴 컨텍스트와 멀티모달 에이전트 워크플로에 적용 가능하나, 최종 처리량은 백엔드와 런타임 설정에 크게 좌우된다는 제한이 있다.

핵심 포인트

  • NVFP4 양자화 아티팩트를 재보정해 다른 NVFP4 구현보다 높은 처리량을 목표로 설계했다.
  • MTP 모듈을 포함해 speculative multi-token 초안 생성으로 디코딩 트레이드오프를 런타임에서 조정할 수 있다.
  • 24GB VRAM 환경에서 동작 가능한 양자화 설정으로 범용 GPU에서 배포 가능성을 높였다.
  • 다수의 고성능 추론 백엔드(vLLM, cute-DSL, flashinfer 등)와 명시적 호환성 지침을 제공한다.

벤치마크

벤치마크지표비교
MMLU-Proaccuracy86.2
GPQA Diamondaccuracy87.8
QwenWebBench (Elo)elo1487
Terminal-Bench 2.0score59.3
Claw-Eval (pass^3)pass^360.6
RealWorldQAaccuracy84.1

이미지 분석

README에 수록된 다중 범주 벤치마크 점수들을 시각화한 그래프 이미지로, 코딩 에이전트·지식·비전 등 여러 태스크의 모델별 점수를 한눈에 보여준다.
이 이미지에는 코딩 에이전트, 지식 기반, 멀티모달 VQA 등 다양한 벤치마크에서 Qwen3.6-27B를 포함한 모델들의 상대 점수가 막대그래프로 정리되어 있다. 이미지의 시각적 요약은 표 형태의 벤치마크 수치와 일치하며 각 카테고리에서 Qwen3.6-27B가 경쟁 모델들과 근접한 성능을 기록했음을 알 수 있다. 이 그래프는 README의 상세 표와 결합해 모델의 범용적 성능 프로파일을 빠르게 파악하도록 돕는다.
Unsloth가 제시한 NVFP4 체크포인트의 처리량 비교 그래프로, 동일 하드웨어(B200 1장, 128 동시성)에서 unsloth 빌드와 NVIDIA 레퍼런스 간 토큰 처리량을 비교하고 있다.
그래프의 수치 표시에 따르면 unsloth의 NVFP4 27B 빌드는 NVIDIA 기준 레퍼런스 대비 5,637 vs 2,259로 약 2.5배의 처리량을 보고했고, 35B-A3B 계열에서는 unsloth 조합이 10,081(또는 11,628 fast) 대 NVIDIA 6,481로 1.56~1.79배 빠른 수치를 제시했다. README는 이러한 처리량 우위를 동일 양자화 계열(NVFP4) 간의 보정 적용 결과로 연결하고 있으며 특정 백엔드(cute-DSL, trtllm 등)와의 조합에서 최고 성능을 얻었다고 표기하고 있다. 이 이미지는 NVFP4 보정과 백엔드 선택이 실사용 처리량에 큰 영향을 미친다는 점을 시각적으로 입증한다.

233

LIKES

2.1M

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.