dots-studio/dots3-note-prev
텍스트·이미지·비디오·오디오를 입력받아 텍스트를 생성하는 멀티모달 장문맥 및 에이전트 작업총 280B, 활성 16B; Vision Encoder 총 7B·활성 1.2B; Audio Encoder 800M512K 컨텍스트apache-2.0
280B 중 16B만 활성화해 512K 문맥과 멀티모달 입력을 처리하는 MoE 모델
TL;DR
dots3-note Preview는 별도 Fine-tune·LoRA·양자화 파생 모델이 아니라 dots3 제품군의 첫 오픈 웨이트 멀티모달 Mixture-of-Experts 모델이다. 총 280B 파라미터 중 토큰마다 16B를 활성화하고 텍스트·이미지·비디오·오디오를 받아 텍스트를 생성하며, 512K 토큰 문맥을 처리한다. 256개 routed expert 중 top-8을 선택하는 MoE, DSA와 SWA를 섞은 Attention, 7B Vision Encoder와 800M Audio Encoder를 결합해 장문서·차트·음성·영상·에이전트 작업을 한 모델에 묶었다. 공개 평가에서 DeepSearchQA 92.1, IFEval 93.9, LiveCodeBench v6 91.5, VideoMMMU 86.8을 기록했지만, 실제 운용에는 FP8 기준 8-GPU 노드와 최신 vLLM·SGLang·Transformers 지원 버전이 필요하다.
핵심 포인트
- dots3-note Preview는 총 280B 중 16B만 활성화하는 Mixture-of-Experts 구조로 추론 비용과 모델 용량 사이의 균형을 맞춘다. 256개 routed expert와 1개 shared expert 중 top-8을 선택해 토큰별 계산량을 제한한다. 이 모델은 dots3 제품군의 첫 오픈 웨이트이자 가장 가벼운 구성이다.
- 텍스트뿐 아니라 이미지·비디오·오디오를 함께 처리하고 결과는 텍스트로 생성한다. Vision Encoder는 총 7B·활성 1.2B MoE이며 Audio Encoder는 800M dense 구조다. 문서·차트·음성·영상 이해와 장문맥 정보 처리를 하나의 모델에서 수행한다.
- 최대 512K 토큰 문맥과 13개 DSA·33개 SWA Attention 구성을 사용한다. DSA는 top-2048 선택을 적용하고 MTP에는 1.13B 규모의 shared layer 1개를 둔다. 긴 대화, 탐색형 에이전트, 메모리 업데이트와 다단계 도구 사용에 맞춘 설계다.
- FP8 체크포인트는 한 노드의 8개 GPU에서 SGLang 또는 vLLM으로 제공하는 방식이 권장된다. vLLM에서는 Tensor Parallel 8과 Expert Parallel 8 설정을 사용하며 SGLang의 MTP/NEXTN은 TPOT를 50% 이상 줄일 수 있다고 README에 기재됐다. 직접 실행하려면 Transformers PR revision이나 최신 vLLM main 등 버전 조건을 확인해야 한다.
제한사항
- Preview 모델이라 Transformers와 SGLang 지원이 README 기준으로 아직 PR 검토 단계이며, vLLM도 안정 릴리스보다 최신 nightly 또는 main 사용이 요구된다.
- BF16 실행은 더 많은 메모리가 필요하고, 권장되는 FP8 제공에도 한 노드의 8개 GPU 구성이 필요하다.
- 512K 문맥 길이는 지원되지만 실제 설정은 메모리, 동시성, 입력 모달리티에 맞춰 조정해야 하며 SGLang에서는 prefill CUDA graph가 아직 지원되지 않는다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| IMOAnswerBench | score | 90.9 | dots3-note Preview 열의 공개 수치 |
| Codeforces | rating | 3056 | dots3-note Preview 열의 공개 수치 |
| LiveCodeBench v6 | score | 91.5 | dots3-note Preview 열의 공개 수치 |
| ARC-AGI-2 | score | 81.4 | dots3-note Preview 열의 공개 수치 |
| IFEval | score | 93.9 | dots3-note Preview 열의 공개 수치 |
| ClawEval(Pass^3) | score | 73.4 | dots3-note Preview 열의 공개 수치 |
| WildClawBench | score | 61.7 | dots3-note Preview 열의 공개 수치 |
| Terminal-Bench 2.1 | score | 75.1 | dots3-note Preview 열의 공개 수치 |
| SWE-bench-pro | score | 61.0 | dots3-note Preview 열의 공개 수치 |
| BrowseComp w/ CM | score | 83.3 | dots3-note Preview 열의 공개 수치 |
| DeepSearchQA | score | 92.1 | dots3-note Preview 열의 공개 수치 |
| VibeSearchBench | score | 25.7 | dots3-note Preview 열의 공개 수치 |
| WorldVQA | score | 42.7 | dots3-note Preview 열의 공개 수치 |
| CharxivReasoning | score | 83.1 | dots3-note Preview 열의 공개 수치 |
| PerceptionBench | score | 53.4 | dots3-note Preview 열의 공개 수치 |
| MMMU-PRO | score | 69.8 | dots3-note Preview 열의 공개 수치 |
| VideoMMMU | score | 86.8 | dots3-note Preview 열의 공개 수치 |
| VoiceBench | score | 92.4 | dots3-note Preview 열의 공개 수치 |
| AudioMC | score | 46.9 | dots3-note Preview 열의 공개 수치 |
이미지 분석




135
Likes
11
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.