thinkingmachines/Inkling-NVFP4
Inkling은 66층의 MoE 디코더 구조와 계층적 패치 인코더 및 이산 오디오 토큰화를 결합해 텍스트·이미지·오디오 입력을 하나의 디코더에서 공동 처리하여 텍스트 출력을 생성하는 범용 멀티모달 모델이다. 이 모델은 총 975B 파라미터 중 약 41B만을 활성화해 효율을 도모하며 BF16과 NVFP4를 지원한다. 공개 가중치로 제공되어 로컬 배포와 추가 미세조정이 가능하다.
학습 방식 · 기본적으로 공개 인터넷, 제3자 제공 데이터, 합성 및 증강 데이터를 혼합해 멀티모달 코퍼스를 구성하고 텍스트·이미지·오디오·비디오를 함께 사용해 자가회귀 방식으로 학습시켰다. 데이터 파이프라인에서 중복 제거, 필터링, 품질 개선과 같은 전처리 단계가 적용되어 노이즈와 저품질 샘플을 줄였다. 이 접근은 대화형·에이전트·멀티모달 생성 능력을 균형 있게 확보하려는 목적이었다.
TL;DR
Inkling은 66층 디코더형 Transformer에 희소 MoE 백본을 결합해 텍스트·이미지·오디오를 공통 히든 공간에서 함께 처리하는 범용 멀티모달 모델이다. 총 975B 파라미터 중 토큰당 약 41B만 활성화하는 라우팅 구성(256 experts, 토큰당 6개 + 2개 공유)을 통해 용량과 연산 효율을 동시에 확보하며 BF16과 NVFP4를 지원해 하드웨어별 배포 유연성을 제공한다. README에 제시된 다중 벤치마크에서 AIME 2026 97.1%, GPQA Diamond 87.2% 등 멀티모달·에이전트 벤치에서 경쟁력 있는 결과를 보였으나 홀로신화(hallucination)와 다중턴 장기 대화에서의 성능 저하 같은 일반적 한계는 남아 있어 실제 배포 시 추가 검증과 외부 필터링 계층을 권장한다.
핵심 포인트
- 토큰당 활성 파라미터를 41B 수준으로 제한하는 975B 총규모의 MoE 설계로 용량과 효율을 동시에 제공한다.
- 이미지용 계층적 패치 인코더와 이산 오디오 토큰화를 통해 텍스트 디코더와의 공동 처리를 네이티브로 지원한다.
- BF16과 NVFP4 두 가지 수치 형식을 지원해 다양한 하드웨어 환경에서 성능·메모리 균형을 조정할 수 있다.
- 멀티모달 입력을 네이티브로 통합하는 아키텍처로 이미지·비디오·오디오를 동일한 디코더 컨텍스트에서 처리할 수 있는 점이 강점이다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| HLE (text only) | accuracy | 29.7% | vs GPT 5.6 Sol: 47.2% |
| AIME 2026 | score | 97.1% | vs GPT 5.6 Sol: 99.9% |
| GPQA Diamond | accuracy | 87.2% | vs Gemini 3.1 Pro: 94.1% |
| SWEBench Verified | accuracy | 77.6% | vs Nemotron 3 Ultra: 70.7% |
| IFBench | score | 79.8% | vs Nemotron 3 Ultra: 81.4% |
| VoiceBench | accuracy | 91.4% | vs Gemini 3.1 Pro: 94.3% |
73
LIKES
76k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.