thinkingmachines/Inkling-Small
텍스트·이미지·오디오를 입력받는 경량 에이전틱 멀티모달 언어모델276B-A12Bapache-2.0
276B 중 12B만 활성화하면서 SWEBench에서 동급 최고 점수를 낸 경량 멀티모달 모델
학습 방식 · 42층 디코더에 256개 전문가 중 6개와 공유 전문가 2개를 라우팅하는 MoE 백본으로, 이미지는 계층적 패치 인코더, 오디오는 discrete 토큰 인코더로 통합해 학습했다.
TL;DR
Inkling-Small은 42층 디코더에 256개 전문가 중 6개와 공유 전문가 2개를 라우팅하는 MoE로, 형제 모델 Inkling(975B-A41B)을 276B 총 파라미터·12B 활성으로 축소하면서도 이미지·오디오 입력을 그대로 지원하는 네이티브 멀티모달 모델이다. SWEBench Verified 80.2%로 Qwen3.5-397B-A17B(76.4%)·Nemotron 3 Ultra(70.7%) 등 비교 오픈 웨이트 모델 중 최고 점수를 기록해, 활성 파라미터가 훨씬 적은데도 코딩 에이전트 성능에서 앞선다. SGLang·vLLM·Unsloth·TokenSpeed 등 주요 로컬 서빙 엔진을 출시일부터 지원해 온프레미스 배치에 적합하다. 다만 환각이나 긴 멀티턴 대화에서의 성능 저하 같은 파운데이션 모델 공통 한계가 있어 고위험 도메인에는 추가 검증이 필요하다.
핵심 포인트
- 276B 중 12B만 활성화하는 경량 MoE로 형제 모델 Inkling(975B-A41B)의 축소판이다.
- SWEBench Verified 80.2%로 Qwen3.5-397B-A17B(76.4%)를 비롯한 비교 오픈 웨이트 모델 중 최고 점수를 냈다.
- 이미지·오디오를 함께 받는 멀티모달 입력을 지원하면서도 활성 파라미터가 적어 서빙 비용이 낮다.
- SGLang·vLLM·Unsloth·TokenSpeed 등 주요 로컬 서빙 엔진을 출시일부터 지원한다.
제한사항
- 환각, 지시 불일치, 긴 멀티턴 대화에서의 성능 저하 등 파운데이션 모델 공통 한계를 갖는다.
- 훈련 데이터 컷오프 이후의 사건은 반영하지 못한다.
- 의료·법률 등 고위험 도메인에는 추가 검증 없이 배포하지 말 것을 권고한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWEBench Verified | pass@1 | 80.2% | Qwen3.5-397B-A17B 76.4%, Nemotron 3 Ultra 70.7% |
| AA Index(v4.1) | index | 40.0% | DeepSeek V4 Flash와 동률 40.0, 형제 모델 Inkling 41.0 |
348
LIKES
32.8k
DOWNLOADS
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.