thinkingmachines/Inkling
975B 중 41B만 활성화하는 네이티브 멀티모달 에이전틱 언어모델
학습 방식 · 66층 디코더에 256개 전문가 중 6개와 공유 전문가 2개를 라우팅하는 MoE 백본으로, 이미지·비디오는 계층적 패치 인코더, 오디오는 discrete 토큰 인코더로 통합해 학습했다.
TL;DR
Inkling은 66층 디코더에 256개 전문가 중 6개와 공유 전문가 2개를 라우팅하는 MoE 백본으로, 이미지·비디오는 계층적 패치 인코더, 오디오는 discrete 토큰 인코더로 통합해 텍스트·이미지·오디오를 함께 처리하는 975B급(41B 활성) 네이티브 멀티모달 모델이다. 로컬·전역 어텐션을 섞은 하이브리드 구조로 코딩 에이전트·툴 사용·RAG 등 다양한 애플리케이션에 쓰도록 설계됐으며, AIME 2026 97.1%·MCP Atlas 74.1%로 Nemotron 3 Ultra·Kimi K2.5를 앞서지만, SWEBench Verified 77.6%는 Kimi K2.6(80.2%)에, Terminal Bench 2.1 63.8은 GLM 5.2(82.7)에 못 미친다. 출시 전 사이버·CBRN 위험, 기만·사보타주 가능성을 프런티어 모델과 비교 평가해 오픈 웨이트 생태계에서 이미 존재하는 위험을 넘어서지 않는다고 결론 내렸다. 다만 환각이나 긴 멀티턴 대화에서의 성능 저하 같은 파운데이션 모델 공통 한계가 있어 고위험 도메인에는 추가 검증과 인간 감독이 필요하다.
핵심 포인트
- 975B 중 41B만 활성화하는 MoE로 텍스트·이미지·오디오를 하나의 디코더에서 함께 처리하는 네이티브 멀티모달 모델이다.
- 로컬·전역 어텐션을 섞은 하이브리드 어텐션을 쓰고, 매 토큰에 항상 켜지는 공유 전문가 2개를 함께 둔다.
- 코딩 에이전트 벤치마크에서 Nemotron 3 Ultra·Kimi K2.5는 앞서지만 Kimi K2.6·GLM 5.2에는 뒤진다.
- 사이버·CBRN·기만·사보타주를 평가해 오픈 웨이트 생태계에 이미 있는 위험을 넘지 않는다고 결론 내렸다.
제한사항
- 환각(사실과 다른 그럴듯한 내용 생성), 지시 불일치, 긴 멀티턴 대화에서의 성능 저하 등 파운데이션 모델 공통 한계를 갖는다.
- 훈련 데이터 컷오프 이후의 사건은 반영하지 못한다.
- 의료·법률 등 고위험 도메인에는 추가 파인튜닝과 인간 검토 없이 배포하지 말 것을 권고한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SWEBench Verified | pass@1 | 77.6% | Nemotron 3 Ultra 70.7%, Kimi K2.6 80.2% |
| Terminal Bench 2.1(Best Harness) | score | 63.8 | GLM 5.2 82.7, Claude Fable 5 84.6 |
| AIME 2026 | accuracy | 97.1% | — |
| MCP Atlas | accuracy | 74.1% | — |
1.7k
LIKES
65k
DOWNLOADS
3 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.