본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

thinkingmachines/Inkling-Small

텍스트·이미지·오디오를 입력받는 경량 에이전틱 멀티모달 언어모델276B-A12Bapache-2.0

276B 중 12B만 활성화하면서 SWEBench에서 동급 최고 점수를 낸 경량 멀티모달 모델

학습 방식 · 42층 디코더에 256개 전문가 중 6개와 공유 전문가 2개를 라우팅하는 MoE 백본으로, 이미지는 계층적 패치 인코더, 오디오는 discrete 토큰 인코더로 통합해 학습했다.

TL;DR

Inkling-Small은 42층 디코더에 256개 전문가 중 6개와 공유 전문가 2개를 라우팅하는 MoE로, 형제 모델 Inkling(975B-A41B)을 276B 총 파라미터·12B 활성으로 축소하면서도 이미지·오디오 입력을 그대로 지원하는 네이티브 멀티모달 모델이다. SWEBench Verified 80.2%로 Qwen3.5-397B-A17B(76.4%)·Nemotron 3 Ultra(70.7%) 등 비교 오픈 웨이트 모델 중 최고 점수를 기록해, 활성 파라미터가 훨씬 적은데도 코딩 에이전트 성능에서 앞선다. SGLang·vLLM·Unsloth·TokenSpeed 등 주요 로컬 서빙 엔진을 출시일부터 지원해 온프레미스 배치에 적합하다. 다만 환각이나 긴 멀티턴 대화에서의 성능 저하 같은 파운데이션 모델 공통 한계가 있어 고위험 도메인에는 추가 검증이 필요하다.

핵심 포인트

  • 276B 중 12B만 활성화하는 경량 MoE로 형제 모델 Inkling(975B-A41B)의 축소판이다.
  • SWEBench Verified 80.2%로 Qwen3.5-397B-A17B(76.4%)를 비롯한 비교 오픈 웨이트 모델 중 최고 점수를 냈다.
  • 이미지·오디오를 함께 받는 멀티모달 입력을 지원하면서도 활성 파라미터가 적어 서빙 비용이 낮다.
  • SGLang·vLLM·Unsloth·TokenSpeed 등 주요 로컬 서빙 엔진을 출시일부터 지원한다.

제한사항

  • 환각, 지시 불일치, 긴 멀티턴 대화에서의 성능 저하 등 파운데이션 모델 공통 한계를 갖는다.
  • 훈련 데이터 컷오프 이후의 사건은 반영하지 못한다.
  • 의료·법률 등 고위험 도메인에는 추가 검증 없이 배포하지 말 것을 권고한다.

벤치마크

벤치마크지표비교
SWEBench Verifiedpass@180.2%Qwen3.5-397B-A17B 76.4%, Nemotron 3 Ultra 70.7%
AA Index(v4.1)index40.0%DeepSeek V4 Flash와 동률 40.0, 형제 모델 Inkling 41.0

348

LIKES

32.8k

DOWNLOADS

2 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.