멀티모달 Inkling의 GGUF 양자화 빌드
이미지와 오디오를 포함한 멀티모달 입력을 받아 텍스트 응답을 생성하는 image-text-to-text 대화형 모델로 설계되어 있다. 텍스트·이미지·오디오를 공통 히든 공간으로 투사하고 디코더에서 공동 처리하는 멀티모달 autoregressive Transformer 방식으로 동작한다. 에이전트, 도구 사용, 코드 보조, 검색결합생성(RAG) 등의 애플리케이션에서 입력 멀티모달 컨텍스트를 텍스트 출력으로 연결하는 용도로 적합하다.276B total, 12B activeapache-2.0
ThinkingMachines Inkling‑Small을 Unsloth가 GGUF로 양자화해 로컬 배포 친화적으로 제공
TL;DR
Inkling‑Small의 Unsloth GGUF 빌드는 ThinkingMachines의 42-layer decoder-only 멀티모달 모델을 GGUF 양자화로 제공해 로컬·클라우드 배포 시 파일 크기와 메모리 요구를 절감하는 실용적 옵션을 제시합니다. 아키텍처는 sparse MoE(Fed‑forward)와 하이브리드 어텐션을 결합하여 전체 파라미터는 276B이지만 활성화 파라미터는 12B로 관리되며 이미지와 오디오를 공통 히든 공간으로 투사해 디코더에서 공동 처리합니다. 다양한 런타임(vLLM, TokenSpeed, SGLang, Unsloth)과 BF16/NVFP4/양자화 옵션을 지원하며 AIME·IFBench·VoiceBench 등에서 경쟁력 있는 성능을 보입니다.
핵심 역량
- 멀티모달 이해와 텍스트 생성 기능을 제공하며 텍스트·이미지·오디오 입력을 받아 자연어 응답을 생성한다. 이미지 입력은 계층적 패치 인코더로 임베딩되어 텍스트 토큰과 같은 히든 공간으로 투사되고, 오디오는 이산 토큰화로 처리되어 디코더에서 함께 예측된다. 멀티턴 대화나 설명문 생성, 이미지 기반 질의응답 시 입력 간 상호참조를 유지한 채 출력이 생성되는 구조다.
- 에이전트형 워크플로우와 도구 연동에 적합하도록 설계되어 있으며, API·플레이그라운드·로컬 런타임(vLLM, Unsloth 등)에서 실행할 수 있다. 모델 내부는 디코더 전용 Transformer에 MoE(feed-forward) 백본을 적용해 대형 파라미터 풀의 표현력을 확보하면서 활성화 파라미터만으로 추론 비용을 관리한다. 따라서 도구 호출·코드 생성·지시 이행 같은 에이전트 작업에서 컨텍스트 용량을 활용해 복합 행동을 출력할 수 있다.
- 로컬 배포와 저비용 추론을 고려한 GGUF 양자화 빌드가 제공되어 실환경에서 파일 크기와 메모리 사용을 절감할 수 있다. Unsloth의 Dynamic GGUF 레시피(예: UD-IQ1_S 1-bit)가 README에 언급되어 있으며, BF16·NVFP4 등 다양한 숫자 형식도 지원된다. 이로 인해 개발자는 vLLM·TokenSpeed·SGLang·Unsloth 같은 런타임에서 양자화된 모델을 선택해 비용·지연을 낮춘 상태로 멀티모달 서비스를 운영할 수 있다.
강점
- 수학·추론 벤치마크에서 경쟁력 있는 성능을 보이며 AIME 2026에서 95.5%를 기록했다. 높은 AIME 점수는 정형화된 수리·추론 문제를 디코더 기반의 멀티모달 컨텍스트와 결합해 해결할 수 있음을 시사한다. 이런 특성은 복합 질의에 대해 단계적 해법을 생성하는 애플리케이션에 유리하다.
- 코딩·에이전트 검증 지표에서 실전 활용성이 높게 나타나며 IFBench 82.2%와 SWEBench Verified 80.2% 점수를 확보했다. 해당 점수들은 도구 연동·코드 생성 시 문맥 이해와 행동 계획을 출력하는 능력이 실용적임을 의미한다. 따라서 에이전트형 워크플로우나 자동화된 도구 호출 시 응답 품질이 비교적 안정적이다.
- 멀티모달 비전·오디오 테스트에서도 유의미한 성능을 보여 MMMU Pro 74.0% 및 VoiceBench 90.1% 같은 점수를 얻었다. 이미지와 음성 입력을 텍스트로 변환해 응답을 생성하는 파이프라인이 실제 활용 가능한 수준으로 구현되어 있다. 멀티모달 QA·콜센터 음성요약·이미지 기반 설명 생성 등에서 적용 가능성이 높다.
훈련 방식
공개·서드파티·합성 데이터를 혼합해 대규모 멀티모달 코퍼스를 사용해 학습했으며 데이터 전처리에는 중복 제거와 필터링이 포함되어 있다. 모델은 멀티모달 토큰을 공통 히든 공간으로 투사하는 방식과 sparse MoE 구조를 결합해 대규모 파라미터를 실용적인 활성화 파라미터로 압축하는 학습 전략을 적용했다. 구체적 학습 알고리즘(예: SFT, RLHF 등) 상세는 README에 명시되지 않아 공개된 정보 중심으로만 기술된다.
알아두면 좋은 것
- Unsloth 배포판으로 Inkling-Small을 GGUF 포맷에서 실행할 수 있으며, README는 Unsloth Studio와 연동한 실행 가이드와 토글형 Thinking 옵션을 제공한다. 문서와 레시피는 vLLM, TokenSpeed, SGLang 같은 오픈소스 런타임을 포함해 로컬·클라우드 환경에서의 배포 절차를 다루고 있다. 예시로 1-bit UD-IQ1_S GGUF가 데모로 제시되어 양자화 성능 비교 지표를 살펴볼 수 있다.
- 모델 아키텍처 핵심으로 42-layer decoder-only Transformer와 sparse MoE FFN을 채택했으며, 토큰당 6개의 선택적 전문가와 2개의 공유 전문가가 활성화되는 라우팅을 사용한다. 어텐션은 로컬 레이어와 글로벌 레이어를 혼합하여 긴 맥락과 지역적 세부를 동시에 처리할 수 있도록 설계되어 있다. 입력 처리 파이프라인은 이미지의 계층적 패치 인코딩과 오디오의 이산 토큰화를 통해 모든 모달리티를 공통 히든 공간에 결합한다.
- 오픈 웨이트로 연구·파인튜닝·서드파티 통합을 지원하며 Apache-2.0 라이선스로 배포된다. ThinkingMachines의 Inkling-Small을 기반으로 하되 Unsloth의 GGUF 빌드가 제공되어 실무 적용에서 양자화된 선택지가 존재한다. Tinker Playground·Tinker Cookbook 등 외부 도구와 연동되는 시연/검증 경로가 README에 연결되어 있어 실험 재현성이 확보되어 있다.
기술적 특징
- 42-layer decoder-only Transformer를 기반으로 하며 FFN은 sparse MoE 아키텍처로 구성되어 토큰당 일부 전문가만 활성화하도록 라우팅한다. 활성화 파라미터는 약 12B로 유지되며 전체 파라미터 풀은 276B에 달해 표현력과 추론 비용을 분리하는 설계를 채택했다. 이 구조는 대형 모델의 표현 능력을 유지하면서 로컬·클라우드 추론에서 메모리 부담을 줄이는 데 목적을 둔다.
- 어텐션은 로컬 레이어와 글로벌 레이어를 혼합한 하이브리드 방식으로, 장문 컨텍스트의 전역 정보와 지역적 세부 정보를 동시에 취급할 수 있도록 구성되어 있다. 이미지 입력은 계층적 패치 인코더를 통해 다양한 해상도에서 특징을 추출하고 오디오는 이산 토큰화로 변환해 텍스트 토큰과 공동으로 디코더에 공급된다. 모든 모달리티는 공통 히든 공간으로 투사되어 디코더 단계에서 통합적으로 처리된다.
- 숫자 형식은 BF16과 NVFP4를 지원하며 README에서 Unsloth Dynamic GGUF 양자화(예: UD-IQ1_S 1-bit) 역량을 별도로 제시하고 있다. 이로 인해 사용자는 런타임 요구에 따라 BF16 원본이나 NVFP4/양자화된 GGUF 빌드를 선택할 수 있다. 다양한 런타임(vLLM, TokenSpeed, SGLang, Unsloth)과의 호환성도 명세되어 있어 배포 유연성이 확보된다.
차별점
- MoE 기반의 대규모 파라미터 풀(276B)과 제한된 활성화 파라미터(12B)를 결합해 표현력과 추론 비용 간 균형을 맞춘 점이 핵심 차별화 요소다. 토큰당 6개 전문가 + 2개 공유 전문가 라우팅 설계가 활성화 비용을 제어하면서도 풍부한 표현을 유지하게 한다. 이 설계는 로컬 또는 비용 민감한 환경에서 고성능 멀티모달 처리를 가능하게 한다.
- 오픈 웨이트로서 ThinkingMachines의 Inkling-Small을 기반으로 하되 Unsloth가 GGUF 양자화 빌드를 제공해 실무 배포 경로를 단축한 점이 또 다른 차별점이다. README에 vLLM·TokenSpeed·SGLang 등 여러 레시피가 연결되어 있어 다양한 런타임에서 즉시 검증이 가능하다. 또한 BF16·NVFP4와 GGUF 옵션을 병행 제공해 배포 시 정밀도·속도·메모리 트레이드오프 선택지가 넓다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| AIME 2026 | score | 95.5% | — |
| IFBench | score | 82.2% | — |
| SWEBench Verified | score | 80.2% | — |
| Global-MMLU-Lite | score | 86.7% | — |
이미지 분석


64
Likes
12.7k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.