Inkling GGUF 양자화 멀티모달 모델, 975B MoE 기반
Unsloth가 배포한 Inkling GGUF 빌드는 66층 MoE 기반의 멀티모달 디코더로 이미지·오디오·텍스트 입력을 받아 텍스트 응답을 생성하도록 최적화된 양자화된 배포판이다.
TL;DR
Inkling GGUF 빌드는 66층 decoder-only Transformer와 sparse Mixture-of-Experts를 결합하여 총 975B 파라미터 중 41B만 활성화하는 희소성 기반 멀티모달 모델이다. 이미지 입력은 계층적 패치 인코더로, 오디오는 이산 토큰 인코딩으로 변환되어 텍스트와 함께 공통 히든 스페이스에서 처리되며 BF16·NVFP4와 같은 저정밀 수치 및 GGUF 양자화 빌드로 로컬 배포를 지원한다. 공개 가중치와 vLLM/SGLang/Unsloth 연동 레시피로 로컬 실험과 파인튜닝이 용이하며 문서에 보고된 벤치마크는 멀티모달·에이전트·챗 성능 계열에서 경쟁력 있는 결과를 나타낸다. 안전성 평가는 사전 수행되어 잔여 위험과 방어 심층 적용을 권고하고 있으며 고위험 도메인에서는 추가 검증과 인간 감독을 요구한다.
핵심 역량
- Inkling은 텍스트, 이미지, 오디오를 결합한 입력을 단일 디코더로 처리하여 자연어 응답을 생성할 수 있다. 입력 이미지와 영상은 계층적 패치 인코더로 임베딩되어 텍스트 컨텍스트와 결합되고 오디오 입력은 16kHz WAV 기준으로 이산 토큰으로 변환되어 동일한 히든 스페이스에서 처리된다. 이 통합 파이프라인은 시각적 맥락을 포함한 설명 생성, 이미지 기반 질의응답, 오디오 기반 요약과 같은 멀티모달 산출물을 생성하는 데 적합하다.
- 모델은 대화형 및 명령어 이행 시나리오에서 체인된 툴 호출 또는 에이전트 워크플로를 지원할 수 있다. README에서 에이전트용 및 도구 사용 시스템 통합을 염두에 둔 설계가 명시되어 있어 외부 툴 피연동 시 텍스트 기반 인터페이스로서 행동 계획과 명령어 생성을 담당할 수 있다. 이 특성은 검색 증강 생성(RAG) 파이프라인이나 도메인 특화 어시스턴트에 자연스럽게 결합될 수 있다.
- 코딩 어시스턴스와 터미널 상호작용 같은 에이전트형 코딩 작업에서도 활용 가능하다. README의 벤치마크 표는 SWEBench와 Terminal Bench 계열에서의 성능 결과를 포함하고 있어 코드 관련 에이전트 평가에서 실무적 활용성을 갖춘 편임을 시사한다. 로컬 배포와 양자화 지원 때문에 개발 환경에서 빠른 반복과 비용 절감 측면의 이점이 있다.
- 로컬/엔드포인트 배포를 염두에 둔 양자화 및 GGUF 포맷 지원으로 추론 환경의 유연성을 제공한다. BF16과 NVFP4 같은 수치 형식을 지원하며 태그와 문서에서 Unsloth의 양자화 벤치마크 링크를 안내하고 있어 다양한 하드웨어·정밀도 조합으로 배포할 수 있다. 관련 오픈 소스 런타임(vLLM, SGLang, Unsloth 등)과의 호환성이 입증되어 배포 파이프라인 통합이 용이하다.
강점
- 오픈 가중치 공개는 연구자와 개발자가 모델을 재현·미세조정·통합할 수 있는 실용적 이점을 제공한다. Apache-2.0 라이선스가 적용되어 상업적 활용 가능성이 열려 있고 로컬 배포를 위한 양자화 빌드가 함께 제공되어 실험적 배포 장벽이 낮다. 문서에 제시된 벤치마크는 멀티모달·에이전트·챗 성능 계열에서 경쟁력 있는 수치를 포함하고 있다.
- 모델 아키텍처가 MoE 기반으로 설계되어 전체 파라미터 수는 크지만 활성화된 파라미터가 상대적으로 작아 추론 시 효율성을 확보할 수 있다. README의 수치(975B/41B)는 희소성 설계로 인해 실사용 연산 비용이 밀집 모델 대비 상대적으로 낮을 가능성을 시사한다. 이 구조는 특히 대규모 용량을 유지하면서도 로컬·양자화 기반 배포에서 실용적 성능을 내고자 할 때 장점이 된다.
훈련 방식
기반 모델은 ThinkingMachines의 Inkling이며 학습에는 텍스트·이미지·오디오·비디오를 포함한 다중 모달리티 데이터가 사용되었다. 데이터 소스는 공개 소스, 제3자 제공 자료, 그리고 합성 또는 증강 데이터로 혼합되었고 전처리 단계에서 중복 제거와 필터링을 적용해 품질과 안전 기준을 향상시켰다. 문서에는 구체적 옵티마이저·스케줄·미세조정 절차는 명시되어 있지 않다.
알아두면 좋은 것
- 모델은 66층의 decoder-only Transformer 아키텍처에 sparse Mixture-of-Experts를 적용하여 총 975B 파라미터지만 활성화되는 파라미터는 41B로 보고되었다. 이 수치는 모델의 전체 용량과 실제 추론·학습 시 활성화되는 연산량이 분리되어 있음을 의미한다. 문서에는 BF16과 NVFP4 같은 수치 형식과 GGUF 양자화 빌드에 대한 참조가 포함되어 있다.
- 입력은 텍스트(UTF-8), 이미지(권장 픽셀 범위 40px~4096px), 오디오(WAV 16kHz, 권장 길이 20분 이내)를 지원하며 모든 모달리티를 공통 히든 스페이스로 투영해 디코더에서 공동 처리한다. 이미지와 영상은 계층적 패치 인코더로 인입되고 오디오는 이산 토큰 인코딩을 거쳐 텍스트와 함께 처리된다. 이 설계는 멀티모달 질의응답과 시각·청각 컨텍스트를 포함한 긴 대화에서 일관된 텍스트 생성을 가능하게 한다.
- 공개 가중치로 릴리스되어 연구와 파인튜닝, 타사 제품 통합이 가능하며 Apache-2.0 라이선스를 적용받는다. 로컬 배포와 실험을 위한 도구로 vLLM, SGLang, TokenSpeed, Unsloth, Hugging Face 연동 레시피가 문서에 연결되어 있다. 또한 Unsloth 측의 양자화 벤치마크 가이드를 통해 저정밀 빌드의 성능·메모리 절약 정보를 얻을 수 있다.
- 안전성 평가가 사전 수행되었고 일상 상호작용·유해성·모방행위 등 다각도의 테스트를 거쳐 잔여 위험이 존재하는 영역과 권장되는 방어 심층 전략(외부 필터링, Llama Guard 등)을 함께 제시하고 있다. 문서에는 모델이 폐쇄 가중치 프론티어 모델 대비 물질적 우위를 확보하지 못했다는 결론과 오픈 가중치 생태계 수준의 잔여 위험이 있음을 명시하고 있다. 고위험 도메인에서는 추가 검증과 인간 감독을 권고하고 있다.
기술적 특징
- 아키텍처는 66층의 decoder-only Transformer에 sparse Mixture-of-Experts(FEED-FORWARD) 백본을 결합한 형태이다. 각 토큰은 256개의 전문가 중 6개로 라우팅되며 토큰당 2개의 공유 전문가가 항상 활성화되어 희소성을 통해 연산량을 줄이는 동시에 대규모 파라미터 공간을 활용한다. 이 설계는 표현력과 효율성을 동시에 확보하려는 목적에서 채택되었다.
- 어텐션 구조는 로컬과 글로벌 레이어를 혼합한 하이브리드 방식을 사용해 긴 컨텍스트와 국부적 세부를 병행 처리한다. 이 접근법은 대화형 문맥 유지와 이미지·오디오에서의 지역 특징 포착 모두에 유리하며 긴 대화에서 성능 저하를 줄이기 위한 설계 선택으로 이해된다. 하이브리드 어텐션은 계산 복잡도와 맥락 길이 간 균형을 맞추는 수단이다.
- 이미지와 영상 입력은 계층적 패치 인코더로 인코딩되어 여러 해상도 수준의 패치를 단계적으로 잠재 공간으로 압축한다. 오디오 입력은 16kHz WAV를 이산 토큰으로 변환한 뒤 동일한 디코더 히든 스페이스로 투영되어 텍스트 컨텍스트와 결합된다. 이 멀티모달 임베딩 합치는 방식은 시각·청각 정보를 텍스트 생성으로 직접 연결하는 데 핵심적 역할을 한다.
- 수치 연산은 BF16과 NVFP4를 지원하며 README와 태그에서는 GGUF 양자화 빌드와 관련 벤치마크 문서를 참조하고 있다. NVFP4나 저정밀 양자화는 로컬 배포에서 메모리와 I/O를 줄여 추론 비용을 낮추는 효과가 있고 GGUF 포맷은 이러한 양자화된 가중치의 배포와 로딩을 단순화한다. 문서는 Unsloth의 양자화 벤치마크 가이드를 통해 다양한 정밀도 조합의 성능·메모리 특성을 제공한다.
- 배포 호환성 측면에서는 vLLM, SGLang, TokenSpeed, Unsloth와 같은 오픈소스 런타임과의 연동 레시피가 제공되어 로컬·서버·엔드포인트 환경에서의 통합이 용이하다. 이러한 런타임은 양자화된 GGUF 파일을 로드하고 실시간 추론 파이프라인에 결합하는 용도로 쓰이기 때문에 실무적 배포 흐름을 단축한다. README는 또한 Unsloth Studio에서의 실시간 데모와 설정 토글 예시를 링크로 연결하고 있다.
차별점
- Inkling은 975B라는 거대한 전체 파라미터 수와 토큰당 41B 활성 파라미터를 병행 보고하여 MoE 기반의 희소성 설계로 대규모 용량과 실사용 효율을 동시에 추구한다.
- 이미지·영상은 계층적 패치 인코더로, 오디오는 이산 토큰 인코딩으로 처리하여 멀티모달 입력을 동일한 디코더 히든 스페이스로 일관되게 투영하는 네이티브 멀티모달 설계를 채택하고 있다.
- 공개 가중치와 GGUF 양자화 빌드를 함께 제공하여 연구자와 엔지니어가 로컬 환경에서 저정밀 빌드를 바로 실험·배포할 수 있도록 배포 편의성을 높였다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| AIME 2026 | score | 97.1% | — |
| GPQA Diamond | score | 87.9% | — |
| SWEBench Verified | score | 77.6% | — |
| IFBench | score | 79.8% | — |
| Global-MMLU-Lite | score | 88.7% | — |
이미지 분석

120
Likes
7.4k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.