멀티모달 MoE 975B 모델, 활성 41B로 설계된 공개 가중치 시스템이다. 이미지·오디오·텍스트를 공동의
Inkling은 이미지-텍스트-오디오 입력을 받아 자연어 응답을 생성하는 image-text-to-text 및 audio-text-to-text 파이프라인을 수행한다. 이 모델은 대화형 응답 생성, 지시 수행, 이미지 캡션·시각 질의응답, 오디오 기반 질의응답 및 텍스트 기반 코드·에이전트 작업 통합을 지원한다. 모델 출력은 UTF-8 텍스트로 한정되며 다양한 언어에서의 활용이 가능하도록 설계되었다.975B total, 41B activeapache-2.0
Inkling은 텍스트·이미지·오디오 입력을 통합해 텍스트를 생성하는 멀티모달 MoE 기반 디코더 모델이며 전체 용량 975B에 활성 파라미터 41B로 효율적 용량을 달성한다.
TL;DR
Inkling은 Thinking Machines가 공개한 멀티모달 디코더형 모델로 텍스트·이미지·오디오 입력을 통합해 텍스트 출력을 생성하도록 설계되었다. 구조적으로 66개 레이어의 디코더와 256개 전문가를 가진 희소 MoE 백본을 사용하여 전체 975B 파라미터 중 토큰당 약 41B만 활성화함으로써 용량과 추론 비용 사이의 균형을 추구한다. 입력 이미지는 계층적 패치 인코더로, 오디오는 이산 토큰 인코딩으로 전처리된 다음 공통 은닉공간으로 투영되어 단일 디코더에서 공동 처리된다. 공개 가중치와 Apache-2.0 라이선스, 그리고 vLLM·SGLang·TokenSpeed·Unsloth용 레시피 제공으로 로컬 배포와 파인튜닝 경로가 열려 있으며 안전성 평가와 전처리 필터링 절차가 적용되었다. 다만 장기 대화 추적과 환각 문제 등 전형적인 한계가 보고되어 배포 시 추가적인 검증·모니터링·필터링 계층을 권장한다.
핵심 역량
- 텍스트 대화와 지시 수행을 멀티턴 환경에서 처리할 수 있으며 텍스트 기반 응답을 생성한다.
- 이미지 입력을 계층적 패치 인코더로 토큰화하여 이미지 캡션 작성과 시각질의응답(VQA)을 수행한다.
- 오디오 입력을 16kHz WAV로 이산 토큰화하여 오디오 질의응답과 멀티모달 문맥 결합을 지원한다.
- 에이전트형 워크플로우와 도구 호출 패턴에 통합되어 도구 사용과 RAG 기반 문맥 주입 환경에서 응답을 생성할 수 있다.
강점
- 공개 가중치로 배포되어 연구자와 개발자가 모델을 직접 파인튜닝하거나 내장 시스템에 통합할 수 있다는 점이 강점이다. 공개 라이선스는 상업적·비상업적 활용을 모두 허용하는 Apache-2.0 조건을 따른다. 이로 인해 서드파티 최적화와 커뮤니티 레시피가 빠르게 확산될 수 있다.
- 모달 통합 성능이 평가에서 전반적으로 양호하게 나타나며 특히 음성·비전 관련 벤치마크에서 경쟁력 있는 수치를 보였다. VoiceBench와 같은 오디오 평가에서 높은 점수를 기록했고 시각·텍스트 결합 과제에서도 우수한 성능을 보였다. 이는 계층적 패치 인코더와 오디오의 이산 토큰화가 멀티모달 통합에 유리하게 작동했음을 시사한다.
- MoE 설계로 전체 파라미터는 매우 크지만 활성화되는 파라미터 수를 41B로 제한하여 계산·메모리 비용을 절감하는 트레이드오프를 택했다. 토큰별로 일부 전문가만 활성화하는 라우팅이 실행 시 연산 효율을 제공한다. 이 구조는 높은 용량이 요구되는 멀티모달 이해력을 확보하면서도 실용적 배포를 가능하게 한다.
훈련 방식
Inkling은 텍스트·이미지·오디오·비디오를 포함한 공개 데이터, 서드파티 제공 데이터 및 합성 데이터를 혼합하여 학습했고 데이터 정제·중복 제거·필터링 같은 전처리 절차를 적용하여 안전성과 품질을 향상시키는 방식으로 훈련되었다.
알아두면 좋은 것
- 모델은 Apache-2.0 라이선스로 공개되어 연구와 파인튜닝, 서드파티 통합이 허용된다.
- 로컬 배포를 위해 SGLang, vLLM, TokenSpeed, Unsloth 등에 대한 레시피와 PR 링크가 제공되어 다양한 추론 환경에서 실행할 수 있다.
- 입력 규격은 이미지의 각 축이 이상적으로 40px에서 4096px 사이이며 오디오는 16kHz WAV 형식, 권장 길이는 20분 이내로 명시되어 있다.
- 학습 데이터는 공개 출처·서드파티·합성 데이터의 혼합으로 구성되었고 중복 제거·필터링 등 전처리 절차가 적용되었다.
기술적 특징
- 아키텍처는 66개 레이어의 디코더 전용 Transformer이며 FFN 대신 희소 Mixture-of-Experts를 사용한다. 모델에는 총 256명의 전문가가 존재하고 각 토큰은 6개의 전문가와 2개의 공유 전문가로 라우팅되어 활성화된다. 이 구조는 전체 파라미터를 975B로 유지하면서 활성 파라미터를 41B 수준으로 낮춰 연산과 메모리 트레이드오프를 관리한다.
- 어텐션은 로컬 레이어와 글로벌 레이어를 혼합한 하이브리드 방식을 채택하여 긴 컨텍스트를 처리하면서도 전역적 상호작용을 보장한다. 로컬 어텐션은 장기 시퀀스에서 계산 복잡도를 낮추고 글로벌 레이어는 멀티모달 간의 상호 참조와 장기적 문맥 결합에 기여한다. 이 결합은 대화형 멀티턴과 이미지·오디오가 결합된 질의응답에서 균형 잡힌 처리량과 표현력을 유지한다.
- 이미지와 비디오는 계층적 패치 인코더로 토큰화되고 오디오는 이산 토큰 인코딩 과정을 거쳐 텍스트 토큰과 동일한 은닉공간으로 투영된다. 이렇게 통합된 표현은 단일 디코더에서 조인된 방식으로 처리되어 멀티모달 교차참조와 응답 생성을 가능하게 한다. 이 접근은 시각적·청각적 신호를 문장 생성 맥락으로 직접 연결하는 데 유리하다.
- 수치 지원은 BF16과 NVFP4를 제공하여 메모리와 저장 공간 효율을 개선하고 다양한 하드웨어 최적화 경로를 허용한다. 레시피 수준에서 vLLM, SGLang, TokenSpeed, Unsloth와의 통합을 통해 로컬 추론 환경에서 실행 가능하도록 설계되었다. 이러한 지원은 대규모 모델을 다양한 추론 백엔드에 배포할 때 실용적 유연성을 제공한다.
차별점
- 975B의 전체 용량과 토큰당 41B의 활성 파라미터라는 MoE 기반의 용량·활성화 분리 설계를 통해 높은 표현력을 확보하면서 추론 효율을 향상시켰다.
- 이미지용 계층적 패치 인코더와 오디오의 이산 토큰 인코딩을 공통 은닉공간으로 투영하여 단일 디코더에서 멀티모달 신호를 공동 처리하는 네이티브 멀티모달 설계를 채택했다.
- BF16과 NVFP4 수치 포맷을 공식 지원하고 vLLM, SGLang, TokenSpeed, Unsloth용 레시피를 제공하여 다양한 하드웨어와 소프트웨어 스택에서 로컬 배포가 용이하도록 배포 경로를 마련했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| HLE (text only) | accuracy | 29.7% | — |
| HLE (with tools) | accuracy | 46.0% | — |
| AIME 2026 | score | 97.1% | — |
| GPQA Diamond | accuracy | 87.2% | — |
| SWEBench Verified | accuracy | 77.6% | — |
| IFBench | accuracy | 79.8% | — |
| Global-MMLU-Lite | accuracy | 88.7% | — |
| MMMU Pro (Standard 10) | accuracy | 73.3% | — |
| VoiceBench | accuracy | 91.4% | — |
1.7k
Likes
45.7k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.