975B 규모 MoE 기반 멀티모달 모델, 이미지·오디오·텍스트 통합 생성 역량
Inkling은 66층의 MoE 디코더 구조와 계층적 패치 인코더 및 이산 오디오 토큰화를 결합해 텍스트·이미지·오디오 입력을 하나의 디코더에서 공동 처리하여 텍스트 출력을 생성하는 범용 멀티모달 모델이다. 이 모델은 총 975B 파라미터 중 약 41B만을 활성화해 효율을 도모하며 BF16과 NVFP4를 지원한다. 공개 가중치로 제공되어 로컬 배포와 추가 미세조정이 가능하다.
TL;DR
Inkling은 66층 디코더형 Transformer에 희소 MoE 백본을 결합해 텍스트·이미지·오디오를 공통 히든 공간에서 함께 처리하는 범용 멀티모달 모델이다. 총 975B 파라미터 중 토큰당 약 41B만 활성화하는 라우팅 구성(256 experts, 토큰당 6개 + 2개 공유)을 통해 용량과 연산 효율을 동시에 확보하며 BF16과 NVFP4를 지원해 하드웨어별 배포 유연성을 제공한다. README에 제시된 다중 벤치마크에서 AIME 2026 97.1%, GPQA Diamond 87.2% 등 멀티모달·에이전트 벤치에서 경쟁력 있는 결과를 보였으나 홀로신화(hallucination)와 다중턴 장기 대화에서의 성능 저하 같은 일반적 한계는 남아 있어 실제 배포 시 추가 검증과 외부 필터링 계층을 권장한다.
핵심 역량
- 텍스트 기반 대화와 지침 추종 기능을 제공하며 이미지와 오디오를 포함한 멀티모달 문맥을 반영해 응답을 생성할 수 있다.
- 코드 보조와 에이전트형 툴 사용 시나리오에서 외부 도구 호출과 멀티턴 상호작용을 지원하도록 설계되어 에이전트 통합에 적합하다.
- 시각 질의응답·이미지 기반 설명·비디오 요약 같은 시각-텍스트 변환 작업과 오디오 트랜스크립션 연동 후 텍스트 생성 같은 오디오-텍스트 작업을 수행할 수 있다.
- 로컬 환경에서 vLLM, SGLang, TokenSpeed, Unsloth 등 오픈 소스 런타임과 함께 배포되어 맞춤형 파인튜닝 및 서빙이 가능하다.
강점
- 멀티모달 입력을 네이티브로 통합하는 아키텍처로 이미지·비디오·오디오를 동일한 디코더 컨텍스트에서 처리할 수 있는 점이 강점이다.
- 희소 MoE 설계로 총 파라미터 규모는 매우 크지만 각 토큰에 활성화되는 파라미터를 약 41B 수준으로 제한해 대형 모델의 용량과 효율을 동시에 확보했다.
- 공개 가중치와 Apache-2.0 라이선스, 그리고 vLLM/SGLang/TokenSpeed/Unsloth 같은 오픈소스 런타임과의 호환성으로 로컬 배포 및 연구·상업적 통합이 용이하다.
훈련 방식
기본적으로 공개 인터넷, 제3자 제공 데이터, 합성 및 증강 데이터를 혼합해 멀티모달 코퍼스를 구성하고 텍스트·이미지·오디오·비디오를 함께 사용해 자가회귀 방식으로 학습시켰다. 데이터 파이프라인에서 중복 제거, 필터링, 품질 개선과 같은 전처리 단계가 적용되어 노이즈와 저품질 샘플을 줄였다. 이 접근은 대화형·에이전트·멀티모달 생성 능력을 균형 있게 확보하려는 목적이었다.
알아두면 좋은 것
- 모델은 공개 가중치로 제공되어 연구와 서드파티 통합, 파인튜닝을 허용하며 Apache-2.0 라이선스를 따른다.
- 아키텍처는 66층 디코더 및 희소 MoE 백본(256 experts, 토큰당 6개 활성 + 2개 공유)을 사용하여 총 975B 파라미터 중 약 41B만 활성화하는 구조다.
- 숫자 연산으로 BF16과 NVFP4를 지원하여 하드웨어별 메모리·연산 효율을 선택할 수 있다.
- 배포와 성능 최적화를 위해 vLLM, SGLang, TokenSpeed, Unsloth 등 여러 오픈소스 런타임에 대한 레시피와 PR이 제공된다.
기술적 특징
- 모델 구조는 66층의 decoder-only Transformer에 희소 MoE(feed-forward) 백본을 결합한 형태이며, 이 MoE는 총 256개의 전문가를 두고 각 토큰에 대해 6개의 전문가와 2개의 공유 전문가를 활성화해 계산 효율을 확보한다. 이 설계는 전체 파라미터 용량을 크게 유지하면서 토큰별 계산·메모리 비용을 낮추는 목적을 가진다.
- 어텐션은 로컬 레이어와 글로벌 레이어를 혼합한 하이브리드 방식으로 구성되어 장기 문맥과 지역적 세부 정보를 동시에 처리할 수 있도록 설계되었다. 이 하이브리드는 긴 멀티턴 대화나 고해상도 시각 입력에서 중요한 문맥 보유와 계산 복잡도 균형을 제공한다.
- 시각 입력은 계층적 패치 인코더로 전처리되어 여러 스케일의 패치를 순차적으로 인코딩하고 텍스트 디코더와 공통 히든 공간으로 투사된다. 이 방식은 이미지·비디오의 지역적 특징과 전역적 구조를 디코더가 텍스트 생성에 활용하도록 돕는다.
- 오디오 입력은 16kHz WAV를 이산 토큰화 방식으로 변환해 텍스트 디코더와 함께 처리하는 파이프라인을 사용하며, 이로 인해 음성이나 오디오 신호가 텍스트 생성 컨텍스트로 직접 통합된다. 오디오 토큰화는 길이와 샘플링 제한을 고려해 최적화되어야 한다.
- 숫자 연산 측면에서 BF16과 NVFP4를 모두 지원해 하드웨어별 메모리·정밀도·퍼포먼스 트레이드오프를 선택할 수 있으며, NVFP4 지원은 특히 대형 모델의 추론 메모리 절감에 기여한다.
차별점
- 토큰당 활성 파라미터를 41B 수준으로 제한하는 975B 총규모의 MoE 설계로 용량과 효율을 동시에 제공한다.
- 이미지용 계층적 패치 인코더와 이산 오디오 토큰화를 통해 텍스트 디코더와의 공동 처리를 네이티브로 지원한다.
- BF16과 NVFP4 두 가지 수치 형식을 지원해 다양한 하드웨어 환경에서 성능·메모리 균형을 조정할 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| HLE (text only) | accuracy | 29.7% | vs GPT 5.6 Sol: 47.2% |
| AIME 2026 | score | 97.1% | vs GPT 5.6 Sol: 99.9% |
| GPQA Diamond | accuracy | 87.2% | vs Gemini 3.1 Pro: 94.1% |
| SWEBench Verified | accuracy | 77.6% | vs Nemotron 3 Ultra: 70.7% |
| IFBench | score | 79.8% | vs Nemotron 3 Ultra: 81.4% |
| VoiceBench | accuracy | 91.4% | vs Gemini 3.1 Pro: 94.3% |
73
Likes
76k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.