MoE 기반 멀티모달 디코더, 12B 활성으로 비용 절감
텍스트 생성형 멀티모달 모델(텍스트·이미지·오디오 입력 → 텍스트 출력)276B total, 12B activatedapache-2.0
텍스트·이미지·오디오를 통합해 텍스트를 생성하는 MoE 멀티모달 모델
TL;DR
Inkling-Small은 텍스트·이미지·오디오 입력을 단일 디코더에서 통합해 텍스트를 생성하는 멀티모달 autoregressive 모델이다. 42-layer 디코더와 sparse MoE FFN(토큰당 6개 전문가 라우팅, 2개 공유 전문가)을 통해 총 276B 용량을 확보하면서 활성 파라미터는 12B로 유지해 추론 비용을 절감한다. 계층적 패치 인코더와 이산 오디오 토큰화를 사용해 모달리티를 공동 처리하고 BF16/NVFP4를 지원해 배포 유연성을 제공하므로 멀티모달 에이전트, 음성·이미지 통합 서비스, 코드 어시스턴트 같은 실무 적용에 적합하다.
핵심 역량
- 텍스트·이미지·오디오 입력을 통합해 단일 디코더에서 UTF-8 텍스트를 생성하는 멀티모달 생성 능력을 갖추고 있다.
- 스파스 MoE 아키텍처로 총 276B 파라미터 용량을 유지하면서 토큰당 활성 파라미터는 12B 수준으로 추론 비용과 메모리 요구를 낮춘다.
- 이미지는 계층적 패치 인코더로, 오디오는 이산 토큰화로 처리하여 서로 다른 모달리티를 동일 숨겨진 공간에서 결합해 복합한 멀티모달 이해와 응답을 생성한다.
- BF16과 NVFP4 수치 형식을 지원해 연구·로컬 배포·저용량 추론 워크로드에서 유연하게 활용할 수 있다.
강점
- 멀티모달 입력을 단일 디코더에서 통합 처리하는 설계로 텍스트·이미지·오디오 간 상호작용이 자연스럽게 연결된다. 이미지와 오디오를 텍스트와 동일한 숨겨진 공간으로 투영하므로 멀티턴 대화에서 모달리티 간 문맥 전달이 일관되게 유지된다. 이로 인해 대화형 에이전트나 멀티모달 Q&A 같은 응용에서 통합 응답 품질이 개선된다.
- MoE 기반의 용량 확장 전략으로 총 276B 파라미터 용량을 확보하면서 실제 활성 연산은 12B 수준에 머물러 추론 비용과 메모리 부담을 줄였다. 토큰당 6개의 전문가 라우팅과 2개의 공유 전문가 구성은 전문가 분산을 통해 전문화된 표현을 학습하게 한다. 결과적으로 대형 모델의 표현력을 어느 정도 유지하면서 로컬·클라우드 배포의 현실적 제약을 고려한 절충을 제공한다.
- 공개 벤치마크에서 실무 중심 지표가 준수되며 특히 코딩·대화·오디오 항목에서 경쟁력 있는 수치를 보인다. 예컨대 SWEBench Verified 80.2%, IFBench 82.2%, VoiceBench 90.1% 등으로 보고되어 특정 실용 작업군에서 응답 형식과 정확도가 유의미하게 확보되었다. 이러한 결과는 에이전트형 워크로드나 음성-텍스트 통합 서비스에 적용할 때 실제 유용성을 기대하게 한다.
훈련 방식
대규모 멀티모달 코퍼스(공개 웹, 서드파티, 합성 데이터 포함)를 혼합해 자가회귀 방식으로 학습했고 데이터 정제·중복 제거·필터링을 적용하여 품질과 안전성 목표를 조정했다.
알아두면 좋은 것
- Inkling-Small은 텍스트, 이미지, 오디오 입력을 받아 텍스트로 응답하는 범용 멀티모달 autoregressive 모델로 설계되었다. 개발자용 통합 사례로 에이전트, 도구사용 시스템, 코드 어시스턴트 및 RAG 시스템을 염두에 두었다. 공개 가중치를 제공해 하위 개발자가 연구·파인튜닝·제품 통합에 사용할 수 있도록 열어두었다.
- 아키텍처는 42개 레이어의 디코더 전용 트랜스포머에 sparse MoE FFN을 결합한 형태이며, 토큰당 6개의 라우팅 전문가와 2개의 공유 전문가가 활성화된다. Attention은 로컬과 글로벌 레이어를 혼합해 긴 문맥과 국소 패턴을 동시에 처리한다. 이 구조로 활성 파라미터는 12B지만 총 파라미터 용량은 276B로 확장성을 확보했다.
- 이미지는 계층적 패치 인코더로, 오디오는 16kHz WAV를 이산 토큰으로 인코딩해 텍스트 토큰과 동일한 숨겨진 표현으로 투영한다. 입력 해상도 권장 범위는 각 축 40px에서 4096px이며 오디오는 2분 미만 권장이다. 이러한 입력 전처리 파이프라인이 멀티모달 합성 능력을 뒷받침한다.
- 로컬 배포용 레시피로 SGLang, vLLM, TokenSpeed, Unsloth, Hugging Face 블로그 가이드를 제공하며 Tinker Playground와 API 접근성도 마련되어 있다. 라이선스는 Apache-2.0으로 상업적·비상업적 활용이 가능한 범위를 명시한다. 또한 BF16과 NVFP4 형식을 통해 다양한 하드웨어에서의 실용적 배포를 고려했다.
기술적 특징
- 아키텍처는 42-layer 디코더 전용 트랜스포머에 sparse MoE FFN을 결합한 형태로 구성되어 있다. 각 토큰은 256개 전문가 중 6개로 라우팅되며 2개의 공유 전문가가 항상 활성화되어 전문가 간 지식 공유를 촉진한다. Attention은 로컬과 글로벌 레이어를 혼합해 장기 문맥과 지역 패턴을 함께 처리하므로 멀티턴 대화와 고해상도 이미지에서 균형 잡힌 성능을 확보한다.
- 이미지는 계층적 패치 인코더로 처리되어 다중 해상도 정보를 포착하고 오디오는 이산 토큰화로 변환해 텍스트 토큰과 동일한 숨겨진 공간에 매핑한다. 이 통합 표현 파이프라인은 서로 다른 모달리티를 디코더가 동일한 생성 프로세스에서 활용할 수 있게 한다. 따라서 이미지 설명, 음성 기반 질의응답, 멀티모달 대화 같은 복합 태스크에서 입력 간 시너지 효과를 얻을 수 있다.
- 수치적 유연성을 위해 BF16과 NVFP4를 네이티브로 지원해 학습과 추론 환경에 맞춰 정밀도·메모리 트레이드오프를 조정할 수 있다. NVFP4는 저장 공간과 메모리 대역폭을 절감해 저비용 GPU에서의 배포를 용이하게 하고 BF16은 학습과 정밀도 유지에 유리하다. 모델 배포 시 이 두 포맷을 혼합 사용하면 클러스터·엣지·데스크톱 환경에서 실용적 이점을 얻을 수 있다.
차별점
- 활성 파라미터를 12B로 제한하면서 총 276B 용량을 가진 sparse MoE 설계는 동일한 연산 비용 내에서 더 풍부한 표현 용량을 확보하려는 접근이다. 이 설계는 대규모 용량의 이점을 활용하되 실제 추론 리소스 제약에 맞춰 효율적으로 동작하도록 균형을 맞춘다. 따라서 대규모 모델의 표현력을 필요로 하는 멀티모달 애플리케이션에 비용 효율적인 대안이 된다.
- 이미지에 대해 계층적 패치 인코더를, 오디오에 대해 이산 토큰화를 적용해 세 가지 모달리티를 동일한 디코더 파이프라인에서 결합한다는 점이 실무적 차별점이다. 입력 전처리 단계에서 모달리티별 특성을 보존하면서도 결국 동일 숨겨진 공간으로 통합하기 때문에 멀티모달 문맥 교차가 자연스럽게 일어난다. 이 구조는 멀티모달 대화, 멀티모달 검색, 멀티모달 에이전트에서 모달리티 간 정합성을 높인다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| AA Index (v4.1) | index | 40.0% | — |
| Params (activated / total) | billions | 12 / 276 | — |
| SWEBench Verified | accuracy | 80.2% | — |
| IFBench | accuracy | 82.2% | — |
| Global-MMLU-Lite | accuracy | 86.7% | — |
| VoiceBench | accuracy | 90.1% | — |
92
Likes
840
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.