본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

thinkingmachines/Inkling-NVFP4

이미지·오디오·텍스트 입력을 받아 자연어 텍스트를 생성하는 image-text-to-text 파이프라인을 기본 임무로 하며, 대화형 응답, 지침 수행, 코드 보조형 에이전트 통합, 검색 증강 생성과 같은 다목적 멀티모달 작업에 사용되도록 설계되었다. 모델은 이미지·비디오를 계층적 패치 인코더로 처리하고 오디오를 이산 토큰화하여 텍스트 디코더와 동일한 잠재 공간에서 공동으로 추론을 수행한다. 영어 중심이지만 다국어 입력에도 일반적 대응 역량을 보유하도록 훈련되었다.975B total, 41B activeapache-2.0

Inkling은 66층의 MoE 디코더 구조와 계층적 패치 인코더 및 이산 오디오 토큰화를 결합해 텍스트·이미지·오디오 입력을 하나의 디코더에서 공동 처리하여 텍스트 출력을 생성하는 범용 멀티모달 모델이다. 이 모델은 총 975B 파라미터 중 약 41B만을 활성화해 효율을 도모하며 BF16과 NVFP4를 지원한다. 공개 가중치로 제공되어 로컬 배포와 추가 미세조정이 가능하다.

학습 방식 · 기본적으로 공개 인터넷, 제3자 제공 데이터, 합성 및 증강 데이터를 혼합해 멀티모달 코퍼스를 구성하고 텍스트·이미지·오디오·비디오를 함께 사용해 자가회귀 방식으로 학습시켰다. 데이터 파이프라인에서 중복 제거, 필터링, 품질 개선과 같은 전처리 단계가 적용되어 노이즈와 저품질 샘플을 줄였다. 이 접근은 대화형·에이전트·멀티모달 생성 능력을 균형 있게 확보하려는 목적이었다.

TL;DR

Inkling은 66층 디코더형 Transformer에 희소 MoE 백본을 결합해 텍스트·이미지·오디오를 공통 히든 공간에서 함께 처리하는 범용 멀티모달 모델이다. 총 975B 파라미터 중 토큰당 약 41B만 활성화하는 라우팅 구성(256 experts, 토큰당 6개 + 2개 공유)을 통해 용량과 연산 효율을 동시에 확보하며 BF16과 NVFP4를 지원해 하드웨어별 배포 유연성을 제공한다. README에 제시된 다중 벤치마크에서 AIME 2026 97.1%, GPQA Diamond 87.2% 등 멀티모달·에이전트 벤치에서 경쟁력 있는 결과를 보였으나 홀로신화(hallucination)와 다중턴 장기 대화에서의 성능 저하 같은 일반적 한계는 남아 있어 실제 배포 시 추가 검증과 외부 필터링 계층을 권장한다.

핵심 포인트

  • 토큰당 활성 파라미터를 41B 수준으로 제한하는 975B 총규모의 MoE 설계로 용량과 효율을 동시에 제공한다.
  • 이미지용 계층적 패치 인코더와 이산 오디오 토큰화를 통해 텍스트 디코더와의 공동 처리를 네이티브로 지원한다.
  • BF16과 NVFP4 두 가지 수치 형식을 지원해 다양한 하드웨어 환경에서 성능·메모리 균형을 조정할 수 있다.
  • 멀티모달 입력을 네이티브로 통합하는 아키텍처로 이미지·비디오·오디오를 동일한 디코더 컨텍스트에서 처리할 수 있는 점이 강점이다.

벤치마크

벤치마크지표비교
HLE (text only)accuracy29.7%vs GPT 5.6 Sol: 47.2%
AIME 2026score97.1%vs GPT 5.6 Sol: 99.9%
GPQA Diamondaccuracy87.2%vs Gemini 3.1 Pro: 94.1%
SWEBench Verifiedaccuracy77.6%vs Nemotron 3 Ultra: 70.7%
IFBenchscore79.8%vs Nemotron 3 Ultra: 81.4%
VoiceBenchaccuracy91.4%vs Gemini 3.1 Pro: 94.3%

73

LIKES

76k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.