본문으로 건너뛰기

Inkling: 가중치 공개형 대규모 MoE 멀티모달 모델

Inkling은 Mixture-of-Experts 구조로 총 975B 파라미터(41B 활성)를 갖추고 1M 토큰 컨텍스트와 텍스트·이미지·오디오·비디오 멀티모달 입력을 처리하도록 45조 토큰으로 사전학습된 공개 모델 계열이다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Inkling은 Mixture-of-Experts 기반의 공개 가중치 모델 계열로, 총 975B 파라미터 가운데 41B만 활성화시키는 설계를 통해 계산 효율을 확보하고 최대 1M 토큰 컨텍스트와 텍스트·이미지·오디오·비디오를 포함한 멀티모달 입력을 처리하도록 45조 토큰으로 사전학습되었다. 동일한 학습 레시피로 구성된 Inkling-Small은 활성 12B로 비용과 지연을 낮춘 대체 옵션을 제공하며, 모델은 에이전트적 행동·추론·코딩·사실성·비전·오디오 과제를 포괄하도록 학습돼 다양한 워크플로에 적응하도록 설계되었다. 게시물에 포함된 레이더형 벤치마크는 Inkling 계열이 여러 평가 기준에서 균형을 추구함을 보여주며 비용·지연과 성능 간의 트레이드오프를 실무적으로 고려했음을 시사한다. 다만 SOTA 지향 모델은 아니라고 명시되어 있어 최고 성능 경쟁보다는 공개 가능성과 실사용 비용·확장성에 초점을 둔 설계 결정을 반영한다.

섹션별 상세

01
Inkling은 Mixture-of-Experts 기반 Transformer로 총 975B 파라미터를 보유하되 입력별로 41B만 활성화되게 설계되어 계산 효율을 확보한다. 사전학습에는 텍스트·이미지·오디오·비디오를 합쳐 45조 토큰이 사용되었고 컨텍스트 윈도우는 최대 1M 토큰을 지원하여 매우 긴 문맥을 처리할 수 있다. 이러한 설계는 전체 모델 용량을 크게 늘리면서도 실제 추론 시의 연산과 메모리 부담을 줄이는 방식으로 동작한다. 결과적으로 대규모 문서나 복합 멀티모달 입력을 요구하는 작업에서 긴 히스토리 유지와 풍부한 표현 학습을 동시에 가능하게 한다.
02
Inkling은 단일 크기 모델이 아니라 계열로 공개되며, 그중 Inkling-Small은 12B 활성 파라미터로 비슷한 학습 레시피를 적용해 낮은 비용과 지연으로 강한 성능을 목표로 한다. 글에서는 모델이 에이전트적 행동, 추론, 코딩, instruction-following, 사실성, 비전, 오디오 과제를 포괄하도록 학습되었다고 밝히며, 이 넓은 학습 범위가 다양한 워크플로에 맞춘 커스터마이제이션에 유리하다고 평가했다. 게시물에는 벤치마크 레이더 차트가 포함되어 있어 여러 공개 모델들과의 상대적 강점과 약점을 시각적으로 제시하며, 비용·지연과 성능 사이의 균형을 맞추려는 설계 의도를 뒷받침한다.

이미지 분석

여러 벤치마크 축을 가진 레이더 차트로 Inkling과 경쟁 모델들의 상대적 성능을 시각화하고 있다.
Chart

이미지는 AIME 2026, SWE-bench Pro, Terminal Bench, MCP Atlas, SimpleQA, AA Omniscience, AudioMC, MMMU Pro, IFBench 등 다양한 벤치마크 축을 사용해 모델별 강점과 약점을 비교한다. 범례에는 Inkling과 Nemotron 3 Ultra, GLM 5.2, GPT 5.6 Sol, Claude Fable 5 같은 모델명이 표시되어 있어 상대성 평가 관점의 비교를 제공한다. 이 차트는 모델 계열이 여러 영역에서 균형 잡힌 성능을 목표로 했음을 시각적 근거로 제시한다.

여러 벤치마크 축을 가진 레이더 차트로 Inkling과 경쟁 모델들의 상대적 성능을 시각화하고 있다.

용어 해설

전문가 혼합(MoE)(Mixture-of-Experts)
여러 전문가(서브네트워크)를 가진 Transformer 구조로, 각 입력마다 일부 전문가만 활성화하여 계산 비용을 줄인다. 라우팅 기법으로 활성 전문가를 선택하고 활성화되지 않은 가중치는 연산에서 배제된다. 대규모 모델에서 효율성을 확보하면서도 모델 용량을 키우는 데 중요하다.
활성 파라미터(Active Parameters)
입력 처리 시 실제로 계산에 관여하는 파라미터의 수를 가리키며 MoE 구조에서는 전체 파라미터보다 훨씬 적을 수 있다. 모델 전체 파라미터는 크되 활성 파라미터가 작으면 추론 비용과 지연을 줄일 수 있다. 성능과 운영 비용 간 균형을 평가하는 핵심 지표이다.
컨텍스트 윈도우(Context Window)
모델이 한 번에 처리할 수 있는 입력 토큰의 최대 길이로, 긴 문맥과 대화 히스토리를 유지하는 능력을 결정한다. 대규모 컨텍스트(예: 1M 토큰)는 장문의 문서, 긴 대화, 코드베이스 전체를 처리할 때 유리하다. 메모리와 속도 요구사항이 크게 증가하므로 구현·최적화가 중요하다.
멀티모달 사전학습(Multimodal Pretraining)
텍스트뿐 아니라 이미지·오디오·비디오 데이터를 함께 사용해 모델을 사전학습하는 방식으로, 서로 다른 입력 유형을 공통 표현공간으로 정렬하는 것이 핵심이다. 멀티모달 학습은 시각·청각 정보 기반 추론과 상호작용 능력을 향상시킨다. 데이터 조정과 정합성 유지가 성능에 큰 영향을 미친다.
사전학습 토큰량(Pretraining Tokens)
모델을 사전학습할 때 소비된 토큰의 총량으로, 모델이 학습한 언어·시각·오디오 분포의 폭과 다양성을 가늠하는 지표이다. 대규모 토큰량은 일반화 능력에 기여하지만 데이터 품질과 중복 처리 방식도 성능에 결정적 영향을 미친다. 단순 토큰 수 증가만으로 성능이 비례하지 않으므로 학습 레시피가 중요하다.

기술

  • Transformer
  • Mixture-of-Experts
  • Inkling
  • Inkling-Small

활용 사례

  • 장문 문서·대화의 맥락 유지
  • 멀티모달 입력 기반 추론과 생성 작업
  • 저지연·저비용 모델이 필요한 실무 애플리케이션
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 16.수집 2026. 07. 16.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.