본문으로 건너뛰기

최신 오픈 AI 유물 (#20): 새로운 조직과 모델 유형의 등장 (Nemotron Super, Sarvam, Cohere Transcribe 등)

NVIDIA의 Nemotron-3-Super를 포함하여 음성 인식, RAG, 코드 편집 등 다양한 도메인에 특화된 최신 오픈 소스 AI 모델들의 기술적 특징과 릴리스 소식을 정리한다.

섹션별 상세

NVIDIA는 LatentMoE 아키텍처와 NVFP4 정밀도를 적용한 Nemotron-3-Super-120B 모델을 출시했다. 이 모델은 120B 전체 파라미터 중 12B만 활성화하며 1M 토큰의 긴 컨텍스트 윈도우를 지원한다. 기술 보고서와 함께 학습 데이터셋의 상당 부분을 공개하여 오픈 소스 커뮤니티의 투명성을 높였다. 이는 대규모 모델에서도 효율적인 추론과 긴 문맥 처리가 가능함을 입증한다.
근거
  • NVIDIA Nemotron-3-Super-120B는 1M 토큰의 컨텍스트 윈도우를 지원한다. Artifacts Log - NVIDIA-Nemotron-3-Super-120B 섹션
Cohere는 기존의 상업적 제한이 있는 라이선스에서 벗어나 Apache 2.0 라이선스로 음성 인식 모델인 cohere-transcribe를 공개했다. Conformer 아키텍처를 기반으로 하며 한국어를 포함한 14개 언어에서 기존 오픈 및 폐쇄형 모델보다 우수한 성능을 기록했다. 고성능 음성 인식 기술의 민주화에 기여하며 기업들이 자유롭게 전사 서비스를 구축할 수 있는 기반을 마련했다.
근거
  • cohere-transcribe-03-2026 모델은 Apache 2.0 라이선스로 출시되었다. Artifacts Log - cohere-transcribe-03-2026 섹션
인도 스타트업 Sarvam AI는 12-16T 토큰으로 학습된 105B 규모의 플래그십 모델을 발표하며 주권 AI(Sovereign AI)의 중요성을 강조했다. 이 모델은 인도 현지 언어 성능에서 글로벌 SOTA 모델들을 능가하는 선호도를 보였다. 특정 지역의 언어와 문화적 맥락에 특화된 모델이 범용 모델보다 효율적일 수 있음을 보여주며 국가별 특화 모델의 필요성을 시사한다.
Sarvam AI 모델의 인도 언어 성능 비교 차트
ChartSarvam 모델이 다른 글로벌 오픈 모델들과 비교하여 인도 현지 언어(Indic languages)에서 얼마나 더 높은 선호도를 보이는지 수치로 보여줍니다. 주권 AI의 실제적인 성능 우위를 입증하는 근거 자료로 활용됩니다.
근거
  • Sarvam 모델은 인도 현지 언어에서 SOTA 오픈 모델보다 훨씬 더 선호된다. Artifacts Log - sarvam-105b 섹션
Chroma는 에이전트 기반 검색(Agentic Search)에 최적화된 context-1 모델을 출시하며 오픈 모델 시장에 처음으로 진입했다. GPT-OSS를 기반으로 파인튜닝되었으며 Thinking Machine의 Tinker를 활용해 학습 과정에 대한 상세한 기술 보고서를 함께 제공했다. 벡터 DB 기업이 직접 모델 최적화에 참여함으로써 RAG 시스템의 효율성을 극대화하고 검색 에이전트의 성능을 높이는 새로운 표준을 제시했다.
Chroma context-1 모델의 자가 수정 검색 에이전트 학습 플로우 다이어그램
DiagramChroma가 개발한 context-1 모델이 검색 에이전트로서 어떻게 학습되고 동작하는지 아키텍처를 설명합니다. RAG 시스템에서 모델이 검색 결과를 스스로 평가하고 수정하는 과정을 도식화하여 보여줍니다.
Mistral AI는 추론과 코딩 능력을 결합한 119B 규모의 하이브리드 모델인 Mistral-Small-4를 공개했다. 이전 세대 모델들의 장점을 통합하여 효율적인 연산과 높은 지능을 동시에 구현하는 것을 목표로 한다. 특히 Lean4 수학 정리 증명에 특화된 Leanstral 버전도 함께 출시되어 전문 연구 영역에서의 활용도를 높였다. 이는 복잡한 논리적 사고가 필요한 작업에 최적화된 모델 라인업을 강화한 결과이다.
Mistral Small 4 모델의 벤치마크 결과 테이블
ChartMistral Small 4 모델이 코딩, 추론, 수학 등 주요 벤치마크에서 이전 세대 및 경쟁 모델 대비 어떤 성능을 기록했는지 상세 수치를 제공합니다. 하이브리드 모델로서의 효율성을 시각적으로 확인할 수 있습니다.

용어 해설

잠재 전문가 혼합(LatentMoE)
전문가 선택 과정을 잠재 공간(Latent Space)에서 수행하여 연산 효율을 극대화하는 Mixture of Experts 아키텍처의 변형이다. 기존 MoE보다 라우팅 효율이 높으며 NVIDIA의 Nemotron-3-Super 모델에 적용되어 120B 규모에서도 12B의 활성 파라미터만으로 동작하게 한다.
엔비디아 4비트 부동소수점(NVFP4)
NVIDIA가 제안한 새로운 4비트 부동소수점 데이터 형식으로 학습 및 추론 시 메모리 사용량을 획기적으로 줄인다. 정밀도 손실을 최소화하면서도 연산 속도를 높일 수 있어 대규모 모델의 효율적인 배포에 필수적인 기술이다.
컨포머(Conformer)
Transformer의 전역적 특징 추출 능력과 CNN의 국소적 특징 추출 능력을 결합한 아키텍처이다. 음성 인식(ASR) 분야에서 특히 뛰어난 성능을 보이며 Cohere의 새로운 전사 모델인 cohere-transcribe의 기반 기술로 사용되었다.
주권 AI(Sovereign AI)
국가나 특정 지역이 자신의 데이터, 문화, 언어적 맥락을 반영하여 독자적으로 구축한 AI 역량을 의미한다. 글로벌 범용 모델이 놓치기 쉬운 현지 언어 성능과 데이터 주권을 확보하는 것이 핵심이며 인도 스타트업 Sarvam의 모델이 대표적인 사례이다.
신경망 구조 탐색(NAS)
사람이 직접 신경망을 설계하는 대신 알고리즘을 통해 주어진 데이터와 목적에 최적화된 모델 구조를 자동으로 찾아내는 기술이다. NVIDIA의 Puzzle 프레임워크에 적용되어 추론 효율성을 개선하고 정확도를 유지하는 데 활용되었다.

기술

  • NVIDIA Nemotron
  • Cohere Transcribe
  • Sarvam AI
  • Mistral Small
  • Chroma context-1
  • NVFP4
  • LatentMoE

활용 사례

  • 다국어 음성 전사 서비스
  • 인도 현지 언어 특화 챗봇
  • 에이전트 기반 RAG 검색 시스템
  • 수학 정리 증명 및 복잡한 코딩 보조
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 30.수집 2026. 03. 30.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.