섹션별 상세
Sarvam AI의 'Sarvam Vision' 모델은 olmOCR-Bench(영어 전용 서브셋)에서 84.3%의 정확도를 기록하며 Gemini 3 Pro 및 DeepSeek OCR 2와 같은 최신 모델을 능가하는 성능을 입증했다. 이 모델은 이미지 캡셔닝, 장면 텍스트 인식, 차트 해석, 복잡한 표 파싱 등 광범위한 시각적 이해 작업을 수행할 수 있도록 설계되었다.
기존 글로벌 모델들이 인도 언어를 2순위로 취급하는 것과 달리, Sarvam AI는 22개 공식 인도 언어의 고품질 데이터셋으로 모델을 학습시켜 지역 스크립트에 대한 정확도를 대폭 높였다. 특히 3B 파라미터 규모의 상태 공간 모델(State-Space Model) 아키텍처를 채택하여 추론 효율성을 극대화했다.
음성 인식 모델은 단 7400만 개의 파라미터(약 294MB)로 10개 인도 언어를 지원하며, 사용자 선택 없이도 언어를 자동 식별한다. 퀄컴 스냅드래곤 8 Gen 3 칩셋에서 실시간 대비 8.5배 빠른 속도와 300ms 미만의 첫 토큰 생성 시간(TTFT)을 기록하며 강력한 온디바이스 성능을 보여준다.
음성 합성(TTS) 모델은 2400만 파라미터와 60MB의 초경량 크기를 유지하면서도 표준 벤치마크에서 0.0173의 낮은 문자 오류율(CER)을 달성했다. 또한 단 1시간의 오디오 데이터만으로 새로운 목소리를 추가할 수 있는 커스텀 보이스 클로닝 기능을 지원하여 개인화된 서비스 가능성을 열었다.
번역 모델은 1억 5천만 개의 파라미터를 통해 영어와 10개 인도 언어 간의 110개 언어 쌍에 대해 양방향 번역을 수행한다. 중간 언어를 거치지 않는 직접 번역 방식을 사용하여 정확도를 높였으며, 약 334MB의 크기로 기기 내 로컬 실행이 가능하다.
용어 해설
- 광학 문자 인식(OCR)
- — 이미지나 스캔된 문서 내의 텍스트를 기계가 읽을 수 있는 디지털 데이터로 변환하는 기술이다. Sarvam AI는 인도 언어의 복잡한 스크립트와 역사적 문서를 디지털화하기 위해 이 기술을 고도화했다.
- 상태 공간 모델(State-Space Model)
- — 시퀀스 데이터를 처리하는 수학적 모델 기반의 아키텍처로, Transformer 대비 연산 효율성이 높다. Sarvam AI는 이를 통해 3B 규모에서도 높은 추론 효율성을 달성했다.
- 첫 토큰 생성 시간(TTFT)
- — AI 모델이 사용자 입력을 받은 후 첫 번째 결과 입자를 출력하기까지 걸리는 지연 시간이다. 실시간 음성 서비스의 반응 속도를 결정하는 핵심 지표로 활용된다.
- 시각-언어 모델(VLM)
- — 이미지와 텍스트를 동시에 이해하고 처리할 수 있는 멀티모달 AI 모델이다. 이미지 캡셔닝, 차트 해석, 문서 내 데이터 추출 등 시각적 정보와 언어 정보를 결합한 작업에 사용된다.
기술
- Sarvam Vision
- Snapdragon 8 Gen 3
- State-Space Model
- Python
활용 사례
- 인도 언어 문서 디지털화
- 실시간 온디바이스 통번역
- 시각 장애인용 이미지 설명 서비스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 21.수집 2026. 02. 21.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.