본문으로 건너뛰기

NVIDIA Cosmos 3의 비전 유스케이스 평가 및 성능 분석

NVIDIA의 멀티모달 파운데이션 모델 Cosmos 3를 활용해 고정 카메라 영상 분석 성능을 테스트한 결과, 파인튜닝 없이도 유의미한 결과를 도출했다.

섹션별 상세

01
Cosmos 3 Super(32B) 모델을 사용하여 공항 게이트, 물류 창고, 주방 조립 라인 등 세 가지 시나리오에서 비전 추론 성능을 측정했다.
Cosmos 3를 활용한 비전 데이터 처리 파이프라인 다이어그램.
Diagram고정 카메라 영상을 청크 단위로 분할하고 추론을 수행하는 전체적인 워크플로우를 나타낸다.
02
공항 게이트 시나리오에서는 15초 단위 청크와 1 FPS 설정을 통해 항공기 상태 변화를 6단계로 정확히 분류했다.
03
물류 창고 시나리오에서는 전체 화면을 한 번에 처리하는 대신 게이트별로 영역을 분할하고, 빠른 동작보다 상태 변화가 느린 팔레트 적재 수준을 관찰할 때 정확도가 향상됐다.
04
주방 조립 라인 시나리오에서는 유사한 작은 객체들이 밀집된 환경에서 공간 접지(spatial grounding)를 적용해 모델에게 객체 위치 정보를 제공함으로써 정확도를 높였다.
05
자체 Visual Understanding Evals 평가에서 Cosmos 3 Super는 67개 작업 중 45개를 통과했으나, Qwen 3.5 27B 대비 공간 이해 및 객체 계수 작업에서 낮은 점수를 기록했다.
Cosmos 3 Super 모델의 Visual Understanding Evals 벤치마크 결과 차트.
Chart다양한 비전 작업에 대한 모델의 통과 여부를 보여주며, Cosmos 3 Super가 특정 작업에서 Qwen 3.5 대비 어떤 성능을 보이는지 시각화한다.

용어 해설

물리 AI(Physical AI)
물리적 세계와 상호작용하고 이를 이해하는 AI 시스템. 센서 데이터(영상, 소리 등)를 처리하여 현실 세계의 물리적 동작이나 상태를 판단하고 제어하는 기술을 의미한다.
파운데이션 모델(Foundation Model)
방대한 데이터를 사전 학습하여 다양한 하위 작업에 범용적으로 적용 가능한 대규모 AI 모델. 특정 도메인에 특화되지 않고도 높은 추론 및 이해 능력을 발휘한다.
공간 접지(Spatial Grounding)
AI 모델이 이미지나 영상 내의 객체 위치와 공간적 관계를 정확히 인식하도록 돕는 기법. 모델에게 객체의 위치 정보를 명시적으로 제공하여 추론 정확도를 높인다.

기술

  • Cosmos 3
  • Qwen 3.5

활용 사례

  • 물류 창고 모니터링
  • 공항 운영 분석
  • 조립 라인 품질 검사
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 03.수집 2026. 06. 03.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.