본문으로 건너뛰기

비전-언어 모델(VLM)을 활용한 물리적 AI 시스템의 데이터 어노테이션 확장 사례

Bedrock Robotics가 AWS와 협력하여 비전-언어 모델(VLM)과 프롬프트 엔지니어링을 통해 건설 현장 영상의 데이터 어노테이션 정확도를 70%까지 높이고 자율 장비 배포를 가속화한 사례를 다룬다.

섹션별 상세

01
건설 산업은 미국 내에서만 약 50만 개의 일자리가 채워지지 않을 정도로 심각한 인력 부족에 직면해 있으며, 이를 해결하기 위해 24시간 가동 가능한 자율 주행 건설 시스템 개발이 필수적이다.
02
자율 주행 모델 학습에는 장비, 작업 내용, 주변 환경이 라벨링된 대규모 데이터셋이 필요하지만, 수백만 시간의 건설 영상을 수동으로 어노테이션하는 것은 비용과 시간 측면에서 실질적으로 불가능하다.
굴착기 작업 화면을 Mass Excavation(대량 굴착), Grading(평탄화), Demolition(파쇄) 세 가지 작업 유형으로 분류하여 보여주는 분할 스크린 이미지이다.
ScreenshotVLM이 분석해야 하는 실제 건설 현장의 비정형 영상 데이터를 예시로 보여준다. 굴착기 캡 내부에서 촬영된 특수한 각도와 먼지 등이 포함된 실제 환경을 시각화하여, 왜 일반적인 VLM에 프롬프트 최적화가 필요한지 기술적 배경을 뒷받침한다.
03
Bedrock Robotics는 VLM을 도입하여 비정형 영상 데이터를 자연어로 해석하고 자동으로 라벨링하는 시스템을 구축함으로써 수동 프로세스의 한계를 극복하고 데이터 처리 규모를 확장했다.
04
기존의 상용 VLM은 건설 현장의 특수한 촬영 각도나 먼지, 날씨 등 열악한 시각 조건 때문에 초기 도구 식별 정확도가 34% 수준에 머무는 한계가 있었다.
05
AWS와의 협업을 통해 각 도구에 대한 상세한 시각적 묘사, 혼동하기 쉬운 도구 쌍에 대한 가이드, 단계별 분석 지침을 포함한 프롬프트 최적화를 진행하여 정확도를 70%까지 끌어올렸다.
06
최적화된 VLM 파이프라인은 영상 처리 비용을 시간당 10달러 수준으로 유지하면서도 빠른 학습 주기와 배포를 가능하게 하여 물리적 AI 분야에서 강력한 경쟁 우위를 제공한다.

용어 해설

비전-언어 모델(VLM)
이미지와 텍스트 데이터를 동시에 처리하고 이해할 수 있는 멀티모달 AI 모델이다. 이미지의 내용을 자연어로 설명하거나 시각적 질문에 답하는 능력을 갖추어, 비정형 영상 데이터에서 의미 있는 정보를 추출하고 자동 라벨링을 수행하는 데 핵심적인 역할을 한다.
물리적 AI(Physical AI)
디지털 환경을 넘어 로봇, 자율 주행 장비, 제조 설비 등 실제 물리적 세계에서 작업을 수행하는 AI 시스템을 의미한다. 센서 데이터와 시각 정보를 실시간으로 처리하여 물리적 객체를 조작하거나 이동하는 능력이 필수적이며, 건설 및 물류 자동화의 핵심 기술이다.
프롬프트 엔지니어링(Prompt Engineering)
AI 모델로부터 최적의 결과물을 얻기 위해 입력값인 프롬프트를 설계하고 최적화하는 기술이다. 이 아티클에서는 건설 도구의 시각적 특징을 상세히 묘사하고 단계별 분석 지침을 제공함으로써 VLM의 도구 식별 정확도를 34%에서 70%로 향상시키는 데 사용되었다.
파운데이션 모델(Foundation Model)
방대한 양의 데이터를 자기주도 학습으로 사전 훈련하여 다양한 하위 작업에 범용적으로 적용 가능한 대규모 AI 모델이다. 특정 도메인의 데이터로 미세 조정하거나 적절한 프롬프트를 통해 건설 현장 분석과 같은 전문적인 작업에 맞게 최적화하여 활용할 수 있다.

기술

  • Amazon Bedrock
  • Vision-Language Models
  • Foundation Models
  • Bedrock Operator

활용 사례

  • 자율 주행 굴착기 학습용 데이터 자동 라벨링
  • 건설 현장 영상 내 도구 및 작업 자동 식별
  • 대규모 비정형 비디오 데이터의 텍스트 자산화

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 24.수집 2026. 02. 24.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.