섹션별 상세
건설 산업은 미국 내에서만 약 50만 개의 일자리가 채워지지 않을 정도로 심각한 인력 부족에 직면해 있으며, 이를 해결하기 위해 24시간 가동 가능한 자율 주행 건설 시스템 개발이 필수적이다.
자율 주행 모델 학습에는 장비, 작업 내용, 주변 환경이 라벨링된 대규모 데이터셋이 필요하지만, 수백만 시간의 건설 영상을 수동으로 어노테이션하는 것은 비용과 시간 측면에서 실질적으로 불가능하다.

Bedrock Robotics는 VLM을 도입하여 비정형 영상 데이터를 자연어로 해석하고 자동으로 라벨링하는 시스템을 구축함으로써 수동 프로세스의 한계를 극복하고 데이터 처리 규모를 확장했다.
기존의 상용 VLM은 건설 현장의 특수한 촬영 각도나 먼지, 날씨 등 열악한 시각 조건 때문에 초기 도구 식별 정확도가 34% 수준에 머무는 한계가 있었다.
AWS와의 협업을 통해 각 도구에 대한 상세한 시각적 묘사, 혼동하기 쉬운 도구 쌍에 대한 가이드, 단계별 분석 지침을 포함한 프롬프트 최적화를 진행하여 정확도를 70%까지 끌어올렸다.
최적화된 VLM 파이프라인은 영상 처리 비용을 시간당 10달러 수준으로 유지하면서도 빠른 학습 주기와 배포를 가능하게 하여 물리적 AI 분야에서 강력한 경쟁 우위를 제공한다.
용어 해설
- 비전-언어 모델(VLM)
- — 이미지와 텍스트 데이터를 동시에 처리하고 이해할 수 있는 멀티모달 AI 모델이다. 이미지의 내용을 자연어로 설명하거나 시각적 질문에 답하는 능력을 갖추어, 비정형 영상 데이터에서 의미 있는 정보를 추출하고 자동 라벨링을 수행하는 데 핵심적인 역할을 한다.
- 물리적 AI(Physical AI)
- — 디지털 환경을 넘어 로봇, 자율 주행 장비, 제조 설비 등 실제 물리적 세계에서 작업을 수행하는 AI 시스템을 의미한다. 센서 데이터와 시각 정보를 실시간으로 처리하여 물리적 객체를 조작하거나 이동하는 능력이 필수적이며, 건설 및 물류 자동화의 핵심 기술이다.
- 프롬프트 엔지니어링(Prompt Engineering)
- — AI 모델로부터 최적의 결과물을 얻기 위해 입력값인 프롬프트를 설계하고 최적화하는 기술이다. 이 아티클에서는 건설 도구의 시각적 특징을 상세히 묘사하고 단계별 분석 지침을 제공함으로써 VLM의 도구 식별 정확도를 34%에서 70%로 향상시키는 데 사용되었다.
- 파운데이션 모델(Foundation Model)
- — 방대한 양의 데이터를 자기주도 학습으로 사전 훈련하여 다양한 하위 작업에 범용적으로 적용 가능한 대규모 AI 모델이다. 특정 도메인의 데이터로 미세 조정하거나 적절한 프롬프트를 통해 건설 현장 분석과 같은 전문적인 작업에 맞게 최적화하여 활용할 수 있다.
기술
- Amazon Bedrock
- Vision-Language Models
- Foundation Models
- Bedrock Operator
활용 사례
- 자율 주행 굴착기 학습용 데이터 자동 라벨링
- 건설 현장 영상 내 도구 및 작업 자동 식별
- 대규모 비정형 비디오 데이터의 텍스트 자산화
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 24.수집 2026. 02. 24.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.