섹션별 상세
기존의 수동 디지털화 방식은 전단지 한 장당 3~4시간의 바운딩 박스 작업과 제품 매칭이 필요하여 수백 개의 소매업체 데이터를 처리하기에 확장성 문제가 발생했다.
Phase 1(이미지 분할)에서는 Meta의 SAM을 기반으로 하되, 텍스트 박스 제거, Weighted Boxes Fusion(WBF)을 통한 박스 병합, 모델 앙상블 기법을 추가하여 복잡한 전단지 레이아웃에 대응했다.
WBF 기법은 단순한 NMS와 달리 겹치는 박스들의 좌표를 신뢰도 가중 평균으로 계산하여 정보 손실 없이 더 정밀한 제품 경계 상자를 생성하며, 의료 영상 등 타 분야에서도 mAP를 3~10% 향상시킨 사례가 있다.
Phase 2(제품 식별)에서는 PaddleOCR로 텍스트를 추출하고, 이를 원본 이미지와 함께 LLM에 전달하여 제품 쿼리와 속성을 분리해내는 과정을 거친다.
추출된 쿼리는 인스타카트의 기존 ANN(Approximate Nearest Neighbors) 검색 클러스터를 통해 카탈로그 내 상위 10~15개 제품과 매칭되며, 최종적으로 LLM이 속성 기반 랭킹을 수행하여 95%의 재현율을 달성했다.
이 자동화 파이프라인은 전단지 디자인에 따라 75~90%의 세그멘테이션 정확도를 기록하며 운영 효율성을 10배 향상시켜 소매업체 네트워크 전반으로 확장 가능한 기반을 마련했다.
용어 해설
- 세그먼트 애니싱 모델(Segment Anything Model (SAM))
- — Meta에서 공개한 범용 이미지 분할 모델로, 별도의 추가 학습 없이도 이미지 내의 모든 객체를 정교하게 분리해낼 수 있는 제로샷(Zero-shot) 능력을 갖추고 있다.
- 가중 박스 융합(Weighted Boxes Fusion (WBF))
- — 여러 객체 탐지 모델의 결과물을 하나로 합칠 때, 겹치는 경계 상자들을 삭제하는 대신 신뢰도 점수에 따라 가중 평균을 내어 더 정확한 위치를 찾는 기법이다.
- 근사 최근접 이웃(Approximate Nearest Neighbor (ANN))
- — 방대한 벡터 데이터셋에서 특정 벡터와 가장 유사한 항목을 빠르게 찾기 위해 정확도를 일부 희생하고 검색 속도를 극대화하는 알고리즘이다.
- 광학 문자 인식(Optical Character Recognition (OCR))
- — 이미지 속에 포함된 텍스트 정보를 디지털 텍스트 데이터로 변환하는 기술로, 전단지 내 제품명이나 가격 정보를 추출하는 데 사용된다.
기술
- Segment Anything Model (SAM)
- PaddleOCR
- Weighted Boxes Fusion (WBF)
- LLM
- ANN Search
활용 사례
- 전단지 디지털화
- 이미지 기반 제품 검색
- 자동 태깅 시스템
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 02. 10.수집 2026. 02. 21.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.