TL;DR
이 프로젝트는 Grounding-DINO가 요구하는 이미지와 다섯 개의 텍스트 텐서를 DeepStream의 단일 텐서 경로 제약 하에서 운용하기 위해 ONNX 그래프를 편집하여 모든 입력을 하나의 packed 텐서로 합치고 그래프 내부에서 split 전처리를 수행한 구현이다. 실시간으로 프롬프트를 토크나이즈해 매 배치 packed 텐서에 쓰는 custom nvdspreprocess 플러그인과 FIFO 제어 파일을 통해 클래스 변경 시 파이프라인 재시작 없이 새로운 질의를 반영하도록 구성했다. pred_logits와 pred_boxes를 디코딩하는 custom bbox 파서는 class-agnostic NMS를 적용하여 일관된 박스 출력을 생성하며, 동일 파이프라인에서 NVIDIA TAO의 상용 체크포인트와 IDEA-Research의 SwinT-OGC 체크포인트를 교체해 실행할 수 있도록 지원한다. 구현은 오픈소스 코드와 스크린샷을 제공하므로 엣지 디바이스에서의 성능·지연·토크나이저 비용에 대한 벤치마크와 최적화 피드백을 요청하고 있다.
실용적 조언
- ONNX 그래프를 직접 편집하여 다중 입력을 하나의 packed 텐서로 합치는 방식은 DeepStream의 단일 텐서 경로 제약을 우회하는 현실적 방법이다. 이 접근은 런타임에 별도 입력 채널을 추가하지 않으면서도 모델이 요구하는 입력 레이아웃을 보존하므로 파이프라인 재설계 비용을 줄인다. 다만 ONNX 조작 후 그래프 일관성과 성능 영향은 벤치마크로 검증해야 한다.
- 실시간 프롬프트 업데이트를 위해 FIFO 제어 파일과 nvdspreprocess 플러그인을 결합하면 파이프라인 재시작 없이 클래스 집합을 교체할 수 있다. 이 방식은 운영 편의성을 높이지만 배치별 토크나이저 처리 비용과 I/O 지연이 늘어날 수 있어 엣지 환경에서는 토크나이저 최적화나 배치 전략을 같이 고려해야 한다. 따라서 프롬프트 갱신 빈도에 따른 처리량·지연 측정이 권장된다.
- 예측 출력의 안정적 디코딩을 위해 class-agnostic NMS를 적용한 custom bbox 파서를 사용하는 것은 open-vocab 설정에서 중복 박스 처리를 단순화하는 효과가 있다. 이 방법은 클래스별 NMS로 인한 불일치를 제거하므로 동적으로 바뀌는 클래스 집합에서 일관된 박스 출력을 확보하는 데 유리하다. 다만 score calibration이나 텍스트-임베딩 매칭 정확도에 따라 최종 품질이 달라지므로 후처리 파라미터 튜닝이 필요하다.
섹션별 상세


용어 해설
- Open-Vocabulary Detection
- — 레이블 집합에 제한되지 않고 자연어 질의를 통해 새로운 객체 클래스를 인식하는 탐지 접근법으로, 이미지와 텍스트 입력을 결합하여 텍스트 조건에 맞는 박스와 점수를 출력한다. 이 방식은 모델 입력에 텍스트 텐서를 포함하고, 예측된 pred_logits를 텍스트 임베딩과 비교하는 과정을 거쳐 동작한다. 프로젝트 맥락에서는 Grounding-DINO와 같은 VLM을 Edge 스트리밍 파이프라인에서 실시간으로 구동하는 문제가 핵심이다.
- Class-Agnostic NMS
- — 모든 클래스 예측을 하나의 집합으로 간주하여 중복 박스를 제거하는 비최대 억제 방식으로, 클래스별 처리 대신 전체 예측을 기준으로 IOU 임계값을 적용한다. 클래스가 많거나 open-vocab 환경처럼 동적으로 클래스가 바뀌는 상황에서 중복 제거 일관성을 유지하는 데 유리하다. 이 구현에서는 pred_logits/pred_boxes 디코딩 이후 일관된 박스 출력을 얻기 위해 사용됐다.
- ONNX Surgery
- — ONNX 그래프를 직접 편집하여 모델의 입력·출력 구조를 변경하거나 텐서 레이아웃을 재구성하는 기법으로, 런타임 제약을 우회할 때 사용된다. 여기서는 다중 입력(이미지 + 5개의 텍스트 텐서)을 하나의 packed 텐서로 합치고 그래프 안에서 split 전처리를 넣기 위해 적용됐다. DeepStream의 단일 텐서 경로 제약을 해결하기 위한 핵심 구현 단계였다.
언급된 도구
open-vocab object detection을 수행하는 비전-라벨링 모델
비디오 스트리밍 환경에서 모델 추론을 수행하는 NVIDIA 기반 파이프라인 프레임워크
모델 그래프를 변형하고 런타임 호환성을 확보하기 위한 중간 표현 포맷
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
