본문으로 건너뛰기

Holoscan과 AI 에이전트로 내시경 앱 최적화

Holoscan CLI와 개발 스킬을 AI coding agent에 연결해 내시경 segmentation 앱을 반복 구축하고 평균 지연시간을 33.6% 낮췄습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

NVIDIA Holoscan과 HoloHub를 이용한 내시경 도구 segmentation 애플리케이션을 AI coding agent와 엔지니어의 반복 검토 방식으로 구축했습니다. 에이전트는 HoloHub 예제와 개발 스킬을 읽고 Holoscan CLI로 애플리케이션 생성·실행·테스트·benchmark를 수행했으며, 엔지니어는 각 반복의 목표와 제약, 결과의 충분성을 판단했습니다. HoloViz 입력 재사용과 pinned buffer 기반 비동기 telemetry 복사 뒤 rendered throughput은 204.0 FPS에서 306.9 FPS로 50.5% 높아졌고 평균 application-path latency는 4.891 ms에서 3.247 ms로 33.6% 낮아졌습니다. CLI·skills·docs/examples를 함께 제공한 절제 실험은 40분과 11M tokens로 표준 Holoscan operators를 활용한 결과를 냈으며, docs/examples만 제공한 설정은 최적화된 operators를 놓쳐 2.6배 느렸습니다.

빠른 이해

새로운 점

AI coding agent를 단일 프롬프트 생성기가 아니라 Holoscan CLI·개발 스킬·문서·예제를 공유하는 반복 검토 루프의 실행자로 활용했다는 점입니다.

핵심 메커니즘

엔지니어가 목표와 제약을 정하면 AI coding agent가 HoloHub 예제와 개발 스킬을 읽고 `./holohub create`로 애플리케이션 골격을 만든 뒤 `./holohub run`과 `./holohub test`로 빌드·실행·검사를 수행합니다. 애플리케이션은 video replay에서 preprocessing, TensorRT inference, segmentation postprocessing, telemetry, HoloViz, rendered-frame sink로 프레임을 전달하고 benchmark mode는 이 경로의 latency를 기록합니다. 이후 엔지니어가 코드와 결과를 검토해 다음 목표를 정하며, 최적화 단계에서는 HoloViz 입력과 static tensor를 재사용하고 pinned buffer 기반 비동기 telemetry 복사를 적용했습니다. 그 결과 동일 시스템의 다섯 차례 측정에서 throughput은 204.0 FPS에서 306.9 FPS로 증가했고 평균 경로 지연시간은 4.891 ms에서 3.247 ms로 감소했습니다.

핵심 수치

  • Rendered throughput: 204.0 FPS -> 306.9 FPS, 50.5% higher- 동일한 테스트 시스템에서 baseline과 optimized version을 다섯 차례 측정
  • Mean application-path latency: 4.891 ms -> 3.247 ms, 33.6% lower- video replay부터 rendered-frame sink까지의 application path
  • P95 application-path latency: 6.273 ms -> 4.554 ms, 27.4% lower- 최적화 전후 동일 조건 비교
  • Agentic processing time: 40 min, 20 min, 30 min- 세 engineering iteration에서 기록된 대략적인 처리시간
  • Resource ablation token usage: 11M, 15M, 20M tokens- CLI + skills + docs/examples, docs/examples, CLI + docs/examples 순서
  • Latency benchmark samples: 280/300 retained samples, median 2.719 ms, P99 4.940 ms- 최종 latency graph의 warm-up 이후 측정 요약

섹션별 상세

01

에이전트 협업 개발 흐름

NVIDIA Holoscan은 의료 영상과 robotics 같은 edge 환경에서 실시간 AI 애플리케이션을 구축하는 플랫폼이며, HoloHub는 참고 애플리케이션과 구성요소를 모아 둔 동반 저장소입니다. 이 작업에서는 엔지니어가 목표와 제약을 정하고 AI coding agent가 관련 예제·문서·개발 스킬을 읽은 뒤 Holoscan CLI로 scaffold, build, run, test를 수행했습니다. 엔지니어는 코드와 실행 결과를 검토하고 다음 반복의 목표를 정했으며, 에이전트와 사람이 동일한 CLI 명령을 사용해 결과를 재현할 수 있게 했습니다. 그림의 양방향 흐름처럼 개발은 에이전트의 코드 작성과 엔지니어의 검토가 번갈아 이어지는 작은 검증 단위로 구성됐습니다.
Edge 장치와 입력 센서가 연결된 실시간 AI 처리 구성을 나타낸 개념도
Diagram이미지는 여러 입력 장치가 하나의 처리 경로를 거쳐 GPU 기반 시스템으로 연결되는 edge AI 구성을 시각화합니다. 본문의 Holoscan 애플리케이션처럼 영상 입력, AI 처리, 결과 렌더링이 현장 장치 안에서 이어지는 구조와 연결됩니다.
AI coding agent와 엔지니어가 Holoscan CLI를 통해 코드를 만들고 검토하는 반복 흐름
Diagram도식은 개발 스킬과 문서·예제가 AI agent와 engineer의 Development and Review 단계로 들어가는 과정을 나타냅니다. Agent는 `./holohub CLI`로 scaffold, build, run, test를 수행하고 application code와 실행 증거를 만들며, 엔지니어의 검토 결과가 다음 반복으로 되돌아갑니다.
02

내시경 분할 애플리케이션 구축

목표는 내시경 영상에서 수술 도구를 segmentation하고, 실시간 mask 시각화와 통계 telemetry를 함께 렌더링하는 end-to-end 애플리케이션을 만드는 일이었습니다. 기존 MONAI endoscopic tool segmentation model과 Holoscan sample video를 재사용하되 model weights는 학습하거나 수정하지 않았고, video replay, preprocessing, TensorRT inference, SDK segmentation postprocessor, telemetry, HoloViz를 하나의 그래프로 연결했습니다. 첫 번째 반복에서 에이전트는 관련 HoloHub 예제와 lifecycle skill을 읽고 `./holohub create`로 표준 골격을 만든 뒤 `./holohub run`으로 애플리케이션을 실행했습니다. 약 40분의 agentic processing 뒤 새 애플리케이션이 모델과 샘플 영상을 end-to-end로 처리했으며, 시각 검토에서는 통계 overlay를 더 명확하게 만들 필요가 확인됐습니다.
내시경 영상 위에 segmentation mask와 실시간 도구 추적 통계를 겹쳐 표시한 화면
Screenshot화면에는 내시경 영상 속 수술 도구 영역을 청록색 mask로 표시하고 tool area 10.9%, mask motion 1.0%, stability 91.3%, edge entropy 10.9%를 함께 기록합니다. 오른쪽에는 114.9 FPS와 8.7 ms frame period가 표시되어, 애플리케이션이 segmentation 결과와 프레임 단위 telemetry를 동시에 렌더링한다는 점을 확인할 수 있습니다.
03

반복 가능한 측정 모드

두 번째 반복은 단순한 실시간 화면을 반복 측정이 가능한 개발 산출물로 바꾸는 데 초점을 맞췄습니다. 에이전트는 tool area, mask motion, temporal IoU, edge entropy, FPS, bounding box 위치를 동적 지표로 추가하고, 실제 latency를 기록해 Python plot으로 저장하는 benchmark mode를 구현했습니다. 애플리케이션은 source pace의 `visual`, 60프레임 headless 검증을 위한 `smoke`, 300프레임과 plot export를 수행하는 `benchmark` 모드로 나뉘었고 `./holohub modes`, `./holohub run`, `./holohub test` 명령으로 각각 조회·실행·검사할 수 있습니다. Benchmark mode는 video replayer부터 preprocessing, inference, telemetry, offscreen HoloViz, rendered-frame sink까지의 경로를 Holoscan Data Flow Tracking으로 측정해 화면 확인에만 의존하지 않는 기준값을 만들었습니다.
04

지연시간 최적화 과정

세 번째 반복에서는 deep-learning model이 모든 프레임에서 실행되는지 확인한 뒤, 인접 프레임의 mask 재사용과 dashboard overhead 감소를 검토했습니다. mask 재사용은 추론 횟수를 줄일 여지가 있지만 오래된 출력 허용 여부를 정하는 정책이 필요하므로 적용하지 않았고, 대신 HoloViz 입력 사양과 static coordinate tensor를 재사용하면서 프레임마다 text와 dynamic geometry만 갱신했습니다. 또 현재 10개 값의 GPU-to-host telemetry 복사를 두 개의 pinned buffer에서 비동기로 대기하고 이전 완료 값을 렌더링하도록 바꿨습니다. 동일한 시스템에서 다섯 차례 측정한 결과 rendered throughput은 204.0 FPS에서 306.9 FPS로 50.5% 높아졌고, 평균 application-path latency는 4.891 ms에서 3.247 ms로 33.6% 낮아졌으며 P95는 6.273 ms에서 4.554 ms로 27.4% 낮아졌습니다.
최적화 전후의 latency 분포, operator interval, throughput을 비교한 benchmark 대시보드
Infographic대시보드는 baseline과 final 버전의 latency CDF, 주요 operator interval, 평균·P95·P99를 나란히 비교합니다. 측정 결과 평균 latency는 4.891 ms에서 3.247 ms로, P95는 6.273 ms에서 4.554 ms로 낮아졌고 rendered throughput은 204.0 FPS에서 306.9 FPS로 높아졌습니다.
05

최종 검증과 증거 보존

세 번의 개발 반복이 끝난 뒤 별도 handoff 단계에서 구현을 commit하고 benchmark log, 출력 figure, headless test 결과를 보존했습니다. `./holohub env-check`와 `./holohub env-info`로 commit hash와 dependency version을 함께 기록해 같은 환경에서 결과를 다시 확인할 수 있게 했습니다. 최종 latency graph에서는 300개 tracked frame 중 280개 sample을 유지했고 median은 2.719 ms, P99는 4.940 ms, 표준편차는 0.868 ms로 집계됐으며 평균선은 3.247 ms, P95는 4.554 ms였습니다. 이 측정은 warm-up 구간의 높은 지연과 이후 대부분 프레임에서 4 ms 아래로 안정화되는 흐름을 함께 드러냅니다.
300개 tracked frame의 application-path latency와 평균·P95 지연시간을 나타낸 그래프
Chart그래프는 warm-up 초기에 지연시간이 크게 튄 뒤 대부분의 프레임에서 4 ms 안팎으로 안정화되는 흐름을 나타냅니다. 그래프의 평균은 3.247 ms, P95는 4.554 ms이며, 하단에는 280/300 retained samples, median 2.719 ms, P99 4.940 ms, 표준편차 0.868 ms가 기록되어 반복 benchmark의 분포를 함께 확인하게 합니다.
06

자원 조합별 절제 실험

같은 coding agent와 sandbox에서 첫 번째 반복의 애플리케이션 생성 작업을 CLI·skills·docs/examples 조합별로 비교해 개발 자원 구성이 결과에 미치는 차이를 측정했습니다. 세 자원을 모두 제공한 설정은 40분과 11M tokens로 표준 Holoscan operators를 사용하는 별도 애플리케이션을 완성했고, CLI와 docs/examples만 제공한 설정은 65분과 20M tokens가 필요했지만 실행 가능한 애플리케이션을 만들었습니다. docs/examples만 제공한 설정은 40분과 15M tokens를 사용했으나 third-party model 설정을 코드에 잘못 넣고 기존 HoloHub base image 대신 별도 Dockerfile을 만들었으며, TensorRT inference와 format converter 같은 최적화된 Holoscan operators를 활용하지 않아 다른 두 설정 대비 2.6배 느린 결과를 냈습니다. 따라서 문서와 예제만 나열하는 것보다 CLI의 실행 규칙과 프로젝트별 skill을 함께 제공하는 편이 적은 token overhead로 표준 구현과 검토 가능한 결과를 얻는 데 유리했습니다.
07

엔지니어링 적용 의미

이 사례의 핵심 산출물은 특정 모델을 새로 학습한 결과가 아니라 기존 MONAI 모델과 sample video를 Holoscan 구성요소에 연결하고, 에이전트가 반복 가능한 개발 절차를 따르도록 만든 engineering prototype입니다. `./holohub`는 실행 작업을 통일하고, skill은 프로젝트별 순서와 점검 항목을 전달하며, HoloHub examples와 documentation은 구현 선택의 기준을 제공합니다. 엔지니어는 목표·제약·trade-off와 증거의 충분성을 판단하고 에이전트는 코드·테스트·benchmark를 갱신하므로, 한 번에 전체 애플리케이션을 생성하는 방식보다 작은 검토 단위에서 오류를 조기에 수정할 수 있습니다. 다만 resource ablation은 단일 작업과 특정 agent 설정에 기반한 비교이므로 모든 Holoscan 프로젝트에서 같은 시간과 비용이 재현된다고 단정할 근거는 없습니다.

용어 해설

AI 코딩 에이전트(AI coding agent)
AI 코딩 에이전트는 개발자가 정한 목표와 제약을 바탕으로 기존 코드와 문서를 탐색하고, 애플리케이션 코드를 작성한 뒤 CLI로 빌드·실행·테스트하는 소프트웨어 도구입니다. 이 글에서는 엔지니어의 검토와 다음 작업 지시가 반복되는 공동 개발 흐름에 사용됩니다.
Holoscan CLI
Holoscan CLI는 HoloHub 애플리케이션의 생성, 빌드, 실행, 테스트, 환경 점검을 동일한 명령 체계로 수행하게 하는 개발 인터페이스입니다. 에이전트와 엔지니어가 같은 실행 절차를 사용하므로 컨테이너와 애플리케이션별 명령을 따로 기억하지 않아도 반복 가능한 개발이 가능합니다.
HoloHub 개발 스킬(HoloHub development skills)
HoloHub 개발 스킬은 애플리케이션 수명주기와 디버그·빌드·실행 순서를 에이전트가 따르도록 만든 프로젝트별 지침입니다. 일반적인 Bash 탐색보다 Holoscan의 표준 절차와 기존 구성요소를 먼저 사용하게 해 시행착오와 불필요한 의존성 설치를 줄입니다.
애플리케이션 경로 지연시간(Application-path latency)
애플리케이션 경로 지연시간은 영상 프레임이 replayer에서 전처리, 추론, telemetry, HoloViz를 거쳐 렌더링 sink에 도달하기까지 걸리는 시간입니다. 평균뿐 아니라 P95와 P99를 함께 측정하면 대부분의 프레임 처리 속도와 지연시간 꼬리를 구분할 수 있습니다.
시간적 IoU(Temporal intersection-over-union)
시간적 IoU는 인접한 프레임에서 얻은 segmentation mask가 얼마나 겹치는지 나타내는 안정성 지표입니다. 현재 mask와 이전 mask의 겹치는 영역을 합집합과 비교해 계산하므로 값이 높을수록 도구 추적 결과가 시간에 따라 일관되게 유지되는지 판단하는 데 유리합니다.

기술

  • NVIDIA Holoscan
  • HoloHub
  • Holoscan CLI
  • AI coding agent
  • Codex
  • GPT-5.6 sol max mode
  • MONAI
  • TensorRT
  • HoloViz
  • Holoscan Data Flow Tracking
  • Python
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 08. 20.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.