본문으로 건너뛰기

Colon-Bench: 전체 대장내시경 영상의 대규모 정밀 병변 주석 생성을 위한 에이전트 기반 워크플로우

대장내시경 영상은 길고 복잡하여 정밀한 데이터셋 구축이 매우 어렵지만, 이 논문은 AI 에이전트를 활용해 수작업을 최소화하면서도 방대한 규모의 고품질 의료 데이터셋을 구축하는 방법론을 제시한다. 이를 통해 최신 멀티모달 AI 모델들이 실제 의료 현장에서 병변을 얼마나 잘 식별하고 추론할 수 있는지 객관적으로 평가할 수 있는 기반을 마련했다.

용어 해설

멀티모달 대형 언어 모델(MLLM)
텍스트뿐만 아니라 이미지, 영상 등 다양한 형태의 데이터를 동시에 이해하고 처리할 수 있는 인공지능 모델이다. 대장내시경 영상의 시각적 특징과 의학적 설명을 연결하는 데 핵심적인 역할을 한다.
오픈 보카벌러리 비디오 객체 세그멘테이션(OV-VOS)
학습 단계에서 보지 못한 새로운 카테고리의 객체도 텍스트 설명을 기반으로 영상 내에서 픽셀 단위로 분할(Segmentation)하고 추적하는 기술이다.
에이전트 기반 워크플로우(Agentic Workflow)
복잡한 작업을 여러 개의 작은 단계로 나누고, 각 단계를 전문화된 AI 에이전트가 순차적으로 해결하도록 설계된 작업 흐름이다. 데이터 주석의 정확도와 효율성을 극대화한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 27.수집 2026. 04. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.