본문으로 건너뛰기

CogOmniControl: 창의적 의도 인지에 기반한 추론 주도 제어 가능한 비디오 생성

다중 모달 입력의 추상적· sparse한 제어 신호를 이해하고 싶은 프로덕션 워크플로우에서 기존 모델은 의도와 출력의 불일치를 겪었다. CogOmniControl은 CogVLM으로 창의적 의도를 인지하고 CogOmniDiT로 해당 의도에 맞춘 비디오 출력을 생성하며, Best-of-N 선택과 evaluator-harness를 통해 클로즈드 루프를 구현한다.

용어 해설

CogVLM
CogVLM은 멀티모달 조건에서 창의적 의도를 파악하고 생산적 생산 계획으로 바꿔주는 비전-언어 모델로, 전문적 애니메이션 워크플로우 데이터를 학습해 조건 해석과 생성 제어를 강화한다.
CogOmniDiT
CogOmniDiT는 CogVLM이 도출한 의도를 기반으로 다양한 제어 신호를 픽셀 수준의 디테일과 고수준 의미 표현으로 통합하여 비디오를 생성하는 diffusion transformer이다.
Best-of-N
Best-of-N은 CogVLM이 산출한 평가 도구를 이용해 N개의 후보 비디오 중 최종 선택을 하는 파이프라인으로, 각 후보의 품질을 상호 비교해 최적 해를 선택한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 19.수집 2026. 05. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.