왜 중요한가
한 문장 입력에서 시작해 전체 드라마를 자동으로 생성하는 프로세스를 제시한다. 서사 페이스(오프닝 훅, 에스컬레이션, 엔딩의 미스터리)를 구조화하고, 클립 간 공간 드리프트를 방지하기 위한 3D 바탕의 일관된 첫 프레임을 제시하며, 스크립트-이미지-비디오 전체 단계에서 품질 관리 루프를 적용한다. 생산 비용과 수동 개입을 감소시키고 개인화된 단편 드라마의 대중적 제작을 가능하게 한다.
핵심 기여
Retrieval-augmented multi-agent story generation
패턴 뱅크, 로직 뱅크, 팩트(atom) 기반의 세 가지 검색 경로를 통해 외부 지식, 인과 관계, 페이싱 정보를 함께 활용해 단편 드라마의 개연성과 오프닝/클로징 훅을 강화한다.
3D-grounded first-frame generation
360도 파노라마 기반의 공간 기준(world)에서 프레임 간 위치 관계를 유지하도록 3D 세계를 구성하고, 첫 프레임의 시각적 구성을 공간적으로 정렬한다.
Multi-stage reviewer loops
스크립트/프롬프트/키프레임/비디오 각 단계에서 다단계 리뷰를 수행해 논리적 무결성, 공간 관계, 물체 소유 및 동선의 일관성을 점검하고 필요한 수정만 부분적으로 반영한다.
Scene-level BGM matching and transitions
씬 단위의 BGM를 선별하고, 씬 간 전환을 공간-시간 인식으로 설계해 몰입감을 높이며 대화 음원과의 조화를 유지한다.
Short-Drama-Bench 및 종합 평가 프로토콜
50개 프롬프트를 다루는 Short-Drama-Bench를 제시하고, 내러티브 훅, 흐름, 연출 연속성, 오디오-전환 등을 포함한 단편 드라마 특화 평가지표를 도입한다.
핵심 아이디어 이해하기
출발점: 시퀀스-생성에서의 모듈화 문제를 다루며, Self-Attention의 고비용성이나 단편 영상의 긴 호라이즌 특성으로 인해 단일 샷 접근이 한계를 보임을 지적한다. Pattern/Lodgic/Fact의 임베딩 공간에서 Beat 단위의 카드를 재구성하고, 다중에이전트 토론으로 개연성과 페이싱을 강화하는 것이 핵심이다.
방법론
- Atom Script Corpus를 구성하고 Pattern Bank, Logic Bank를 구축한다. 2) 문제-주도 Retrieval으로 Logline에서 필요 정보(Fact, Logic, Pattern Atom)를 수집하고, 세 가지 retrieval 경로를 Summarize해 Story Core를 생성한다. 3) Clip-수준 스크립트로 전환하고, Opening Hook/Ending Hook/ Twist Density를 점검하는 3단계 스크립트 리뷰 루프를 도입한다. 4) Scene-level Visual Assets를 생성하고 3D 월드를 구성해 3D-consistent First-Frame 프롬프트를 준비한다. 5) 3D 기반 Next-Frame/Next-Clip 생성과, Tail-Frame으로부터의 트래젝토리 맵핑을 통해 Cross-clip Spatial Consistency를 확보한다. 6) Post-Production에서 Scene Transition Clips와 BGM을 설계하고, Transition/Naturalness를 높이는 자동화된 검토를 수행한다.
관련 Figure

논문의 핵심 파이프라인을 시각적으로 제시하여 독자에게 전체 아이디어를 빠르게 전달한다. methodology에 직접 연결되며 도식의 각 구성요소가 추후 상세 섹션과 연결된다.
논문 제목/개요를 시각적으로 요약하는 티저 이미지로, One Sentence, One Drama의 파이프라인을 한눈에 보여주는 인포그래픽에 가깝다.

전체 파이프라인의 흐름과 모듈 간 데이터 흐름을 시각적으로 검토 가능하게 한다. retrieval-debate-visual assets-3D-keyframe 제어 흐름이 한 눈에 파악된다.
4단계 파이프라인을 흐름도로 보여주는 도식이다.

다중 클립 간 공간 레이아웃 일관성을 확보하는 3D grounding의 구체적 구현을 시각화한다. Multi-character 등록 및 next-shot 계획의 연결고리를 보강한다.
3D 일관성 프레임 생성을 위한 3D 월드 구성 및 좌표계 공유를 보여준다.
주요 결과
일반 비디오 및 스토리 벤치마크에서 SOTA를 상회하며 Short-Drama-Bench에서도 Opening Hook, End Hook, Escalation, Continuity 등 주요 지표에서 우수하다. Ablation 연구에서 3D First-Frame 제거 시 Continuity 점수가 가장 큰 폭으로 하락하고, Multi-Stage Review 제거 시 전반적 품질 저하가 나타난다. 시나리오별로 74–90분의 전체 제작 시간으로 단일 문장 입력에서 전체 드라마를 생산하는 실행 가능성을 확인했다.
관련 Figure

다른 baselines와 비교한 Spatial Continuity와 Dramatic Pace의 차이를 시각적 예시로 제시한다. BGM/전환의 품질 향상 효과를 보여주는 지표의 시각적 근거로 작용한다.
실험적 질적 결과 비교와 파이프라인의 구성 요소를 한 화면에 보여준다.

생성된 비디오의 다중 샷과 캐릭터 위치를 보여주는 예시로, cross-clip continuity의 향상을 시연한다.
Generated video gallery 샘플 중 하나의 프레임 샷 모음

다양한 프롬프트 토픽에서의 시각적 일관성과 스토리텔링 흐름의 질 향상을 시각적으로 보여준다.
두 번째 샘플의 갤러리 이미지

씬 전환 및 BGM 매칭의 효과를 보여주는 샘플로 활용된다.
세 번째 샘플의 갤러리 이미지

다양한 프롬프트에 대한 생성 결과의 질적 차이를 시각적으로 제시한다.
네 번째 샘플의 갤러리 이미지
기술 상세
아키텍처는 크게 (i) Retrieval-augmented multi-agent story generation, (ii) 3D-grounded first-frame generation, (iii) 자료-프롬프트 규모의 다단계 리뷰, (iv) 씬-레벨 트랜지션과 BGM 매칭으로 구성된다. 패턴/로직/팩트 원소를 Atom으로 환원하고, Pattern Bank와 Logic Bank의 임베딩 유사도 기반 Top-K 검색으로 Retrieval Plan을 구성한다. Story Core는 Cross-Scene Progression Lines를 도입해 글로벌 일관성을 유지하고, Clip 수준의 스크립트는 Opening Hook, Ending Hook, Twist Density를 분리된 리뷰에서 수정한다. 3D_WORLD 구성은 Marble 시스템으로 월드를 재구성하고, SAM3D Body 및 VGGT를 활용해 다중 캐릭터의 포즈 및 위치를 공유 좌표계에 맞춘다. 이벤트 간 전환은 Text Card + Location Establish + Motion-Bridge를 조합한 다형적Transition으로 구현한다.
실무 활용
단일 문장 입력으로부터 전체 생산 흐름을 자동화하는 체계로, 독립 창작자나 소규모 스튜디오의 제작 비용과 시간을 대폭 절감한다.
- 교육용 비주얼 스토리텔링 도구
- 맞춤형 학습 콘텐츠 제작
- 창작 아이디어의 빠른 프로토타이핑
- 멀티모달 스토리텔링 플랫폼의 백엔드 구성
코드 공개 여부: 미확인
키워드
용어 해설
- 패턴 뱅크(Pattern Bank)
- — 단편 드라마의 리듭적 구성과 페이싱 패턴을 보관하는 저장소로, beat 단위의 카드와 임베딩을 포함해 재사용 가능한 연출 프리바를 제공한다.
- 로직 뱅크(Logic Bank)
- — 로컬 인과관계 및 상황 전개에 필요한 논리적 근거를 저장하는 저장소로, 각 단락의 인과 관계를 유지하도록 지원한다.
- 앳옴 대본 코퍼스(Atom Script Corpus)
- — 약 300개의 고성과 SHORT-DRAMA 스크립트를 원소 단위 beat로 분해한 코퍼스로, 패턴과 로직의 재활용 가능성을 높인다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.