본문으로 건너뛰기

CoCo: 텍스트-이미지 프리뷰 및 희귀 개념 생성을 위한 코드 기반 사고의 사슬(Code as CoT)

기존 텍스트-이미지 생성 모델은 복잡한 배치나 텍스트 렌더링에서 한계를 보였으나, 이 논문은 사고 과정을 실행 가능한 코드로 변환하여 이를 해결한다. 코드를 통해 논리적인 초안을 먼저 만들고 이를 정교하게 다듬는 방식을 통해 과학 도표나 정밀한 레이아웃이 필요한 이미지 생성의 신뢰도를 획기적으로 높였다.

용어 해설

사고의 사슬(Chain-of-Thought)
모델이 복잡한 문제를 해결할 때 중간 추론 단계를 거치도록 유도하는 기법이다. 이 논문에서는 텍스트 대신 실행 가능한 코드를 중간 단계로 사용하여 이미지 생성의 정밀도를 높인다.
통합 멀티모달 대형 언어 모델(Unified MLLM)
텍스트와 이미지 등 다양한 형태의 데이터를 단일 아키텍처 내에서 동시에 이해하고 생성할 수 있는 모델이다. 별도의 모델을 연결하는 방식보다 데이터 간의 상호작용이 효율적이다.
결정론적 렌더링(Deterministic Rendering)
동일한 입력(코드)에 대해 항상 동일한 결과(이미지)를 출력하는 방식이다. 확률적인 생성 모델과 달리 구조적 안정성을 보장하여 이미지의 뼈대를 잡는 데 유리하다.
변분 오토인코더 인코더(VAE Encoder)
이미지를 저차원의 잠재 공간으로 압축하는 신경망이다. 이미지의 세부적인 픽셀 정보를 보존하여 생성 모델이 고품질의 결과물을 낼 수 있도록 돕는다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 10.수집 2026. 03. 11.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.