용어 해설
- 컨텍스트 갭(Context Gap)
- — 사용자가 제공한 정보와 성공적인 이미지 생성을 위해 실제로 필요한 생성 컨텍스트 사이의 불일치를 가리킨다. 이 논문에서는 사용자의 불완전하거나 암시적인 요구를 모델 내부에서 직접 처리하기보다 외부 검색·추론·메모리·피드백으로 누락된 정보를 점진적으로 보완하는 문제로 규정한다. 컨텍스트 갭을 해결하지 못하면 프롬프트가 충분히 구체적이더라도 결과물이 사용자 의도와 불일치하게 생성된다.
- 컨텍스트 그라운딩(Context Grounding)
- — 결정된 누락 항목을 실제 정보로 채우는 과정으로서 reasoning, web search, image search, memory, feedback의 출처에서 증거를 수집하고 정제해 생성 컨텍스트에 포함시키는 절차를 가리킨다. 이 논문에서는 각 소스별로 서로 다른 처리 파이프라인과 VLM 기반 검증을 적용해 항목별 신뢰도를 확보한다. 그라운딩된 컨텍스트는 content-level planning으로 편집되어 최종 렌더러에 전달된다.
- 생성 컨텍스트(Generation Context)
- — 실제 이미지 생성에 필요하다고 판단된 모든 정보의 집합으로서 최종 렌더러에 입력되는 상세 프롬프트, 시각 레퍼런스, 레이아웃·속성 제약, 사용자 프로필 및 피드백 등을 포함한다. 사용자 입력은 불완전한 user context이고, generation context는 에이전트가 계획·그라운딩을 거쳐 구성하는 완전한 컨디션이다. generation context는 멀티턴·멀티이미지 상황에서 선택적 할당과 길이 관리를 필요로 한다.
- 비전-언어 모델(VLM)
- — 이미지와 텍스트를 동시에 처리해 시각적 증거를 텍스트 조건으로 변환하거나 생성 결과를 체크리스트 항목과 비교하는 모델을 가리킨다. 본 논문에서는 reasoning-stage의 시각 추론, 이미지 검색 결과 랭킹, 피드백 체크리스트 평가 등에 VLM을 활용해 그라운딩 신뢰도를 판단한다. VLM 출력은 후속 prompt 재작성과 content-level planning에 통합된다.
- 멀티모달 LLM(MLLM)
- — 시각 입력을 포함한 멀티모달 맥락을 이해하고 계획·질의 생성·컨텍스트 통합을 수행하는 고급 LLM 계열 모델을 가리킨다. 논문 실험에서는 GPT-5.5-0424를 MLLM 백본으로 사용해 레이아웃 계획, 검색 키워드 생성, 관련성 선별 등 고수준 의사결정을 수행했다. MLLM의 능력은 컨텍스트 갭 식별과 그라운딩 전략 분배에 직접적인 영향을 미친다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



