본문으로 건너뛰기

BRAID: 교차 텍스트‑이미지 추론을 통합 MDP로 규정하여 텍스트·이미지 생성을 공동 최적화한 연구

BRAID는 텍스트·이미지·텍스트 형태의 다중 턴 추론을 단일 MDP로 모델링하고 궤적 수준 advantage를 텍스트의 GRPO와 이미지의 DiffusionNFT에 각각 주입하여 7개 벤치마크에서 평균 +5.73 개선을 달성했다.

용어 해설

통합 마르코프 결정 과정(Unified MDP)
텍스트와 이미지 생성을 하나의 상태·행동 공간으로 통합하여 전체 추론 궤적을 단일 보상 신호 아래 최적화하는 수학적 프레임워크이다. 본문 맥락에서는 각 텍스트 청크와 이미지 생성 단계를 매크로-액션으로 취급하고, 이들을 미시적 토큰/디노이징 단계로 펼쳐서 궤적 수준 advantage를 공동 계산한다. 이렇게 하면 서로 다른 생성 메커니즘에 대해 일관된 보상 전파가 가능해진다.
흐름 매칭(Flow Matching)(Flow Matching)
연속 시간 축에서 노이즈 샘플을 깨끗한 이미지로 옮기는 속도장(velocity field)을 예측하도록 학습하는 방법이다. 논문에서는 이미지 분기에서 이 방식의 미세한 denoising 경로를 마이크로 액션으로 보고 정책으로 최적화한다. 확산 기반 생성기를 RL과 결합할 때 likelihood 추정을 회피하면서 보상을 주입하는 기반 수단으로 사용된다.
그룹 기반 정책 최적화(Grupo)(GRPO)
프롬프트별로 다수의 롤아웃을 샘플링하고 그룹 정규화된 advantage를 계산한 뒤 클리핑된 서러게이트 목적과 KL 페널티로 정책을 갱신하는 방법이다. 텍스트 분기에 적용되어 토큰 단위로 importance ratio를 활용한 안정적 업데이트를 가능하게 한다. 본문에서는 텍스트 브랜치 최적화에 GRPO 스타일을 채택해 통합 목표와 결합했다.
비전 사고 프로세스 보상(Vision-Thinking Reward)
중간에 생성된 각 이미지를 시각적 정확성, 충실도, 추론 유용성, 신뢰성 기준으로 평가하여 이미지 턴에 촘촘한 보상을 부여하는 설계이다. 이 보상은 VLM 판정기로 산출된 다중 구성 요소 값을 그룹 내 정규화한 뒤 궤적 advantage에 합쳐 이미지 생성의 신호 대 잡음을 개선한다. 지연된 최종 보상만으로는 식별하기 어려운 시각적 분기 기여도를 세분화한다는 점이 핵심이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 04.수집 2026. 07. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.