본문으로 건너뛰기
HF Daily Papers조회 1

Multi-Turn Reflective Masking이 Mask Diffusion Models에서 추론을 이끈다

AR 기반 모델의 다-turn 추론은 초기 결정의 오류가 누적되며 전체 시퀀스를 재생성해야 한다. Reflective Masking(RM)은 출력의 일부를 선택적으로 재마스킹하고 수정하는 방식으로, 출력의 일부를 현 시점에서만 수정하고 재생성 비용을 줄인다. History Reference(HR)는 denoising 궤적의 과거 상태를 참조해 일관성과 수정 안정성을 높이며, 이는 이미지 편집, 구조적 추론(Sudoku) 및 자유 생성 텍스트 과제에서 일관된 성능 향상을 뒷받침한다.

왜 중요한가

AR 기반 모델의 다-turn 추론은 초기 결정의 오류가 누적되며 전체 시퀀스를 재생성해야 한다. Reflective Masking(RM)은 출력의 일부를 선택적으로 재마스킹하고 수정하는 방식으로, 출력의 일부를 현 시점에서만 수정하고 재생성 비용을 줄인다. History Reference(HR)는 denoising 궤적의 과거 상태를 참조해 일관성과 수정 안정성을 높이며, 이는 이미지 편집, 구조적 추론(Sudoku) 및 자유 생성 텍스트 과제에서 일관된 성능 향상을 뒷받침한다.

핵심 기여

Reflective Masking (RM)

MDMs의 각 위치에 keep / re-mask / reveal의 세 가지 행동을 선택하도록 하는 경량 학습 파이프라인이다. 평가 시 RM은 비마스크 위치에서 MASK보다 MASK 확률이 높으면 재마스킹하고, MASK 위치에서 가장 가능성이 높은 토큰을 드러낸다. 이는 아키텍처 수정 없이 기존 MDM에 적용 가능하다.

History Reference (HR)

과거 denoising 상태를 history embedding으로 요약해 입력에 더해주며, 시차에 따라 회전 인코딩을 적용한다. 이를 통해 다중 턴 수정에서 과거 예측을 참조하여 일관된 수정과 오류 회피를 가능하게 한다.

전용 학습 데이터 설계 및 목적 함수

합성 trajectories를 만들어 per-position oracle action(z, x*)를 학습 신호로 사용한다. 이 오라클은 비마스크/token이 잘못되었으면 MASK를 예측, MASK이면 정답 토큰으로 Reveal, 정답 토큰은 Preserve를 목표로 삼는다. CE 손실은 reveal / mask / keep 손실의 합으로 구성된다.

테스트 타임 확장(test-time scaling)

추가 계산을 선택적으로 할당하는 RM-계열의 추론은 AR의 forward expansion과 달리, 필요한 부분에만 추가 계산을 수행하도록 설계되어 테스트 타임 확장성을 제공한다.

다중 모달 일반성(일반화)

이미지 편집, Sudoku, 텍스트 추론 등 다양한 모달리티에서 RM과 HR의 결합이 일관된 성능 향상을 보여 다중 모달 추론에서의 일반 프리미엄으로 제시된다.

핵심 아이디어 이해하기

단계별 요약: (1) 기존 MDM의 비마스크 토큰은 재생성 없이 유지되지만, RM은 각 위치에서 keep, re-mask, reveal 중 하나의 선택을 학습한다. (2) 입력 표준화: t번째 스텝에서 tilde x^(t)와 per-position 확률 p_theta를 이용해 각 위치의 다음 상태를 결정한다. (3) History Reference는 과거 상태를 회전-가중 합으로 요약한 history embedding을 현재 입력에 더해, 수정 판단의 주변 맥락 정보를 강화한다. (4) HR과 RM의 조합은 테스트 타임에서의 수정 효율과 정확성을 높이며, 텍스트/이미지/구조적 추론에서 성능이 향상된다.

관련 Figure

Sample noisy positions 및 Sample RM의 수정 경로 예시
Diagram

RM의 동작 원리를 구체적으로 보여주는 사례 그림으로, 각 위치에서의 wrong/MASK/정답 토큰의 전개를 따라가며 how RM이 재마스킹/재생성하는지 시각화한다.

Sample noisy positions 및 Sample RM의 수정 경로 예시

방법론

  1. Reflective Masking의 기본Inference Rule: t 시점에서 비마스크 위치 i의 상태 tilde x_i^(t)에서 p_theta(M|tilde x) > p_theta(x_i|tilde x) 이면 MASK 유지/재마스킹, 그렇지 않으면 원래 토큰 유지. tilde x_i^(t) == MASK인 경우 argmax p_theta(v|tilde x)로 v를 Reveal. 2) History Reference(HR): 각 위치 i에 대해 history embedding a_i^(t) = sum_{k=0}^t gamma^{t-k} R_{k-t} e_i^(k) 로 누적; 현재 입력에 더해 모델이 과거 상태 정보를 활용하도록 한다. 3) RM 학습 목표: z_i ∈ {w_i, MASK, x_i*}에 대해 τ(z_i, x_i*)를 oracle로 정의하고, per-position CE loss를 최소화한다. 4) 데이터 구성: x*에서 일부 위치를 corrupt하고, wrong-token과 MASK로 트레이젝토리를 시뮬레이션한다. 5) 구현 메모: per스텝 입력은 a^(t)와 c, HR로 확장된 입력이며, O(1) 시간 복잡도로 누적 임베딩 업데이트가 가능하도록 설계되었다. 6) 비제한성 및 이론 보장: Bayes-최적화에 근거한 Revision 정책 학습과 HR의 정보 증가가 위험을 감소시킨다는 이론적 보장을 제시한다.

관련 Figure

Reflective Masking 구조의 흐름도: RM과 HR의 상호작용 및 MDM의 반복적인 수정 흐름을 보여준다.
Diagram

Fig.1은 RM의 기본 작동 원리와 HR의 추가 입력이 어떻게 상호작용하는지 시각화한다. RM은 non-mask 위치에서 MASK 확률이 더 크면 재마스킹하고, MASK 위치에서 가장 가능성이 높은 토큰을 Reveal한다. HR은 과거 상태의 임베딩을 누적해 현재 입력에 더한다.

Reflective Masking 구조의 흐름도: RM과 HR의 상호작용 및 MDM의 반복적인 수정 흐름을 보여준다.

History Reference의 구성 및 누적 방식(히스토리 임베딩 회전 접근)
Diagram

HR의 임베딩은 각 토큰 위치에서 과거 denoising 상태를 회전 인코딩으로 누적하고 γ로 감소시키며 현재 상태와 합산한다. 이로써 모델은 과거 출력의 흐름을 명시적으로 참조하는 입력을 받게 된다.

History Reference의 구성 및 누적 방식(히스토리 임베딩 회전 접근)

주요 결과

메인 벤치마크: 이미지 편집에서 RM은 Edit Precision 99.73, Edit Coverage 73.02, MAE-RGB 3.613, PSNR 34.759, SSIM 0.9744, VQAScore 85.17, User Study 68.2로 Baseline 대비 우수. Sudoku 수정에서 RM+HR의 Exact Accuracy 93.4%, Valid Rate 93.6%, Replay Mistake 0.03, Conflict Cells 0.236으로 최적. Text reasoning에서 MATH/MBPP/ARC-Challenge에서 RM이 Vanilla SFT 대비 개선; 예: MBPP에서 39.4%로 8.8% 향상. Case 1-5에서 RM이 다중 과제에 걸쳐 일관된 성능 증가를 보임. 제한: 현재의 RM은 현재 Block Diffusion 모델의 한계를 넘지 못하며, 더 큰 규모의 학습에서 Transfer 가능성은 추가 연구 필요. 향후 Block Diffusion 모델에 대한 적용은 전역 컨텍스트 수정의 한계를 넘는 방향으로 필요.

관련 Figure

이미지 편집 태스크에서 RM의 결과 비교(예시 이미지)
Photo

RM이 마스크된 영역만 재생성하도록 학습되어, 수정된 영역이 원본과의 차이만 발생하고 비수정 영역의 품질 저하를 최소화한다. 이는 RM의 지역성(refined local edits)을 뚜렷하게 보여준다.

이미지 편집 태스크에서 RM의 결과 비교(예시 이미지)

텍스트-추론에서 RM의 수정 경로를 보여주는 결과 예시
Diagram

다양한 텍스트 추론 과제에서 RM의 재마스킹/수정 경로가 최종 결과에 긍정적으로 기여함을 시각적으로 제시한다. 수정 토큰의 재마스킹 및 재생성의 흐름은 코히어런스를 향상시키는 것을 시사한다.

텍스트-추론에서 RM의 수정 경로를 보여주는 결과 예시

기술 상세

아키텍처 변경 없이 RM을 적용하는 것이 목표다. 1) RM의 기본 인퍼런스 규칙은 비마스크 위치에서 MASK보다 MASK의 확률이 더 높으면 재마스킹하고, MASK 위치에서는 토큰을 Reveal한다. 2) HR은 history embedding과 rotary encoding으로 구성되며, 시차Δ에 따라 회전 행렬을 적용해 past 토큰 임베딩을 누적한다. 3) 학습 목표는 per-position oracle actionsτ(z_i, x_i*)를 예측하는 cross-entropy loss이며, 이를 통해 RM의 예측 분포가 Bayesian-optimal에 수렴하도록 한다. 4) Synthetic trajectory 샘플링으로 트레이닝 데이터를 구성하고, 각 위치의 수렴 행동을 학습한다. 5) 테스트 타임 확장성을 위한 일정한 업데이트 규칙이 보장되며, per-step 입력 a^(t)와 c만으로도 업데이트가 가능하다. 6) 제한점으로는 현재의 RM은 더 큰 시퀀스나 더 긴 의사결정에 대해 추가 연구가 필요하다는 점이다.

한계점

제한점으로, 본 연구는 비교적 간단한 long-horizon 문제 및 현재의 베이스 MDM의 한계를 가지는 작업들에 집중한다. 대규모 스케일링/대규모 데이터로의 전이성 평가가 제한적이다. 향후 stronger block diffusion 모델에의 적용에서 전체 컨텍스트 수정이 필요할 수 있으며, 전역 수정의 효율적 확장을 위한 추가 메커니즘이 요구된다.

실무 활용

MDM에 아키텍처 수정 없이 RM과 HR을 적용해 다TURN의 개별 수정 및 추론을 가능하게 하므로, 비용 효율적인 추론과 더 나은 품질의 수정 결과를 제공한다.

  • 이미지 편집에서 지정된 영역의 국지적 수정
  • Sudoku와 같이 제약된 구조적 추론에서의 오류 수정
  • 텍스트/수학/코드 생성에서의 다단계 추론 및 수정
  • 장시간 의문 해결에서의 중간 결과 수정과 안정성 향상

코드 공개 여부: 공개

코드 저장소 보기

키워드

Reflective MaskingHistory ReferenceMask Diffusion Modeltop-k samplingtrajectory trainingin-place revisionmultimodalimage editingSudokutext reasoning

용어 해설

반사 마스킹(Reflective Masking)
Mask Diffusion Model(MDM)에서 각 위치에 대해 keep/re-mask/reveal의 의사결정을 수행하도록 학습된 경량 프레임워크로, 출력의 일부를 반복적으로 수정해 다중 턴 추론을 가능하게 한다. 이 방식은 탐색 공간을 줄이고, 출력의 업데이트를 부분적으로만 수행하도록 설계됐다.
히스토리 레퍼런스(History Reference)
중간 denoising 상태들을 모아 per-positionhistory embedding으로 모델 입력에 제시하는 파라미터 프리 기법으로, 다중 턴 수정 시 이전 출력의 정보를 명시적으로 참조하도록 한다.
Mask Diffusion 모델(Mask Diffusion Model)
토큰 위치를 마스킹해 부분적으로만 수정하는 방식으로 시퀀스를 생성하는 디퓨전 모델 계열로, 출력의 일부를 재샘플링하는 방식이 본질적으로 고정된 상태를 유지하면서도 부분 수정이 가능하도록 설계됐다.
Top-k 샘플링(Top-k Sampling)
샘플링 시 가장 높은 확률을 갖는 상위 k개의 후보를 고려하는 기법으로, RM 학습에서 wrong-token 분포를 구성할 때 활용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 15.수집 2026. 06. 23.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.