왜 중요한가
다중 영역 인지가 필요한 시나리오에서 AR 기반 디코딩은 영역 수에 비례해 지연이 증가한다. PerceptionDLM은 diffusion 언어 모델의 비 autoregressive 특성을 활용해 여러 영역의 캡션을 함께 생성할 수 있도록 설계되었으며, ParaDLC-Bench를 통해 캡션 품질과 추론 효율성을 함께 평가한다. 결과적으로 다중 영역 인지 작업에서 평균 처리량이 크게 증가하고, AR 대비 속도 상승이 가능해진다.
핵심 기여
PerceptionDLM-Base: 강력한 DVLM 베이스라인
시각 인식을 위한 비전 인코더와 확산 언어 모델 백본을 결합한 멀티모달 확산 언어 모델로, 시각적 지시 학습을 통해 인지 능력을 강화한다.
병렬 영역 인지 메커니즘
region prompting, RoI-aligned feature replay, structured attention masking을 결합해 다중 영역의 설명을 단일 디노이즈 과정에서 병렬로 생성한다.
ParaDLC-Bench: 다중 영역 캡션 평가 벤치마크
다중 마스크를 포함하는 이미지에 대해 품질과 효율성을 동시에 평가하는 벤치마크로, 진단 지표로 Positive/Negative 질문 체계를 사용한다.
ParaCaption-5.7M 데이터 엔진
다양한 데이터 소스에서 다중 영역 캡션 데이터를 생성·정제해 병렬 캡션 학습에 활용한다.
실험적 성과
ParaDLC-Bench에서 평균 62.4%의 Avg를 달성하고, ParaDLC-Bench 대비 AR 기반 모델보다 강건한 속도 향상을 보이며, 4개 마스크 조건에서 최대 3.44×의 처리량 증가를 달성한다.
핵심 아이디어 이해하기
출발점과 한계: AR 디코딩은 각 영역에 대해 순차적으로 캡션을 생성하므로 영역 수가 늘수록 연산량과 지연이 증가한다. 원리: diffusion language model의 마스크된 토큰 예측을 이용해 토큰 단위 병렬 생성을 가능하게 하고, region prompting과 RoI 기반 피처 재생, 그리고 구조적 어텐션 마스킹으로 서로 다른 영역의 정보를 구분하여 처리한다. 달라지는 점: 단일 denoising 프로세스에서 다중 영역의 설명을 함께 생성하므로 AR 대비 추론 속도가 비선형적으로 증가하지 않는다. 결과적으로 다중 영역 인지에서 평균 처리량이 증가하고, 대규모 영역 수에서의 속도 향상이 실현된다.
관련 Figure

ParaDLC-Bench 설계의 다중 마스크 구성과 마스크 면적 분포를 시각적으로 제시해 데이터 구성의 다양성과 난이도를 설명한다.
Mask 수와 영역 면적 분포 그래프(파이 차트, 히스토그램 포함)
방법론
[입력-처리-생성 흐름] 어떤 입력을 받으면 xt로 마스킹된 타깃 토큰을 디노이즈하는 역 방향 모델을 통해 x0를 재구성한다. 수식: L_DLM = - E_{t, x0, xt} [ (1/t) * sum_i 1[xt_i = [MASK]] * log p_theta(x0_i | xt) ]. 이는 마스킹된 타깃 토큰의 예측 확률을 최적화하는 목표다. 시각적 조건은 SigLIP-2 비전 인코더로 얻은 시각 특성 Hv를 두-layer MLP로 텍스트 임베딩 공간에 매핑해 입력 시퀀스에 결합한다. PerceptionDLM-Base의 학습은 4단계로 구성되며, 비전-언어 정렬 → 대규모 중간 학습 → SFT(22M 샘플) → 고품질 SFT(Honey-Data 15M)로 진행된다. 동적 해상도 tiling: 이미지가 큰 경우 512×512 타일로 분할하고 각 타일은 픽셀 언샤플링으로 시각 토큰 수를 줄인 후 인코더에 전달된다. 손실 함수은 다음과 같이 정의된다: L_PerceptionDLM_Base = - E_{(Xv, Xq, Xa), t, xt} [ (1/t) * sum_{i ∈ Ma} log p_theta(x0_i | xt, Hv, Xq) ], Ma는 Xa의 마스킹된 인덱스 집합이다.
관련 Figure

다수의 지역 마스크를 한 번에 처리하는 병렬 인지 구조의 핵심 아이디어를 시각적으로 보강하며, C-layer의 세부 설계(Region Prompting, RoI Feature Replay, Structured Attention Masking)가 어디에 적용되는지 연결한다.
PerceptionDLM의 파이프라인 개요와 병렬 지역 인지 흐름을 보여주는 도식

PerceptionDLM-Base의 비전 인코더, 시각-언어 커넥터 및 DLM 디코더 간의 연결 및 입력 흐름을 시각화해 방법론의 핵심 구성 요소를 보강한다.
Parallel region perception 아키텍처의 구성 요소를 보여주는 도식
주요 결과
[주요 결과] ParaDLC-Bench에서 PerceptionDLM은 Avg 62.4%로 기존 확산 VLM 대비 우수하며, DLC-Bench에서 51.9%를 기록했다. ParaDLC-Bench 평가에서 AR 모델 대비 속도 이점이 확인되며, Tokens Per Forward(TPF) 지표에서 PerceptionDLM은 2.9를 달성했다. 4-mask 조건에서 처리량은 4마스크에서 3.44×의 속도 향상을 보였고, 단일 이미지 대기 시간은 약 2.9초로 안정적이다. ParaDLC-Bench에서 Judge 모델(GPT-5.2) 사용 시, 32 denoising steps에서 최적의 균형으로 성능과 latency를 달성한다.
관련 Figure

병렬 캡션의 다중 영역 인지에서의 향상된 во 특징을 보여주는 시각적 예시로, 교차 영역 간 간섭 문제를 완화하는 구조의 필요성을 보강한다.
다중 영역 캡션 비교 및 예시(ARvs 병렬 캡션의 차이 가능성 포함)

특정 지역마다 독립적으로 지역 정보를 추출해 병렬로 묘사하는 PerceptionDLM의 강점을 시각적으로 나타낸다.
다중 영역에서의 자세한 지역 설명 예시(실제 다중 Mask에 대한 설명)
기술 상세
[아키텍처] PerceptionDLM-Base는 비전 인코더 + 시각-언어 커넥터 + DLM 디코더로 구성된다. Vision Encoder로 SigLIP-2를 사용하고, 2-layer MLP를 통해 Hv를 텍스트 임베딩 공간으로 매핑한 후 Xq와 Xa의 입력 시퀀스에 결합한다. Diffusion forward는 Xa에만 적용되고 Hv, Xq는 고정 조건으로 유지된다. [수학적 기반] Diffusion 언어 모델의 LLM 구조에 시각 조건을 결합하고, 마스크된 타깃 토큰 예측에 초점을 맞춘다. [주요 차별점] region prompting, RoI-aligned feature replay, structured attention masking은 다중 영역의 간섭을 차단하고 병렬 캡션 생성을 가능하게 한다. [학습 세부사항] 4단계 학습 파이프라인(vision-language alignment, middle-stage training, instruction tuning, high-quality SFT) 및 32×32의 H100에서의 학습이 보고된다. [데이터] ParaCaption-5.7M 데이터 구성은 SA-1B, COCONut에서 GAR-8B로 초기 설명 생성 → LLM으로 핵심 카테고리 추출 → SAM으로 마스크 재예측 및 IoU로 필터링. [평가] ParaDLC-Bench의 2,345개 문제를 LLM judge로 채점하고, 다-region 간 간섭과 독립성 평가에 중점을 둔다.
한계점
[한계] 확산 모델의 단계적 디노이징은 여전히 계산 비용의 주요 요인이며, 고밀도 영역에서의 속성Entanglement 완전 제거는 어려움이 보고된다. 향후 RL을 통한 추론 능력 향상, step distillation 같은 방법으로 추론 단계 축소, 지역 간 대조 손실 도입, 그리고 더 정교한 어텐션 마스킹 개선이 제시된다. 실패 사례로 cross-region 엔탈리먼트, 작거나 가려진 영역, 보이는 특성의 잘못된 상상, OCR 텍스트의 오독 등이 분석된다.
관련 Figure

영역 간 간섭으로 잘못된 속성 귀속 혹은 작은 영역의 잘못된 해석 사례를 제시하며, 한계 및 향후 개선 방향의 근거를 제공한다.
Failure Case: Cross-region attribute entanglement 사례
실무 활용
병렬 region perception 구조를 활용해 다중 영역 인지 애플리케이션의 응답 속도와 처리량을 크게 향상시킬 수 있다.
- 다중 객체가 포함된 고해상도 이미지의 연속적 지역 설명 자동화
- 실시간 로봇 비전 시스템에서 다중ROI 설명의 지연 최소화
- 문서/차트 이해에서 다중 영역의 텍스트 및 속성 추출
- 멀티-region 기반 비주얼 QA 및 대화형 비주얼 어시스턴트
- 감지도구나 모듈형 비전-언어 파이프라인의 inference 비용 절감
코드 공개 여부: 공개
코드 저장소 보기키워드
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.