본문으로 건너뛰기

PhysicEdit: 물리 법칙을 준수하는 이미지 편집 AI 모델

PhysicEdit은 이미지 편집을 물리적 상태 전이로 재정의하고 비디오 학습 데이터를 통해 조명과 굴절 등 현실 세계의 물리 법칙을 준수하는 편집 결과를 생성한다.

섹션별 상세

01
기존의 명령어 기반 이미지 편집 모델은 입력 이미지와 결과 이미지 사이의 정적인 매핑에만 집중하여, 전등을 끄거나 물컵에 빨대를 꽂는 등의 물리적 변화 과정에서 발생하는 광학적·역학적 법칙을 제대로 반영하지 못하는 한계가 있다.
전등 끄기 명령에 따른 조명 변화 비교 이미지
Screenshot전등을 끄라는 명령에 대해 기존 모델들은 방의 전체적인 조도 변화를 반영하지 못하지만, PhysicEdit은 그림자와 조명을 물리적으로 일관되게 수정함을 보여준다.
물컵 속 빨대 삽입 명령에 따른 굴절 효과 비교 이미지
Screenshot물컵에 빨대를 꽂는 편집에서 기존 모델이 놓치는 빛의 굴절 현상을 PhysicEdit이 정확하게 재현하여 시각적 오류를 해결하는 사례를 제시한다.
02
PhysicEdit은 이미지 편집을 단순한 변환이 아닌 물리적 트리거에 의한 '상태 진화' 문제로 재정의하며, 이를 위해 기계적, 광학적, 생물학적, 재료적, 열적 도메인을 아우르는 38,000개의 비디오 데이터셋인 PhysicTran38K를 구축하여 학습에 활용한다.
PhysicTran38K 데이터셋 구축 및 구조화된 생성 과정 다이어그램
Diagram물리적 전이를 학습하기 위한 PhysicTran38K 데이터셋의 구성 방식과 시작 상태, 트리거, 전이, 최종 상태로 이어지는 구조화된 생성 과정을 설명한다.
03
이중 사고(Dual-Thinking) 메커니즘 중 하나인 '물리적 근거 추론'은 고정된 Qwen2.5-VL-7B 모델을 사용하여 편집 명령에 따른 물리 법칙과 제약 조건을 텍스트로 생성하고, 이를 확산 모델의 컨텍스트로 제공하여 인과 관계를 유지한다.
PhysicEdit 프레임워크의 학습 및 추론 아키텍처 개요
DiagramQwen2.5-VL을 통한 물리적 추론과 DINOv2/VAE 특징을 활용한 시각적 전이 쿼리 학습으로 구성된 PhysicEdit의 전체 학습 및 추론 아키텍처를 도식화한다.
04
암시적 시각 사고 단계에서는 비디오의 중간 프레임에서 추출한 DINOv2 및 VAE 특징을 학습 가능한 전이 쿼리에 정렬시켜, 텍스트로 표현하기 어려운 미세한 질감 변화나 빛의 산란 같은 시각적 효과를 모델이 학습하도록 유도한다.
05
벤치마크 평가 결과, PhysicEdit은 물리적 사실성을 측정하는 PICABench에서 기존 모델 대비 약 5.9% 향상된 성능을 보였으며, 특히 굴절, 인과 관계, 광원 효과 등 물리적 역동성이 필요한 카테고리에서 큰 개선을 나타냈다.
PICABench 벤치마크 결과 비교표
ChartPICABench 벤치마크에서 PhysicEdit이 기존의 상용 및 오픈소스 모델들과 비교하여 물리적 사실성 점수에서 우위를 점하고 있음을 수치로 나타낸다.

기술

  • Qwen2.5-VL
  • DINOv2
  • VAE
  • PhysicTran38K
  • Python

활용 사례

  • 현실적인 이미지 편집
  • AR/VR 콘텐츠 생성
  • 물리 기반 시뮬레이션 시각화
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 05.수집 2026. 03. 05.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.