TL;DR
기존 MLLM은 노이즈나 블러 같은 저수준 열화를 내부 표현에서 구별하지 못해 품질 점수가 직관적 수준에 그치는 문제가 있었다. IQA-T1은 이미지 입력에 대해 노이즈 잔차, 푸리에 스펙트럼, 기울기 맵 등 15개의 지각 도구로 구조화된 시각 증거를 생성하고 이를 증거 기반 추론에 활용하여 예측의 해석력을 확보했다. 모델은 Q-Tool의 약 11천 개 증거-근거 체인으로 감독 학습으로 도구 사용과 증거 해석을 학습한 뒤 GRPO 강화학습으로 정확도·도구 수·중복성 보상을 균형 있게 최적화하여 평균 이미지당 2.34개의 도구만 호출하도록 정책을 조정했다. 결과적으로 7개 벤치에서 평균 PLCC 0.795의 SOTA 성능을 보고하고 코드·가중치·데이터·데모를 모두 공개하여 재현성과 적용 가능성을 확보했다.
섹션별 상세
용어 해설
- Perceptual Toolset
- — 이미지의 저수준 열화(노이즈, 블러, 압축 아티팩트 등)를 구조화된 증거로 변환하는 여러 알고리즘 모음으로, 잔차 맵·푸리에 스펙트럼·기울기 맵 등을 입력 특성으로 생성하여 후속 모델이 시각적 근거를 해석하도록 돕는다.
- Q-Tool dataset
- — 입력 이미지와 도구로 생성된 시각적 증거 및 해당 증거에 근거한 품질 추론 체인으로 구성된 데이터셋으로, 약 11천 개의 증거-근거 추론 체인을 포함하여 모델의 증거 기반 추론을 감독 학습할 수 있도록 설계되었다.
- GRPO
- — 정확도, 도구 호출 수, 중복성 같은 목적을 균형 있게 고려하면서 언제 도구를 호출할지를 학습하는 강화학습 정책으로, 도구 사용 비용과 정보 효율성을 함께 최적화하기 위해 보상 설계를 도입한다.
- PLCC
- — 모델의 예측 점수와 인간 주관적 품질 점수 간의 선형 상관 관계를 수치화한 지표로, 값이 1에 가까울수록 예측과 주관적 평가의 일치도가 높음을 의미하여 이미지 품질 평가 성능 비교에 자주 사용된다.
- Noise residual map
- — 원본 이미지와 잡음 제거 또는 예측 이미지 사이의 잔차를 공간적으로 표시한 맵으로, 열화의 위치와 강도를 정량적·시각적으로 드러내어 품질 평가 모델이 구체적 증거를 참조하게 만든다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
