본문으로 건너뛰기
HF Daily Papers조회 2

GEMS: 메모리와 스킬을 갖춘 에이전트 네이티브 멀티모달 생성 프레임워크

기존 이미지 생성 모델이 복잡한 지시사항이나 전문적인 요구사항을 한 번에 처리하지 못하는 한계를 해결하기 위해 에이전트 구조를 도입했다. 반복적인 수정 과정과 도메인 지식을 활용하여 60억 파라미터 수준의 작은 모델로도 거대 폐쇄형 모델을 능가하는 고품질 이미지를 생성할 수 있음을 입증했다.

용어 해설

추론 시간 스케일링(Inference-time Scaling)
모델의 가중치를 수정하는 학습 단계가 아니라, 실제 결과물을 내놓는 추론 단계에서 더 많은 연산 자원과 시간을 투입하여 성능을 높이는 기법이다. 반복적인 시도나 여러 후보군 중 최적안 선택 등을 통해 모델의 기본 성능 한계를 극복하게 한다.
멀티모달 대형 언어 모델(MLLM)
텍스트뿐만 아니라 이미지, 오디오 등 다양한 형태의 데이터를 동시에 이해하고 처리할 수 있는 대형 언어 모델이다. 본 논문에서는 생성된 이미지를 시각적으로 분석하고 텍스트 지시사항과 대조하여 피드백을 주는 검증자 역할을 수행한다.
반복적 정제(Iterative Refinement)
초기 결과물을 바탕으로 피드백을 받아 점진적으로 품질을 개선해 나가는 과정이다. 이미지 생성에서 한 번에 완벽한 그림을 그리는 대신, 부족한 부분을 찾아 프롬프트를 수정하고 다시 생성하는 과정을 반복하여 정확도를 높인다.
계층적 압축(Hierarchical Compression)
데이터의 중요도나 성격에 따라 서로 다른 수준으로 정보를 요약하여 저장하는 방식이다. 본 논문에서는 프롬프트 같은 사실 정보는 원본 그대로, 장황한 추론 과정은 핵심 경험으로 요약하여 메모리 효율성과 추론 속도를 동시에 확보한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 30.수집 2026. 04. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.