본문으로 건너뛰기

한 마리의 고무오리

작성자가 동일한 소스 이미지와 편집 프롬프트로 Muse Image, gpt-image-2, Nano Banana 2를 비교하고 각 모델을 3회 실행해 27점 루브릭으로 채점했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

Meta가 Muse Image를 공개한 뒤 작성자는 동일한 소스 오리 사진과 동일 편집 지시문을 사용해 OpenAI의 gpt-image-2와 Google의 Nano Banana 2와 비교 실험을 수행했으며 편집 난이도를 왼쪽에서 오른쪽으로 점진적으로 높이는 8단계 시퀀스를 적용했다. 각 모델은 같은 프롬프트를 입력으로 받아 편집된 이미지를 출력했고 모델당 세 번의 반복 실행을 통해 결과 일관성을 확인했으며 최종 평가는 고정된 27점 루브릭으로 정량화했다. 게시물 본문은 실험 설계와 비교 대상 모델을 밝히고 결과 행 중 하나가 Meta의 새 모델임을 알렸으며 전체 점수와 세부 평가는 댓글에서 공개되어 있다.

섹션별 상세

01
작성자는 Meta의 Muse Image 공개 직후 동일한 소스 오리 사진과 동일 편집 지시문을 사용해 OpenAI의 gpt-image-2와 Google의 Nano Banana 2와 비교 실험을 수행했다. 입력으로 원본 이미지와 순차적 편집 지시문(unchanged → blue → face away → glass → wireframe → hat-on-ball → "FRENZY" text → standing on a mirror with a correct reflection)을 고정했고 각 모델은 해당 프롬프트를 받아 편집된 이미지를 출력했다. 이렇게 동일한 입력 조건을 적용함으로써 모델 간 편집 충실도와 단계별 실패 양상을 직접 비교할 수 있는 실험 설계가 마련되었다.
02
실험은 난이도를 왼쪽에서 오른쪽으로 점진적으로 높이는 형태의 8단계 편집 시퀀스를 적용했고 각 모델당 세 번의 반복(run)을 실행해 출력의 일관성을 확인했다. 출력 이미지는 단계별로 편집 목표와의 일치도를 관찰하는 방식으로 수집되었고, 최종 평가는 고정된 27점 루브릭을 통해 정량적으로 이루어졌다. 동일한 소스와 프롬프트, 반복 실행, 정해진 루브릭 적용이라는 절차가 실험의 재현성과 비교 가능성을 확보했다.
03
게시물에는 각 모델의 결과 행 가운데 하나가 Meta의 새 모델임이 명시되어 있으며 전체 점수와 정밀한 평가는 댓글에서 공개된다고 적시되어 있다. 원문은 점수 세부치나 어떤 모델이 상위권을 차지했는지 본문에 제시하지 않았기 때문에 결과 해석은 댓글의 공개 점수를 확인해야 가능하다. 단계별 편집 난이도와 반복 실행 설계는 특정 편집 유형에서 모델들이 보이는 약점과 강점을 드러내는 구조적 근거를 제공한다.
04
실험 설계가 단일 소스 이미지와 정해진 편집 시퀀스에 집중되어 있다는 사실은 결과의 범용성에 대한 한계를 내포한다. 동일 프롬프트와 같은 소스 이미지를 사용하면 모델 간 직접 비교는 가능하지만 다양한 이미지 유형과 프롬프트 변형에 대한 확장성은 본 게시물의 서술만으로는 판단할 수 없다. 따라서 본 결과는 동일 조건 하에서의 상대적 성능 지표로 해석되어야 하고, 추가 이미지와 다른 편집 목표에 대한 후속 실험이 필요하다.

이미지 분석

동일 소스 고무오리에 대해 세 모델의 편집 결과 행을 나란히 배치해 단계별 편집 충실도를 시각적으로 비교하는 출력 배치 이미지이다.
Infographic

이미지는 왼쪽에서 오른쪽으로 난이도를 높이는 8단계 편집 시퀀스에 따른 모델별 결과를 횡렬로 배열해 각 단계에서의 편집 성공 여부와 시각적 오류를 확인하게 한다. 유리 재질 변환, 와이어프레임 표출, 모자-공 조합, 텍스트 삽입, 거울 위 반사 등 특정 편집 목표에서 모델 간 성능 차이를 직관적으로 보여주며 반복 실행의 일관성 여부도 시각적으로 평가할 수 있다. 이미지 자체가 비교 결과를 전달하는 주요 근거 자료이므로 본문 평가와 댓글의 점수표를 함께 확인해야 정량적 결론을 도출할 수 있다.

동일 소스 고무오리에 대해 세 모델의 편집 결과 행을 나란히 배치해 단계별 편집 충실도를 시각적으로 비교하는 출력 배치 이미지이다.

용어 해설

이미지 편집 벤치마크(Image Edit Benchmark)
동일한 입력 이미지와 편집 지시문을 여러 이미지 생성 모델에 적용해 출력 품질을 비교하는 방식이다. 각 모델에 대해 동일한 프롬프트를 사용해 출력 이미지를 생성한 뒤 정량적 루브릭으로 채점해 성능 차이를 계량적으로 평가한다. 모델 간 편집 충실도와 일관성을 비교하는 데 중요하다.
프롬프트 엔지니어링(Prompt Engineering)
모델에 원하는 편집을 정확히 전달하기 위해 문장 구조와 지시어를 설계하는 절차이다. 동일한 소스 이미지에 대해 일관된 편집 결과를 얻기 위해 입력 프롬프트의 순서와 표현을 고정한다. 이미지 편집 비교 실험에서 공정성을 확보하는 핵심 요소이다.
평가 루브릭(Evaluation Rubric)
출력 이미지의 품질을 정량화하기 위해 기준별 점수를 합산하는 채점 체계이다. 본 사례에서는 총점 27점의 고정 루브릭을 사용해 모델별 편집 충실도와 오류를 일관되게 계량화했다. 반복 실험 결과를 비교하는 데 표준화된 근거를 제공한다.

언급된 도구

Muse Image중립

이미지 편집/생성 모델로서 동일 편집 프롬프트에 따른 출력 비교 대상

gpt-image-2중립

이미지 편집/생성 모델로서 비교 대상

Nano Banana 2중립

이미지 편집/생성 모델로서 비교 대상

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 09.수집 2026. 07. 09.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.