본문으로 건너뛰기

멀티모달 평가 도구: Strands Evals의 이미지-텍스트 작업을 위한 MLLM-as-a-Judge

Strands Evals SDK에 추가된 4가지 멀티모달 평가 도구를 통해 이미지 기반 모델의 응답을 자동 평가하고 디버깅하는 방법을 소개합니다.

섹션별 상세

01
기존 텍스트 전용 평가 도구는 이미지 기반 모델의 환각이나 사실 오류를 탐지하는 데 한계가 있다. Strands Evals는 이미지와 텍스트를 함께 평가하는 4가지 MLLM-as-a-Judge 평가자를 도입하여 이미지 기반의 정확한 검증을 지원한다. 이 도구들은 모델의 응답이 이미지에 근거하는지 확인하여 텍스트 전용 평가의 사각지대를 해소한다.
python
cases = [
    Case[MultimodalInput, str](
        name="revenue-chart-1",
        input=MultimodalInput(
            media=ImageData(source="revenue_chart.jpeg"),
            instruction="Which region has the highest average revenue? "
            "State the region name and the dollar amount shown in the chart.",
        ),
        expected_output="U.S. and Canada has the highest at $13.32.",
        metadata={"dataset": "ChartQA"},
    ),
]

evaluators = [
    MultimodalOverallQualityEvaluator(), # Likert 1-5
    MultimodalCorrectnessEvaluator(), # Binary
    MultimodalFaithfulnessEvaluator(), # Binary
    MultimodalInstructionFollowingEvaluator(), # Binary
]

평가 케이스를 정의하고 4가지 멀티모달 평가자를 설정하는 예시

python
agent = Agent(callback_handler=None)
task_output = None

def run_task(case):
    global task_output
    image = case.input.media
    messages = [
        {"image": {"format": image.format or "png", "source": {"bytes": image.to_bytes()}}},
        {"text": case.input.instruction},
    ]
    task_output = str(agent(messages))
    return task_output

reports = await Experiment(cases=cases, evaluators=evaluators).run_evaluations_async(
    task=run_task,
    max_workers=1,
)

비전 모델을 실행하고 실험을 수행하는 코드

멀티모달 평가 프레임워크의 전체 구조를 보여주는 다이어그램.
Diagram이미지, 쿼리, 응답을 입력받아 MLLM 판사가 평가 프롬프트를 구성하고 점수와 추론 근거를 반환하는 과정을 도식화했다.
평가 예시로 사용된 지역별 스트리밍 멤버십 평균 수익 막대 차트.
Chart이 차트는 멀티모달 평가 도구가 이미지 내의 데이터를 얼마나 정확하게 읽고 해석하는지 검증하는 테스트 케이스의 입력값으로 사용되었다.
02
도입된 평가자는 Overall Quality, Correctness, Faithfulness, Instruction Following으로 구성된다. 각 평가자는 Likert 1-5점 또는 이진 점수를 제공하며, 평가 결과와 함께 디버깅에 필요한 추론 근거를 반환한다. 이를 통해 모델의 오류 유형을 명확히 파악하고 수정 방향을 결정할 수 있다.
03
평가자는 참조 기반과 참조 없는 모드를 모두 지원하여 다양한 환경에서 활용 가능하다. 참조 기반 모드는 정답 데이터셋이 있을 때 유용하며, 참조 없는 모드는 실제 운영 환경에서 실시간 평가에 적합하다. 사용자는 필요에 따라 평가 모드를 선택하여 유연하게 워크플로를 구성할 수 있다.
04
Amazon Bedrock의 Claude Sonnet 4.6이 기본 모델로 권장된다. 실험 결과, 멀티모달 평가자가 텍스트 전용 평가자보다 인간의 평가와 더 높은 일치도를 보였으며, 평가 시 '추론 후 점수 산정' 방식과 '다양한 예시 포함'이 성능 향상에 핵심적임이 확인됐다. 이 설계 원칙은 평가 모델의 신뢰성을 높이는 데 기여한다.

용어 해설

MLLM 기반 평가(MLLM-as-a-Judge)
멀티모달 대규모 언어 모델(MLLM)을 평가자로 활용하여 모델의 출력을 평가하는 기법. 이미지와 텍스트를 동시에 입력받아 정확도, 환각 여부, 지시 준수 등을 판단한다.
환각(Hallucination)
모델이 이미지에 존재하지 않는 객체를 생성하거나 사실과 다른 정보를 출력하는 현상. 멀티모달 모델의 신뢰성을 저해하는 주요 요인이다.
리커트 척도(Likert Scale)
설문이나 평가에서 응답자의 태도나 품질을 1~5점 등의 단계로 측정하는 척도. 이 아티클에서는 모델의 전반적 품질을 평가하는 데 사용된다.
참조 기반 평가(Reference-based Evaluation)
모델의 출력을 정답(Gold Answer)과 비교하여 평가하는 방식. 정답 데이터셋이 확보된 경우 정확한 성능 측정이 가능하다.

기술

  • Strands Evals
  • Amazon Bedrock
  • Claude Sonnet 4.6
  • Python

활용 사례

  • 이미지 캡셔닝
  • 시각적 질의응답
  • 차트 해석
  • 문서 필드 추출
  • 스크린샷 요약
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 21.수집 2026. 05. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.