섹션별 상세
기존 텍스트 전용 평가 도구는 이미지 기반 모델의 환각이나 사실 오류를 탐지하는 데 한계가 있다. Strands Evals는 이미지와 텍스트를 함께 평가하는 4가지 MLLM-as-a-Judge 평가자를 도입하여 이미지 기반의 정확한 검증을 지원한다. 이 도구들은 모델의 응답이 이미지에 근거하는지 확인하여 텍스트 전용 평가의 사각지대를 해소한다.
python
cases = [
Case[MultimodalInput, str](
name="revenue-chart-1",
input=MultimodalInput(
media=ImageData(source="revenue_chart.jpeg"),
instruction="Which region has the highest average revenue? "
"State the region name and the dollar amount shown in the chart.",
),
expected_output="U.S. and Canada has the highest at $13.32.",
metadata={"dataset": "ChartQA"},
),
]
evaluators = [
MultimodalOverallQualityEvaluator(), # Likert 1-5
MultimodalCorrectnessEvaluator(), # Binary
MultimodalFaithfulnessEvaluator(), # Binary
MultimodalInstructionFollowingEvaluator(), # Binary
]평가 케이스를 정의하고 4가지 멀티모달 평가자를 설정하는 예시
python
agent = Agent(callback_handler=None)
task_output = None
def run_task(case):
global task_output
image = case.input.media
messages = [
{"image": {"format": image.format or "png", "source": {"bytes": image.to_bytes()}}},
{"text": case.input.instruction},
]
task_output = str(agent(messages))
return task_output
reports = await Experiment(cases=cases, evaluators=evaluators).run_evaluations_async(
task=run_task,
max_workers=1,
)비전 모델을 실행하고 실험을 수행하는 코드


도입된 평가자는 Overall Quality, Correctness, Faithfulness, Instruction Following으로 구성된다. 각 평가자는 Likert 1-5점 또는 이진 점수를 제공하며, 평가 결과와 함께 디버깅에 필요한 추론 근거를 반환한다. 이를 통해 모델의 오류 유형을 명확히 파악하고 수정 방향을 결정할 수 있다.
평가자는 참조 기반과 참조 없는 모드를 모두 지원하여 다양한 환경에서 활용 가능하다. 참조 기반 모드는 정답 데이터셋이 있을 때 유용하며, 참조 없는 모드는 실제 운영 환경에서 실시간 평가에 적합하다. 사용자는 필요에 따라 평가 모드를 선택하여 유연하게 워크플로를 구성할 수 있다.
Amazon Bedrock의 Claude Sonnet 4.6이 기본 모델로 권장된다. 실험 결과, 멀티모달 평가자가 텍스트 전용 평가자보다 인간의 평가와 더 높은 일치도를 보였으며, 평가 시 '추론 후 점수 산정' 방식과 '다양한 예시 포함'이 성능 향상에 핵심적임이 확인됐다. 이 설계 원칙은 평가 모델의 신뢰성을 높이는 데 기여한다.
용어 해설
- MLLM 기반 평가(MLLM-as-a-Judge)
- — 멀티모달 대규모 언어 모델(MLLM)을 평가자로 활용하여 모델의 출력을 평가하는 기법. 이미지와 텍스트를 동시에 입력받아 정확도, 환각 여부, 지시 준수 등을 판단한다.
- 환각(Hallucination)
- — 모델이 이미지에 존재하지 않는 객체를 생성하거나 사실과 다른 정보를 출력하는 현상. 멀티모달 모델의 신뢰성을 저해하는 주요 요인이다.
- 리커트 척도(Likert Scale)
- — 설문이나 평가에서 응답자의 태도나 품질을 1~5점 등의 단계로 측정하는 척도. 이 아티클에서는 모델의 전반적 품질을 평가하는 데 사용된다.
- 참조 기반 평가(Reference-based Evaluation)
- — 모델의 출력을 정답(Gold Answer)과 비교하여 평가하는 방식. 정답 데이터셋이 확보된 경우 정확한 성능 측정이 가능하다.
기술
- Strands Evals
- Amazon Bedrock
- Claude Sonnet 4.6
- Python
활용 사례
- 이미지 캡셔닝
- 시각적 질의응답
- 차트 해석
- 문서 필드 추출
- 스크린샷 요약
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 21.수집 2026. 05. 21.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.