요약은 생성됐지만 현재 화면 버전과 데이터 형식이 맞지 않아 렌더링할 수 없습니다.
출처 · 인용 안내
원문 발행 2026. 02. 26.수집 2026. 03. 01.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
아직 관련 토론이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.
LLM 심판은 답변의 근거보다 위치·길이·어조에 흔들리므로 주장 단위 Grounding 평가가 필요합니다.
LLM을 평가자 시스템으로 만들기 위한 신뢰성 전략과 벤치마크를 정리한 서베이
다섯 Frontier LLM은 실제 사실 주장 63%에서 서로 다른 판정을 내렸다
벙크마크 점수는 작업 선택·하니스·채점·보고 방식 네 가지 선택에 의해 크게 달라지며 일부 감사에서 34.1%·42%의 결함이 확인되었다.
6:06AI 에이전트의 복잡성 증가에 따라 정적 검사에서 LLM-as-a-judge, 그리고 자율적인 Agent-as-a-judge로 평가 방식이 진화하고 있다.