본문으로 건너뛰기

Beyond Final Answers: 다중 에이전트 산업 워크플로우의 궤적-수준 환각 감사

대형 언어 모델이 자율적 에이전트로 작동하는 환경에서, 최종 산출물만 평가하는 기존 벤치마크는 중간 단계에서 발생하는 환각을 놓친다. Trajel은 Thought-Action-Observation 트레이스를 기반으로 다섯 가지 환각 유형을 정의하는 체계를 제시하고, 225개 궤적의 expert-annotated 데이터와 LLM-판정자 및 인간 평가자 간의 일치도를 통해 궤적-수준 평가의 필요성을 입증한다. 또한 실행-품질 신호(예: 명확성/정당화)가 단일 분류기보다 환각 예측에 더 강력하다는 실증을 제공한다.

왜 중요한가

대형 언어 모델이 자율적 에이전트로 작동하는 환경에서, 최종 산출물만 평가하는 기존 벤치마크는 중간 단계에서 발생하는 환각을 놓친다. Trajel은 Thought-Action-Observation 트레이스를 기반으로 다섯 가지 환각 유형을 정의하는 체계를 제시하고, 225개 궤적의 expert-annotated 데이터와 LLM-판정자 및 인간 평가자 간의 일치도를 통해 궤적-수준 평가의 필요성을 입증한다. 또한 실행-품질 신호(예: 명확성/정당화)가 단일 분류기보다 환각 예측에 더 강력하다는 실증을 제공한다.

핵심 기여

Trajectory-aware hallucination taxonomy

다섯 가지 환각 유형(F, R, L, P, S)을 트레이스의 구조적 predicate로 정의하고, 한 트레이너가 동시에 여러 유형을 가질 수 있도록 다중 라벨 포맷으로 설계한다.

Trajel dataset

225개 expert-annotated 궤적과 6개 모델 구성, 42개 산업 작업 질문으로 구성되며, 각 궤적은 subtask 및 trajectory 수준으로 라벨링된다. 인간 평가자와 LLM-판정자의 합의 지표(Cohen’s κ=0.456)가 제시된다.

Trajel ML Modeling Framework

서브태스크 분류(BERT), trajectory-level NLI, 장-context Long-context 모델(Longformer)의 세 가지 검출 패러다임을 벤치마크한다.

Execution signals as predictors

작업완료, 데이터회수정확도, 결과검증, 에이전트 시퀀스 정확성, 명확성/정당화의 다섯 신호가 환각 예측에 미치는 영향을 분석하고, CJ(Clear-justification) 신호가 단일 지표로 가장 높은 AUC(0.908)를 기록한다.

Empirical findings on prevalence and localization

절차적 환각이 38.5%로 가장 많고, 48.7%의 궤적이 다중 유형을 동반하며, 자동 검출기가 일부 유형에서 낮은 κ를 보인다. 또한 실행 루프의 경로-중심 분석이 필요하다는 것을 확인한다.

핵심 아이디어 이해하기

문제 정의에서 시작한다. 기존 벤치마크는 단일 출력의 정확성만 평가하고, 다-step/다-에이전트 상의 누적 오류를 포착하지 못한다. Trajel은 트레이스의 Thought-Action-Observation 구조를 기반으로 5개 타입의 환각을 정의하고, 이들 각각이 필요한 맥락(현장 정보, 역사 정보, 워크플로우 규약, 역할 한계)을 구분한다. 이 체계는 다중 에이전트 산업 환경에서의 안전성과 신뢰성을 높이기 위한 진단 도구로 작동한다. 실험은 두 단계의 주석 프로토콜(LLM-판정자 + 인간 리뷰)과, Prompt variation으로 스트레스 테스트를 수행해 유형별 탐지 성능을 분석한다. 마지막으로 실행-품질 신호가 실제 운영에서 실시간 차단/개입에 가장 효과적일 수 있음을 보여준다.

방법론

전체 접근 방식은 세 단계로 구성된다. Stage 1에서 Trajel 데이터셋을 구축하고 각 궤적에 대해 subtask 단위 다중 라벨 및 trajectory 수준 이진 라벨을 부여한다. 이를 두 단계로 라벨링하는데, 먼저 LLM-판정자를 활용한 예비 라벨링을 실시하고 blind human 리뷰를 거쳐Bias를 줄인다. Stage 2에서 평가 문장(prompt) 변형을 통해 같은 궤적에 대해 여러 버전을 생성하고, 프로빙을 수행한다. Stage 3에서 세 가지 검출 패러다임(BERT-based subtask classifier, trajectory-level NLI, Longformer 기반 long-context 모델)을 훈련·평가하고 ROC-AUC를 주 평가 지표로 사용한다. Execution signals는 Task completion, Data retrieval accuracy, Result verification, Agent sequence correct, Clarity and justification의 다섯 가지 이진 신호를 분석하여 실시간 경고의 가능성을 평가한다.

관련 Figure

AssetOpsBench의 Trajectory-Level Hallucination Detection Framework 아키텍처 다이어그램으로, 에이전트 시스템, 궤적 분석, 트레이셜 ML 프레임워크, 평가 스테이지의 흐름을 보여준다.
Diagram

이 다이어그램은 연구의 주요 구성 요소를 한 눈에 보여주며, 각 파트가 어떻게 연결되어 있는지 설명한다. 특히 Offline/Online 모듈과 Evaluation Stage 간의 피드백 경로를 시각화하여 연구의 방법론적 흐름을 뚜렷하게 드러낸다.

AssetOpsBench의 Trajectory-Level Hallucination Detection Framework 아키텍처 다이어그램으로, 에이전트 시스템, 궤적 분석, 트레이셜 ML 프레임워크, 평가 스테이지의 흐름을 보여준다.

주요 결과

주요 벤치마크 결과로 LLM-판정자의 F1은 0.855로 보고된다(다중 라벨 기준). 교차 비교에서 모델별 F1은 0.590(BERT), 0.563(NLI), 0.533(Longformer)로 나타났으며, ROC-AUC는 각각 0.613, 0.689, 0.599이다. 다만 이러한 모델은 Binary 수준의 정확도에서 LLM-판정자보다 열등하며, Trajel의 다중-타입 특성으로 인해 다층적 분석이 필요함을 시사한다. 실행 신호 중 CJ(Clarity-Justification)가 단일 지표로 가장 높은 예측력을 보이며, CJ만으로도 환각 여부를 0.908의 AUC로 예측할 수 있다. 또한 프로시저 환각은 38.5% 차지하고, 8개의 태스크에서 Task 3에 집중되는 경향이 관찰된다.

기술 상세

아키텍처는 Φ=(M, C, Ttool)로 표현되며, M은 여러 에이전트 모듈, C는 오케스트레이터, Ttool은 도구 세트이다. 궤적 s1..sN은 Thought-τt, Action-αt, Observation-ωt로 구성된 Step으로 표현되며, Trajectory T는 s1..sN의 순차적 트레이스이다. Hallucination h(gt|Et,K,at)는 gt이 Et, K, at의 맥락에서 비일치할 때 발생한다. 다섯 타입은 F, R, L, P, S로 정의되며, 각 타입은 시퀀스 내 위치에 따라 사실 확인 필요성, 히스토리 의존성, 워크플로우 규정 및 역할 경계의 정보를 요구한다.

한계점

단일 산업 도메인(AssetOpsBench)에서 수집된 225개 궤적에 의존하며, 인터-주석자 일치는 κ=0.456로 중간 수준이다. 다중 타입의 가능성으로 인해 단일 라벨만으로는 충분치 않으며, 향후 다중 모델 앙상블 및 더 풍부한 주석 프로토콜이 필요하다.

실무 활용

실용적으로는 CJ 기반 경보 시스템과 런타임 모니터링으로 에이전트 루프에 경고를 삽입하는 방법이 가장 실용적이다.

  • 실시간 다에이전트 오케스트레이션에서 환각 위험도 모니터링 및 차단
  • 프롬프트 설계 스트레스 테스트를 통한 워크플로우 개선
  • 기존 워크플로우의 궤적 로그에 대한 포스트-홉 감사

코드 공개 여부: 미확인

키워드

hallucinationmulti-agent workflowstrajectory-level auditinghallucination taxonomyagent tracessupervised detection modelspost-hoc verificationagentic deployment

용어 해설

생각-행동-관찰(Thought-Action-Observation)
Thought-Action-Observation은 에이전트의 추론(생각), 도구 호출(행동), 도구 결과(관찰)로 구성된 트레이스의 기본 순서이며, 환각 분석의 주된 단위로 작용한다.
궤적 수준 환각(Trajectory-Level Hallucination)
궤적 수준 환각은 단일 출력이 아닌 트레이스 전체에서 발생하는 허위 주장이나 불일치를 가리키며, 다중 단계의 에이전트 협업 맥락에서 운영 상의 오류를 초래한다.
다섯 유형의 분류학(Five-Type Taxonomy)
다섯 가지 환각 유형(Factual, Referential, Logical, Procedural, Scope-based)을 트레이스 구조에 근거해 구분하는 분류 체계이다.
AssetOpsBench
산업용 자산 운영 및 유지보수를 시뮬레이션하는 다중 에이전트 프레임워크로, Trajel의 실험 환경으로 사용된다.
LLM-판정자(LLM-as-a-Judge)
LLM을 자동 평가자로 활용하여 궤적의 환각 여부를 판단하는 평가 프레임워크이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 26.수집 2026. 05. 28.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.