왜 중요한가
대형 언어 모델이 자율적 에이전트로 작동하는 환경에서, 최종 산출물만 평가하는 기존 벤치마크는 중간 단계에서 발생하는 환각을 놓친다. Trajel은 Thought-Action-Observation 트레이스를 기반으로 다섯 가지 환각 유형을 정의하는 체계를 제시하고, 225개 궤적의 expert-annotated 데이터와 LLM-판정자 및 인간 평가자 간의 일치도를 통해 궤적-수준 평가의 필요성을 입증한다. 또한 실행-품질 신호(예: 명확성/정당화)가 단일 분류기보다 환각 예측에 더 강력하다는 실증을 제공한다.
핵심 기여
Trajectory-aware hallucination taxonomy
다섯 가지 환각 유형(F, R, L, P, S)을 트레이스의 구조적 predicate로 정의하고, 한 트레이너가 동시에 여러 유형을 가질 수 있도록 다중 라벨 포맷으로 설계한다.
Trajel dataset
225개 expert-annotated 궤적과 6개 모델 구성, 42개 산업 작업 질문으로 구성되며, 각 궤적은 subtask 및 trajectory 수준으로 라벨링된다. 인간 평가자와 LLM-판정자의 합의 지표(Cohen’s κ=0.456)가 제시된다.
Trajel ML Modeling Framework
서브태스크 분류(BERT), trajectory-level NLI, 장-context Long-context 모델(Longformer)의 세 가지 검출 패러다임을 벤치마크한다.
Execution signals as predictors
작업완료, 데이터회수정확도, 결과검증, 에이전트 시퀀스 정확성, 명확성/정당화의 다섯 신호가 환각 예측에 미치는 영향을 분석하고, CJ(Clear-justification) 신호가 단일 지표로 가장 높은 AUC(0.908)를 기록한다.
Empirical findings on prevalence and localization
절차적 환각이 38.5%로 가장 많고, 48.7%의 궤적이 다중 유형을 동반하며, 자동 검출기가 일부 유형에서 낮은 κ를 보인다. 또한 실행 루프의 경로-중심 분석이 필요하다는 것을 확인한다.
핵심 아이디어 이해하기
문제 정의에서 시작한다. 기존 벤치마크는 단일 출력의 정확성만 평가하고, 다-step/다-에이전트 상의 누적 오류를 포착하지 못한다. Trajel은 트레이스의 Thought-Action-Observation 구조를 기반으로 5개 타입의 환각을 정의하고, 이들 각각이 필요한 맥락(현장 정보, 역사 정보, 워크플로우 규약, 역할 한계)을 구분한다. 이 체계는 다중 에이전트 산업 환경에서의 안전성과 신뢰성을 높이기 위한 진단 도구로 작동한다. 실험은 두 단계의 주석 프로토콜(LLM-판정자 + 인간 리뷰)과, Prompt variation으로 스트레스 테스트를 수행해 유형별 탐지 성능을 분석한다. 마지막으로 실행-품질 신호가 실제 운영에서 실시간 차단/개입에 가장 효과적일 수 있음을 보여준다.
방법론
전체 접근 방식은 세 단계로 구성된다. Stage 1에서 Trajel 데이터셋을 구축하고 각 궤적에 대해 subtask 단위 다중 라벨 및 trajectory 수준 이진 라벨을 부여한다. 이를 두 단계로 라벨링하는데, 먼저 LLM-판정자를 활용한 예비 라벨링을 실시하고 blind human 리뷰를 거쳐Bias를 줄인다. Stage 2에서 평가 문장(prompt) 변형을 통해 같은 궤적에 대해 여러 버전을 생성하고, 프로빙을 수행한다. Stage 3에서 세 가지 검출 패러다임(BERT-based subtask classifier, trajectory-level NLI, Longformer 기반 long-context 모델)을 훈련·평가하고 ROC-AUC를 주 평가 지표로 사용한다. Execution signals는 Task completion, Data retrieval accuracy, Result verification, Agent sequence correct, Clarity and justification의 다섯 가지 이진 신호를 분석하여 실시간 경고의 가능성을 평가한다.
관련 Figure

이 다이어그램은 연구의 주요 구성 요소를 한 눈에 보여주며, 각 파트가 어떻게 연결되어 있는지 설명한다. 특히 Offline/Online 모듈과 Evaluation Stage 간의 피드백 경로를 시각화하여 연구의 방법론적 흐름을 뚜렷하게 드러낸다.
AssetOpsBench의 Trajectory-Level Hallucination Detection Framework 아키텍처 다이어그램으로, 에이전트 시스템, 궤적 분석, 트레이셜 ML 프레임워크, 평가 스테이지의 흐름을 보여준다.
주요 결과
주요 벤치마크 결과로 LLM-판정자의 F1은 0.855로 보고된다(다중 라벨 기준). 교차 비교에서 모델별 F1은 0.590(BERT), 0.563(NLI), 0.533(Longformer)로 나타났으며, ROC-AUC는 각각 0.613, 0.689, 0.599이다. 다만 이러한 모델은 Binary 수준의 정확도에서 LLM-판정자보다 열등하며, Trajel의 다중-타입 특성으로 인해 다층적 분석이 필요함을 시사한다. 실행 신호 중 CJ(Clarity-Justification)가 단일 지표로 가장 높은 예측력을 보이며, CJ만으로도 환각 여부를 0.908의 AUC로 예측할 수 있다. 또한 프로시저 환각은 38.5% 차지하고, 8개의 태스크에서 Task 3에 집중되는 경향이 관찰된다.
기술 상세
아키텍처는 Φ=(M, C, Ttool)로 표현되며, M은 여러 에이전트 모듈, C는 오케스트레이터, Ttool은 도구 세트이다. 궤적 s1..sN은 Thought-τt, Action-αt, Observation-ωt로 구성된 Step으로 표현되며, Trajectory T는 s1..sN의 순차적 트레이스이다. Hallucination h(gt|Et,K,at)는 gt이 Et, K, at의 맥락에서 비일치할 때 발생한다. 다섯 타입은 F, R, L, P, S로 정의되며, 각 타입은 시퀀스 내 위치에 따라 사실 확인 필요성, 히스토리 의존성, 워크플로우 규정 및 역할 경계의 정보를 요구한다.
한계점
단일 산업 도메인(AssetOpsBench)에서 수집된 225개 궤적에 의존하며, 인터-주석자 일치는 κ=0.456로 중간 수준이다. 다중 타입의 가능성으로 인해 단일 라벨만으로는 충분치 않으며, 향후 다중 모델 앙상블 및 더 풍부한 주석 프로토콜이 필요하다.
실무 활용
실용적으로는 CJ 기반 경보 시스템과 런타임 모니터링으로 에이전트 루프에 경고를 삽입하는 방법이 가장 실용적이다.
- 실시간 다에이전트 오케스트레이션에서 환각 위험도 모니터링 및 차단
- 프롬프트 설계 스트레스 테스트를 통한 워크플로우 개선
- 기존 워크플로우의 궤적 로그에 대한 포스트-홉 감사
코드 공개 여부: 미확인
키워드
용어 해설
- 생각-행동-관찰(Thought-Action-Observation)
- — Thought-Action-Observation은 에이전트의 추론(생각), 도구 호출(행동), 도구 결과(관찰)로 구성된 트레이스의 기본 순서이며, 환각 분석의 주된 단위로 작용한다.
- 궤적 수준 환각(Trajectory-Level Hallucination)
- — 궤적 수준 환각은 단일 출력이 아닌 트레이스 전체에서 발생하는 허위 주장이나 불일치를 가리키며, 다중 단계의 에이전트 협업 맥락에서 운영 상의 오류를 초래한다.
- 다섯 유형의 분류학(Five-Type Taxonomy)
- — 다섯 가지 환각 유형(Factual, Referential, Logical, Procedural, Scope-based)을 트레이스 구조에 근거해 구분하는 분류 체계이다.
- AssetOpsBench
- — 산업용 자산 운영 및 유지보수를 시뮬레이션하는 다중 에이전트 프레임워크로, Trajel의 실험 환경으로 사용된다.
- LLM-판정자(LLM-as-a-Judge)
- — LLM을 자동 평가자로 활용하여 궤적의 환각 여부를 판단하는 평가 프레임워크이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
