TL;DR
현대 LLM/VLM 에이전트의 대화는 관측 정보와 행동에 근거해야 한다. 기존 연구는 주로 최종 게임 결과에 의존하거나 텍스트 기반 평가에 머물며 발화의 grounding을 자동으로 점검하지 못한다. QUACK은 엔진 로그로 재구성된 ground-truth 트래젝토리리를 바탕으로 발화의 주장들을 검증하고, 공간적 환각, 근거 없는 고발, 속임수 붕괴, 언어-행동 불일치 같은 grounding 실패를 자동으로 측정한다.
왜 중요한가
현대 LLM/VLM 에이전트의 대화는 관측 정보와 행동에 근거해야 한다. 기존 연구는 주로 최종 게임 결과에 의존하거나 텍스트 기반 평가에 머물며 발화의 grounding을 자동으로 점검하지 못한다. QUACK은 엔진 로그로 재구성된 ground-truth 트래젝토리리를 바탕으로 발화의 주장들을 검증하고, 공간적 환각, 근거 없는 고발, 속임수 붕괴, 언어-행동 불일치 같은 grounding 실패를 자동으로 측정한다.
핵심 기여
QUACK 환경의 공개 소스화
다중 모달 사회 추론을 위한 실행 가능한 환경을 오픈 소스로 제공한다. 부분 관찰이 가능한 그래프 맵, 렌더링된 전역/로컬 뷰, 그리고 재생 가능한 엔진 로그를 포함해 각 에이전트의 ground-truth 궤적을 재현한다.
3층 평가 프레임워크의 제시
Tier 1 게임 결과, Tier 2 행동 궤적, Tier 3 발화의 groundedness를 자동으로 평가하는 3-tier 프레임워크를 제시한다.
Statement Verification Pipeline의 도입
발화에서 추출된 주장들을 재구성된 ground-truth 궤적과 대조해 각 주장의 진위 여부를 자동으로 판별한다. 이 과정에서 spatial hallucination, unsupported accusation, deception collapse, language-action inconsistency를 정량적 지표로 정의한다.
세 가지 프런티어 VLM의 내부 평가
GPT-5.5, GEMINI-3.1-PRO, CLAUDE-OPUS-4.7 등 세 가지 프런티어 모델을 동종모델 및 교차모델 설정에서 평가하고, grounding Failures가 일관되게 나타남을 확인했다.
공개 로그와 코드의 재현성
엔진 로그와 평가 코드를 GitHub에 공개하여 재현 가능성을 높이고, 발화의 groundedness에 기반한 평가를 표준화한다.
핵심 아이디어 이해하기
출발점: 다중 에이전트 대화에서 발화의 신뢰성은 관측과 행동에 얼마나 충실한가에 달려 있다. 기존 평가는 주로 최종 승패나 간헐적 일치도에 의존하지만, 장기적이고 부분 관찰되는 환경에서는 발화가 ground-truth와 얼마나 일치하는지 확인하기 어렵다. 기초 개념으로 Partial Observability와 Ground-truth Trajectory를 도입한다.
논문의 해결 원리: QUACK은 partially observable Markov game으로 구성된 맵에서 Geese(crew)와 Ducks(impostors)가 상호 작용한다. 엔진 로그를 통해 각 에이전트의 ground-truth trajectory를 재구성하고, 각 발화 claim을 이 궤적과 대조하여 진위를 자동으로 판단한다. Claim은 LOCATION, SIGHTING, ACTIVITY, ACCUSATION, DEFENSE로 분류된다.
달라지는 점: 3-tier 평가와 자동 검증 파이프라인을 통해 grounding 이슈를 정량화한다. Spatial hallucination(15.1%), Unsupported accusation(53.5%), Deception collapse(22.1%), Language-action inconsistency 같은 네 가지 실패 모드가 모델들 간에 공통적으로 나타나며, 교차모델 압박에서도 악화된다. 큰 승리기가 Grounded하게 행동하지 못하는 경우가 많음을 실증한다.
방법론
단락 1: QUACK은 부분적으로 관찰 가능한 그래프 맵에서 동작하는 n-에이전트 역할 기반의 마르코프 게임이다. 두 팀은 Geese(크루)와 Ducks(Impostor)로 구성되며, Duck은 몸집을 가장하고 fake tasks를 수행한다. 맵은 10룸 노드와 가중 간선으로 표현되며 each tick에서 상태가 갱신된다. 단락 2: 관찰 공간(o ti)은 두 이미지(rendered global/local)와 구조화된 요약 τ ti로 구성된다. 렌더링 뷰는 위치와 자신이 본 것만 보여주고, 구조화된 요약은 이동 상태, 관찰된 이벤트, 인접 룸 및 경로 비용 등을 포함한다. 단락 3: 에이전트는 o ti와 과거 trajectory를 바탕으로 행동 및 발화를 생성한다. 발화는 회의 중에 생성되며, 메세지는 토론 transcript와 상호작용한다. 단락 4: 전이 다이나믹스는 FREEROAM, DISCUSSION, VOTING, EJECTION, GAMEOVER의 사이클로 구성되며, 종료 조건은 Ducks 동일 수, Goose의 작업 완료, 또는 타임 아웃이다. 단락 5: Tier 3은 Claim extraction과 Claim verification으로 구성된다. Claim 유형은 LOCATION, ROUTE, SIGHTING, ACTIVITY, ACCUSATION, DEFENSE이며, 각 claim은 시간 창(window)과 근거를 갖고 검증된다. 단락 6: Grounding failure를 네 가지로 정의한다. Spatial hallucination, Unsupported accusation, Deception collapse, Language-action inconsistency. 파이프라인의 신뢰도는 전문가 휴먼으로 200개의 claims 샘플 검증과 20개의 utterance 샘플 재확인을 통해 99.5%/98.7%의 precision/recall로 확인됐다.
관련 Figure

MAP 구조와 관찰 정보의 구성을 시각적으로 보여주며, Tier 3의 ground-truth trajectory 재구성 및 발화 검증의 기반이 되는 구조를 이해하는 데 도움이 된다.
Alice의 Observation과 각 룸의 연결 구조를 포함한 맵 다이어그램 및 Alice의 Observation 예시가 제시된 그림.
주요 결과
메인 벤치마크 결과: 270게임에서 Grounding 프랙티스의 차이가 존재하며, Spatial hallucination은 15.1%로 나타난다. Unsupported accusation은 53.5%로 가장 높은 grounded-ungrounded 비율을 보인다. Deception collapse는 Duck 측에서 22.1%의 verifiable claims이 거짓인 경우가 관찰되었고, Deception sophistication은 모든 모델에서 거의 0에 가깝다. Language-action inconsistency 역시 빈번하며, Duck의 거짓 주장이 실제 행동과 일치하지 않는 사례가 다수였다. 교차모델 설정에서도 이러한 grounding 이슈가 지속적으로 나타나며, 가장 강한 Geese(GPT-5.5)조차 spatial hallucination을 16.4%로 보유하고, grounded한 accusations의 비율이 낮다. 한편, 같은 설정에서 verifiable lie가 보고되었을 때 Duck이 ejected되는 비율은 평균 75.2%에 불과해, 제시된 ground-truth와 증거에도 불구하고 추론에서의 실패가 생존 전략에 영향을 미침을 시사한다.
기술 상세
구현 세부사항: QUACK은 그래프 맵과 10룸 구성 같은 고정 맵 설정에서 6명 에이전트(n=6,m=1)로 구성된다. 관찰은 global/local 이미지 2개와 τ ti 구조화 요약으로 이루어져 있으며, 에이전트는 상태 메모리의 trajectory를 유지한다. 전개 흐름은 FREEROAM → DISCUSSION → VOTING → EJECTION의 사이클로 진행되며, 각 tick에서 상태 업데이트와 이벤트 로깅이 이루어진다. Claim extraction은 GPT-5.5를 이용해 각 발화에서 LOCATION, ROUTE, SIGHTING, ACTIVITY, ACCUSATION, DEFENSE 등 5가지 유형의 주장으로 분해한다. Claim verification은 claim의 시간 윈도우를 ground-truth trajectory에 대조해 true/false/wrong_room/near_miss/unverifiable로 판정한다. 신뢰도 평가를 위한 human-검증은 extraction precision 99.5%, recall 98.7%를 보고한다. Grounding failure의 네 가지 축은 spatial hallucination, unsupported accusation, deception collapse, language-action inconsistency이며, 교차모델 설정에서도 유의하게 나타난다.
한계점
한계로 논문은 claim extraction이 LLM 의존적이며, 맵 구성은 고정된 10룸 맵에 한정된다. 비주얼 모듈의 기여도는 분리해 평가하지 않았고, 실험은 단일 맵 구성(n=6,m=1)에서 수행되었다. 또한 발화의 Pragmatic content를 완전 포착하기 위해서는 더 다양한 맵과 다수의 impostor/crew 구성이 필요하다.
실무 활용
QUACK는 VLM 에이전트의 groundedness를 진단하고 강화하는 데 활용될 수 있는 진단 도구다. 엔드-투-엔드 평가에서 발화의 근거를 자동으로 확인함으로써, 운영 환경에서의 신뢰성 있는 의사소통과 디버깅에 기여한다.
- Groundedness auditing for multi-agent LLM/VLM systems in collaborative tasks
- Red-teaming and deception-detection training for agents
- Ground-truth trajectory 기반의 검증 가능한 대화 데이터 수집
- 안전 및 규제 준수를 위한 발화-행동 일치성 모니터링
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Ground-truth Trajectory
- — 에이전트가 실제로 관측하고 이동한 경로를 시간축으로 재구성한 재현 가능한 기록으로, 발화의 주장과 행동의 일치 여부를 평가하는 기준이 된다.
- Statement Verification Pipeline
- — 오픈된 엔진 로그에서 재구성된 ground-truth trajectory의 각 발화 주장을 구성 요소로 분해하고, 이들 주장을 ground-truth와 대조하여 진위 여부를 자동으로 확인하는 체계이다.
- Spatial Hallucination
- — 에이전트가 실제로 존재하지 않는 위치나 시점을 발화에 포함하는 현상으로, 부분 관찰 환경에서의 위치 추정 오류를 반영한다.
- Unsupported Accusation
- — 발화에서 특정 플레이어를 의심한다고 진술하되, 자신의 관측이나 ground-truth로 뒷받침되지 않는 경우를 가리킨다.
- Deception Collapse
- — Duck이 쉽게 거짓을 만들어 알리려는 전략이 사전에 판단 가능한 수준의 거짓으로 드러나는 현상으로 분석된다.
- Language-Action Inconsistency
- — 발화로 진술된 활동이나 경로가 실제 로그의 행동과 충돌하는 현상으로, 알리기 위한 서술과 실제 행동 간의 불일치를 포착한다.
- Vision-Language Model
- — 이미지-텍스트를 연계하는 다중모달 모델로, 본 연구의 에이전트에 사용되는 핵심 기술이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.