본문으로 건너뛰기

전문가는 세계 모델을 가지고, LLM은 단어 모델을 가진다: 다음 토큰 예측을 넘어 다음 상태 예측으로

LLM이 생성하는 텍스트의 정교함에도 불구하고, 타인의 의도와 숨겨진 인센티브를 시뮬레이션하는 '세계 모델'의 부재가 전문가와의 결정적 차이를 만든다.

섹션별 상세

01
LLM은 겉보기에 훌륭한 결과물(Artifact)을 생성하지만, 전문가들은 이를 환경 내 다른 에이전트들과의 상호작용 속에서 실행되는 '수(Move)'로 평가한다. LLM은 텍스트의 일관성과 톤을 맞추는 데 집중하는 반면, 전문가는 해당 텍스트가 상대방의 인센티브와 제약 조건에 어떻게 작용할지를 시뮬레이션한다.
LLM의 단일 플레이어 게임 방식과 인간의 멀티플레이어 게임 방식을 비교한 다이어그램이다.
DiagramLLM은 프롬프트에 따른 출력을 내놓는 단일 플레이어 게임을 하지만, 인간은 타인(에이전트)의 반응과 숨겨진 의도를 고려하는 멀티플레이어 게임을 수행함을 시각적으로 대조하여 보여준다.
02
체스와 같은 완전 정보 게임에서는 모든 상태가 공개되어 있어 상대의 마음을 모델링할 필요가 없으며, LLM은 이와 유사한 결정론적 도메인(코드 작성, 수학)에서 뛰어난 성능을 보인다. 반면 포커와 같은 불완전 정보 게임은 정보의 비대칭성을 활용한 기만과 상대방의 모델을 역으로 이용하는 재귀적 추론이 필수적이다.
완전 정보 게임과 불완전 정보 게임의 특성을 비교한 표이다.
Infographic체스와 같은 완전 정보 게임은 가시성과 최적화가 중요하지만, 포커와 같은 불완전 정보 게임은 숨겨진 부분에 대한 추론과 신호 읽기, 리스크 관리가 핵심임을 명시한다.
03
Meta의 Pluribus와 같은 포커 AI는 자신의 패와 상관없이 모든 가능성을 고려하여 전략을 균형 있게 배분함으로써 상대방이 자신의 행동에서 정보를 읽어내지 못하게(Unreadable) 설계되었다. 현재의 LLM은 RLHF를 통해 협력적이고 예측 가능한 패턴을 보이도록 학습되었으며, 이는 적대적 환경에서 상대방에게 쉽게 읽히고 이용당하는 취약점이 된다.
04
LLM은 상대방이 자신을 테스트하거나 정보를 캐내기 위해 프로빙(Probing)을 수행하고 있다는 사실을 감지하지 못하는 '읽히기 쉬운(Readable)' 상태에 머물러 있다. 인간 전문가는 상대의 의도를 파악하고 의도적으로 오해의 소지가 있는 신호를 보내는 등 재귀적으로 대응하지만, LLM은 고정된 프롬프트 전략을 일관되게 수행하여 패턴이 노출된다.
LLM이 전략적 상황을 처리하는 과정에서 발생하는 실패 지점을 나타낸 플로우차트이다.
DiagramLLM이 전략적 상황 자체를 감지하는 첫 단계에서 실패하며, 이로 인해 에이전트 식별, 반응 시뮬레이션, 견고한 행동 선택으로 이어지는 프로세스가 작동하지 않음을 보여준다.
05
AI가 진정한 전문가 수준의 전략적 능력을 갖추기 위해서는 '다음 토큰 예측'에서 벗어나 자신의 행동이 가져올 환경의 변화를 예측하는 '다음 상태 예측'으로 학습 패러다임이 전환되어야 한다. 이를 위해 텍스트의 품질이 아닌 실제 결과(Outcome)를 보상으로 제공하는 멀티 에이전트 강화학습 환경에서의 훈련이 필수적이다.

용어 해설

마음 이론(Theory of Mind)
타인의 지식, 믿음, 의도 등 정신 상태를 추론하고 이해하는 능력이다. AI가 멀티 에이전트 환경에서 상대방의 다음 행동을 예측하고 자신의 행동이 상대에게 어떻게 해석될지 시뮬레이션하는 데 필수적인 요소이다.
불완전 정보 게임(Imperfect Information Game)
포커처럼 모든 플레이어가 게임의 전체 상태를 알 수 없는 게임이다. 상대방의 숨겨진 정보(패)를 추론하고 자신의 정보를 전략적으로 노출하거나 숨기는 기만과 블러핑이 핵심적인 전략 요소가 된다.
적대적 견고성(Adversarial Robustness)
상대방이 시스템의 취약점을 찾아내어 악용하려 할 때도 의도한 성능을 유지하는 능력이다. LLM 에이전트가 협상이나 보안 환경에서 상대의 유도 질문이나 전략적 프로빙에 넘어가지 않고 목표를 달성하는 능력을 의미한다.
추론 시점 연산(Test-time Compute)
모델이 답변을 내놓기 전 더 많은 추론 단계나 시뮬레이션을 거치도록 자원을 투입하는 기법이다. OpenAI의 o1 모델처럼 복잡한 전략적 상황에서 여러 시나리오를 검토하여 최적의 '수'를 찾기 위해 사용된다.
인간 피드백 기반 강화학습(RLHF)
인간의 선호도에 맞춰 모델을 미세 조정하는 기법이다. 모델을 더 유용하고 안전하게 만들지만, 적대적 상황에서도 지나치게 협력적이고 예의 바른 태도를 보이게 만들어 전략적 유연성을 떨어뜨리는 부작용을 낳기도 한다.

기술

  • LLM
  • Pluribus
  • RLHF
  • Test-time Compute

활용 사례

  • 전략적 협상 에이전트
  • 적대적 보안 시뮬레이션
  • 복잡한 비즈니스 의사결정 보조
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 08.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.