용어 해설
- 제약 조건 표류(Constraint Drift)
- — LLM 에이전트가 긴 추론 과정이나 도구 사용 기록이 누적됨에 따라 초기 설정된 전역 제약 조건(예: 전체 예산)에 대한 주의력을 잃고 이를 위반하는 현상이다. 컨텍스트가 길어질수록 초기 정보의 영향력이 약해지는 Transformer 아키텍처의 한계로 인해 발생하며, 계획의 일관성을 해치는 주요 원인이 된다.
- 그룹 상대 정책 최적화(GRPO)
- — DeepSeek-V3에서 제안된 강화학습 알고리즘으로, 별도의 Critic 모델 없이 샘플링된 그룹 내의 상대적 보상을 기준으로 정책을 업데이트한다. 계산 효율성이 높고 메모리 사용량을 줄이면서도 모델의 추론 능력을 효과적으로 정렬할 수 있어 멀티 에이전트 학습에 유리하다.
- 역할 조건화(Role Conditioning)
- — 단일 LLM 정책이 시스템 프롬프트나 입력 접두사를 통해 서로 다른 역할(예: 조정자, 실행자)을 수행하도록 유도하는 기법이다. 이를 통해 여러 모델을 개별적으로 학습시키지 않고도 하나의 모델 내에서 복잡한 협업 구조를 구현할 수 있으며, 역할 간의 지식 전이 효과를 기대할 수 있다.
- 최종 통과율(Final Pass Rate)
- — 에이전트가 생성한 전체 계획이 모든 하드 제약 조건(예: 예산, 기간, 장소 중복 금지 등)을 동시에 만족하는 비율을 측정하는 지표이다. 단순한 문법적 정확도를 넘어 실제 실행 가능한 계획의 품질을 평가하는 핵심 벤치마크 지표로 사용된다.
- 트랜잭션 모니터(Transactional Monitor)
- — 병렬로 실행되는 여러 에이전트가 공유 자원(예: 예산)을 사용할 때 데이터 무결성을 보장하기 위해 도입된 외부 제어 장치이다. 데이터베이스의 트랜잭션 개념을 차용하여 원자적(Atomic) 연산을 지원하며, 에이전트 간의 자원 충돌이나 중복 예약을 실시간으로 방지한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
