TL;DR
Salesforce AI Research는 ICLR 2026에서 복잡한 환경에서의 에이전트 신뢰성, 추론 능력 강화, 시스템 효율성 및 평가 프레임워크를 주제로 한 21편의 논문을 공개했다. 주요 연구로는 GUI 환경에서 자율적으로 과업을 수행하는 GTA1 에이전트와 에이전트 간 대화 시 발생하는 '에코잉' 결함 분석 등이 포함됐다. 또한 강화학습(RL)을 활용해 데이터 효율성을 100배 높인 Webscale-RL과 수학적 추론 효율을 극대화한 HyRea 기술을 선보였다. 이러한 성과들은 기업용 AI가 대규모 환경에서 더 안전하고 경제적으로 작동할 수 있는 기술적 토대를 마련했다.
배경
LLM 에이전트 아키텍처 및 도구 사용(Tool Use) 개념, 강화학습(RL) 및 GRPO 알고리즘에 대한 기본 이해, 추론 시간 스케일링(Test-time Scaling) 및 CoT 개념
대상 독자
엔터프라이즈 AI 에이전트를 설계하는 개발자 및 효율적인 LLM 추론/학습 기법을 연구하는 ML 엔지니어
의미 / 영향
이번 연구 성과들은 AI 에이전트가 실제 비즈니스 환경에서 겪는 역할 상실이나 비효율성 문제를 해결하는 데 집중하고 있습니다. 특히 추론 시간 스케일링과 데이터 효율적 강화학습 기술은 기업들이 더 적은 비용으로도 고성능의 특화 모델을 운영할 수 있게 하여 AI 도입의 경제적 장벽을 낮출 것으로 기대됩니다.
섹션별 상세
- LLM 에이전트 간 대화에서 에코잉 발생률이 최대 70%에 달하며, 이 중 93%는 표준 지표에서 성공으로 기록된다. — ECHOING: Identity Failures 섹션

- CoAct-1 시스템은 OSWorld 벤치마크에서 60.76%의 성공률을 기록하며 새로운 SOTA를 달성했다. — CoAct-1: Computer-using Multi-agent System 섹션

- HyRea 기술은 수학적 추론 벤치마크에서 정확도를 유지하며 토큰 사용량을 약 60%로 줄였다. — Learning to Reason over Continuous Tokens (HyRea) 섹션
- Webscale-RL은 기존 사전 학습 대비 100배 적은 토큰으로 유사한 성능의 지속적 학습을 달성했다. — Webscale-RL 섹션
용어 해설
- Test-time Scaling
- — 모델이 추론(Test-time) 시에 더 많은 계산 자원을 투입하여 결과의 품질을 높이는 기법이다. 여러 후보 답변을 생성하고 검증하거나, 사고의 사슬(CoT)을 확장하는 방식을 통해 복잡한 추론 문제의 해결 능력을 향상시킨다.
- Echoing
- — 자율적인 LLM 에이전트들이 서로 대화할 때, 할당된 고유 역할을 잊고 대화 상대방의 말투나 역할을 그대로 따라 하는 현상이다. 이는 에이전트 시스템의 신뢰성을 저해하며, 표준 지표로는 감지하기 어려운 정렬 실패 사례에 해당한다.
- GRPO
- — Group Relative Policy Optimization의 약자로, 별도의 비평가(Critic) 모델 없이 그룹 내 상대적 보상을 통해 정책을 업데이트하는 강화학습 기법이다. 계산 효율성이 높으며 최근 추론 모델의 정렬 및 성능 향상에 널리 사용된다.
- Circuit Analysis
- — 신경망 내부의 특정 뉴런이나 어텐션 헤드가 수행하는 논리적 기능을 분석하여 모델의 작동 원리를 파악하는 해석 가능성(Interpretability) 연구 방법이다. 특정 작업이 모델 내 어떤 구조적 경로를 통해 처리되는지 규명한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

