본문으로 건너뛰기

노이즈 환경에서의 학습: 노이즈 환경을 통한 에이전트 견고성 향상

실세계 환경은 불확실하고 동적이다. 기존 학습은 이상적인 설정에 의존하는 경향이 있어 배치된 노이즈에 취약하다. 본 연구는 노이즈를 의도적으로 도입하는 학습 프레임워크(NoisyAgent)를 통해 사용자 노이즈와 도구 노이즈에 강인한 의사결정과 일반화 능력을 향상시킨다.

왜 중요한가

실세계 환경은 불확실하고 동적이다. 기존 학습은 이상적인 설정에 의존하는 경향이 있어 배치된 노이즈에 취약하다. 본 연구는 노이즈를 의도적으로 도입하는 학습 프레임워크(NoisyAgent)를 통해 사용자 노이즈와 도구 노이즈에 강인한 의사결정과 일반화 능력을 향상시킨다.

핵심 기여

노이즈-민감 학습 프레임워크 제시

두 축의 노이즈(사용자 노이즈, 도구 노이즈)를 자동으로 주입하는 파이프라인을 제시하고, 이를 agentic training 파이프라인에 통합한다.

Adaptive noise training 도입

혼합형 학습(Hybrid Training)에서 깨끗한 트롭아웃과 노이즈 트롤아웃을 섞고, 노이즈의 난이도와 비율을 커리큘럼 방식으로 점진적으로 증가시킨다.

실험적 검증 및 일반화 분석

AgentNoiseBench 기반의 노이즈 평가에서 견고성 증가를 확인하고, 이상화 벤치마크에서도 일관된 성능 향상을 보인다.

핵심 아이디어 이해하기

출발점과 한계: 기존의 agent 학습은 이상적이고 안정적인 환경에서 수행되며, 현실 세계의 노이즈가 성능 저하를 초래한다. 해결 원리: NoisyAgent는 사용자 노이즈와 도구 노이즈를 체계적으로 주입하고, 혼합된 트롤아웃에서 그룹-정규화와 GRPO 계열 최적화를 활용해 학습 안정성을 유지한다. 달라지는 점: 커리큘럼으로 노이즈를 점진적으로 증가시키고, 노이즈로 인한 성능 저하와 정적 학습의 균형을 맞추며, 노이즈 조건에서의 로버스트성과 이상화 벤치마크에서의 개선을 동시에 달성한다.

방법론

전체 접근 방식: NoisyAgent은 환경 스케일링 파이프라인에 자동 노이즈 주입을 더하고, 학습은 깨끗한 트롤아웃과 노이즈 트롤아웃을 혼합하는 하이브리드 형식으로 진행한다. 핵심 메커니즘: 사용자 측 노이즈 ũint = πnoise(uint), 도구 측 노이즈 õt = πnoise(ot)로 각 단계에서 perturbation을 적용하고, Nrollouts 중 Nnoise만 노이즈를 적용한다. 학습 전략: GRPO 기반의 정책 최적화에서 두 그룹의 어드밴티지를 구분하여 학습하고, ∆를 이용한 노이즈 난이도 커리큘럼을 적용한다. 수식/원리(입력-계산-출력-의미): (1) J(θ) = Eq[ (1/G) ∑i∈Tclean Li,t(Âclean_i) + (1/Lj) ∑j∈Tnoise Lj,t(Ânoise_j) ]로 정책을 최적화한다. (2) Âclean_i = (ri − μclean)/σclean, Ânoise_j = (rj − μnoise)/σnoise로 각 그룹의 이점을 정규화한다. (3) ρk,t = πθ(ak,t|hk,t)/πold(ak,t|hk,t)로 비율을 정의한다. (4) ∆ = Eτ∈Tclean[1(r(τ)=1)] − Eτ∈Tnoise[1(r(τ)=1)]로 노이즈의 영향력을 측정하고 θ 초과 시 노이즈 난이도와 비율을 증가시킨다.

주요 결과

메인 벤치마크 결과: AgentNoiseBench에서 Qwen3-8B 모델의 Ours는 Avg@4 36.40, Pass@4 61.40로, GRPO 30.48/50.88, DAPO 29.39/53.51, GSPO 31.80/54.39보다 높다. Qwen3-32B의 Ours는 Avg@4 43.20, Pass@4 65.79로, GRPO 38.16/61.40, DAPO 36.18/57.89, GSPO 37.72/60.53보다 우수하다. 이상화(setting)에서의 결과 역시 Ours가 많은 도메인에서 우수한 성능을 보인다(τ2-Bench: 47.59/77.19; VitaBench: 40.00/68.00; Retail: 40.79/64.91; Airline: 22.25/35.00; Telecom: 24.00/37.00; OTA: 9.75/15.00). Ablation 연구: w/o controlled injection(13.25/21.00; 14.75/24.00), w/o scheduling(20.00/31.00; 21.50/33.00), w/o noise(16.00/26.00; 21.25/33.00), w/o training(11.75/18.00; 13.75/22.00)로 각 구성요소의 중요성을 확인했다. training dynamics: 초기에는 깨끗한 traj가 주로 학습되며, 노이즈 커리큘럼 도입 이후 NoisyAgent가 노이즈 평가에서 더 큰 성장을 보인다. 상호작용 패턴 분석: 노이즈 조건에서 NoisyAgent는 도구 호출 수를 18% 감소시키고(13.9→11.4), 응답 토큰 수를 크게 증가시키며(2,014→4,248) 더 명확하고 정보가 풍부한 응답을 산출한다.

관련 Figure

Delivery 도메인에서 no-noise 조건과 noise 조건의 Avg Score 비교 그래프
Chart

노이즈 조건에서의 성능 증가를 시각화하며, 커리큘럼 학습이 견고성을 높였음을 보인다.

Delivery 도메인에서 no-noise 조건과 noise 조건의 Avg Score 비교 그래프

Delivery 도메인에서 noise 조건의 성능 차이 비교 그래프
Chart

노이즈 학습이 일반화 및 견고성 향상에 기여함을 시각적으로 뒷받침한다.

Delivery 도메인에서 noise 조건의 성능 차이 비교 그래프

기술 상세

아키텍처: 환경 스케일링 파이프라인과 자동 노이즈 주입 파이프라인, GRPO 기반의 정책 최적화, 그룹별 어드밴티제이션, 노이즈 커리큘럼 학습으로 구성된다. 수학적 기초: J(θ) = Eq[ (1/G) ∑Li∈Tclean Ai + (1/Lj) ∑Lj∈Tnoise Aj ] 형태의 확률적 최적화 문제를 해결하며 ρk,t = πθ(ak,t|hk,t)/πold(ak,t|hk,t)로 업데이트 비율을 정의한다. 어드밴티지의 정규화는 Âclean_i = (ri − μclean)/σclean, Ânoise_j = (rj − μnoise)/σnoise로 그룹별 평균과 표준편차를 이용해 계산한다. 노이즈 주입: ũint = πnoise(uint), õt = πnoise(ot)로 사용자 인풋과 도구 응답을 perturb한다. 학습 디테일: 배치 크기 16, 롤아웃 수 32, 노이즈 비율 최대 0.5, 커리큘럼 임계치 θ와 ∆ 기반 평가를 활용한다. 평가 도구: AgentNoiseBench 및 VitaBench, 백본 모델은 Qwen3-8B, Qwen3-32B를 사용하며, 환경 구성은 GPT-4.1(환경 구축), Claude-Sonnet-4.5(평가) 사용, 롤아웃 당 100 턴 한도.

한계점

제한점은 두 가지 노이즈 축(User-Noise, Tool-Noise)에 집중하고 합성된 환경에서 주로 평가한다는 점이다. 더 다양한 상호작용 패턴과 실제 데이터에 대한 적용성은 추가 연구가 필요하다. 또한 비용 및 학습 시간의 증가가 있으며, 본 연구는 제어된 설정에서의 비교에 중점을 두었다.

실무 활용

노이즈가 존재하는 실제 환경에서 LLM 에이전트의 로버스트니스를 높이기 위한 실용적 프레임워크를 제공한다.

  • 고객 지원 자동화에서 예기치 못한 사용자 피드백과 시스템 장애에 견고하게 대응
  • 다중 도구를 이용하는 비즈니스 자동화 파이프라인의 신뢰성 개선
  • 실시간 서비스 로봇의 안정적 상호작용 및 의도 불명확성 처리

코드 공개 여부: 미확인

키워드

LLMinteractive agentsagentic trainingnoise-aware trainingenvironmental imperfectionsuser-noisetool-noiseAgentNoiseBench

용어 해설

NoisyAgent 학습(Noisy-Agent-Training)
에이전트가 현실 세계의 노이즈와 불확실성을 학습 과정에 반영하도록 설계된 에이전트 학습 프레임워크를 가리킨다.
환경 노이즈(Environmental Noise)
사용자 인터랙션과 도구 실행의 변동성으로 인한 환경 불확실성을 설명하는 개념이다.
user 노이즈(User Noise)
사용자 의도 불충분성, 변화, 불일치 등 사용자 인터랙션 패턴의 노이즈를 포괄하는 개념이다.
도구 노이즈(Tool Noise)
도구 실행의 실패, 불완전성, 오도 정보 등을 시뮬레이션하는 노이즈 개념이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 26.수집 2026. 05. 28.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.