관련 기사 바로가기
에이전트용 턴제 게임 benchmark DelveRLBreakout에서 PPO의 암기 스크립트와 근접 보상으로의 해결R-GCN 탐정과 GNN Mr. X를 학습시켜 PUCT 검색과 결합해 탐정 승률 91.7% 달성10,000 FPS 온폴리시 가치 학습: REPO 알고리즘 소개강화학습의 PPO(Proximal Policy Optimization)란 무엇인가?제로샷 시뮬-실세계 로봇 학습: 반응적 포착에 대한 정교한 조작 연구DOS 게임 'Indianapolis 500'을 위한 강화학습 에이전트 개발기상시 통신이 다중 에이전트 AI의 조정을 방해한다는 연구 결과EgoPush: 이동 로봇을 위한 엔드투엔드 1인칭 시점 다중 객체 재배치 학습CUDA Agent: 고성능 CUDA 커널 생성을 위한 대규모 에이전트 강화학습 시스템정책 개선 강화학습(PIRL)과 회고 검증 레이어인 PIPO: 업데이트 효과를 확인하고 강화·보정하는 닫힌 루프 접근Representation over Routing: 다중 타임스케일 PPO에서의 시간적 라우팅 병리 진단보행 로봇을 위한 분포 강화학습 라이브러리 e3rl 공개고전 아케이드 게임 파이널 파이트를 활용한 행동 복제 및 강화학습 실험인간 피드백 기반 강화학습(RLHF)을 통한 LLM 성능 극대화 전략다중 시간 척도 강화학습에서의 정책 붕괴 해결: '라우팅보다 표현' 접근법비트코인 RL 에이전트 NASMU의 2020-2026 백테스트 성공 사례 및 학습 분석강화학습 환경 구축을 위한 드래그 앤 드롭 방식의 2D 물리 시뮬레이터 공개PyTorch로 처음부터 구현한 LLM 정렬 기법 비교: PPO, GRPO, DPO 분석StepSearch: 단계별 근사 정책 최적화(StePPO)를 통한 LLM 검색 능력 강화