본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
보행 로봇을 위한 분포 강화학습 라이브러리 e3rl 공개
정규화된 마르코프 결정 과정(MDP)의 이론: 엔트로피를 넘어선 볼록 정규화
MDP에서 최적 정책이 결정론적인 이유와 확률적 정책의 필요성
유니티 기반 물리 휴머노이드 강화학습 및 혼합 현실(MR) 상호작용 오픈소스 프로젝트
전기차 배터리 열 관리 시스템을 위한 강화학습 및 MPC 제어 전략 비교 연구
ARCUS-H: 강화학습 에이전트의 견고성 및 스트레스 하 붕괴 평가를 위한 새로운 프레임워크
← 피드로 돌아가기
SAC
Training (학습/파인튜닝)
약 14개 아티클
관련 태그:
PPO
ARCUS-H
JAX
Stable-Baselines3
MuJoCo
TorchSharp
Robustness
TD3
PyTorch
Mirror Descent