로봇 학습의 병목은 알고리즘이 아닌 데이터? 시뮬레이션 자산 생성 플랫폼 4종 비교
로봇 강화학습의 sim-to-real 성능을 결정짓는 핵심 요소인 물리적 정확도와 자산 다양성을 확보하기 위한 4가지 시뮬레이션 자산 생성 플랫폼을 비교 분석함.
강화학습 분야의 최신 연구, 프로젝트 구현, 알고리즘 토론 및 관련 뉴스를 공유하는 레딧 커뮤니티입니다.
로봇 강화학습의 sim-to-real 성능을 결정짓는 핵심 요소인 물리적 정확도와 자산 다양성을 확보하기 위한 4가지 시뮬레이션 자산 생성 플랫폼을 비교 분석함.
메모리, 반성, 8개 성분 보상 체계 등 인지 기능을 환경 수준에서 제공하는 의존성 없는 순수 파이썬 강화학습 프레임워크 CogniCore가 공개됐다.
보행 로봇 제어를 위한 DPPO, DSAC 등 분포 강화학습 알고리즘을 포함한 PyTorch 기반 라이브러리 e3rl이 공개됐다.
1세대 포켓몬 배틀의 완전 정보 탐색을 위해 초고속 시뮬레이터와 신경망 학습 기능을 결합한 파이썬 라이브러리가 공개됐다.
대량의 데이터 수집보다 특정 모델 행동을 유도하기 위한 정교한 데이터 엔지니어링과 워크플로 설계가 데이터셋의 핵심 가치로 부상했다.
시각적 인터페이스를 통해 Box2D 기반의 강화학습 환경을 설계하고 실시간으로 학습 과정을 시각화할 수 있는 2D RL 도구가 공개됐다.
다중 에이전트 시스템에서 상시 통신이 조정 능력을 저해하며, 위기 상황에서만 통신을 허용하는 적응형 스티그머지 방식이 성능을 최대 34% 향상시킨다는 연구 결과이다.
현재 RLHF의 정적 보상 모델링과 단기 평가 구조가 가진 한계를 지적하고, 다중 에이전트 상호작용과 궤적 기반 보상을 통한 진정한 강화학습으로의 전환 필요성을 논의한다.
Pygame으로 구축한 드론 요격 환경에서 사격 페널티 보상을 통해 탄약 보존과 밀도별 대응 전략을 학습시킨 사례이다.
POMDPPlanners는 다양한 플래닝 알고리즘과 환경을 통합 인터페이스로 제공하여 연구와 산업 응용을 돕는 오픈소스 파이썬 라이브러리이다.
다양한 강화학습 알고리즘을 적용하여 Snake, 레이싱, 슈팅 등 여러 토이 게임 에이전트를 학습시킨 오픈소스 프로젝트를 공유했다.
20층 건물 내 4대의 엘리베이터 제어를 위해 PPO 알고리즘을 적용하여 고전적 배차 방식 대비 대기 시간을 84% 줄인 실험 결과와 커스텀 Gymnasium 환경을 공유했다.
강화학습의 근본적인 정의와 보상 가설의 수학적 한계를 지적하며 에이전트 중심의 지속적 적응 관점을 조명하는 연구를 공유했다.
Onyx는 RAG, 하이브리드 검색, 커스텀 에이전트 구축을 지원하며 보안 환경에서 자가 호스팅이 가능한 오픈소스 AI 채팅 플랫폼이다.
Multi-Agent PPO 학습 시 단순 최대값 스케일링보다 Z-score 정규화에서 성능이 하락하는 현상의 원인과 해결책이 확인됐다.
유니티와 MuJoCo를 활용해 물리 기반 휴머노이드를 생성하고 TorchSharp으로 기기 내에서 직접 SAC 강화학습을 수행하며 퀘스트 MR 환경에서 상호작용하는 프레임워크이다.
LunarLander-v3 환경에서 DQN 변체들의 성능을 단순 보상 외에 그래디언트 분포, 액션 갭, Q-값 동역학 등 다각도로 분석한 평가 프레임워크를 공유했다.
OpenCV로 추출한 특징 벡터와 PPO 알고리즘을 결합하여 지오메트리 대시의 초기 레벨들을 자율적으로 클리어하는 강화학습 프레임워크이다.
메모리 회상, 안전 계층, 전이 학습을 지원하며 트랜스포머 기반 범용 에이전트 실험이 가능한 오픈소스 강화학습 프레임워크 Multiverse가 공개됐다.
화학공학 학사 논문으로 개발된 전기차 배터리 열 관리 시스템 환경에서 SAC 강화학습과 모델 예측 제어(MPC)의 성능을 비교 분석한 프로젝트이다.
IT 전문가들이 익숙한 PowerShell 5.1 환경에서 강화학습 알고리즘의 내부 동작 원리를 직접 확인하고 학습할 수 있는 오픈소스 프레임워크 VBAF가 공개되었습니다.
스트리밍 데이터에서 누적되는 재식별 위험을 강화학습 기반의 적응형 컨트롤러로 관리하여 개인정보 보호와 데이터 유용성 사이의 최적의 균형을 찾는 프로젝트입니다.