본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
10,000 FPS 온폴리시 가치 학습: REPO 알고리즘 소개
강화학습의 PPO(Proximal Policy Optimization)란 무엇인가?
제로샷 시뮬-실세계 로봇 학습: 반응적 포착에 대한 정교한 조작 연구
DOS 게임 'Indianapolis 500'을 위한 강화학습 에이전트 개발기
상시 통신이 다중 에이전트 AI의 조정을 방해한다는 연구 결과
EgoPush: 이동 로봇을 위한 엔드투엔드 1인칭 시점 다중 객체 재배치 학습
최적 제어의 핵심 원리: 피드백, 학습 및 적응
스카이림 AI 3종이 모두 '은신 궁수'가 된 이유: 강화학습으로 증명한 게임 이론
Representation over Routing: 다중 타임스케일 PPO에서의 시간적 라우팅 병리 진단
보행 로봇을 위한 분포 강화학습 라이브러리 e3rl 공개
고전 아케이드 게임 파이널 파이트를 활용한 행동 복제 및 강화학습 실험
인간 피드백 기반 강화학습(RLHF)을 통한 LLM 성능 극대화 전략
다중 시간 척도 강화학습에서의 정책 붕괴 해결: '라우팅보다 표현' 접근법
비트코인 RL 에이전트 NASMU의 2020-2026 백테스트 성공 사례 및 학습 분석
강화학습 환경 구축을 위한 드래그 앤 드롭 방식의 2D 물리 시뮬레이터 공개
PyTorch로 처음부터 구현한 LLM 정렬 기법 비교: PPO, GRPO, DPO 분석
StepSearch: 단계별 근사 정책 최적화(StePPO)를 통한 LLM 검색 능력 강화
RLHF와 GRPO의 기반이 되는 강화학습 실전 가이드
GPT-OSS를 위한 에이전트형 강화학습(Agentic RL) 학습 활성화: 실전 회고록
정규화된 마르코프 결정 과정(MDP)의 이론: 엔트로피를 넘어선 볼록 정규화
← 피드로 돌아가기
PPO
Training (학습/파인튜닝)
약 91개 아티클
관련 태그:
GRPO
DQN
PyTorch
DPO
SAC
RLHF
xLSTM
RL
Stable-Baselines3
Transformer