본문으로 건너뛰기
Reddit
소스별 피드
아티클 353개
r/reinforcementlearning
강화학습(RL) 분야에 특화된 전 세계적인 로, 논문 구현 경험과 실무적인 트러블슈팅 노하우가 매우 풍부함
최신 글
조회수순 — 오늘
조회수순 — 이번 주
조회수순 — 이번 달
관심 태그 추가
Language Models
Libraries
Training
Architecture
Products
Benchmarks
Agents
Hardware
Coding Agents
Best Practices
MLOps
Dev Tools
Inference
TIME
HEADLINE
3달 전
RDT
RDT
Noisy Nets를 사용한 에이전트 평가, 왜 결정론적 방식이 항상 정답은 아닐까?
요약 펼치기
4달 전
RDT
RDT
GPU 없이 브라우저에서 끝내는 AI 미세 조정, 엔지니어의 역할이 바뀐다
2
요약 펼치기
4달 전
RDT
RDT
강화학습 실험이 쉬워진다! 한 줄 명령어로 실행하는 Ostrea 프로젝트
요약 펼치기
5달 전
RDT
RDT
28,565% 수익률을 기록한 AI 트레이더가 시장에 대해 배운 것
6
요약 펼치기
5달 전
RDT
RDT
똑똑한 AI가 왜 멍청한 실수를 할까? 8단계 계층 구조 ALHA가 답하다
3
요약 펼치기
5달 전
RDT
RDT
보상 설계 없이 뇌 모델로 로봇 강아지를 학습시키다
요약 펼치기
5달 전
RDT
RDT
내가 만든 AI에게 추월당했다: Rainbow DQN으로 정복한 2D 카트 레이싱
2
요약 펼치기
5달 전
RDT
RDT
버리던 체크포인트의 재발견: 약한 모델로 SFT 한계를 돌파하는 법
9
요약 펼치기
5달 전
RDT
RDT
강화학습부터 LLM까지, 포켓몬 마스터가 될 AI는 누구?
4
요약 펼치기
6달 전
RDT
RDT
Windows에서 강화학습 환경 구축, MuJoCo부터 SB3까지 한 번에 해결하기
1
요약 펼치기
6달 전
RDT
RDT
폐쇄적 라이선스 폐기, SOTA RL 툴킷 전면 오픈소스화 선언
3
요약 펼치기
6달 전
RDT
RDT
JAX의 Disco103을 PyTorch로! Catch 벤치마크 99% 달성
요약 펼치기
6달 전
RDT
RDT
샘플 비용은 절반으로, 성능은 3.3% 향상시킨 이종 에이전트 협력 강화학습
6달 전 발행
요약 펼치기
6달 전
RDT
RDT
RTX 4090으로 도전하는 DPO: 에이전트 추론 경로로 데이터셋 만들기
6달 전 발행
요약 펼치기
6달 전
RDT
RDT
프라이버시 걱정 없는 나만의 AI 워크스페이스, Onyx 오픈소스 공개
6달 전 발행
요약 펼치기
6달 전
RDT
RDT
강화학습 알고리즘, 밑바닥부터 직접 구현하며 마스터하기
6달 전 발행
요약 펼치기
6달 전
RDT
RDT
F1 2026 규정의 핵심, AI로 상대의 숨겨진 배터리 상태를 읽는다
6달 전 발행
요약 펼치기
6달 전
RDT
RDT
평균 보상은 비슷해도 안정성은 23배? 강화학습 조건화의 비밀
6달 전 발행
요약 펼치기
6달 전
RDT
RDT
1900 ELO 달성: 탐색 엔진 없이 신경망만으로 포켓몬 고수가 된 AI
6달 전 발행
요약 펼치기
6달 전
RDT
RDT
1억 2천만 토큰 분석으로 밝혀낸 모델의 가식적 복종과 새로운 추론 엔진
6달 전 발행
1
요약 펼치기
6달 전
RDT
RDT
GRPO로 72%까지 올렸는데... 소형 모델 코드 예측의 한계 돌파하기
6달 전 발행
요약 펼치기
6달 전
RDT
RDT
성능과 다양성이 충돌할 때? Lean 4로 증명된 자동 종 분화 시스템
6달 전 발행
1
요약 펼치기
6달 전
RDT
RDT
Z3와 Lean 4로 구현하는 안전한 모델 가중치 업데이트
6달 전 발행
1
요약 펼치기
6달 전
RDT
RDT
물리학과 강화학습의 만남: Lean 4로 검증하는 에너지 보존 MARL
6달 전 발행
1
요약 펼치기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필