관련 기사 바로가기
처음부터 구현하는 강화학습(Reinforcement Learning) 강의 시리즈 및 코드 공유포켓몬 쇼다운(Pokémon Showdown) 9세대 랜덤 배틀을 위한 강화학습 에이전트 구축기Language Model Zero (LMZ): 인간의 데이터 없이 스스로 언어와 지식을 학습하는 1차원 월드 시뮬레이션그라디언트 없이 스칼라 보상만으로 신경망 학습시키기: 18번의 실패 끝에 얻은 성공벨만 최적 방정식과 그리디 정책의 최적성 증명UC 버클리 센서리모터 AI 저널 클럽: RL 토론 시리즈 피날레 및 신규 세션 안내SWE-rebench-V2 공개: 코딩 에이전트 학습을 위한 세계 최대 규모의 오픈 데이터셋