본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
VibeThinker-3B 논문 분석: 소형 추론 모델의 학습 전략
스타트업이 드러낸 차세대 AI 인프라
LEAD: 길이 기반의 적응적 동적 추론으로 대형 언어 모델의 길이 효율화
NVIDIA와 Ineffable Intelligence, 대규모 강화학습 인프라 구축 협력
CogniCore: 인지 미들웨어가 내장된 새로운 강화학습 프레임워크
1세대 포켓몬 배틀을 위한 초고속 시뮬레이터 및 신경망 학습 라이브러리
SimToolReal: 제로샷 다지 로봇 도구 조작을 위한 객체 중심 정책
5개의 AI 어시스턴트로 구축한 3가지 연구용 AI 플랫폼: FEMS, VulcanAMI, ASE
Arc Raiders의 적 AI를 구동하는 머신러닝의 마법
확산 언어 모델과 강화학습을 활용한 웹 에이전트 성능 개선 연구
Rainbow DQN을 활용한 2D 카트 레이싱 AI 개발기: 개발자를 이긴 인공지능
에이전트형 AI가 교체 불가능한 레거시 시스템을 치유하는 방법
AlphaZero의 한계: Nim 게임에서 드러난 상징적 추론의 부재
클라우드 ETL 파이프라인 복구를 위한 RL 기반 헬스 에이전트
VideoRLVR: 검증 가능한 보상으로 비디오 추론을 수행하는 방법
추론 모델은 언제 생각을 멈춰야 할지 내재적으로 알고 있는가?
SKILL0: 스킬 내재화를 위한 인컨텍스트 에이전트 강화학습
강화학습이 LLM 에이전트의 일반화 능력을 향상시킬 수 있는가? 실증적 연구
Multilingual Reasoning Gym: 절차적 추론 환경의 다국어 확장
데이터브릭스, AI 에이전트 평가 및 강화학습 혁신을 위해 Quotient AI 인수
← 피드로 돌아가기
RL
Training (학습/파인튜닝)
약 98개 아티클
관련 태그:
GRPO
Alignment
Best Practice
Microsoft
Chain of Thought
Anthropic
PPO
Continual Learning
Claude
DQN