본문으로 건너뛰기
관련 기사 바로가기
Video-DeepResearch 멀티모달 딥리서치 에이전트
프레임 순서 기반 진행도만으로 학습하는 Rank-Then-Act
그래프-네이티브 강화학습을 통한 개념 재조합 기반 추적 가능한 과학적 가설 생성
← 피드로 돌아가기
Group Relative Policy Optimization (GRPO)
Training (학습/파인튜닝)
약 3개 아티클
관심 태그 추가
Training
관련 태그:
Graph-PRefLexOR
GRPO
Video-DeepResearch
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필