관련 기사 바로가기
MediX-R1: 개방형 의료 강화 학습 프레임워크하이브리드 온/오프 정책 최적화를 통한 탐색적 메모리 증강 LLM 에이전트가중 상호 정보량 데이터 선택을 통한 효율적인 RLVR 학습InfoPO: 사용자 중심 에이전트를 위한 정보 기반 정책 최적화CoVe: 제약 조건 가이드 검증을 통한 대화형 도구 사용 에이전트 학습Tool-R0: 제로 데이터 기반 도구 학습을 위한 자가 진화 LLM 에이전트V1: 병렬 추론 모델을 위한 생성 및 자기 검증의 통합 프레임워크맹점에서 이득으로: 대형 멀티모달 모델을 위한 진단 기반 반복 학습보상 모델링을 통한 이미지 생성의 공간적 이해 능력 향상의료용 시각-언어 모델(VLM)에서 강화학습은 언제 도움이 되는가? 시각, SFT, RL 이득의 분리 분석기하학 가이드 강화학습을 이용한 다중 뷰 일관성 3D 장면 편집강화학습에서 그룹 수준 자연어 피드백을 통한 탐색 부트스트래핑MemSifter: 결과 중심 프록시 추론을 통한 LLM 메모리 검색 오프로딩행동할 때와 거절할 때를 배우기: 안전한 다단계 도구 사용을 위한 에이전트 추론 모델 보호좁은 시야에서 파노라마 시야로: 어텐션 가이드 콜드스타트를 통한 멀티모달 추론의 재구성Memex(RL): 인덱스 기반 경험 메모리를 통한 장기 작업 LLM 에이전트 확장이종 에이전트 협업 강화 학습에이전트 비판적 학습: LLM 에이전트의 자율적 추론 및 행동 품질 평가 능력 향상을 위한 강화학습 패러다임비디오 추론 모델은 실외 환경으로 나갈 준비가 되었는가?대형 언어 모델의 도구 사용을 위한 인컨텍스트 강화학습