관련 기사 바로가기
HiMAP-Travel: 장기 제약 조건 여행 계획을 위한 계층적 멀티 에이전트 계획 프레임워크BandPO: 확률 인지 경계를 통한 LLM 강화학습의 신뢰 영역과 비율 클리핑 연결컨텍스트가 아닌 에이전트 능력의 확장: 대규모 도구 공간을 위한 효율적인 강화학습 파인튜닝금융 분야의 데이터 가치 극대화: 증류 및 난이도 인지 학습에 관한 연구RetroAgent: 회고적 이중 내재적 피드백을 통한 해결에서 진화로의 전환비지도 강화학습(URLVR)은 LLM 학습을 어디까지 확장할 수 있는가?Fish Audio S2 기술 보고서RubiCap: 정밀한 이미지 캡셔닝을 위한 루브릭 가이드 강화학습MM-Zero: 제로 데이터로부터 스스로 진화하는 멀티 모델 비전 언어 모델CodePercept: MLLM을 위한 코드 기반 시각적 STEM 인지 능력 강화V0.5: 희소한 강화학습 롤아웃을 위한 사전 지식으로서의 범용 가치 모델희소에서 밀집으로: 증강된 조건 공간을 통한 플로우 모델용 멀티뷰 GRPO비디오 스트리밍 사고: 비디오 LLM은 시청과 사고를 동시에 수행할 수 있다Visual-ERM: 시각적 동등성을 위한 리워드 모델링GRPO를 이용한 소형 언어 모델의 코드 실행 예측 성능 개선 및 72% 정확도 정체 문제 해결 방안FOOM.md: 모델 고유의 계산 매체를 통한 추론 가속화 연구 청사진