관련 기사 바로가기
길이 확장을 넘어: 생성형 보상 모델을 위한 너비와 깊이의 시너지MediX-R1: 개방형 의료 강화 학습 프레임워크LLM 터미널 능력 확장을 위한 데이터 엔지니어링 연구CHIMERA: 일반화된 LLM 추론을 위한 콤팩트한 합성 데이터참조 가이드 파인튜닝을 통한 강화학습 중 고난도 문제 학습CoVe: 제약 조건 가이드 검증을 통한 대화형 도구 사용 에이전트 학습서지컬 포스트 트레이닝: 지식은 유지하고 오류만 도려내기MemSifter: 결과 중심 프록시 추론을 통한 LLM 메모리 검색 오프로딩Memex(RL): 인덱스 기반 경험 메모리를 통한 장기 작업 LLM 에이전트 확장에이전트 비판적 학습: LLM 에이전트의 자율적 추론 및 행동 품질 평가 능력 향상을 위한 강화학습 패러다임HiMAP-Travel: 장기 제약 조건 여행 계획을 위한 계층적 멀티 에이전트 계획 프레임워크컨텍스트가 아닌 에이전트 능력의 확장: 대규모 도구 공간을 위한 효율적인 강화학습 파인튜닝Penguin-VL: LLM 기반 비전 인코더를 활용한 시각 언어 모델의 효율성 한계 탐색대규모 언어 모델이 따라잡을 수 있을까? 지속적인 지식 스트림에 대한 온라인 적응 벤치마킹비지도 강화학습(URLVR)은 LLM 학습을 어디까지 확장할 수 있는가?사고를 통한 회상: 추론이 대형 언어 모델의 파라미터 지식을 깨우는 방법V0.5: 희소한 강화학습 롤아웃을 위한 사전 지식으로서의 범용 가치 모델OmniStream: 연속 스트림에서의 지각, 재구성 및 행동 마스터하기LLM2VEC-GEN: 대형 언어 모델을 활용한 생성형 임베딩파인튜닝된 Qwen3 SLM(0.6-8B), 특정 작업에서 프런티어 LLM 능가