관련 기사 바로가기
추론 모델은 언제 생각을 멈춰야 할지 내재적으로 알고 있는가?ASI-Evolve: AI가 AI 연구와 개발을 스스로 가속화하는 에이전트 프레임워크M4 Mac에서 SmolLM2-360M으로 GRPO 강화학습 루프를 구현하며 겪은 시행착오PyTorch로 처음부터 구현한 LLM 정렬 기법 비교: PPO, GRPO, DPO 분석개인화된 그룹 상대 정책 최적화(P-GRPO): 이질적인 선호도 정렬을 위한 새로운 프레임워크로컬 하드웨어를 활용한 오픈 소스 모델 무료 파인튜닝 파일럿 프로젝트 모집Qwen2.5-0.5B-Instruct 모델의 GSM8K 추론 튜닝 중 발생한 리워드 해킹 사례Gen-Searcher: 이미지 생성을 위한 에이전트 기반 강화 검색 시스템정보 이론적 한계까지 효율성을 높이기 위한 문법 유도 기반 강화학습UniGRPO: 추론 기반 시각적 생성을 위한 통합 정책 최적화멀티모달 Chain-of-Thought를 위한 토큰 수준 정책 최적화의 재고비디오 생성을 위한 강화학습에서의 매니폴드 인지 탐색설명 가능한 인용 기반 대화를 위한 점진적 학습: 영어-힌디어 LLM의 환각 현상을 0으로 줄이기Insight-V++: 멀티모달 대형 언어 모델을 활용한 고도화된 롱체인 시각적 추론을 향하여중요한 곳을 보라: 효율적인 시각 언어 모델을 위한 고해상도 크롭 검색 (AwaRes)구멍 메우기: 다국어 번역을 위한 강화학습에서의 리워드 해킹 완화MHPO: 안정적인 강화학습을 위한 변조된 위험 인식 정책 최적화수학적 객체에 대한 추론: 온폴리시 보상 모델링 및 테스트 시간 집계PRISM: 미드 트레이닝에서의 능력 유지 및 상호작용의 원리 규명MetaClaw: 야생에서 메타 학습하고 진화하는 에이전트