관련 기사 바로가기
세 LLM에서 GRPO 후 성능 저하와 KV cache 검증온폴리시 자기 증류를 통한 AI 모델의 지속적 학습 및 성능 개선SLAI T-Rex: Ascend NPU SuperPOD에서 트릴리언 규모 MoE 모델 후처리와 OR 특화 SFT를 결합한 전층 최적화 실무 보고Self-Distilled Reasoning(SDR)를 이용한 SFT 맞춤화에서의 추론 토큰 생성Text-LLM-Training-from-scratch: PyTorch 원시 연산으로 구현한 텍스트 LLM 학습 파이프라인생각할 때와 말할 때: LLM 추론을 위한 공개 정책 학습AI 모델 현지화 서비스: 언어, 문화적 뉘앙스 및 규제 준수를 위한 모델 최적화 가이드AI 모델 성능 극대화를 위한 코퍼스 증강 및 데이터 강화 전략검색 관련성 확장: LLM 생성 판단을 통한 App Store 랭킹 강화불투명한 추론을 가진 AI 모델에 대한 지도 학습 기반 제어의 미래SFT 충돌과 RL 공존의 LLM 다중태스크 분석VibeThinker-3B 논문 분석: 소형 추론 모델의 학습 전략파인튜닝이 할루시네이션을 유발하는 이유와 해결 방법Claude Opus의 강화된 안전 필터가 Kaggle 경진대회 데이터 감사 작업을 차단하는 문제시간적 이득, 공간적 비용: 멀티모달 대형 언어 모델의 비디오 파인튜닝 재검토지능 저하 없는 특화 AI 구축: Nova Forge 데이터 믹싱 활용 사례지도 학습 기반 미세 조정(SFT) 대 강화 학습(RL): 대형 언어 모델 사후 학습 방법론 연구OpenSeeker: 학습 데이터 전면 공개를 통한 최첨단 검색 에이전트의 대중화GUI-Libra: 행동 인식 지도 학습과 부분 검증 가능 강화학습을 통한 네이티브 GUI 에이전트 훈련RBTACT: 실행 가능한 리뷰 피드백 생성을 위한 답변 기반 지도 학습