관련 기사 바로가기
대규모 MoE 학습률을 단계적으로 확장하는 방법Adam의 좌표별 적응성이 저랭크 복원을 깨뜨리는 이유Muon이 에이전트형 강화학습에 유용한 경우Macrocosmos, 저대역폭 파이프라인 병렬 학습을 위한 ResBM 아키텍처 공개24시간 만에 텍스트-이미지 모델 학습시키기: Photoroom의 PRX 프로젝트 3부한 단계 지연(One-Step) 그래디언트가 대규모 비동기 파이프라인 병렬 LLM 사전학습의 장벽이 아님Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling LawsMuon으로 Adam-Pretrained 모델의 파인튜닝 가능성에 관한 연구너비-깊이 동시 확장을 위한 µP의 스펙트럼 조건GFlowNet을 활용한 무선 전파 모델링 가속화 및 오픈소스 연구 공유