본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
Muon이 에이전트형 강화학습에 유용한 경우
한 단계 지연(One-Step) 그래디언트가 대규모 비동기 파이프라인 병렬 LLM 사전학습의 장벽이 아님
Macrocosmos, 저대역폭 파이프라인 병렬 학습을 위한 ResBM 아키텍처 공개
GFlowNet을 활용한 무선 전파 모델링 가속화 및 오픈소스 연구 공유
24시간 만에 텍스트-이미지 모델 학습시키기: Photoroom의 PRX 프로젝트 3부
Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws
Muon으로 Adam-Pretrained 모델의 파인튜닝 가능성에 관한 연구
너비-깊이 동시 확장을 위한 µP의 스펙트럼 조건
← 피드로 돌아가기
Muon
Optimization (최적화 기법)
약 8개 아티클
관련 태그:
AdamW
Error Feedback
GFlowNet
GiGPO
GPT-2
H200
JAX
LoRA
Macrocosmos
µP