관련 기사 바로가기
200M 파라미터 디코더-온리 Transformernisbenz의 TensorLib: 순수 C로 구현한 CPU 전용 텐서와 역전파 자동미분 라이브러리SkewAdam: MoE 학습에서 옵티마이저 상태 메모리를 계층적으로 줄여 6.78B 모델을 단일 40GB GPU에 탑재한 옵티마이저GGN 기반 'Gnome' 옵티마이저가 MSE·PINN 최적화에서 Empirical Fisher 기반 방법을 대체하는 근거와 성능Bayer-CFA 사진을 Foveon X3 스타일로 변환하도록 수정된 U-Net을 학습한 사례 공유Same Architecture, Different Capacity: Optimizer-Induced Spectral Scaling LawsLearn-by-Wire Training Control Governance: 스트레스 하에서의 안정성과 효율성을 위한 경계된 자율 학습 거버넌스AutoMuon: PyTorch에서 Muon 최적화 도구를 AdamW처럼 쉽게 사용하는 라이브러리메모리 효율이 극대화된 새로운 PyTorch 옵티마이저 'Rose' 공개Clip to Grok 업데이트: 가중치 노름 클리핑을 통한 대수 학습 39~249배 가속처음부터 만드는 LLM 32e부: 학습률 스케줄링과 최적화 개입POET-X: 단일 H100 GPU에서 10억 파라미터 LLM 사전 학습 가능하게 하는 메모리 효율적 기법너비-깊이 동시 확장을 위한 µP의 스펙트럼 조건PyTorch 옵티마이저 하이퍼파라미터 스케줄링을 위한 유연한 스위트 개발가정용 환경에서 3B 파라미터 모델을 처음부터 학습시키는 것이 가능할까요?Flux.2 Klein 캐릭터 LoRA 제작을 위한 기초 가이드 및 단계별 성능 분석AdamWClip: 수동 설정이 필요 없는 적응형 그래디언트 클리핑 옵티마이저