본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
대형 언어 모델에서의 모델 머징 스케일링 법칙
UniMixer: 추천 시스템의 스케일링 법칙을 위한 통합 아키텍처
다이나믹 라지 컨셉 모델: 적응형 의미 공간에서의 잠재 추론
로지스틱 회귀와 대형 언어 모델의 매개변수 비율 비교
Import AI 445: 초지능의 타이밍, AI의 프론티어 수학 증명, 그리고 새로운 ML 연구 벤치마크
딥러닝이 강력한 이유는 어려운 것을 쉽게 만들기 때문이다 - 10년 후의 성찰
언어 모델을 위한 병렬 스케일링 법칙: 파라미터 증가 없이 성능을 높이는 새로운 방법
3진법 LLM의 스케일링 법칙과 효율적인 추론: TriLM 연구
MDM-Prime-v2: 이진 인코딩과 인덱스 셔플링을 통한 확산 언어 모델의 연산 최적 스케일링
Qwen 모델의 데이터, 크기 및 컨텍스트 확장 전략: 지능을 향한 여정
다리오 아모데이의 '기술의 사춘기': 인공지능의 미래에 대한 4가지 거대한 예측
Attention Residuals: 잔차 연결을 어텐션 메커니즘으로 대체하여 효율성 증대
← 피드로 돌아가기
Scaling Laws
Best Practices (모범 사례)
약 15개 아티클
관련 태그:
MoE
Quantization
Qwen
Attention Residuals
Diffusion Model
DLCM
Cross-Entropy
GAN
Google DeepMind
Dynamic YaRN