관련 기사 바로가기
Track4World: 모든 픽셀에 대한 피드포워드 방식의 세계 중심 고밀도 3D 트래킹언어 모델 사전 학습을 위한 점진적 잔차 웜업 (ProRes)Timer-S1: 시리얼 스케일링을 적용한 10억 파라미터 규모의 시계열 파운데이션 모델시각-언어 모델이 야바위 게임을 풀 수 있을까?하나의 모델, 다양한 예산: 확산 트랜스포머를 위한 탄력적 잠재 인터페이스 (ELIT)트랜스포머의 '두드러짐의 저주': 왜 모델은 의미보다 표면적 강조에 속는가물리적 토큰 드로핑(PTD): 트랜스포머 하드웨어 효율성 개선을 위한 새로운 접근법ML 엔지니어를 위한 단백질 AI 가이드솔로 개발로 구축한 전체 수명 주기 통계적 차익거래 플랫폼 - 헥사고날 아키텍처 및 22개 모델 앙상블단일 포워드 패스에서 N개 문장 간 방향성 관련성을 측정하는 비대칭 시그모이드 어텐션 실험효율적인 LLM을 위한 레저버 컴퓨팅과 어텐션 메커니즘의 결합 연구포켓몬 쇼다운(Pokémon Showdown) 9세대 랜덤 배틀을 위한 강화학습 에이전트 구축기시스템 프롬프트의 관계적 프레임워크가 LLM의 생성 역학을 변화시킨다는 연구 결과Karpathy의 MicroGPT에서 영감을 받은 텍스트 디퓨전의 최소 구현체: Micro-Diffusion재귀적 언어 모델(RLM)의 성능을 극대화하는 간단한 기법들가정용 환경에서 3B 파라미터 모델을 처음부터 학습시키는 것이 가능할까요?트랜스포머부터 GPT-5.3까지: 171개 모델을 담은 LLM 타임라인 구축궤도 역학 강화학습 문제: 결정론적 환경에서 성능 정체 현상 해결 방법바이트댄스 Ouro-2.6B-Thinking 모델의 아키텍처 버그 수정 및 실행 가이드오픈소스 강화학습 프레임워크 'Multiverse' 출시: 다중 환경 및 트랜스포머 기반 실험 지원