관련 기사 바로가기
토큰화가 비용과 검색 품질을 가르는 방식SynthID 텍스트 워터마크 재토큰화 실험모든 라우터는 표현 붕괴로 이어진다: 키 노름 맹시성과 어텐션 집중의 통일적 관찰GPT-2가 'Trump' 토큰에서 학습한 내용DeepLoop: 루프드 트랜스포머의 깊이 스케일링책 기반 GPT-2 구현을 함수 호출용으로 파인튜닝한 프로젝트 후기Claude Mythos 비공개 결정과 집단 거버넌스 방어 프레임워크 제안처음부터 만드는 LLM 32e부: 학습률 스케줄링과 최적화 개입Andrej Karpathy의 AutoResearch: 스스로 학습 코드를 개선하는 AI 에이전트GEKO: 그래디언트 효율적 지식 최적화 - 모델이 이미 아는 것은 학습하지 않는 기법MettaMazza의 UnisonAI 공개와 가중치 스펙트럼 분석 결과. 학습된 모델 가중치를 기저로 변환해 구조적 신호를 분리하는 도구와 논문이 포함되어 있다. 토큰 임베딩에서 반복적으로 동일한 계산적 '법칙'이 관찰됐다.LIMEN 연구: Transformer 은닉 상태 궤적에서 맥락 의존성 및 보편적 동적 문법 발견클리포드 대수 기반의 새로운 트랜스포머 아키텍처 T³ 공개Transformer 아키텍처를 처음부터 직접 구현하여 GPT-2 성능을 능가한 프로젝트프레임워크 없이 C++로 구현하며 이해하는 Attention 메커니즘GPT-2에서 Llama로 전이되는 깊이 우선 가지치기(Depth-first pruning)의 의외의 효과손실 곡선보다 먼저 학습 불안정성을 감지하는 도구 공개True Positive Weekly #154: AI 및 머신러닝 주요 소식 큐레이션MAX Python API를 활용한 GPT-2 트랜스포머 바닥부터 구현하기인간의 뇌가 예상보다 AI와 더 유사하게 작동한다는 연구 결과 발표