본문으로 건너뛰기

관련 기사 바로가기

원문 논문 기반 Transformer를 PyTorch로 처음부터 구현하고 영어-타밀 병렬 데이터로 학습한 튜토리얼과 코드 공개수작업 가중치 MLP의 시퀀스 기억 용량과 학습 모델 비교Mixture-of-Experts(MoE) 모델은 활성화되는 파라미터보다 훨씬 더 많은 파라미터를 보유한다LLM을 인간 작업기억의 외부 레지스터로 보는 관점과 제약 기반 재구성의 작동 원리Transformer의 핵심 혁신은 병렬화 가능한 수학 구조로의 전환이었다트랜스포머 모델의 줄바꿈 처리: 내부 회로 분석CNN에서 트랜스포머, 파운데이션 모델까지: AI 아키텍처와 스케일링의 역사트랜스포머 아키텍처의 탄생 배경과 발전 과정트랜스포머 내부에서 개념의 의미적 계산 그래프를 복원할 수 있는가긴 대화에서 초기 지시가 사라지는 최근성 편향과 현장 대응책튜니지아 다리자(Darija) 영어 번역용 오픈 파이프라인과 병렬 코퍼스 공개상태-예측 분리 가설과 State-Prediction Separation TransformerDamped Resonance Alignment 테스트 79: 압력 다이얼 비교와 Qwen2.5-1.5B 스티어링 로그LLM의 기초: 토큰, 트랜스포머 및 추론의 이해Yobi CTO와의 인터뷰: 행동 예측을 위한 파운데이션 모델과 시스템 설계infosave2007/svetoch 프로젝트로 구현한 스마트폰 기반 광학 신경 연산딥러닝 연구자를 위한 2000장 이상 연속 업데이트된 강의 노트와 데모 깃허브 저장소 공유AI의 위대한 정신 모델: 표현력(Expressivity)Bug or Feature: Weight Drift, Activation Sparsity and SpikesSame Architecture, Different Capacity: Optimizer-Induced Spectral Scaling Laws
← 피드로 돌아가기

Transformer

Architecture (AI 아키텍처)

197개 아티클

관심 태그 추가
TIMEHEADLINE