TL;DR
Transformer는 Self-Attention을 통해 병렬 처리를 혁신했으며, 이제는 데이터 품질 개선과 아키텍처 효율화를 통해 AGI를 향해 진화하고 있다.
배경
스탠포드 대학교의 CS25 'Transformers United' 코스의 여섯 번째 반복 강의로, 현대 AI의 근간이 되는 Transformer 기술을 총망라한다.
대상 독자
AI/ML 기초 지식을 갖추고 최신 LLM 기술의 심층적인 이해를 원하는 학생 및 연구자
의미 / 영향
이 강의는 Transformer가 단순한 유행을 넘어 현대 AI의 표준 아키텍처로 자리 잡았음을 보여준다. 실무자들은 모델의 크기를 키우는 것만큼이나 고품질 데이터 큐레이션과 사후 학습(Post-training) 전략에 집중해야 한다. 향후 SSM이나 World Model과 같은 새로운 아키텍처의 등장은 현재의 연산 비용 문제를 해결하고 진정한 의미의 에이전트 AI 시대를 열 것으로 기대된다.
챕터별 상세
머신러닝과 NLP의 역사적 흐름
Transformer 아키텍처의 핵심 원리
Query, Key, Value는 정보 검색 시스템에서 유래한 개념으로, 어텐션 스코어를 계산하는 핵심 요소이다.
데이터 중심의 사전 학습 전략
RAG의 확장 법칙과 최적화
RAG는 외부 데이터베이스에서 관련 정보를 검색하여 모델의 답변 생성에 활용하는 기술이다.
사후 학습 및 추론 기술
DPO(Direct Preference Optimization)는 복잡한 강화학습 과정 없이 인간의 선호도를 직접 학습시키는 최신 기법이다.
Transformer의 한계와 미래 대안
Hallucination(환각)은 모델이 사실과 다른 내용을 그럴듯하게 답변하는 현상을 말한다.
용어 해설
- Self-Attention
- — 시퀀스 내의 각 토큰이 다른 모든 토큰과의 연관성을 계산하여 문맥적 의미를 파악하는 메커니즘이다. 입력 데이터의 가중치를 동적으로 조절함으로써 멀리 떨어진 단어 간의 관계도 효과적으로 학습할 수 있게 한다.
- Self-Supervised Learning
- — 사람이 직접 라벨링하지 않은 대규모 데이터에서 데이터 자체의 구조를 이용해 학습 목표를 생성하는 방식이다. 텍스트의 다음 단어를 예측하거나 가려진 부분을 맞추는 방식으로 LLM의 사전 학습에 핵심적으로 사용된다.
- State Space Model
- — 시퀀스 데이터를 처리할 때 상태 방정식을 사용하여 정보를 압축하고 전달하는 아키텍처이다. Transformer의 연산 복잡도 문제를 해결하기 위해 등장했으며 긴 시퀀스 처리에 효율적이다.
- RLHF
- — 모델의 출력 결과에 대해 인간이 매긴 순위나 점수를 보상 신호로 사용하여 모델을 미세 조정하는 기법이다. 모델의 답변을 인간의 의도와 가치관에 정렬시키는 데 필수적인 기술이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



