챕터별 상세
머신러닝과 NLP의 역사적 흐름
2012년 이전의 머신러닝은 수동으로 특징을 추출하는 방식이었으나 점차 Raw 데이터를 직접 사용하는 Supervised Deep Learning으로 진화했다. 이후 데이터 라벨링 비용 문제를 해결하기 위해 데이터 자체에서 정답을 찾는 Self-Supervised Learning이 핵심 방법론으로 자리 잡았다. 언어 모델링 분야에서는 단순한 감성 분석에서 시작하여 문맥을 고려한 다음 토큰 예측 방식으로 발전하며 대규모 언어 모델의 기반을 마련했다.
Transformer 아키텍처의 핵심 원리
Transformer는 Self-Attention 메커니즘을 사용하여 시퀀스 내 각 단어가 서로 어떻게 연결되는지 학습한다. Query, Key, Value 행렬 연산을 통해 도서관에서 책을 찾는 것과 유사한 방식으로 관련 정보를 추출한다. RNN과 달리 시퀀스를 한 번에 병렬로 처리할 수 있어 GPU 연산 효율이 극대화되며 장기 의존성 문제를 해결했다. Multi-Head Attention과 Positional Encoding을 결합하여 단어의 순서와 다양한 관계를 동시에 파악한다.
Query, Key, Value는 정보 검색 시스템에서 유래한 개념으로, 어텐션 스코어를 계산하는 핵심 요소이다.
데이터 중심의 사전 학습 전략
사전 학습 단계에서 데이터의 양보다 품질과 구조가 모델 성능에 더 큰 영향을 미친다는 사실이 확인됐다. 'BabyLM' 프로젝트 연구 결과, 어린이가 학습하는 수준의 적은 데이터로도 데이터의 문맥적 다양성과 상호작용성이 높으면 효율적인 학습이 가능했다. 다국어 학습 시에도 언어 간 간섭 없이 성공적으로 지식을 습득할 수 있음을 실험적으로 증명했다. 이는 무조건적인 데이터 증설보다 스마트한 데이터 큐레이션이 중요함을 시사한다.
RAG의 확장 법칙과 최적화
Retrieval Augmented Generation(RAG) 시스템에서 사전 학습 토큰과 검색 토큰 사이의 최적 배분을 연구했다. 실험 결과 소형 모델일수록 RAG를 통한 성능 향상 폭이 대형 모델보다 훨씬 컸다. 대형 모델은 이미 내부에 많은 지식을 저장하고 있어 일반적인 지식 검색의 효용이 상대적으로 낮았다. 특정 도메인 지식이 필요한 경우에만 RAG가 대형 모델에서도 유의미한 보완 수단이 됨을 확인했다.
RAG는 외부 데이터베이스에서 관련 정보를 검색하여 모델의 답변 생성에 활용하는 기술이다.
사후 학습 및 추론 기술
사전 학습된 모델을 특정 작업에 맞추기 위해 Fine-tuning, RLHF, DPO 등의 기법이 사용된다. Chain-of-Thought(CoT) 프롬프팅은 모델이 단계별로 사고하게 하여 복잡한 추론 능력을 비약적으로 향상시킨다. 최근에는 모델이 스스로 자신의 답변을 비판하고 수정하는 Self-Improvement 에이전트 기술이 주목받고 있다. DeepSeek의 GRPO와 같은 새로운 최적화 기법은 보상 모델 없이도 효율적인 정렬을 가능하게 한다.
DPO(Direct Preference Optimization)는 복잡한 강화학습 과정 없이 인간의 선호도를 직접 학습시키는 최신 기법이다.
Transformer의 한계와 미래 대안
Transformer는 연산 복잡도가 시퀀스 길이의 제곱에 비례하는 효율성 문제와 Hallucination 문제를 안고 있다. 이를 해결하기 위해 선형적 확장이 가능한 State Space Models(SSM)나 Mamba 아키텍처가 대안으로 연구되고 있다. 또한 단순 텍스트 예측을 넘어 세상의 물리적 법칙을 이해하는 World Model과 JEPA 아키텍처가 차세대 방향성으로 제시됐다. 궁극적으로는 인간처럼 지속적으로 학습하고 장기 기억을 보유한 시스템으로의 진화가 목표이다.
Hallucination(환각)은 모델이 사실과 다른 내용을 그럴듯하게 답변하는 현상을 말한다.
용어 해설
- 셀프 어텐션(Self-Attention)
- — 시퀀스 내의 각 토큰이 다른 모든 토큰과의 연관성을 계산하여 문맥적 의미를 파악하는 메커니즘이다. 입력 데이터의 가중치를 동적으로 조절함으로써 멀리 떨어진 단어 간의 관계도 효과적으로 학습할 수 있게 한다.
- 자기 지도 학습(Self-Supervised Learning)
- — 사람이 직접 라벨링하지 않은 대규모 데이터에서 데이터 자체의 구조를 이용해 학습 목표를 생성하는 방식이다. 텍스트의 다음 단어를 예측하거나 가려진 부분을 맞추는 방식으로 LLM의 사전 학습에 핵심적으로 사용된다.
- 상태 공간 모델(State Space Model)
- — 시퀀스 데이터를 처리할 때 상태 방정식을 사용하여 정보를 압축하고 전달하는 아키텍처이다. Transformer의 연산 복잡도 문제를 해결하기 위해 등장했으며 긴 시퀀스 처리에 효율적이다.
- 인간 피드백 기반 강화학습(RLHF)
- — 모델의 출력 결과에 대해 인간이 매긴 순위나 점수를 보상 신호로 사용하여 모델을 미세 조정하는 기법이다. 모델의 답변을 인간의 의도와 가치관에 정렬시키는 데 필수적인 기술이다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 23.수집 2026. 04. 23.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
