챕터별 상세
강화학습이 필요한 이유와 AI의 진화
RAG(검색 증강 생성)는 외부 지식을 참조하는 방식이며, RL(강화학습)은 행동에 따른 보상을 통해 최적의 전략을 찾아가는 학습 방식이다.
실전 강화학습 스택과 핵심 알고리즘
PPO(Proximal Policy Optimization)는 안정적인 학습을 돕는 대표적인 강화학습 알고리즘이며, RLHF는 인간 피드백을 통해 언어 모델을 정렬하는 기법이다.
RL의 실제 적용 사례: 로봇에서 에이전트까지
에이전트(Agent)는 주어진 환경에서 목표를 달성하기 위해 스스로 판단하고 행동하는 AI 시스템을 뜻한다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


