챕터별 상세
강화학습의 정의와 지도학습과의 차이
강화학습은 컴퓨터가 시행착오(Trial and Error)를 통해 스스로 학습하게 만드는 방식이다. 정답 데이터셋을 제공하는 지도학습(Supervised Learning)과 달리, 에이전트가 환경과 상호작용하며 얻는 보상(Reward)을 기반으로 행동을 개선한다. 지도학습은 효율적이지만 데이터 구축 비용이 크고 경직된 반면, 강화학습은 비용이 많이 들고 학습이 느리지만 매우 유연하고 복잡한 행동을 학습할 수 있다.
강화학습의 핵심 구성 요소
강화학습 시스템은 에이전트(Agent), 환경(Environment), 상태(State), 행동(Action), 보상(Reward), 정책(Policy)의 6가지 요소로 구성된다. 에이전트는 의사결정자이며, 환경은 에이전트가 존재하는 세계이다. 상태는 환경과 에이전트에 대한 정보를 담고 있으며, 에이전트는 정책에 따라 행동을 선택하고 그 결과로 환경으로부터 보상을 받는다.
실전 사례: 스네이크 게임과 주식 관리
스네이크 게임에서 에이전트는 먹이를 먹으면 +1 보상을 받고, 벽이나 몸에 부딪히면 -1 보상을 받으며 학습한다. 주식 관리 에이전트는 매수, 보유, 매도 행동을 취하며 수익이 발생하면 양의 보상을, 손실이 나면 음의 보상을 받는다. LLM의 수학 문제 풀이 사례에서는 모델이 다음 토큰을 예측하는 행동을 취하고, 최종 정답 여부에 따라 보상을 부여받아 추론 과정을 최적화한다.
가치 기반 학습과 정책 기반 학습의 차이
강화학습 메서드는 크게 가치 기반(Value-based)과 정책 기반(Policy-based)으로 나뉜다. 가치 기반 방식은 특정 상태에서 행동의 가치를 평가하는 함수를 학습하여 가장 높은 가치의 행동을 선택한다. 정책 기반 방식은 상태를 입력받아 각 행동을 취할 확률 분포를 직접 출력하는 정책 함수를 학습한다. 가치 기반은 미래 보상을 예측하는 모델을 만들고, 정책 기반은 의사결정 규칙 자체를 학습한다는 차이가 있다.
Q-Learning의 작동 원리와 업데이트 규칙
Q-Learning은 가치 기반 학습의 대표적인 방법으로, Q-함수를 학습하여 특정 상태와 행동 쌍의 기대 보상을 예측한다. 벨만 방정식을 기반으로 현재의 예측치와 실제 관찰된 보상 사이의 차이인 시간차 에러(TD Error)를 계산하여 Q-값을 업데이트한다. 할인율(Gamma)을 적용하여 미래 보상의 가치를 현재 시점으로 환산하며, 학습률(Alpha)을 통해 업데이트 속도를 조절한다. 결과적으로 에이전트는 '우리가 생각했던 가치'와 '실제로 관찰된 가치'의 간극을 줄여나간다.
python
# Q-learning update rule logic
# New_Estimate = Current_Estimate + alpha * (Reward + gamma * Max_Future_Value - Current_Estimate)
def update_q_table(state, action, reward, next_state, alpha, gamma):
best_next_action = np.argmax(q_table[next_state])
td_target = reward + gamma * q_table[next_state][best_next_action]
td_error = td_target - q_table[state][action]
q_table[state][action] += alpha * td_errorQ-learning의 핵심인 시간차 에러(TD Error)를 이용한 가치 업데이트 로직 예시
REINFORCE 알고리즘과 정책 경사법
REINFORCE는 정책 기반 학습의 고전적인 알고리즘으로, 목적 함수 J(theta)를 최대화하기 위해 경사 상승법(Gradient Ascent)을 사용한다. 에이전트가 행동을 취한 후 양의 보상을 받으면 해당 행동을 유발한 파라미터의 비중을 높이고, 음의 보상을 받으면 낮춘다. 학습의 안정성을 위해 보상에서 기준점(Baseline)을 빼주는 방식을 사용하여 분산을 줄인다. 이는 모델이 단순히 보상을 받는 것뿐만 아니라 평균보다 얼마나 더 잘했는지를 학습하게 한다.
하이브리드 방식: Actor-Critic 모델
Actor-Critic은 가치 기반과 정책 기반의 장점을 결합한 하이브리드 접근법이다. Actor는 정책을 담당하여 행동을 결정하고, Critic은 가치 함수를 담당하여 Actor가 취한 행동을 평가한다. Critic이 계산한 어드밴티지 함수(Advantage Function) 값을 바탕으로 Actor의 정책 파라미터를 업데이트한다. PPO나 TRPO와 같은 현대적인 강화학습 알고리즘은 대부분 이 Actor-Critic 구조를 기반으로 설계되었다.
용어 해설
- 정책(Policy)
- — 에이전트가 주어진 상태(State)에서 어떤 행동(Action)을 취할지 결정하는 매핑 함수 또는 규칙이다. 강화학습의 최종 목표는 누적 보상을 최대화하는 최적의 정책을 학습하는 것이다.
- 시간차 에러(Temporal Difference (TD) Error)
- — 현재 상태의 가치 예측치와 실제 관찰된 보상 및 다음 상태의 가치 예측치 합 사이의 차이를 의미한다. 가치 기반 강화학습에서 모델의 예측을 수정하는 핵심 지표로 사용된다.
- 할인율(Discount Factor)
- — 미래에 받을 보상을 현재 가치로 환산할 때 사용하는 계수(0~1 사이 값)이다. 당장 얻는 보상에 더 높은 가치를 부여하고 먼 미래의 불확실한 보상 비중을 조절하는 역할을 한다.
- 어드밴티지 함수(Advantage Function)
- — 특정 행동이 해당 상태에서의 평균적인 행동 가치보다 얼마나 더 나은지를 나타내는 함수이다. Actor-Critic 모델에서 학습의 분산을 줄이고 안정성을 높이는 데 기여한다.
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 01. 26.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
