챕터별 상세
실험 설계: 세 가지 서로 다른 AI 빌드와 보상 함수
전사, 마법사, 도적이라는 세 가지 서로 다른 플레이 스타일을 강제하기 위해 독립적인 보상 함수를 설계했다. 전사는 근접 데미지와 남은 체력에 보상을 주고 마법은 감점하며, 마법사는 마법 처치와 마나 효율에 보상을 주고 무기 사용은 감점한다. 도적은 은신 처치와 훔친 골드에 보상을 주며 발각 시 감점을 부여하는 방식으로 각 에이전트의 최적화 방향을 설정했다.
보상 함수(Reward Function)는 강화학습 에이전트가 특정 행동을 하도록 유도하는 수학적 지표이다.
학습 초기 단계: 혼돈과 기초 조작 습득
학습 초기 50시간 동안 에이전트들은 게임의 기본 메커니즘을 이해하지 못해 무작위적인 행동을 반복했다. 전사는 무기를 장착하지 못한 채 게를 주먹으로 공격했고, 마법사는 화염 마법을 사용하다 스스로에게 불을 붙이는 실수를 반복했다. 도적은 대낮에 경비병의 물건을 훔치다 즉시 체포되는 등 시행착오를 겪으며 환경과의 상호작용 데이터를 축적했다.
100시간 경과: 빌드별 특성화와 성능 차이
학습 100시간 시점에 도달하자 각 에이전트는 설정된 보상 함수에 최적화된 고유의 플레이 스타일을 보여주었다. 전사는 적극적으로 돌진하여 근접 공격을 수행하는 탱크가 되었고, 마법사는 거리를 유지하며 마나를 관리하는 유리 대포 스타일을 확립했다. 도적은 적의 패턴을 파악하고 은신 처치를 수행하는 암살자로서의 면모를 갖추며 실험이 의도대로 진행되는 듯 보였다.
전환점: 은신 궁수 전략으로의 수렴 시작
127시간 경과 시점부터 예상치 못한 변화가 발생했다. 전사 에이전트가 전투 중 우연히 활을 사용해 적을 처치한 후, 데미지 대비 피격 리스크 비율이 근접 전투보다 압도적으로 높다는 것을 수학적으로 감지했다. 이후 전사는 활 사용에 따른 감점에도 불구하고 전체 보상 효율을 높이기 위해 활을 주무기로 선택하기 시작했으며, 이는 마법사와 도적 에이전트에게도 동일하게 나타났다.
내쉬 균형(Nash Equilibrium)은 경쟁 상태에서 상대방의 전략이 변하지 않는 한 자신의 전략을 바꿀 유인이 없는 상태를 의미한다.
최종 검증: 보스전 테스트와 수학적 결론
세 가지 빌드의 성능을 최종 보스전에서 테스트한 결과, 은신 궁수 전략을 취한 도적 에이전트만이 모든 보스를 처치하는 데 성공했다. 전사는 포션 부족으로 사망했고 마법사는 마나 고갈로 패배했으나, 은신 궁수는 지형지물을 활용한 무위험 원거리 공격으로 11분 만에 모든 도전을 완료했다. 이는 은신 궁수가 단순한 취향이 아니라 스카이림 시스템 내에서 가장 합리적인 수학적 최적해임을 증명한다.
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2025. 12. 04.수집 2026. 02. 21.출처 타입 YOUTUBE
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.