본문으로 건너뛰기

구글 리서치 풋볼 경진대회 2위 팀 SaltyFish의 강화학습 전략 분석

구글 리서치 풋볼 경진대회에서 2위를 차지한 SaltyFish 팀이 IMPALA 알고리즘과 Surgery 기법을 활용해 고성능 축구 AI 에이전트를 구축한 기술적 세부 사항을 공유합니다.

챕터별 상세

00:00

팀 소개 및 연구 배경

NetEase Fuxi AI Lab 소속의 SaltyFish 팀은 2017년에 설립된 중국 최초의 게임 AI 연구소 팀이다. 이들은 강화학습, 사용자 페르소나, 컴퓨터 비전 등 다양한 AI 분야를 연구하며 농구 게임, MMORPG, 게임 테스팅 등에 강화학습을 적용한 경험이 풍부하다. 이번 대회에서는 3~4명의 핵심 개발자와 3명의 어드바이저가 참여하여 2위를 기록했다.
09:11

강화학습 솔루션 및 기술 요약

기본 알고리즘으로 IMPALA를 사용했으며, 신경망 구조는 단순한 Fully Connected 구조를 채택했다. 상태 표현(State Representation)을 위해 Multi-head 벡터 방식을 사용했으며, 학습 도중 피처를 추가하는 Surgery 기법을 적용했다. 이외에도 Curriculum Learning, Imitation Learning, 그리고 코너킥과 스로인 상황을 위한 고정 규칙(Fixed Rules)을 혼합하여 에이전트를 완성했다.
11:01

학습 접근 방식: PvE에서 Self-play까지

학습은 총 3단계로 진행되었다. 1단계는 쉬운 룰 기반 AI를 상대로 전진과 슈팅을 학습했고, 2단계는 어려운 룰 기반 AI를 상대로 드리블과 슈팅 기술을 강화했다. 마지막 3단계는 Self-play를 통해 정교한 전술을 습득했다. Self-play 시 대결 상대는 최신 모델을 70%, 과거 모델 중 하나를 랜덤하게 30% 비율로 선택하여 전략의 다양성을 확보했다.
14:26

상태 표현의 진화와 Surgery 기법

초기에는 공과 선수들의 위치, 방향 등 기본적인 벡터 정보만 사용했다. 하지만 대회 중반에 옐로카드, 레드카드, 피로도, 오프사이드 정보가 누락되었음을 발견하고 Surgery 기법을 통해 이를 추가했다. Surgery 기법은 기존 신경망의 가중치를 유지하면서 새로운 입력 차원을 확장하는 방식으로, 적용 후 에이전트의 성능 지표가 비약적으로 상승했다.
18:21

신경망 아키텍처 및 보상 설계

신경망은 각 정보 그룹(공, 선수 등)을 처리하는 개별 레이어와 이를 통합하는 3개의 공유 레이어로 구성되었다. 보상 설계는 최대한 단순하게 유지했다. PvE 단계에서는 득점과 체크포인트 보상을 사용했지만, Self-play 단계에서는 오직 득점 보상만 사용했다. 체크포인트 보상을 Self-play에 계속 사용하면 패스를 하지 않는 이기적인 플레이가 발생하는 부작용이 있었기 때문이다.
21:30

추가 연구 및 실험 결과 분석

대회 종료 후 다양한 추가 실험을 진행했다. 랜덤 시드가 학습 결과에 미치는 영향을 분석한 결과, 동일한 설정에서도 약 50%의 확률로만 성공적인 수렴이 일어났다. 또한 ASN(Action Semantics Network)이나 GNN(Graph Neural Network) 같은 복잡한 구조를 테스트했으나, 기본 Fully Connected 구조보다 성능이 낮거나 학습 속도가 느린 것으로 나타났다.

용어 해설

중요도 가중치 기반 액터-러너 아키텍처(IMPALA)
액터(Actor)와 러너(Learner)를 분리하여 대규모 분산 학습을 가능하게 하는 강화학습 프레임워크이다. 액터는 환경에서 경험을 수집하고 러너는 이를 바탕으로 정책을 업데이트하며, V-trace 알고리즘을 통해 오프-폴리시(Off-policy) 편향을 보정한다. 대규모 컴퓨팅 자원을 효율적으로 활용하여 복잡한 환경에서 학습 속도를 획기적으로 높인다.
자기 대국 학습(Self-play)
에이전트가 자기 자신 또는 자신의 과거 버전과 대결하며 학습하는 기법이다. 고정된 상대가 아닌 에이전트의 실력에 맞춰 진화하는 상대와 대결하므로, 복잡한 전략과 상호작용을 스스로 터득하게 된다. 알파고와 같은 게임 AI에서 고도의 전략을 학습시키기 위해 필수적으로 사용된다.
보상 설계(Reward Shaping)
에이전트가 최종 목표(예: 승리)에 도달하기 전에도 올바른 방향으로 행동하도록 중간 단계의 보상을 추가하는 기법이다. 희소한 보상 문제를 해결하여 학습 초기 단계의 탐색 효율을 높인다. 하지만 잘못 설계할 경우 에이전트가 최종 목표 대신 중간 보상만 챙기는 부작용이 발생할 수 있다.
서저리 기법(Surgery Technique)
학습이 진행 중인 모델의 신경망 구조나 입력 피처를 변경하면서도 기존에 학습된 가중치를 최대한 보존하는 기법이다. 처음부터 다시 학습하지 않고도 새로운 정보를 모델에 주입할 수 있어 대규모 학습 비용을 절감한다. 본 대회에서는 누락된 축구 규칙 정보를 중간에 추가하는 데 사용되었다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 26.수집 2026. 02. 26.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.