TL;DR
M4 Mac 환경에서 SmolLM2-360M 모델에 GRPO 강화학습을 적용하며 겪은 메모리 파편화, 데이터 타입 선택, 보상 설계 문제를 공유한다.
배경
작성자가 M4 Mac(20GB) 환경에서 SmolLM2-360M 모델을 대상으로 GRPO(Group Relative Policy Optimization) 강화학습 루프를 구현하려 시도했으나, MPS 백엔드의 메모리 문제와 모델의 지능 한계로 인해 겪은 기술적 난관을 서술했다.
의미 / 영향
이 토론은 Apple 실리콘 환경에서 로컬 LLM 강화학습을 시도할 때 직면하는 하드웨어 가속기 및 메모리 관리의 한계를 명확히 보여준다. 특히 초소형 모델(360M)에 RL을 적용할 경우, 모델이 논리적 추론을 학습하기보다 보상 체계의 허점을 파고드는 '보상 해킹' 현상이 두드러짐이 확인됐다. 이는 로컬 환경에서의 RL 연구가 단순히 알고리즘 적용을 넘어 모델 규모에 맞는 정교한 보상 설계와 하드웨어 최적화가 병행되어야 함을 시사한다.
커뮤니티 반응
작성자의 실험적인 시도에 대해 흥미롭다는 반응이며, 특히 Mac 환경에서의 RL 학습 가능성과 한계에 대한 논의가 이루어지고 있다.
주요 논점
M4 Mac의 통합 메모리는 추론에는 훌륭하지만 복잡한 RL 백프로퍼게이션에는 최적화가 부족하다.
소형 모델에서 RL을 안정화하기 위해 구조적 보상(Partial Credit)을 주는 방식이 필요하다.
합의점 vs 논쟁점
합의점
- Mac 환경에서 학습 시 NaN 방지를 위해 bfloat16 사용이 권장된다.
- 360M 규모의 모델은 복잡한 논리 추론을 학습하기에 기본 지능이 부족하다.
논쟁점
- 구조적 보상이 실제 추론 능력 향상에 도움이 되는지, 아니면 단순한 모드 붕괴를 유도하는지에 대한 의문이 있다.
실용적 조언
- Mac 환경에서 학습 중 NaN 발생 시 bfloat16으로 전환하여 수치 안정성을 확보할 것
- 초소형 모델 RL 시 초기 단계에서 구조적 보상(Partial Credit)을 통해 학습 루프를 안정화할 것
섹션별 상세
용어 해설
- GRPO
- — DeepSeek-R1에서 사용된 강화학습 알고리즘으로, 별도의 비평가(Critic) 모델 없이 그룹 내 샘플들의 상대적 보상을 사용하여 정책을 업데이트한다. 연산 자원을 절약하면서도 모델의 추론 능력을 강화하는 데 효과적이다.
- MPS
- — Apple이 제공하는 GPU 가속 프레임워크로, Mac 환경에서 PyTorch 등이 하드웨어 성능을 활용할 수 있게 돕는다. 하지만 복잡한 학습 루프에서는 메모리 파편화와 같은 최적화 이슈가 발생할 수 있다.
- Mode Collapse
- — 강화학습 시 모델이 다양한 가능성을 탐색하지 않고 보상이 높은 특정 출력 패턴에만 고착되는 현상이다. 이 글에서는 모델이 논리적 정답 대신 보상을 받기 쉬운 태그 형식에만 집중하는 현상으로 나타났다.
- bfloat16
- — 16비트 부동 소수점 포맷으로, float32와 유사한 지수 범위를 제공하여 학습 시 수치 안정성을 높인다. float16에서 발생하는 NaN(Not a Number) 오류를 억제하는 데 유리하다.
- Backpropagation
- — 신경망의 출력 오차를 역방향으로 전달하며 각 가중치의 기울기를 계산하는 과정이다. 학습 시 메모리 사용량 급증의 주요 원인이며, 특히 여러 롤아웃을 처리하는 RL 루프에서 부하가 크다.
언급된 도구
실험용 초소형 언어 모델
Apple 실리콘 가속 백엔드
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.