본문으로 건너뛰기

Ring-Zero: 1조 파라미터로 제로 RL을 확장하여 자발적 추론 능력 획득

Ring-Zero는 클리핑 중요도 샘플링, 학습·추론 비율 보정, 자기증류, 샘플단위 손실 및 계층형 훈련을 결합해 1조 파라미터 모델에서 사람 판독 가능한 간결한 Chain-of-Thought를 제로 RL로 자발적으로 획득시켰다.

용어 해설

사고 과정 추론(Chain-of-Thought)
모델이 문제를 푸는 과정에서 단계적 추론을 토큰 형태로 출력하는 방식으로, 각 단계가 다음 단계의 입력으로 작용해 복잡한 논리적 결론을 도출하게 한다. 본문에서는 CoT가 인간 판독 가능성, 재현성, 토큰 효율성이라는 세 가지 품질 축으로 평가되어 최종 답뿐 아니라 추론 경로 자체의 가치가 강조된다.
중요도 샘플링(Importance Sampling)
실행정책과 학습정책 사이의 확률 비를 사용해 오프폴리시 샘플을 재가중하는 기법으로, 본 논문에서는 클리핑된 중요도 비율을 토큰 단위로 적용해 낮은 확률의 추론 토큰에 학습 신호를 증폭시켰다. 수치 불일치를 막기 위해 분자에 학습 엔진의 로짓을 사용해 안정성을 확보했다.
자체 증류(Self-Distillation)
직접 생성한 고품질 롤아웃을 짧고 정제된 정답 추론으로 압축한 뒤 원래 모델을 교사-학생 방식으로 재학습시키는 과정이다. 논문에서는 1단계 RL이 생성한 긴 추론을 가장 짧고 정확한 응답으로 선택·정제한 뒤 supervised fine-tuning으로 수렴 안정성과 간결성을 회복시켰다.
혼합 정밀도 제어(Mixed-Precision Control)
모델 본체는 BF16으로 유지하되, 수치 민감 연산인 attention softmax와 LM head는 FP32로 계산하여 지수 연산에서의 반올림 오류가 중요도 비율에 증폭되는 것을 방지하는 방식이다. 이 조정은 훈련-추론 엔진 간 로짓 불일치와 갑작스런 손실 스파이크를 억제했다.
컨텍스트 병렬화(Context Parallelism)
긴 시퀀스를 여러 장치에 분할해 attention 계산을 병렬로 수행하는 통신 패턴으로, 논문에서는 MLA 계층에 대해 all-to-all 재배열을 사용하고 Lightning Attention에서는 AllGather를 적용해 통신 병목을 줄였다. 이 최적화는 긴 컨텍스트(수만 토큰)에서의 대기 시간을 획기적으로 낮췄다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 14.수집 2026. 07. 17.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.