본문으로 건너뛰기

DeepLoop: 루프드 트랜스포머의 깊이 스케일링

DeepLoop은 루프드 Transformer에서 반복 방문의 정렬 효과를 반영하여 α=(2N)^{1/2}, β=(8N)^{-1/2} 스케일링을 사용해 공유된 블록을 반복할 때의 학습 안정성을 확보한다.

용어 해설

루프드 트랜스포머(Looped Transformer)
루프드 트랜스포머는 K개의 물리적 블록을 R번 반복 호출해 전개된 깊이 N=K·R를 만들되 저장되는 파라미터는 K 블록에만 국한하는 구조로, 동일 연산을 여러 번 재사용해 파라미터 증가 없이 계산량을 늘릴 수 있다.
방문 정렬 계수(Visit-Alignment Coefficient)
각 물리적 서브레이어가 여러 라운드에서 받는 방문별 그래디언트와 민감도 벡터의 정렬도를 측정하는 계수로, 방문 간 정렬이 높으면 공유 파라미터의 업데이트가 여러 방문에 걸쳐 증폭되어 안정성 조건이 강화된다.
DeepNorm
Post-LN Transformer에서 스킵 스케일 α와 잔차 초기화 게인 β를 층 수 N에 따라 정해 학습 초기 일차 영향(첫번째 항)을 제한하는 규칙으로, 전통적(비공유) 깊이에서 M(β/α)^2=Θ(1)을 만족하도록 설계된다.
RMSNorm
정규화 기법의 하나로 각 서브레이어에서 신호의 RMS(제곱평균제곱근)를 맞추어 전역 스케일을 안정화하며, DeepLoop 분석에서 잔차 브랜치가 Norm을 통해 1/α 배율로 민감도에 기여함을 드러내는 역할을 한다.
전개된 깊이(Unrolled Depth)
루프드 구조에서 물리적 블록 K와 라운드 수 R의 곱으로 계산되는 유효 깊이 N=K·R를 의미하며, 최종 전방 경로에서의 잔차 서브레이어 적용 횟수와 모델 표현력을 결정한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 15.수집 2026. 07. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.