본문으로 건너뛰기

매니폴드 하이퍼-커넥션 기반 비대칭 토큰-믹서 라우팅으로 GDN2와 Attention을 같은 레이어에서 병렬 결합한 사전학습 실험 공유

mHC 기반 다중 스트림 라우팅으로 같은 레이어 내에서 GDN2와 Attention을 병렬 운영하자 60M 모델의 사전학습 손실이 순차적 구조보다 지속적으로 낮게 관찰되었다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

같은 레이어 안에서 Gated DeltaNet 2와 Attention을 병렬 전문가로 두고 Manifold-Constrained Hyper-Connections식 투영으로 토큰별 비대칭 라우팅을 수행하자, 파라미터를 정확히 매칭한 조건에서 8-layer·60M 모델을 2B 토큰으로 사전학습한 결과 로그 스케일 손실이 순차적 GDN2+Attention 스택보다 일관되게 낮게 관찰되었다. 구현상 H^{pre}/H^{post}를 (2,nc) 형태로 구성하고 H^{res}를 항등행렬로 단순화해 계산 오버헤드를 줄였으며 포워드 훅으로 라우팅 행렬을 관측해 모드 붕괴는 없고 특정 스트림의 near-zero 활성화가 일부 레이어에서 관찰되었다. 토큰 수준으로 보면 문장 경계와 거시적 상태 토큰은 GDN2에, 숫자와 BPE로 분할된 접미사 등 정밀 검색이 필요한 토큰은 Attention에 라우팅되는 분업 패턴이 일관되게 나타났다. 단순화와 소형 실험 규모라는 한계가 존재하므로 H^{res} 정규화 복원과 스트림 수·모델 스케일을 바꾼 추가 실험이 필요하다.

실용적 조언

  • 동일 파라미터 예산을 유지하려면 각 전문가의 내부 차원을 D/2로 병목화하고 어텐션 헤드 수를 절반으로 줄이는 방식으로 공정한 비교가 가능하다.
  • 훈련 효율과 구현 단순성을 위해 초기 실험에서는 H^{res}를 항등행렬로 두어 Sinkhorn 정규화에 따른 계산 오버헤드를 피하는 것이 실용적이지만 특정 레이어에서 스트림 소거가 발생하면 정규화 복원을 고려해야 한다.
  • 라우팅 거동을 확인하려면 포워드 훅으로 H^{pre}/H^{post} 값을 기록하여 토큰별 활성 패턴을 분석하면 되고, 특이 토큰(숫자·하이픈·BPE 접미사 등)에서 Attention 우위, 문장 경계 토큰에서 GDN2 우위 패턴을 찾아볼 수 있다.

섹션별 상세

01
기존 Hybrid LLM 설계는 RNN 계열 레이어를 여러 장 쌓은 뒤 최종에 Attention을 위치시키는 순차적 스택 구조가 일반적이었다고 보고되었으며, 이 구조는 입력 토큰을 처리하는 방식이 레이어별로 고정된다는 한계를 가졌다. 제시된 접근은 같은 레이어 안에서 GDN2와 Attention을 병렬 전문가로 배치하고 mHC식 다채널 투영을 통해 토큰별로 비대칭 라우팅을 수행하는 방식이며, 이 방식은 H^{pre}와 H^{post} 투영을 (2,nc) 형태로 만들어 각 스트림에 서로 다른 투영을 적용한다. 실험 증거로 8-layer, 60M 모델을 2B 토큰으로 사전학습한 결과가 제공되었고 로그 스케일의 손실 곡선에서 전통적 순차적 베이스라인보다 낮은 손실을 지속적으로 기록했다. 이 결과는 레이어 내부의 동적 라우팅이 토큰 특성에 맞춘 처리 경로 선택으로 학습 신호를 개선할 수 있음을 시사한다.
RNN 계열 레이어 여러 개 뒤에 Attention 레이어를 순차적으로 쌓은 전통적 하이브리드 구조의 다이어그램이다.
Diagram이 그림은 기존 하이브리드 설계가 레이어 수준에서 연산자 선택을 고정하는 형태임을 시각적으로 보여주며, 같은 입력이 레이어를 거치며 순차적으로 처리되는 흐름을 나타낸다. 전통적 스택 구조의 한계로서 레이어 내부의 동적 전문화가 불가능하다는 맥락적 근거를 제공한다.
02
비대칭 라우팅의 구현은 계산 효율을 고려해 H^{res}를 항등행렬로 단순화한 상태에서 수행되었고, 이는 Sinkhorn-Knopp 같은 완전 정규화 절차를 생략해 학습 오버헤드를 줄이는 선택이었다. 라우팅 행렬은 학습·추론 중 포워드 훅으로 관찰되었고 모드 붕괴는 없었으나 특정 레이어에서 일부 스트림이 거의 0에 가까운 가중치를 보이는 현상이 발견되었다. 이러한 관찰은 항등 흐름 단순화가 일부 스트림의 사용성을 감소시킬 수 있음을 시사하며, 향후 H^{res} 정규화의 복원 여부와 스트림 수 변화를 통해 영향을 검증해야 한다는 근거가 된다. 따라서 단순화는 학습 효율을 높이는 실용적 선택이나 스트림 다양성 유지 측면에서 트레이드오프가 존재한다.
mHC 기반 다채널 투영을 통해 같은 레이어 내부에서 두 전문가(GDN2, Attention)로 토큰을 비대칭 라우팅하는 아키텍처 도식이다.
Diagram이 다이어그램은 H^{pre}/H^{post} 투영이 채널 축을 확장하여 서로 다른 전문가로의 통로를 만드는 방식을 시각화한다. 아키텍처 관점에서 투영 행렬 형태가 (2,nc)로 조정되어 각 스트림이 입력 토큰에 대해 다른 비중을 갖도록 설계되었음을 구체적으로 보여주어 구현·코드화 관점의 이해를 돕는다.
03
토큰 수준의 업무 분할이 명확하게 관찰되었는데 GDN2는 문장 경계나 문맥 요약이 필요한 토큰(예: BOS, 줄바꿈, 문장 시작 단어)에서 높은 라우팅 가중치를 받았고, Attention은 숫자, 하이픈, BPE로 분할된 접미사 같은 정확한 프릭시스 검색이 필요한 토큰에서 우세한 가중치를 보였다. 이 동작은 GDN2가 연속적 상태 갱신으로 거시적 문맥을 포착하고 Attention이 점대점 매칭으로 정밀 토큰 검색을 수행하는 역할 분담으로 해석될 수 있다. 관찰 근거는 포워드 훅으로 추출한 H^{pre}/H^{post} 값의 토큰별 활성 패턴이며, 이로 인해 동일 레이어 내에서 각 토큰에 대해 더 적합한 연산자를 동적으로 선택하는 메커니즘이 확인되었다. 결과적으로 토큰 특성에 기반한 라우팅은 처리 정밀도와 요약 능력 사이의 보완 관계를 활용할 수 있다.
로그 스케일로 표시된 학습 손실 곡선으로 mHC 기반 하이브리드 모델이 순차적 베이스라인보다 지속적으로 낮은 손실을 기록한 그래프이다.
Chart그래프는 30,000+ 스텝 구간에서 두 모델의 손실 차이를 시간 축에 따라 비교하며 mHC 하이브리드가 일관된 우위를 보였음을 수치적으로 시각화한다. 실험 조건(8-layer, 60M, 2B 토큰)과 함께 제시되어 구조 변경의 학습 영향이 단순한 시각적 증거를 통해 뒷받침된다.
04
파라미터 매칭을 위해 Attention과 GDN2의 내부 차원을 D/2로 병목화하고 어텐션 헤드 수도 절반으로 줄였으며 출력 프로젝션은 (D/2,D) 형태로 각각 스케일하였다. 이와 같은 동등 파라미터 조건에서 비교 실험이 수행되었고, 모델은 30,000+ 스텝 이상에서 일관된 손실 차이를 보였다고 보고되었다. 실험 세부 조건으로는 8-layer, 60M 파라미터, FineWeb 데이터 2B 토큰 사용이 명시되었으며 로그 스케일 손실 그래프가 증거로 제공되었다. 따라서 구조 변화에 따른 성능 차이는 단순 파라미터 수 차이로 인한 영향이 아니라 라우팅·전문화 효과에 기인할 가능성이 높다.
포워드 훅으로 추출한 라우팅 행렬의 토큰별 활성 패턴 히트맵으로 특정 토큰군에서 GDN2와 Attention의 가중치 할당이 달라지는 모습이 보인다.
Screenshot히트맵은 토큰 축과 스트림 축에서 가중치 분포를 보여주며 문장 경계·문맥 토큰에서 GDN2 우세, 숫자·하이픈·BPE 접미사에서 Attention 우세라는 정성적 관찰을 수치적 패턴으로 보완한다. 이 시각적 근거는 토큰 수준의 업무 분할이 실제 라우팅 행렬에서 구현되고 있음을 보여준다.

용어 해설

게이티드 델타넷(Gated DeltaNet)
순환 기반의 선형 상태 기계 계열로 토큰 간 상태를 선형적으로 갱신하면서 장기 의존성을 효율적으로 처리하는 구조이며, 이 글에서는 Attention과 병렬로 작동하는 토큰-믹서 전문가 중 하나로 사용되어 경계 토큰과 문맥 요약에 유리함이 관찰되었다.
매니폴드 제약 하이퍼-커넥션(Manifold-Constrained Hyper-Connections)
여러 스트림 채널을 갖는 하이퍼-연결 매커니즘으로 입력과 출력 사이의 다채널 투영 행렬을 통해 서로 다른 토큰 믹서(예: RNN 계열, Attention)를 동적·비대칭적으로 라우팅할 수 있게 하는 구조적 아이디어이며, 이 글에서는 mHC 기반 투영을 활용해 레이어 내 전문가 라우팅을 수행했다.
토큰-믹서 라우팅(Token-Mixer Routing)
하나의 레이어 내부에서 서로 다른 토큰 처리 모듈(예: GDN2, Attention)으로 특정 토큰을 동적으로 분배하는 메커니즘으로 입력 토큰에 대해 H^{pre}/H^{post} 같은 투영 행렬을 통해 어느 전문가가 활성화될지 결정하며 토큰 특성에 따른 전문화가 가능해진다.
싱크혼-크놉프 알고리즘(Sinkhorn-Knopp)
행렬을 이중 정규화하여 확률적 매칭이나 이산화된 퍼뮤테이션 행렬 근사를 만들기 위한 반복 정규화 방법으로, 원문에서는 계산 비용 문제로 H^{res}의 완전한 Sinkhorn 정규화를 단순화하여 항등행렬로 대체한 영향이 논의되었다.

언급된 도구

PyTorch추천

모델 구현 및 학습 실험을 위한 딥러닝 프레임워크

FineWeb중립

사전학습 데이터셋(2B 토큰 규모)으로 사용된 코퍼스 이름

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 16.수집 2026. 07. 16.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.