TL;DR
같은 레이어 안에서 Gated DeltaNet 2와 Attention을 병렬 전문가로 두고 Manifold-Constrained Hyper-Connections식 투영으로 토큰별 비대칭 라우팅을 수행하자, 파라미터를 정확히 매칭한 조건에서 8-layer·60M 모델을 2B 토큰으로 사전학습한 결과 로그 스케일 손실이 순차적 GDN2+Attention 스택보다 일관되게 낮게 관찰되었다. 구현상 H^{pre}/H^{post}를 (2,nc) 형태로 구성하고 H^{res}를 항등행렬로 단순화해 계산 오버헤드를 줄였으며 포워드 훅으로 라우팅 행렬을 관측해 모드 붕괴는 없고 특정 스트림의 near-zero 활성화가 일부 레이어에서 관찰되었다. 토큰 수준으로 보면 문장 경계와 거시적 상태 토큰은 GDN2에, 숫자와 BPE로 분할된 접미사 등 정밀 검색이 필요한 토큰은 Attention에 라우팅되는 분업 패턴이 일관되게 나타났다. 단순화와 소형 실험 규모라는 한계가 존재하므로 H^{res} 정규화 복원과 스트림 수·모델 스케일을 바꾼 추가 실험이 필요하다.
실용적 조언
- 동일 파라미터 예산을 유지하려면 각 전문가의 내부 차원을 D/2로 병목화하고 어텐션 헤드 수를 절반으로 줄이는 방식으로 공정한 비교가 가능하다.
- 훈련 효율과 구현 단순성을 위해 초기 실험에서는 H^{res}를 항등행렬로 두어 Sinkhorn 정규화에 따른 계산 오버헤드를 피하는 것이 실용적이지만 특정 레이어에서 스트림 소거가 발생하면 정규화 복원을 고려해야 한다.
- 라우팅 거동을 확인하려면 포워드 훅으로 H^{pre}/H^{post} 값을 기록하여 토큰별 활성 패턴을 분석하면 되고, 특이 토큰(숫자·하이픈·BPE 접미사 등)에서 Attention 우위, 문장 경계 토큰에서 GDN2 우위 패턴을 찾아볼 수 있다.
섹션별 상세




용어 해설
- 게이티드 델타넷(Gated DeltaNet)
- — 순환 기반의 선형 상태 기계 계열로 토큰 간 상태를 선형적으로 갱신하면서 장기 의존성을 효율적으로 처리하는 구조이며, 이 글에서는 Attention과 병렬로 작동하는 토큰-믹서 전문가 중 하나로 사용되어 경계 토큰과 문맥 요약에 유리함이 관찰되었다.
- 매니폴드 제약 하이퍼-커넥션(Manifold-Constrained Hyper-Connections)
- — 여러 스트림 채널을 갖는 하이퍼-연결 매커니즘으로 입력과 출력 사이의 다채널 투영 행렬을 통해 서로 다른 토큰 믹서(예: RNN 계열, Attention)를 동적·비대칭적으로 라우팅할 수 있게 하는 구조적 아이디어이며, 이 글에서는 mHC 기반 투영을 활용해 레이어 내 전문가 라우팅을 수행했다.
- 토큰-믹서 라우팅(Token-Mixer Routing)
- — 하나의 레이어 내부에서 서로 다른 토큰 처리 모듈(예: GDN2, Attention)으로 특정 토큰을 동적으로 분배하는 메커니즘으로 입력 토큰에 대해 H^{pre}/H^{post} 같은 투영 행렬을 통해 어느 전문가가 활성화될지 결정하며 토큰 특성에 따른 전문화가 가능해진다.
- 싱크혼-크놉프 알고리즘(Sinkhorn-Knopp)
- — 행렬을 이중 정규화하여 확률적 매칭이나 이산화된 퍼뮤테이션 행렬 근사를 만들기 위한 반복 정규화 방법으로, 원문에서는 계산 비용 문제로 H^{res}의 완전한 Sinkhorn 정규화를 단순화하여 항등행렬로 대체한 영향이 논의되었다.
언급된 도구
모델 구현 및 학습 실험을 위한 딥러닝 프레임워크
사전학습 데이터셋(2B 토큰 규모)으로 사용된 코퍼스 이름
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.