TL;DR
Transformer의 잔여(residual) 스트림을 여러 병렬 스트림으로 확장하면 모델의 지속적 상태(persistent state)를 늘려 학습 및 일반화 여지를 제공한다. 기존 HC 계열은 N=4에서 성능이 정체되고 비용이 급증해 확장 축으로서 실용성이 제한됐다. xHC는 쓰기 신호를 풍부하게 만들고 잔여 혼합 비용을 희소 업데이트로 제어해 대규모 N 확장을 실용적인 방향으로 전환했다.
왜 중요한가
Transformer의 잔여(residual) 스트림을 여러 병렬 스트림으로 확장하면 모델의 지속적 상태(persistent state)를 늘려 학습 및 일반화 여지를 제공한다. 기존 HC 계열은 N=4에서 성능이 정체되고 비용이 급증해 확장 축으로서 실용성이 제한됐다. xHC는 쓰기 신호를 풍부하게 만들고 잔여 혼합 비용을 희소 업데이트로 제어해 대규모 N 확장을 실용적인 방향으로 전환했다.
핵심 기여
보틀넥 진단과 원인 규명
mHC에서 N을 늘릴 때 성능 향상이 빠르게 포화되는 원인으로 정보 공급 부족과 잔여 혼합의 세제곱 비용을 규명했다. 정보 공급 부족은 각 층이 단일 write-back 성분만 제공해 추가 스트림이 비중복적 히스토리를 형성할 수 없게 만드는 현상이다. 비용 측면에서는 residual-mapping 예측이 N^2개의 계수를 예측하며 이로 인해 전체 비용이 O(N^3 C)로 증가함이 확인됐다.
xHC: 시간적 증강과 희소 잔여 업데이트 결합
xHC는 temporal feature augmentation으로 write-back 기저를 다중 성분으로 확장하고 sparse residual updates로 활성 스트림 k만 갱신해 비용을 O(k^3 C)로 줄였다. 두 설계는 구조적으로 분리되지만 N이 커질수록 상호 보완적으로 작동해 추가 스트림의 정보 유효성을 확보하고 계산 부담을 낮췄다. 기본 설정은 N=16, k=4이며 시계열 합성은 깊이별 인과적 depthwise conv과 Gram–Schmidt 정규화를 통해 구현된다.
대규모 검증과 효율성 평가
18B·28B MoE 모델에서 xHC는 mHC보다 일관되게 낮은 학습 손실과 높은 downstream 성능을 보였고, 18B에서 평균 점수는 44.8→48.8로 +4.0 포인트 향상했다. 스케일링 법칙 실험에서는 동일 손실을 달성하기 위한 계산량에서 vanilla 대비 1.50×, mHC 대비 1.19×의 절감 효과가 관측됐다. 또한 xHC-Flash와 커널 퓨전을 통해 메모리 트래픽을 대폭 줄여 실전 학습 환경에서의 도입 가능성을 확보했다.
Muon과의 호환성 및 실용적 배포 방안
xHC는 AdamW 외에 Muon 옵티마이저로 학습한 백본과도 호환되어 Muon 환경에서도 downstream 향상이 유지되었다. Muon 사용 시 Gram–Schmidt 정규화를 제거하고 xHC 전용 프로젝션은 AdamW로 유지하는 하이브리드 처리를 적용해 안정성을 확보했다. 실무 배포를 위해 xHC-Flash라는 경량 변형을 제안해 서브레이어 간 풀스테이트 접근을 공유함으로써 per-sublayer 메모리 트래픽을 73.5C에서 40C 수준으로 낮췄다.
핵심 아이디어 이해하기
기존 Transformer는 토큰 표현을 층간에 전달할 때 단일 잔여 스트림만 사용해 지속적으로 보존되는 상태의 표현력이 제한된다. 이 논문은 잔여 스트림을 N개의 병렬 스트림으로 확장하면 각 스트림이 서로 다른 가중합의 히스토리를 저장할 수 있어 모델의 기억 용량이 늘어난다고 출발한다. 그러나 단일 층에서 들어오는 write-back이 하나뿐이면 추가 스트림이 실질적 정보를 얻지 못해 확장 효과가 포화된다는 문제가 존재한다. xHC는 층 출력뿐만 아니라 인접 토큰들의 저비용 로컬 특징을 인과적 depthwise convolution으로 추출해 write-back 기저를 K_r개로 늘렸다. 이렇게 하면 각 활성 스트림이 서로 다른 선형 성분을 조합해 비중복적 히스토리를 형성할 수 있다. 비용 측면에서는 mHC가 전체 N×N residual-mapping을 예측하면서 발생하는 O(N^3 C) 비용이 확장의 실용성을 저해했다. xHC는 라우터를 통해 k개의 활성 스트림만 선택해 residual-mapping과 post-mapping을 활성 부분에 대해 생성함으로써 비용을 O(k^3 C)로 낮췄다. 또한 읽기 경로는 밀집(dense read)으로 유지해 한 층에서 업데이트된 정보가 이후 층에서 접근 불가능해지는 연결 단절을 방지했다. 두 설계를 결합하면 N을 크게 확장하더라도 유의미한 성능 향상과 현실적 계산 비용을 동시에 달성할 수 있다.
방법론
전체 설계는 두 축으로 구성된다: 쓰기 신호의 풍부화와 희소 업데이트를 통한 비용 제어이다. 쓰기 신호 풍부화는 MLP 서브레이어 출력에 대해 r개의 인과적(depthwise) 1D convolution을 적용해 인접 토큰의 로컬 특징을 추출하고 원본 출력과 함께 연결한 뒤 Gram–Schmidt 절차로 성분 간 직교화를 수행한다. 이 과정은 K_r(=r+1)개의 직교화된 성분을 만들어 각 활성 스트림이 이들 성분을 독립적으로 결합하도록 post-mapping 차원을 확장한다. 희소 잔여 스트림 아키텍처는 라우터가 Flatten(LN(X))을 선형 투영한 후 sigmoid로 per-stream 점수를 계산하고 fixed-plus-TopK 방식으로 k개의 활성 인덱스를 선택한다. 선택된 활성 스트림의 flattened 상태에서 residual 및 post 매핑을 생성하고 Sinkhorn 정규화를 활성 부분의 ℋ_res에 적용해 안정성을 유지한다. 읽기 경로는 ℋ^{pre}를 통해 전체 N 스트림을 집계해 sublayer 입력을 구성하되 쓰기와 residual-mixing은 k 활성 스트림에만 적용해 계산 비용을 절감한다. 구현 측면에서는 α 방식의 게이팅 스칼라(initialized=0.01)를 사용해 동적 항과 정적 바이어스의 균형을 맞추고 post-mapping에서는 2σ 스케일링으로 [0,2] 범위를 허용해 attenuation과 약한 증폭을 모두 지원한다. 추가적으로 xHC-Flash 변형은 블록 단위로 라우팅과 pre-mapping을 공유해 풀스테이트 접근을 아웃소싱하고 Attention 쪽 residual-mixing을 제거한 뒤 MLP에서 집약적으로 mixing을 수행해 per-sublayer 메모리 트래픽을 크게 낮췄다.
관련 Figure

도식은 고전적 residual이 단일 스트림을 사용하는 반면 mHC는 N개의 스트림을 밀집으로 섞고 xHC는 라우터로 k개의 활성 스트림을 선택해 쓰기·mixing을 수행하면서 읽기는 밀집으로 유지함을 시각적으로 요약한다. 이 그림은 논문 방법론의 핵심 설계 의도를 직관적으로 확인하는 역할을 한다.
아키텍처 다이어그램으로 Residual connection, mHC, xHC의 구조적 차이를 나란히 배치해 xHC의 라우팅·밀집 읽기·희소 쓰기 흐름을 도해로 보여준다.
주요 결과
주요 실험은 18B·28B MoE 백본에서 수행되었으며 모든 방법은 유사한 FLOPs 예산에서 비교됐다. 18B 설정에서 xHC(N=16,k=4)는 mHC(N=4) 대비 평균 downstream 점수를 44.8에서 48.8로 +4.0 포인트 개선했으며 ARC-Challenge, BBH, C3, HumanEval 등 다양한 벤치마크에서 대표적 향상이 관측됐다. 스케일링 법칙 실험에서는 훈련 FLOPs 범위 전반에서 xHC가 낮은 손실 곡선을 유지했으며, 동일 손실을 달성하는 데 vanilla와 mHC가 각각 xHC 대비 1.50×,1.19×의 계산량을 요구하는 것으로 나타났다. N 스윕 실험(2.5B MoE)에서는 mHC가 N=4→16 구간에서 손실 개선이 미미한 반면 xHC는 같은 구간에서 손실을 더 크게 줄이며 추가 FLOPs가 적게 드는 것으로 보고됐다. 절제된 ablation에서는 temporal augmentation 단독으로도 손실을 낮추지만 희소 업데이트가 없으면 FLOPs가 크게 증가했으며, 두 구성요소를 같이 적용할 때 성능과 비용 균형이 최적화됨이 확인됐다. Muon 옵티마이저 환경에서도 xHC는 AdamW 대비 설정을 일부 조정한 뒤(Gram–Schmidt 제거, xHC 전용 프로젝션은 AdamW 유지) 유사한 downstream 이득을 보였고 평균 점수가 43.1→49.9로 개선되었다.
관련 Figure

그래프는 mHC가 N을 4에서 16으로 늘릴 때 손실 개선이 극히 작고 FLOPs가 크게 증가하는 반면 xHC는 같은 N 증가에서 손실을 더 많이 줄이면서 FLOPs 증가폭을 작게 유지함을 시각적으로 나타낸다. 이 결과는 논문에서 진단한 정보 병목과 비용 병목을 동시에 완화한 설계가 확장 효율을 개선한 근거로 연결된다.
2.5B MoE 모델에서 N 스윕에 따른 손실 대 훈련 FLOPs 비교 그래프로 xHC가 N=16에서 mHC 대비 유의미한 손실 개선을 더 작은 FLOPs 증가로 달성한 것을 보여준다.

곡선은 xHC가 학습 전 구간에서 낮은 언어모델링 손실을 유지해 최종 lm loss가 1.758로 mHC(1.776)와 vanilla(1.799)보다 유리했음을 보여준다. 이 시계열 증거는 downstream 성능 향상의 원인이 사전학습 손실 개선임을 연결하는 근거로 사용될 수 있다.
18B MoE 모델 학습 동안 iteration 대비 손실 궤적으로 xHC가 초기부터 끝까지 vanilla와 mHC보다 일관되게 낮은 손실을 보인다는 것을 나타낸다.

평균 점수 곡선은 xHC가 학습 후반으로 갈수록 vanilla 및 mHC보다 더 큰 성능 우위를 확보했음을 시사한다. 이 결과는 사전학습 손실 개선이 실제 벤치마크 일반화 성능으로 전이되었음을 보강한다.
18B MoE 학습 중 iteration에 따른 평균 downstream 점수 궤적로 xHC가 학습 진행에 따라 꾸준히 높은 평균 점수를 기록함을 보여준다.

막대 그래프는 xHC가 특히 reasoning(ARC-C), 코드(HumanEval)와 같이 정보 유지와 추론이 중요한 태스크에서 mHC와 vanilla 대비 두드러진 향상을 달성했음을 드러낸다. 이 시각화는 테이블 수치와 일치하며 특정 벤치마크별 개선의 크기를 직관적으로 전달한다.
18B 및 28B MoE에서 주요 벤치마크(MMLU-Pro, BBH, ARC-C, C3, HumanEval)별 성능 막대 그래프로 xHC가 전반적으로 높은 점수를 기록함을 보여준다.

곡선 피팅은 ℒ(C)=A C^{-α}+E 모델을 사용했으며 가장 큰 계산점에서 xHC가 mHC에 비해 약 1.1% 손실 절감을, vanilla 대비 2.4% 절감을 달성했음을 시각적으로 요약한다. 이 플롯은 동일 손실 달성을 위한 계산량 비교(vanilla 1.50×, mHC 1.19×)를 뒷받침한다.
스케일링 법칙 플롯으로 훈련 FLOPs 대비 손실 곡선을 그려 xHC가 vanilla·mHC보다 낮은 손실 곡선을 따름을 보여준다.
기술 상세
전체 아키텍처는 기존 Transformer 블록 내부의 residual stream을 N×C 텐서로 유지하고 각 층에 세 가지 매핑(ℋ^{pre}∈ℝ^{1×N}, ℋ^{post}∈ℝ^{N×K_r}, ℋ^{res}∈ℝ^{k×k})을 도입한다. ℋ^{pre}는 RMSNorm(flatten(X)) W^{pre}+b^{pre} 형태의 투영을 통해 생성되고 출력은 sigmoid로 제한돼 전체 N 스트림을 가중 합해 sublayer 입력을 구성한다. 활성 스트림에 대해서만 mat_{k×k}(RMSNorm(vec(X_active)) W^{res})를 통해 residual-mixing logits를 예측하고 exp+Sinkhorn으로 doubly-stochastic 제약을 적용해 ℋ_res를 산출한다. 시간적 증강은 MLP 출력에 대해 r개의 depthwise causal convolution(g_j)과 수정된 Gram–Schmidt 정규화를 적용해 out_aug∈ℝ^{K_r×C}를 구성한 뒤 활성 스트림별 post-mapping ℋ_post∈ℝ^{k×K_r}과 결합해 write-back을 만든다. 비용 분석에서 mHC의 dominant cost는 W^{res}가 NC→N^2 차원으로 예측하는 점에 있으며 이로 인해 입력 차원 NC, 출력 N^2가 곱해져 O(N^3 C)가 된다. xHC는 활성 스트림 k로 이 투영을 제한해 이 항을 O(k^3 C)로 낮추며 dense read를 유지해 정보 단절을 방지한다. 구현에서는 full-state 투영과 normalization correction, routed TopK 선택을 하나로 묶고 활성 스트림 관련 투영을 재사용하는 fused kernel 설계를 적용했다. xHC-Flash 변형은 블록 단위로 라우팅과 pre-mapping을 공유하고 Attention에서 residual mixing을 생략한 뒤 MLP에서 집약적으로 mixing을 수행해 per-sublayer I/O를 73.5C→40C 수준으로 낮췄다.
한계점
논문은 N 확장이 정보 공급과 계산 비용 두 축에서 병목을 보이며 이를 완화하기 위해 xHC와 xHC-Flash를 제안했다는 점을 명확히 하고 있다. 그러나 xHC의 기본 형태는 여전히 풀스테이트 읽기와 활성 스트림 투영으로 인해 메모리 트래픽이 증가하며, 이를 해결하려면 xHC-Flash 같은 추가 아키텍처적 단순화와 커널 퓨전이 필요하다. 또한 실험 결과는 MoE 백본과 특정 하이퍼파라미터(N=16,k=4)에 기반하므로 다른 백본·설정에서 동일한 이득이 항상 보장된다는 주장은 논문에 의해 제한적으로 언급되었다.
실무 활용
xHC는 사전학습(pre-training) 단계에서 잔여 스트림을 확장해 모델의 표현 기억 용량을 늘리고자 하는 환경에서 실무적으로 적용 가능하다. 기본 구현과 효율화 변형(xHC-Flash)이 공개되어 있어 연구·엔지니어링 팀이 기존 Transformer·MoE 백본에 소규모 변경으로 통합할 수 있다.
- 대형 언어 모델의 사전학습에서 추가 메모리 상태를 통해 reasoning·지식·코드 성능을 개선하려는 연구·운영 환경
- MoE 기반 백본에서 토큰별 전문가 라우팅과 결합해 모델의 파라미터 효율을 높이려는 시스템 설계
- 대규모 학습 인프라에서 메모리 트래픽을 제어하면서 새로운 확장 축(N)을 탐색하려는 성능·비용 최적화 실험
코드 공개 여부: 공개
코드 저장소 보기키워드
추가 이미지 분석

그래프는 temporal feature augmentation을 더했을 때 mHC 대비 손실 개선량이 N 증가에 따라 확대되는 트렌드를 보이며, 이는 정보 공급 병목이 N 증가에 따라 심화된다는 논문의 진단과 일치한다. 이 결과는 xHC 설계에서 시간적 증강의 필요성을 정량적으로 뒷받침한다.
확장율 N에 따른 손실 격차(대비 mHC)를 보여주는 ablation 플롯으로 temporal augmentation의 효과가 N이 클수록 커짐을 나타낸다.
용어 해설
- Hyper-Connections (HC)
- — 하나의 잔여(residual) 스트림을 N개의 병렬 스트림으로 확장하여 층간 정보흐름을 학습 가능한 mixing 행렬로 제어하는 구조이다. 각 층은 pre/post/residual 매핑을 통해 스트림을 읽고 섞으며 쓰기를 수행하여 지속적 상태(persistent state)를 확장한다. 이 논문에서는 HC의 확장 한계와 이를 극복하는 방법이 핵심 배경으로 사용되었다.
- Temporal Feature Augmentation
- — 층 출력(out)에 대해 인접 토큰의 정보를 인과적(depthwise causal) 1D convolution으로 추출해 write-back 신호의 기저(basis)를 넓히는 기법이다. 다중 커널 크기(예: {4,8,12})로 다양한 시공간 범위를 캡처한 뒤 Gram–Schmidt 정규화를 적용하여 중복성을 줄인다. 추가적인 쓰기 성분을 제공해 N이 커질수록 각 스트림이 비중복적 히스토리를 형성하도록 돕는다.
- Sparse Residual Updates
- — 전체 N 스트림 중 k개(active streams)만을 선택해 residual-mixing과 write-back을 수행하고 나머지 스트림은 읽기에는 참여하도록 유지하는 설계이다. 이로 인해 ℋ_res 생성 비용의 지수 계열적 확장을 O(N^3 C)에서 O(k^3 C)로 줄인다. 라우터(router)로 TopK 또는 fixed+TopK 방식을 사용하여 안정성과 가용 경로를 확보한다.
- Sinkhorn Normalization
- — 행과 열의 합이 각각 1이 되도록 행렬을 반복적으로 스케일링하는 연산으로, mHC에서 residual-mixing 행렬 ℋ_res를 이 폴리토프 위로 투사하여 심층 잔여 흐름의 안정성을 확보하는 데 사용된다. 다중 층을 통과하는 합성 매핑이 신호를 증폭하거나 소실하는 것을 억제해 잔여 학습의 수렴을 돕는다. xHC에서도 활성 스트림에 대해 Sinkhorn 투사를 적용한다.
코드 예제
Algorithm 1 Forward pass of one xHC sublayer
0: X ∈ ℝ^{N×C} (multi-stream state), sublayer ℱ (Attention/MLP)
1:
2: /* Stream routing */
3: s ← σ(LN(flatten(X)) W^r), ℋ^{pre} ← f_pre(X) // ℝ^N, ℝ^N
4: ℐ, p ← Route(s; m, k) // m fixed and k-m routed streams
5: X_act ← Gather(X, ℐ) // ℝ^{k×C}
6:
7: /* Mapping generation (from active streams) */
8: ℋ_res, ℋ_post ← f_res(X_act), f_post(X_act) // ℝ^{k×k}, ℝ^{k×K_r}
9:
10: /* Dense read → sublayer → temporal feature augmentation */
11: out ← ℱ(∑_{i=1}^N ℋ^{pre}_i ⋅ x_i) // ℝ^C
12: if ℱ is MLP then
13: out_aug ← TempAug(out) // ℝ^{K_r×C}
14: else
15: out_aug ← out // K_r = 1
16: end if
17:
18: /* Sparse write-back */
19: X_act_new ← ℋ_res X_act + p ⊙ (ℋ_post out_aug) // ℝ^{k×C}
20: X ← Scatter(X, ℐ, X_act_new) // inactive streams unchanged
21: return X이 코드는 xHC 한 서브레이어의 순전파 절차를 단계별로 나열한 의사코드로서 라우팅, 활성 스트림 추출, 매핑 생성, 밀집 읽기와 서브레이어 적용, 시간적 증강, 희소 쓰기 백을 순서대로 실행한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.