TL;DR
Scaled dot-product attention은 모든 이미지 토큰과 Query 토큰의 조합을 계산해 O(N²·d)의 복잡도를 발생시키지만, SSOG는 각 head의 Gaussian atom을 Query에 맞춰 조정하고 분리 가능한 합으로 계산해 O(N·√N·d)로 낮춥니다. 게시물에 따르면 SSOG는 cifar100에서 SDPA를 앞섰고 IN1k에서는 동등한 성능과 더 빠른 수렴을 기록했습니다. 데이터 규모가 커질수록 속도와 메모리 효율도 유리했으며, 세부 결과와 ablation은 연결된 블로그 글과 repository에서 확인할 수 있습니다.
섹션별 상세
이미지 분석

이미지는 새의 서로 다른 위치에 Gaussian 형태의 색상 영역이 배치된 모습을 보여줍니다. 이는 SSOG가 소수의 Gaussian atom을 사용해 입력 이미지의 특정 위치에 Attention을 배치하는 직관과 연결됩니다. 본문에서 말한 Gaussian atom의 공간적 조정 개념을 시각적으로 보완하지만, 정확한 수치나 성능 결과는 담고 있지 않습니다.
새 위에 여러 색상의 Gaussian 형태 강조 영역이 겹쳐 표시된 시각화입니다.

정지 이미지에는 새의 머리, 몸통, 발 주변에 서로 다른 크기와 강도의 색상 분포가 나타납니다. 이 시각화는 Query에 따라 Gaussian 기반 Attention의 위치와 집중도가 달라질 수 있다는 SSOG의 작동 방식을 직관적으로 나타냅니다. 다만 이 이미지 자체만으로는 SDPA와 SSOG 사이의 정량적 비교를 확인할 수 없습니다.
새 이미지 위에 노란색과 붉은색의 Gaussian 강조 영역이 표시된 정지 이미지입니다.
용어 해설
- 스케일드 내적 Attention(Scaled Dot-Product Attention)
- — Query 토큰과 이미지 토큰 사이의 유사도 점수를 모두 계산하는 Attention 방식입니다. 모든 토큰 쌍을 비교하므로 토큰 수가 늘어날 때 계산량이 제곱으로 증가합니다. 이 글에서는 SSOG와 복잡도 및 성능을 비교하는 기준 방식으로 사용됩니다.
- SSOG
- — 각 Attention head에 소수의 Gaussian atom을 학습시키고 Query 토큰에 따라 그 위치를 기하학적으로 조정하는 Attention 구조입니다. Gaussian을 분리 가능한 합으로 인수분해해 모든 토큰 쌍을 직접 비교하지 않습니다. 그 결과 계산 복잡도를 O(N²·d)에서 O(N·√N·d)로 낮추는 방식입니다.
- Gaussian atom(Gaussian Atom)
- — SSOG가 Attention 패턴을 구성할 때 사용하는 개별 Gaussian 요소입니다. 각 head는 여러 Gaussian atom을 학습하고 Query 토큰에 맞춰 이들의 위치를 조정합니다. 여러 요소를 결합해 토큰 간 중요도 분포를 효율적으로 계산합니다.
- 분리 가능한 Gaussian 합(Separable Sum of Gaussians)
- — Gaussian 함수를 여러 축의 독립적인 연산으로 나눌 수 있는 형태로 표현하는 구조입니다. SSOG는 이 분해를 이용해 전체 이미지 토큰과 Query 토큰의 조합을 하나씩 계산하지 않습니다. 이 구현 방식이 토큰 수 증가에 따른 계산량과 메모리 사용량을 줄입니다.
- IN1k
- — 글에서 SSOG의 대규모 데이터셋 실험에 사용한 데이터셋입니다. 저자는 이 데이터셋에서 SSOG가 SDPA와 동등한 성능을 내면서 더 빠르게 수렴했다고 밝혔습니다. 데이터 규모가 커질 때 효율성이 유지되는지 비교하는 평가 기준으로 쓰였습니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
