본문으로 건너뛰기

Exclusive Self Attention: Transformer의 문맥 모델링 성능을 높이는 새로운 어텐션 기법

Apple 연구진이 제안한 Exclusive Self Attention(XSA)은 토큰 자기 자신의 정보를 제외하고 주변 문맥에만 집중하게 하여 Transformer의 시퀀스 모델링 성능을 향상시킨다.

섹션별 상세

기존 Self Attention 구조는 쿼리 토큰이 자기 자신의 위치 정보를 포함하여 어텐션 스코어를 계산하는 특성을 가진다. XSA는 토큰의 자체 가치 벡터(Value Vector)와 직교하는 정보만을 캡처하도록 어텐션을 제약하여 자기 자신의 정보를 의도적으로 배제한다. 이러한 제약은 모델이 개별 토큰의 정적인 정보보다 주변 토큰과의 관계 및 문맥적 흐름을 더 깊게 학습하도록 유도한다.
XSA의 성능은 다양한 모델 규모와 시퀀스 길이 조건에서 검증되었다. 최대 2.7B 파라미터 크기의 모델까지 표준 언어 모델링 벤치마크에서 기존 Self Attention 대비 일관된 성능 우위를 기록했다. 특히 입력 시퀀스의 길이가 길어질수록 XSA가 제공하는 성능 이득이 점진적으로 확대되는 경향이 확인되었다.

기술

  • Transformer
  • Exclusive Self Attention
  • XSA

활용 사례

  • 대규모 언어 모델(LLM) 학습
  • 긴 문맥 이해가 필요한 문서 요약
  • 시퀀스 데이터 분석

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 25.수집 2026. 03. 26.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.