1억 토큰 컨텍스트에서도 성능 저하 없는 메모리 희소 어텐션 MSA
Research0 / 0
1억 개의 토큰을 처리하면서도 성능 저하를 최소화하는 종단간 학습 가능 잠재 메모리 프레임워크이다.
주요 기능
- 문서별 RoPE를 적용하여 학습 범위를 초과하는 1억 토큰까지의 컨텍스트 외삽을 수행함
- 청크 단위 평균 풀링으로 KV 캐시를 압축하여 메모리 점유율을 획기적으로 낮춤
- Memory Parallel 엔진을 통해 2대의 A800 GPU에서 대규모 토큰 처리량을 확보함
- Memory Interleave 기법으로 분산된 메모리 세그먼트 간의 복합적인 추론을 지원함
어떻게 동작하는가
문서를 청크 단위로 압축하여 잠재 상태로 저장하고, 쿼리와의 유사도 기반으로 상위 K개 블록을 동적으로 선택해 로컬 컨텍스트와 결합하여 어텐션을 수행한다.
사용 사례
- 수백만 단어 분량의 법률 문서나 기술 명세서 전체를 컨텍스트로 입력하여 정밀한 질의응답 수행
- 수만 개의 문서로 구성된 지식 베이스에서 실시간으로 관련 정보를 추출하고 생성에 반영하는 차세대 RAG 시스템 구축
- 여러 단계의 논리적 연결이 필요한 복잡한 멀티홉 질문에 대해 대규모 데이터를 바탕으로 답변 생성
1.5k
Stars
82
Forks
+814
Trending
0
조회수
1.5k watchers2 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.