1.6 trillion MoE 기반 1M-context 장기문맥 특화 LongCat-2.0
LongCat-2.0은 1.6 trillion 파라미터의 MoE 아키텍처와 1M-context 학습으로 장기 문맥과 코딩·에이전트 과제를 겨냥한 대형 언어모델이다.
TL;DR
LongCat-2.0은 1.6 trillion 파라미터 규모의 Mixture of Experts 아키텍처를 기반으로 토큰당 약 48 billion만 활성화하는 설계를 채택해 대규모 파라미터와 토큰별 연산 효율을 동시에 추구한 대형 언어모델이다. 사전학습은 AI ASIC superpod에서 수백만 accelerator-hour와 more than 35 trillion 토큰에 걸쳐 진행되었고, 장기 문맥 처리 강화를 위해 LongCat Sparse Attention과 수백억 토큰 규모의 1M-context 후속 학습이 적용되었다. 이 조합은 코딩과 에이전트형 작업에서의 성능 향상을 목표로 삼고 있으며 가중치는 현재 공개되지 않아 외부 검증은 제한적이다. 전용 하드웨어와 초대형 데이터로 학습된 점은 실무적 확장성을 의미하지만 구체적 벤치마크 수치와 데이터셋 상세가 제공되지 않아 성능 비교와 적용 범위는 추가 검증이 필요하다.
핵심 역량
- 매우 긴 문맥을 입력으로 받아들이는 능력이 설계 목표이며 1M-context 수준의 학습 데이터로 문맥 유지와 문맥 기반 추론을 강화했다.
- 대규모 MoE 구조로 특정 토큰 처리 시 전체 파라미터 중 일부만 활성화하는 방식으로 토큰당 활성화 파라미터를 제한해 효율적인 대형 모델 동작을 목표로 한다.
- 코딩 관련 태스크와 에이전트형 작업에서 성능 향상을 목표로 후속 학습(post-training)을 수행해 실용적 응용에서의 성능을 개선하려는 설계적 접근을 채택했다.
- 대규모 학습 인프라(AI ASIC superpods)에서 수백만 accelerator-hour 규모로 사전학습을 수행한 경험을 바탕으로 대규모 모델 학습·배포 파이프라인을 활용하는 능력을 갖췄다.
강점
- 모델 설계 단계에서 MoE를 채택해 총 파라미터 수를 매우 크게 설계하는 한편 토큰당 활성화 파라미터를 제한해 대형 모델의 효율적 운영이 가능하도록 한 점이 핵심 강점이다.
- AI ASIC 기반의 대규모 학습 인프라에서 more than 35 trillion 토큰을 이용해 사전학습을 수행한 점과 1M-context 후속 학습으로 장기 문맥 작업과 코딩·에이전트 관련 과제에서의 성능을 목표로 삼은 점이 실용적 우위로 연결될 수 있다.
훈련 방식
사전학습은 AI ASIC superpods에서 수백만 accelerator-hour에 걸쳐 진행되었고 more than 35 trillion 토큰으로 학습을 완료했으며 이후 LongCat Sparse Attention을 적용한 1M-context 데이터 수백억 토큰 규모의 후속 학습을 통해 장기 문맥 성능을 강화했다.
알아두면 좋은 것
- 모델은 총 1.6 trillion 파라미터 규모이며 토큰당 약 48 billion이 활성화되는 MoE 설계를 채택해 파라미터 폭을 넓히면서 토큰당 연산을 제한했다.
- 전체 사전학습과 대규모 배포가 AI ASIC superpod 환경에서 이루어졌으며 사전학습은 수백만 accelerator-hour와 more than 35 trillion 토큰 규모를 기록했다.
- 장기 문맥 성능 강화를 위해 LongCat Sparse Attention을 도입했고 수백억 토큰 규모의 1M-context 데이터로 추가 학습을 수행했다.
- 모델 가중치는 아직 공개되지 않았고 README에는 'Model weights coming soon'으로 표기되어 있으며 라이선스는 MIT로 명시되어 있다.
기술적 특징
- MoE 아키텍처를 통해 전체 파라미터를 1.6 trillion 수준으로 확장했으며 각 토큰 처리 시에는 약 48 billion 수준만 활성화되도록 설계해 연산 효율을 확보했다. 이 설계는 모든 토큰에 동일하게 전체 파라미터를 적용하지 않고 필요한 전문가만 선택적으로 활성화하는 방식으로 동작한다. 토큰당 활성화 파라미터 제어는 초대형 모델의 추론·학습 비용을 통제하는 핵심 수단이다.
- LongCat Sparse Attention은 전체 토큰 쌍에 대한 완전한 어텐션을 피하고 장기 문맥에서 선택적 연결 패턴을 사용해 메모리와 연산을 줄이는 방식으로 설계되었다. 이 방법은 1M-context 수준의 입력을 처리할 때 필요 이상으로 크고 비용이 큰 어텐션 행렬 생성을 회피한다. 결과적으로 긴 문맥에서의 정보 흐름을 유지하면서도 실용적 연산량을 유지할 수 있다.
- 사전학습 파이프라인은 AI ASIC superpods 상에서 수백만 accelerator-hour를 투입해 진행되었고 학습 데이터 규모는 more than 35 trillion 토큰에 달했다. 전용 하드웨어 활용은 대규모 병렬 처리와 메모리·대역폭 설계 선택을 가능하게 하여 초대형 MoE 학습을 현실화했다. README는 롤백이나 회복 불가한 손실 스파이크 없이 훈련이 완료되었다고 명시했다.
- 후속 학습과 전용 포스트트레이닝이 코딩과 agentic 태스크 성능을 강화하기 위해 도입되었으며 수백억 토큰 규모의 1M-context 데이터가 이 과정에 사용되었다. 이러한 단계적 학습은 기본적인 사전학습의 범위를 넘어 특정 응용군에 대한 성능 최적화를 목표로 한다. 다만 구체적 데이터셋 목록과 정량적 효과는 README에서 제시되지 않았다.
차별점
- 토큰당 활성화 파라미터를 약 48 billion 수준으로 유지하는 1.6 trillion 규모의 MoE 설계는 파라미터 총량과 토큰별 계산의 균형을 추구한 점에서 차별화된다.
- LongCat Sparse Attention과 1M-context 학습의 결합을 통해 백만 토큰 단위의 긴 문맥을 실제 학습 파이프라인에 적용한 점이 장기 문맥 처리 측면에서 주요 차별 요소이다.
- 전체 학습과 대규모 배포를 AI ASIC superpod에서 수행한 점은 전용 하드웨어를 전제로 한 대규모 학습·배포 역량을 모델의 차별점으로 부각시킨다.
187
Likes
2k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.