용어 해설
- 혼합 전문가(MoE)(Mixture-of-Experts (MoE))
- — Mixture-of-Experts는 모델 내부에 여러 전문가(expert)를 두고 각 입력에 대해 게이팅 메커니즘으로 일부 전문가만 활성화하여 연산량을 줄이면서 전체 모델 용량을 크게 확장하는 구조이다. 입력별로 활성화되는 전문가가 달라지므로 총 파라미터 수는 크더라도 단일 토큰 처리 시 필요한 연산은 활성 전문가 수에 비례해 줄어든다. 고용량과 낮은 활성 연산량의 트레이드오프를 통해 대규모 모델의 표현력을 비용 효율적으로 확보하는 것이 목적이다.
- 루프드 Transformer(Looped Transformer)
- — Looped Transformer는 동일한 Transformer 블록을 여러 번 반복 실행(looping)하여 유효 깊이(effective depth)를 늘리는 설계 방식이다. 모델 파라미터를 직접 늘리는 대신 같은 블록을 반복해 더 긴 계산 경로를 만들어 표현력을 키우는 방식으로, 반복 횟수에 따라 계산량이 증가한다. 사전학습 계산량이 증가할 때 단순 반복이 파라미터 확장에 비해 성능 면에서 불리해지는 문제가 관찰되어 왔다.
- 액티브 파라미터(Active Parameters)
- — 액티브 파라미터는 Mixture-of-Experts 구조에서 실제로 한 입력 처리 시 활성화되어 사용되는 파라미터 집합을 가리킨다. 전체 파라미터 수는 크더라도 게이팅에 의해 일부 전문가만 선택되므로 토큰별 연산 비용은 활성 파라미터 수에 의해 결정된다. 논문 맥락에서는 20B 모델에서 2B만 활성화되는 식의 표기법으로 모델의 실질적 연산 규모를 명시한다.
- 제거 실험(Ablation Study)
- — Ablation Study는 모델 구성 요소나 학습 절차의 개별 요소를 제거하거나 변경해 각 요소가 최종 성능에 미치는 영향을 정량적으로 평가하는 실험 방법이다. 구성별 성능 차이를 통해 어떤 설계 선택이 성능 향상에 실질적으로 기여했는지를 확인할 수 있다. Loopie는 이러한 광범위한 제거 실험을 통해 설계 결정의 유효성을 검증했다고 보고되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.