용어 해설
- Group Relative Policy Optimization(GRPO)
- — Group Relative Policy Optimization은 본문에서 LongStraw를 구체화하기 위해 사용된 학습 구성으로, 그룹 단위로 토큰을 묶어 처리하면서 공유된 프롬프트를 별도의 autograd 없이 평가하고 응답 분기를 재생하는 방식으로 메모리 사용을 줄이는 목적을 가진다.
- 응답 브랜치 재생(Replay Branches)
- — 응답 브랜치 재생은 모델의 응답 경로를 짧은 분기단위로 다시 연산하는 기법으로, 생방송 그래프(live training graph)에 필요한 상태를 작게 유지하면서도 역전파를 위해 필요한 경로를 재생해 그래디언트를 얻는 트레이드오프를 구현한다.
- 압축 어텐션(Compressed Attention)
- — Compressed Attention은 모델의 전체 시퀀스 어텐션을 완전하게 저장하지 않고 구조적·압축적 표현으로 대체해 메모리 사용을 줄이는 방법으로, 논문에서는 GLM-5.2의 혼합전문가 구조와 함께 대규모 컨텍스트 실행을 가능하게 하는 요소로 작동한다.
- 혼합 전문가(MoE)(Mixture-of-Experts)
- — Mixture-of-Experts는 서로 다른 '전문가' 서브네트워크들 중 일부만 활성화해 계산을 분산시키는 아키텍처 패턴으로, 본문에서는 압축 어텐션과 결합되어 대규모 토큰 수에 대한 실행 가능성을 보인 GLM-5.2 사례에서 사용되었다.
- 프롬프트 상태(Prompt State)
- — 프롬프트 상태는 입력 컨텍스트(프롬프트)에 대한 중간결과와 모델별 내부 상태를 포함하는 데이터로, LongStraw는 이 중에서 이후 토큰 계산에 실제로 필요한 모델별 상태만 유지하고 공유된 부분은 autograd에서 분리하여 메모리를 절감했다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.