본문으로 건너뛰기

LongStraw: 고정 GPU 예산으로 백만 토큰급 RL 포스트트레이닝을 실행하는 아키텍처 인식 스택

LongStraw는 공유 프롬프트를 autograd 없이 평가하고 모델별로 필요한 내부 상태만 보존한 뒤 응답 브랜치를 순차적으로 재생하는 방식으로 백만 토큰급 RL 포스트트레이닝을 고정 GPU 예산에서 가능하게 한 아키텍처 인식 실행 스택이다. 이 접근은 메모리 축소와 재연산 비용을 명시적으로 트레이드오프하며 GRPO(Group Relative Policy Optimization)로 구현되어 실험에서 수백만 토큰 처리 능력을 입증했다. 구현 사례로 Qwen3.6-27B와 GLM-5.2에서 대규모 토큰 처리 검증이 수행되었다.

용어 해설

Group Relative Policy Optimization(GRPO)
Group Relative Policy Optimization은 본문에서 LongStraw를 구체화하기 위해 사용된 학습 구성으로, 그룹 단위로 토큰을 묶어 처리하면서 공유된 프롬프트를 별도의 autograd 없이 평가하고 응답 분기를 재생하는 방식으로 메모리 사용을 줄이는 목적을 가진다.
응답 브랜치 재생(Replay Branches)
응답 브랜치 재생은 모델의 응답 경로를 짧은 분기단위로 다시 연산하는 기법으로, 생방송 그래프(live training graph)에 필요한 상태를 작게 유지하면서도 역전파를 위해 필요한 경로를 재생해 그래디언트를 얻는 트레이드오프를 구현한다.
압축 어텐션(Compressed Attention)
Compressed Attention은 모델의 전체 시퀀스 어텐션을 완전하게 저장하지 않고 구조적·압축적 표현으로 대체해 메모리 사용을 줄이는 방법으로, 논문에서는 GLM-5.2의 혼합전문가 구조와 함께 대규모 컨텍스트 실행을 가능하게 하는 요소로 작동한다.
혼합 전문가(MoE)(Mixture-of-Experts)
Mixture-of-Experts는 서로 다른 '전문가' 서브네트워크들 중 일부만 활성화해 계산을 분산시키는 아키텍처 패턴으로, 본문에서는 압축 어텐션과 결합되어 대규모 토큰 수에 대한 실행 가능성을 보인 GLM-5.2 사례에서 사용되었다.
프롬프트 상태(Prompt State)
프롬프트 상태는 입력 컨텍스트(프롬프트)에 대한 중간결과와 모델별 내부 상태를 포함하는 데이터로, LongStraw는 이 중에서 이후 토큰 계산에 실제로 필요한 모델별 상태만 유지하고 공유된 부분은 autograd에서 분리하여 메모리를 절감했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 16.수집 2026. 07. 18.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.