본문으로 건너뛰기

공유를 통한 협력적 병렬 사고: 효율적 Test-Time Scaling을 위한 CPT

병렬로 다수의 추론 브랜치를 실행하는 Test-Time Scaling에서 브랜치 간 정보가 공유되지 않으면 중복 탐색이 증가한다. CPT는 진행 중인 브랜치의 정보를 deduplicated pool에 모아 입력 컨텍스트로 broadcast하고, 각 브랜치가 다른 브랜치의 발견 정보를 재사용하도록 한다. 실험에서 CPT는 HMMT24/25, AIME24/25/26에서 강한 accuracy–latency Pareto frontier를 보인다.

왜 중요한가

병렬로 다수의 추론 브랜치를 실행하는 Test-Time Scaling에서 브랜치 간 정보가 공유되지 않으면 중복 탐색이 증가한다. CPT는 진행 중인 브랜치의 정보를 deduplicated pool에 모아 입력 컨텍스트로 broadcast하고, 각 브랜치가 다른 브랜치의 발견 정보를 재사용하도록 한다. 실험에서 CPT는 HMMT24/25, AIME24/25/26에서 강한 accuracy–latency Pareto frontier를 보인다.

핵심 기여

정보-isolation bottleneck 식별

병렬 TTS에서 브랜치별 발견 정보가 공유되지 않아 중복 탐색이 증가하는 문제를 확인했다.

CPT 도입

Training-free inference 프레임워크로, 진행 중인 분기의 정보를 deduplicated query-level Pool에 축적하고 입력 컨텍스트를 통해 broadcast한다.

Shared Information Pooling/Broadcast

Extractπ를 통해 compact 정보를 Pool에 추가하고, M개 엔트리까지 broadcast로 분배한다.

Adaptive Broadcast Scheduling

새 엔트리의 도입 속도를 윈도우 단위로 추적하고 τstart, τstop 임계치로 방송 시작/종료를 제어한다.

실험적 검증

HMMT24/25, AIME24/25/26에서 CPT가 Baselines 대비 더 나은 accuracy–latency 프론티어를 보인다.

핵심 아이디어 이해하기

단계 1: 독립적으로 작동하는 여러 reasoning branch들이 각자의 private history를 가지며 서로의 정보를 공유하지 않으면 동일한 정보를 반복적으로 발견하는 비효율이 발생한다. 단계 2: CPT는 진행 중인 분기에서 compact한 중간 정보를 추출해 deduplicated Pool에 저장한다. Pool은 입력 컨텍스트의 shared-information 섹션으로 broadcast되며, 각 브랜치는 이전에 발견된 정보를 재활용한다. 단계 3: 적응형 방송 일정(adaptive broadcast scheduling)을 채택한다. 초기에는 독립적 탐색을 허용하고, Pool에 새 정보가 증가하는 구간에서 방송을 시작하며, 추가 방송으로 얻는 이점이 감소하면 방송을 중지한다. 단계 4: 이로 인해 중복된 정보의 탐색이 줄고 누적된 글로벌 의사결정 정보 G(Z1:K|S,q)가 증가한다. 다만 L(Z1:K|S,q)와 R(Z1:K|S,q) 간의 관계를 고려하면 공유가 항상 이득은 아니다.

방법론

단락 1: CPT는 K개의 브랜치를 병렬로 시작하고 각 스텝에서 길이 C의 토큰을 생성한다. 각 브랜치 h_i는 private history를 유지하고 Broadcast 모드에서 Pool-entry를 공유한다. 단락 2: Shared Information Pooling은 Extractπ(x, hi, ∆hi)을 통해 Z_i를 얻고, 임베딩 유사도 ϕ를 이용한 τ_dup로 Pool에 중복 없이 추가한다. broadcast가 활성화되면 P에서 최대 M개의 엔트리를 선택해 입력 컨텍스트에 직렬화한다. 단락 3: Adaptive Broadcast Scheduling은 새 엔트리 수 n을 윈도우 W에서 평균화하여 g_j, r_j를 계산하고, r_j이 τstart보다 작아지면 BROADCAST 모드로 전환하고, τstop보다 작아지면 FREERUN으로 전환한다. 단락 4: 구현 세부사항으로, 입력 토큰 길이 C=2048, 방송 엔트리 최대 M=512, 임베딩은 all-MiniLM-L6-v22, τ_dup=0.75, 윈도우 W=3, τstart=0.4, τstop=0.1가 고정값으로 사용된다.

주요 결과

주요 벤치마크에서 CPT가 Base Parallel Sampling, DeepConf, LeaP 대비 더 나은 accuracy–latency 프론티어를 달성한다. QWEN3-4B-THINKING-2507 및 QWEN3-30B-A3B-THINKING-2507 모델에서 다양한 rollout budget(K=8~128)에서도 일관되게 우수한 성능을 보인다. 토큰 효율성은 증가하고, 평균 토큰 수는 유의하게 감소하며, 전반적으로 latency가 감소하는 경향이 있다. 또한, 정보 추출 단계의 FLOPs 증가가 있되, 대체로 샘플링이 지배적이다.

기술 상세

단락 1: 전체 아키텍처는 Collaborative Parallel Search, Shared Information Pooling, Adaptive Broadcast Scheduling의 3가지 구성요소로 이루어져 있다. 단락 2: 핵심 수식/알고리즘 기반은 Z1:K를 통해 각 브랜치에서 추출한 Zi를 Pool에 합쳐 G(Z1:K|S,q)와 L(Z1:K|S,q), R(Z1:K|S,q)로 정의되는 글로벌 의사결정 정보를 분석한다. Extractπ, 임베딩 유사도 τ_dup, Broadcasting 크기 M, 창 크기 W, 시작/종료 임계치 τstart, τstop이 사용된다. 단락 3: Prior work 대비 차별점은 (i) 브랜치 간 탐색의 독립성 유지, (ii) deduplicated query-level Pool를 통한 정보 공유, (iii) 입력 컨텍스트를 통한 Broadcast로 후속 브랜치가 타 브랜치 발견 정보를 재활용하도록 하는 점이다. 단락 4: 구현 세부사항으로, 입력 토큰 길이 C=2048, 방송 엔트리 최대 M=512, 임베딩은 all-MiniLM-L6-v22, τ_dup=0.75, 윈도우 W=3, τstart=0.4, τstop=0.1가 기본값으로 고정되어 있다.

한계점

패킷 단위 동기화로 인해 한 스텝 내의 발견은 다음 스텝에서만 반영되며, 같은 스텝에서의 중복 발견이 남아 있을 수 있다. 입력 컨텍스트 업데이트를 위한 broadcasting은 일반 decoding 구현에서 context를 재프리필링해야 하므로 추가 FLOPs와 latency를 야기한다.

실무 활용

대규모 언어 모델의 수학적 추론이나 코드 작성 등 복잡한 문제를 다룰 때, CPT를 사용해 테스트 타임에서 여러 브랜치를 병렬로 실행하되 정보 공유를 통해 중복 탐색을 줄이고 효율성을 높일 수 있다.

  • 수학적 추론 벤치마크(HMMT, AIME)에서의 추론 속도/정확도 개선
  • LLM 기반 에이전트의 다중 추론 모듈 간 협업 강화
  • 길고 복잡한 대화에서의 합의 도출 및 문제 해결 속도 향상

코드 공개 여부: 공개

코드 저장소 보기

키워드

Test-Time ScalingCollaborative Parallel Thinkingdeduplicated information poolShared Information Pooladaptive broadcast schedulingHMMTAIME

용어 해설

테스트-타임 스케일링(Test-Time Scaling)
추론 시점에 추가 계산을 허용하여 문제해결 공간을 확장하고, 더 긴 탐색과 더 높은 추론 정확도를 가능하게 하는 방법
협력적 병렬 사고(Collaborative Parallel Thinking)
병렬로 수행되는 여러 추론 브랜치가 탐색 중에 발견한 정보를 공유하고 재활용하도록 하는 inference 프레임워크
공유 정보 풀(Shared Information Pool)
브랜치들에서 추출된 정보를 중복 제거 후 모아두는 풀로, 입력 컨텍스트를 통해 방송되는 구조
적응형 방송 스케줄링(Adaptive Broadcast Scheduling)
새 정보의 도입 속도를 실시간으로 모니터링하여 방송 시작/종료를 제어하는 스케줄링 전략
정보 풀링(Information Pooling)
다수의 브랜치가 발견한 정보를 통합하고 중복을 제거하는 과정
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 26.수집 2026. 05. 28.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.