왜 중요한가
대형 추론 모델의 Long-CoT는 계산 비용이 크며, 기존의 post-hoc 큐레이션은 교사 간 협업의 잠재력과 탐색의 유연성을 놓쳤다. CoRD는 단계별 협업 디코딩과 예측 퍼플렉시티 기반 평가, 빔 서치를 통해 상호 보완적 추론 경로를 효율적으로 구성하고, 학생 모델의 성능을 교사 수준에 근접시키거나 초과하는 성과를 달성한다. 또한 도메인 외 및 오픈 엔드 설정에서도 일반화가 잘 되는 점이 특징이다.
핵심 기여
CoRD 프레임워크 제안
협업적 단계별 디코딩을 통해 다중 교사 간 상호 보완적 추론 경로를 구성하는 새로운 지식 증류 파이프라인을 제시한다.
Prompt-guided Step Segmentation 도입
초기 프롬프트에 <think> ### Step 와 같은 마커를 삽입해 서로 다른 LRMs 간에도 의미적으로 일관된 단계 경계를 학습하도록 한다.
Perplexity-based Step Selection 및 메타-프로버
메타-프로버를 사용해 각 후보 단계를 Ground-Truth 정답 예측 가능도에 기반해 점수화하고, 그 중 최상위 후보를 선택한다.
Beam Search 기반 Step-wise Decoding
Top-B 벡을 유지하며 각 단계에서 다수의 고가능성 경로를 병렬로 확장해 탐색의 다양성과 안정성을 확보한다.
실험적 성과 및 일반화
세부 구성에서 CoRD가 데이터 품질과 학생 모델 성능에서 SOTA 대안들을 능가하고, 도메인 외 및 오픈 엔드 태스크에서도 일반화 능력을 보인다.
핵심 아이디어 이해하기
core_intuition_sid2_placeholder": []
실무 활용
CoRD는 Long-CoT 추론 데이터를 효과적으로 distill하는 방법으로, 상호 보완적 신호를 활용해 학생 모델의 성능을 교사 수준으로 끌어올릴 수 있다. 또한 open-domain 및 out-of-domain 설정에서도 일반화된다.
- 수학 문제 해결에서 긴 추론 경로를 효율적으로 distill하여 작은 모델의 문제 해결 능력 향상
- 오픈 엔드 의학/생물학 도메인에서 긴 설명형 답변의 정확도 향상
- 도메인 간 일반화를 위한 단계별 추론 데이터 증류 파이프라인 구축
- 프롬프트 엔지니어링 없이도 다중 LRMs의 협력을 통한 추론 데이터 확장
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 단계 세분화(Step Segmentation)
- — Long-CoT 추론에서 여러 LRMs가 제시하는 단계들을 의미 있게 구분하고 표준화된 프롬프트 마커를 통해 협업적 추론을 가능하게 하는 기법으로, 모델 간 비교 및 결합을 용이하게 한다.
- 예측 퍼플렉시티(Predictive Perplexity)
- — Ground-truth 정답이 주어진 조건부 맥락에서 확률적으로 얼마나 잘 예측되는지에 대한 척도이며, 후보 단계의 상호 적합성과 진행의 일관성을 판단하는 로컬 신호를 제공한다.
- 빔 탐색(Beam Search)
- — 여러 후보를 병렬로 확장하고 상위 B 경로를 유지함으로써 초기 선택의 실패를 보정하고 장기적으로 더 나은 추론 경로를 보존하는 탐색 기법이다.
- 다중 교사 증류(Multi-Teacher Distillation)
- — 여러 LRMs로부터의 추론 신호를 단계적으로 통합해 교사 간 보완을 활용하는 데이터 증류 프레임워크로, 단일 교사 대비 성능과 일반화 능력을 향상시킨다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.