섹션별 상세
기존 RLVR이나 self-distillation 방식은 훈련 시도 후 데이터를 대부분 폐기하여 훈련 과정에서 얻을 수 있는 전략적 패턴을 활용하지 못한다.
PMD는 훈련 시도를 경험(Experience), 통찰(Insight), 행동(Behavior)의 계층적 절차적 기억으로 구조화하여 저장한다.

경험 기억은 원시 궤적을, 통찰 기억은 문제별 전략과 실패 원인을, 행동 기억은 문제 간 공통된 일반 기술을 추상화하여 보관한다.
훈련 루프에서 현재 정책이 생성한 시도를 기억으로 저장하고, 이 기억을 조건으로 하는 자가 학습 교사가 다음 정책을 업데이트하는 방식으로 정책과 기억이 상호 진화한다.

SciKnowEval 벤치마크에서 Qwen3-8B 모델 기준 SDPO 대비 평균 정확도가 74.4에서 77.2로 상승했다.

추론 시점에는 기억 장치를 사용하지 않으며, 훈련 과정에서 습득한 절차적 지식이 모델 가중치에 내재화되어 성능 향상으로 이어진다.

기술
- Qwen3
- OLMo3
- GRPO
- SDPO
활용 사례
- 과학적 추론 모델 학습
- 코드 생성 모델 성능 개선
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 29.수집 2026. 05. 29.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.