본문으로 건너뛰기
Salesforce조회 1

Procedural Memory Distillation (PMD): 훈련 기록을 절차적 기억으로 변환하는 새로운 학습 기법

훈련 중 생성된 시도와 실패를 절차적 기억으로 변환하여 모델의 학습 효율을 높이는 PMD 기법을 제안한다.

섹션별 상세

기존 RLVR이나 self-distillation 방식은 훈련 시도 후 데이터를 대부분 폐기하여 훈련 과정에서 얻을 수 있는 전략적 패턴을 활용하지 못한다.
PMD는 훈련 시도를 경험(Experience), 통찰(Insight), 행동(Behavior)의 계층적 절차적 기억으로 구조화하여 저장한다.
PMD의 훈련 루프 및 기억 계층 구조 다이어그램
Diagram모델의 시도, 기억 형성, 교사 모델의 지도, 학생 모델 업데이트로 이어지는 전체 순환 과정을 보여준다. 경험, 통찰, 행동으로 이어지는 기억 계층 구조를 명확히 설명한다.
경험 기억은 원시 궤적을, 통찰 기억은 문제별 전략과 실패 원인을, 행동 기억은 문제 간 공통된 일반 기술을 추상화하여 보관한다.
훈련 루프에서 현재 정책이 생성한 시도를 기억으로 저장하고, 이 기억을 조건으로 하는 자가 학습 교사가 다음 정책을 업데이트하는 방식으로 정책과 기억이 상호 진화한다.
PMD 구성 요소별 성능 기여도 분석 테이블
Other반사(Reflection), 지속성(Persistence), 상호 진화(Co-evolution)가 결합되었을 때 최고의 성능을 냄을 보여준다. 정책이나 기억 중 하나만 고정할 경우 성능이 저하됨을 증명한다.
SciKnowEval 벤치마크에서 Qwen3-8B 모델 기준 SDPO 대비 평균 정확도가 74.4에서 77.2로 상승했다.
PMD와 기존 기법(GRPO, SDPO)의 벤치마크 성능 비교 차트
ChartQwen3-8B와 OLMo3-Instruct-7B 모델에서 PMD가 기존 기법 대비 SciKnowEval 및 LiveCodeBench에서 일관된 성능 향상을 보임을 입증한다.
추론 시점에는 기억 장치를 사용하지 않으며, 훈련 과정에서 습득한 절차적 지식이 모델 가중치에 내재화되어 성능 향상으로 이어진다.
모델 크기별 PMD 기억 전이 성능 차트
ChartPMD로 학습된 기억이 1.7B부터 32B까지 다양한 모델 크기에서 성능 향상을 이끌어냄을 보여준다. 기억 검색량이 많을수록 성능이 개선됨을 나타낸다.

기술

  • Qwen3
  • OLMo3
  • GRPO
  • SDPO

활용 사례

  • 과학적 추론 모델 학습
  • 코드 생성 모델 성능 개선
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 29.수집 2026. 05. 29.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.