섹션별 상세
기존 RLVR 방식은 외부에서 큐레이션된 문제 세트에 의존하지만, LAIMARK는 모델이 직접 문제를 생성하여 학습 데이터를 구성한다.
시스템은 프롬프트 진화 루프와 GRPO 업데이트를 결합하여 모델이 스스로 문제를 만들고 정답을 검증하는 순환 구조를 갖춘다.
Qwen3-8B 모델에 적용한 결과, HumanEval 기준 pass@1 성능이 63.4%에서 76.8%로 향상되어 curated 데이터셋 대비 65% 수준의 성능 개선을 보였다.
반복 학습 시 성능이 누적되지 않고 이전 체크포인트로 수렴하는 현상이 발생하며, 학습 데이터의 작업 유형이 편향될 경우 오히려 성능이 저하된다.
32B 파라미터 규모에서는 모델이 이미 대부분의 문제를 해결할 수 있어, 학습 가능한 문제(learnability window)를 선별하는 기준이 작동하지 않는 한계가 있다.
기술
- Qwen3
- GRPO
- Python
- Ollama
활용 사례
- 데이터 부족 환경에서의 모델 성능 개선
- 자동화된 학습 커리큘럼 생성
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 18.수집 2026. 04. 18.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.