TL;DR
이 글은 2022년 이후 기계 지능 파이프라인의 보상 신호, 학습 데이터, 교사, curriculum, 연구자, 환경, 인간 대상이 차례로 인간 제작에서 모델 제작으로 이동했다는 관점을 제시한다. InstructGPT와 LLM-as-Judge는 평가를, Phi와 Knowledge Distillation은 데이터와 교사를, autoresearch는 실험 선택을, GLM-5.3 계열의 합성 환경은 강화학습의 gym과 verifier를 모델 중심으로 바꾼다. Simile의 digital twin은 인터뷰와 RCT 자료로 인간의 행동과 선호를 재현해 focus group과 A/B 테스트를 inference workload로 전환하려 한다. 다만 물리 세계는 실제 실험 피드백이 필요해 완전히 합성하기 어렵고, 합성화의 진척은 생성 품질보다 oracle 검사, 테스트, RCT, wet-lab loop처럼 결과를 믿을 수 있게 만드는 검증 기술에 달려 있다.
섹션별 상세
- 2022년에는 reward signal과 평가 장치가 인간의 판단에서 모델의 판단으로 이동했다. — 본문의 Stage 1에서 InstructGPT, Constitutional AI, RLAIF, MT-Bench, AlpacaEval을 연결한 설명
- Microsoft Phi의 합성 교재형 데이터와 Apple WRAP의 웹 재작성은 모델 생성 데이터가 학습 파이프라인의 핵심 입력이 될 수 있음을 보였다. — 본문의 Stage 2에서 Textbooks Are All You Need, phi-1.5, WRAP, 약 3배 효율 수치
- autoresearch는 coding agent가 실험을 실행하고 validation loss 개선 여부로 변경을 선택하는 연구 자동화 루프를 구현했다. — 본문의 Stage 5에서 5분 실험, 700개 실험, 20개 개선, 2.02시간에서 1.80시간으로의 변화
- Simile의 digital twin 연구는 1,000명 규모 가상 인물이 원래 사람의 설문과 행동 반응을 85% 정확도로 재현했다고 보고했다. — 본문의 Stage 7에서 Generative Agent Simulations of 1,000 People과 두 시간 인터뷰, 85% 수치
용어 해설
- 합성 데이터(Synthetic Data)
- — 모델이 생성한 학습용 데이터로, 사람이 직접 작성하거나 수집한 자료를 보완하거나 대체한다. 이 글에서는 Textbooks Are All You Need의 교재형 데이터, 웹 재작성, reasoning trace처럼 모델의 학습 효율과 범위를 넓히는 입력으로 쓰인다.
- LLM 평가자(LLM-as-Judge)
- — LLM이 다른 모델의 답변을 기준에 따라 채점하거나 비교하는 평가 방식이다. 사람의 선호 데이터를 한 번 학습한 reward model이나 별도의 평가 프롬프트를 통해 보상, 비평, 벤치마크 판정을 모델 중심으로 처리한다.
- 지식 증류(Knowledge Distillation)
- — 성능이 높은 교사 모델의 출력이나 중간 정보를 사용해 더 작은 학생 모델을 학습하는 기법이다. 이 글에서는 GPT가 만든 지시문과 설명, reasoning trace를 학생 모델의 학습 신호로 사용해 작은 모델이 교사의 행동을 모방하도록 만든다.
- 온폴리시 지식 증류(On-Policy Distillation)
- — 학생 모델이 실제 추론 과정에서 생성한 상태와 출력을 기준으로 교사 모델의 지식을 전달하는 증류 방식이다. 학습 데이터와 실제 추론 분포의 차이를 줄여 긴 작업에서 발생하는 train/inference mismatch를 완화한다.
- 검증 가능한 보상 기반 강화학습(Reinforcement Learning with Verifiable Rewards)
- — 모델의 결과를 정답 판정기, 테스트, 증명 검사기처럼 자동 검증 가능한 기준으로 채점해 강화학습 보상으로 사용하는 방식이다. 사람의 주관적 평가 대신 이진 또는 명확한 보상을 제공하려면 환경과 verifier가 실제 작업의 성공 여부를 안정적으로 판정해야 한다.
- 디지털 트윈(Digital Twin)
- — 실제 사람이나 시스템의 특성과 행동 패턴을 모델 안에 재현한 가상 대리자다. Simile의 사례에서는 인터뷰, 거래 데이터, 등록된 RCT 자료를 사용해 사람의 선호와 불일치, 인과적 반응까지 시뮬레이션하려 한다.
- 인 실리코 실험(In Silico Experiment)
- — 실험실이나 생체 환경에서 직접 수행하는 대신 계산 모델 안에서 생물학적 현상과 실험 조건을 재현하는 방식이다. 글에서는 Human Cell Atlas와 가상 세포를 연결해 in vivo 실험보다 약 1000배 저렴하고 빠른 탐색을 시도하는 흐름으로 제시된다.
기술
- InstructGPT
- Constitutional AI
- RLAIF
- MT-Bench
- AlpacaEval
- Phi
- WRAP
- Nemotron-4 340B
- Alpaca
- Vicuna
- Orca
- DeepSeek-R1
- Self-Instruct
- STaR
- SPIN
- AlphaEvolve
- AI Scientist
- autoresearch
- GLM-5.3
- Simile
- SimGym
- Human Cell Atlas
활용 사례
- 합성 데이터와 reasoning trace를 활용한 LLM 사전학습 및 중간학습
- LLM-as-Judge를 활용한 모델 평가와 reward model 운영
- coding agent를 이용한 LLM 학습 설정 자동 탐색
- 실행 가능한 환경과 verifier를 이용한 장기 작업용 강화학습
- digital twin을 이용한 설문, focus group, 사용자 행동 시뮬레이션
- 가상 세포와 in silico 모델을 이용한 AI for Science 실험
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
