용어 해설
- 재귀적 자기 개선(Recursive Self-Improvement)
- — AI 시스템이 자신의 학습·개발 절차를 반복적으로 개선하는 접근입니다. 이 논문에서는 모델 학습 자동화뿐 아니라 학습 후 모델 내부를 감시하고 감사하는 절차까지 포함해야 안전한 자율 개발이 가능하다고 봅니다.
- 희소 오토인코더(Sparse Autoencoder)
- — 모델의 내부 활성값을 소수의 활성 feature 조합으로 다시 표현하는 신경망입니다. 각 feature가 특정 개념과 연결되도록 학습하면 모델이 무엇을 학습했는지 검사하거나 특정 방향으로 조정하는 데 활용할 수 있습니다.
- 기계론적 해석 가능성(Mechanistic Interpretability)
- — 모델의 출력만 비교하지 않고 내부 활성값과 회로가 어떤 계산을 수행하는지 추적하는 연구 분야입니다. 이 논문에서는 SAE feature를 찾아 개념 표현과 인과적 조정 가능성을 측정하는 기반으로 사용합니다.
- 대조 프로브(Contrastive Probe)
- — 목표 개념이 포함된 텍스트와 이를 구별하기 위한 대조 텍스트를 함께 사용해 특정 feature가 개념을 선택적으로 감지하는지 측정하는 방법입니다. 에이전트가 후보 feature의 우연한 상관을 걸러내는 데 사용합니다.
- 인과적 조정(Causal Steering)
- — 모델 내부의 특정 활성 feature를 의도적으로 변경한 뒤 생성 결과가 목표 개념에 맞게 달라지는지 확인하는 방법입니다. 단순한 상관관계가 아니라 feature가 출력에 실제 영향을 주는지 평가합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.