용어 해설
- 근사 정책 최적화(PPO)
- — 강화학습에서 에이전트의 정책을 업데이트할 때 급격한 변화를 방지하여 학습의 안정성을 높이는 알고리즘이다. 이전 정책과 새 정책의 차이를 일정 범위 내로 제한(clipping)하여 안정적인 수렴을 돕는 것이 핵심이다.
- 신경망 아키텍처 탐색(NAS)
- — 최적의 딥러닝 모델 구조를 사람이 직접 설계하는 대신 알고리즘을 통해 자동으로 찾아내는 기술이다. 레이어 수, 채널 크기, 연결 방식 등을 탐색 공간으로 설정하고 성능이 가장 좋은 조합을 탐색한다.
- 비트당 비트(BPB)
- — 언어 모델의 압축 효율성을 측정하는 지표로, 각 바이트를 표현하는 데 필요한 평균 비트 수를 의미한다. 값이 낮을수록 모델이 데이터를 더 정확하게 예측하고 잘 압축하고 있음을 나타낸다.
- 마르코프 결정 과정(MDP)
- — 의사결정 과정을 수학적으로 모델링한 프레임워크로, 상태, 행동, 전이 확률, 보상으로 구성된다. 현재 상태에서의 행동이 다음 상태와 보상에 영향을 주는 순차적 결정 문제를 해결하는 데 사용된다.
- 저순위 적응(LoRA)
- — 거대 모델의 전체 파라미터를 수정하는 대신 일부 저순위 행렬만을 학습시켜 효율적으로 파인튜닝하는 기법이다. 연산 자원과 메모리 사용량을 획기적으로 줄이면서도 성능을 유지할 수 있다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.